Základní datové typy | Mňamka #41
Datový typ je jednoduše atributem dat, který říká kompilátoru nebo interpretovi, jak programátor hodlá data použít. Většina programovacích jazyků podporuje běžné datové typy reálných , celých a booleovských . Datový typ omezuje hodnoty, které může mít výraz , například proměnná nebo funkce. Tento datový typ definuje operace, které lze s daty provádět, význam dat a způsob, jakým lze uložit hodnoty tohoto typu. Typ hodnoty, ze které může výraz vzít svou hodnotu. (zdroj wiki)
Uf. Toť definice. Co to ale ve skutečnosti znamená? Vědět, o jaký datový typ se jedná je úplný základ datové analytiky. Správná klasifikace nám ulehčí spoustu budoucích troubles. Když jsem začínala s datovou analytikou, o datových typech jsem samozřejmě slyšela, ale moc mi to hned nedocvaklo :-) Postřehla jsem to až ve chvíli, kdy jsem se učila s vizualizačním nástrojem - pokud totiž neoznačíte správně datový typ hned na startu, bude vám i to nejlepší zobrazovátko ukazovat nesmysly. Například máte-li sloupec “rok” označený jako “text - string” - pokud nezměníte datový typ na “datum - date”, nikdy nebudete schopni zobrazit data (rok) v časové ose, protože zobrazovátko nepochopí, že jde o datum.

Správná klasifikace datových typů ale není samozřejmě jen o vizualizaci. Tím úplně nejzákladnějším důvodem je velikost data. Pro každý datový typ je vyhrazeno větší či menší množství paměti - v praxi to znamená, že z hlediska místa je výhodnější mít uloženu informaci jako boolean (muž - 1 ano / 0 ne) než jako text “muž - ano”. Jakou mají jednotlivé datové typy velikost se dočtete například zde.
Nerada bych tu popisovala celou problematiku datových typů, na to jsem malý pán. Datové typy mají různou klasifikaci a pro různé programovací jazyky se mohou lišit. Jak už mám ale ve zvyku, tady je pár zajimavých odkazů, které se datovými typy zabývají trochu podrobněji:
- Analýza a vizualizace dat v jazyce R - jasné shrnutí datových typů v R
- Datové typy v SQL
- Základní datové typy v Python
Eva
Zeptej se svých dat: BigQuery vs. Fabric vs. Copilot | Mňamka #558
Je to sen skoro každého manažera: místo čekání na analytika prostě napíšu do chatu „jak nám rostly tržby po regionech za poslední kvartál?" a za pár vteřin mám odpověď, ideálně i s grafem. Říká se tomu konverzační analytika a tři velcí hráči ji dnes nabízejí. My jsme si všechny tři osahali. Tady je upřímné srovnání, co funguje a kde to zatím drhne.
Postavili jsme stejného AI chatbota nad firemními daty v Googlu i v Microsoft Azure. | Mňamka #557
Skoro každá firma dneska sedí na hromadě vlastních dokumentů - produktové listy, FAQ, smlouvy, zápisy z projektů. A skoro každá firma by chtěla to samé: chatbota, kterému napíšete otázku a on odpoví z vašich dat, ne z toho, co si kde přečetl na internetu. Zní to jednoduše. My jsme si to chtěli osahat pořádně, a tak jsme jedno a to samé řešení postavili dvakrát - jednou v Google Cloudu, podruhé v Microsoft Azure. Tady je, co z toho vypadlo.
Microsoft Fabric vs. dbt | Mňamka #556
Když firmy modernizují svou datovou platformu, narazí dřív nebo později na otázku, jaký datový stack zvolit a co je pro jejich byznys nejvhodnější. Migrovat na Microsoft Fabric? Nasadit dbt? Otázka je ale položená trochu zavádějícím způsobem, jde totiž o srovnání dvou věcí, které stojí na jiné úrovni datového stacku: Fabric je platforma, dbt je transformační nástroj, který na takové platformě běží. Přesto má smysl se ptát, jak se tyto dva světy doplňují, kde si uvnitř Fabricu konkurují nativní nástroje a dbt, a kdy se vyplatí sáhnout po dbt jako standardní transformační vrstvě.



