Je to mezera, není to mezera? | Mňamka #370

O čištění dat a jeho významu už jsme toho napsali poměrně hodně. Jednoduše řečeno - bez úklidu na vstupu budeme mít bordel i na výstupu.

Dokonce na to máme appku (Cooltivator), která tuhle mravenčí práci umí výrazně zjednodušit. :)

Co ale dělat, když potřebujeme “přechroustat” finanční čísla (například nějaký mapovací Google sheet s budgety)? Ono totiž jeden budget můžete napsat několika způsoby - a reálně se to i stává - copy & paste a najednou tam máte nový formát. :)

Třeba takhle:

Ale co s tím? Čistící skript by měl být univerzální a umět ošetřit všechny tyto možnosti.

Vezměme si to na příkladu Snowflake SQL a pěkně postupně:

1. “číslo” - pohodička, tady není o čem

2. “finanční” - tady už nám TO_NUMBER() stačit nebude - musíme nejdřív nahradit mezery a desetinnou čárku a až poté převést na číslo – rozehříváme se :)

3. “měna” - musíme navíc vyhodit “Kč”, vyzkoušíme

“Oops.. co se děje?” říkal jsem si, když jsem to viděl poprvý a zkusil to dvakrát znovu - chyba mezi klávesnicí a židlí? Není, ani napotřetí to neprošlo... Po chvíli googlení a zkoušení mi to došlo.

Poznáte rozdíl? :)

Ne? Já taky ne, až tady je vidět:

Zatímco v prvním případě jsme nahrazovali znak mezery, v tom druhém jde o oddělovač tisíců, což sice vizuálně vypadá úplně stejně, ale jde o jiný znak.

Takže:

Voilá - funguje! :)

Zapomněl jsem na něco? Chcete se na něco zeptat? Napište mi. 

Petr

Petr Koza
datový detektiv
LinkedIn

Zeptej se svých dat: BigQuery vs. Fabric vs. Copilot | Mňamka #558

Zeptej se svých dat: BigQuery vs. Fabric vs. Copilot | Mňamka #558

Je to sen skoro každého manažera: místo čekání na analytika prostě napíšu do chatu „jak nám rostly tržby po regionech za poslední kvartál?" a za pár vteřin mám odpověď, ideálně i s grafem. Říká se tomu konverzační analytika a tři velcí hráči ji dnes nabízejí. My jsme si všechny tři osahali. Tady je upřímné srovnání, co funguje a kde to zatím drhne.

Postavili jsme stejného AI chatbota nad firemními daty v Googlu i v Microsoft Azure. | Mňamka #557

Postavili jsme stejného AI chatbota nad firemními daty v Googlu i v Microsoft Azure. | Mňamka #557

Skoro každá firma dneska sedí na hromadě vlastních dokumentů - produktové listy, FAQ, smlouvy, zápisy z projektů. A skoro každá firma by chtěla to samé: chatbota, kterému napíšete otázku a on odpoví z vašich dat, ne z toho, co si kde přečetl na internetu. Zní to jednoduše. My jsme si to chtěli osahat pořádně, a tak jsme jedno a to samé řešení postavili dvakrát - jednou v Google Cloudu, podruhé v Microsoft Azure. Tady je, co z toho vypadlo.

Microsoft Fabric vs. dbt | Mňamka #556

Microsoft Fabric vs. dbt | Mňamka #556

Když firmy modernizují svou datovou platformu, narazí dřív nebo později na otázku, jaký datový stack zvolit a co je pro jejich byznys nejvhodnější. Migrovat na Microsoft Fabric? Nasadit dbt? Otázka je ale položená trochu zavádějícím způsobem, jde totiž o srovnání dvou věcí, které stojí na jiné úrovni datového stacku: Fabric je platforma, dbt je transformační nástroj, který na takové platformě běží. Přesto má smysl se ptát, jak se tyto dva světy doplňují, kde si uvnitř Fabricu konkurují nativní nástroje a dbt, a kdy se vyplatí sáhnout po dbt jako standardní transformační vrstvě.