Nový způsob transformace dat: Co to je dbt | Mňamka #129

Únor 1, 2021

Máme technologie, které milujeme, máme je odzkoušené a umíme je. To ale rozhodně neznamená, že stále netestujeme nové. A tak jsme narazili na dbt (Data Build Tool) - open source, který nás hodně baví.

Než si řekneme víc, pojďme o krok zpět. Máme data ve zdrojových systémech a ve finále se na ně potřebujeme koukat třeba v nějakém vizualizačním nástroji. Ale než se podíváme na pěkný grafíky a rozjedeme naplno business intelligence, musíme ujít ještě dlouhou cestu (který datový analytik by neznal, že...). No a ta cesta je zjednodušeně v zásadě dvojí. Buď si data vezmeme ze zdrojového systému (extract), cestou v nich uklidíme (transform) a upravené je natáhneme do cíle (třeba cílový data warehouse) = ETL (na to se dá využít například nástroj Keboola nebo si to můžeme postavit na cloudových službách), nebo je ze zdrojového systému vytáhneme tak jak jsou a ten úklid děláme až v cíli, plus často až když je potřeba = ELT.

Co to je dbt?

Je to nástroj, který se v ELT stará o to “T”. Základem je projekt, který se konfiguruje sadou YAML souborů a SQL souborů s makry.

Zdroj obrázku: https://blog.getdbt.com/what--exactly--is-dbt-/

V čem je jeho kouzlo?

Tím, že dbt podporuje makra v SQL spojuje silu skriptovacího jazyka Python a SQL. Umožňuje používat cykly pro generování SQL, takže minimalizuje kopírování kódu. Automatické testování - stačí popsat, jak mají vypadat data, která vystupují z transformace, a dbt se postará o to, že to tak fakt je.

Prostě kouzlo dbt je v tom, že k tomu “T” přistupuje tak, že se snaží usnadňovat věci, který jsou často třeba a je nutný je řešit opakováním kódu, případně kódem, kterej je náchylnej k chybám. V případě, že se něco změní v datech, transformace s dbt se dají napsat tak, že to dbt buď pozná a řekne, že je něco špatně, nebo na to bude připravený a zařídí, že se nestane nic špatného.

A mimojiné - je to opensource s velmi snadnou instalací. Správa kódu v gitu, která podporuje CI/CD principy a spolupráci týmu na projektu. Dá se integrovat do existující pipeline, de facto poběží všude, kde běží Python.

Za nás je to pecka. Chcete vědět víc? Mrkněte výše na Tomovo video.

Zapomněla jsem na něco? Chcete se na něco zeptat? Napište mi.

Eva

Eva Hankusová
detektiv nových příležitostí
LinkedIn

Líbí se vám článek? Ochutnejte naše mňamky.

Chci si kousnout

7 signálů, že vaše firma potřebuje datovou strategii | Mňamka #555

Každá firma chce zvednout efektivitu a využít příležitosti, které dnes AI nabízí. Jenže než nasadíte jakýkoliv model, copilota nebo „chytrou analýzu", musíte mít v pořádku to, na čem AI stojí a to jsou pevné datové základy. Následující signály jsou věci, se kterými se u klientů stále poměrně často setkáváme. Pokud některý z nich zní povědomě, datová strategie není nice-to-have. Je to základ. A ten se bohužel nedá přeskočit, i když by to bylo hodně pohodlné. Dá se oddálit, ale pak se vždy platí i s úroky.

EU AI Act: Co to reálně znamená pro české firmy | Mňamka #554

Evropská unie přichází s první ucelenou regulací umělé inteligence. EU AI Act má nastavit pravidla pro to, jak se AI vyvíjí a používá. Pro spoustu firem to může znít jako další regulace navíc. Ve skutečnosti ale jde o změnu, která se poměrně rychle propíše do každodenního fungování. AI už dávno není jen experiment nebo playground pro technologické firmy a čím víc se AI dostává do citlivých oblastí, tím větší tlak je na to, aby její fungování bylo férové a kontrolovatelné. Jak se tato regulace dotkne českých firem a co je v této regulaci podstatné?

Google Workspaces - Přestaňte platit za centrální správu podpisů v Gmailu | Mňamka #553

Přišli jsme o správu e-mailových podpisů při přechodu k novému GCP partnerovi. Místo placení SaaS nástrojů jsem to postavil za odpoledne přes Google Apps Script – zdarma. Tady je celý návod.