Najważniejsze wnioski
Krótka odpowiedź: Hurtownia danych i jezioro danych to dwa podejścia do przechowywania danych do analiz.
Hurtownia danych przechowuje dane ustrukturyzowane, oczyszczone i wymodelowane, zorganizowane z góry (schema-on-write) i zoptymalizowane pod kątem szybkiego, wiarygodnego raportowania i analityki biznesowej; dobrze odpowiada na znane pytania.
Jezioro danych przechowuje surowe dane dowolnego typu, ustrukturyzowane, półustrukturyzowane i nieustrukturyzowane, przechowywane tanio na dużą skalę w formie natywnej, a strukturę nakłada się dopiero podczas odczytu (schema-on-read), co daje elastyczność do eksploracji, data science i uczenia maszynowego.
Hurtownie wymieniają elastyczność na prędkość i spójność; jeziora wymieniają gotową strukturę na elastyczność i skalę. Większość nowoczesnych architektur używa obu, często z jeziorem zasilającym hurtownię.
Hurtownia danych to repozytorium danych ustrukturyzowanych, oczyszczonych i wymodelowanych, zaprojektowane i zoptymalizowane pod kątem raportowania i analityki biznesowej.
Zanim dane trafią do hurtowni, są przetworzone: wydobyte z systemów źródłowych, przekształcone do spójnej, zdefiniowanej struktury i załadowane do tabel zorganizowanych według wcześniej ustalonego schematu.
To nazywa się schema-on-write: struktura jest ustalana i egzekwowana przed zapisaniem danych, więc wszystko w hurtowni jest już oczyszczone, spójne i gotowe do zapytań.
Korzyść to prędkość i niezawodność dla znanych pytań: ponieważ dane są wymodelowane z wyprzedzeniem i zoptymalizowane pod zapytania analityczne, pulpity i raporty działają szybko i zwracają spójne, wiarygodne odpowiedzi. Hurtownie są tradycyjnym kręgosłupem analityki biznesowej.
KPI, raporty finansowe, pulpity wydajności, tam, gdzie z góry wiadomo, co mierzyć i potrzebne jest to szybko i niezawodnie.
Kompromis to sztywność i wysiłek: decyzja o schemacie z góry i przekształcanie wszystkich przychodzących danych wymaga pracy, a hurtownia radzi sobie głównie z danymi ustrukturyzowanymi, które pasują do jej modelu.
Nowe pytania, których schemat nie przewidział, albo nieporządne typy danych, które nie mieszczą się w prostych tabelach, są niewygodne dla hurtowni. Świetnie nadaje się ona do szybkiego odpowiadania na dobrze zdefiniowane pytania, nie do swobodnej eksploracji.
Jezioro danych to repozytorium, które przechowuje surowe dane praktycznie każdego typu, tabele ustrukturyzowane, dzienniki i JSON półustrukturyzowane oraz dane nieustrukturyzowane, takie jak obrazy, wideo i strumienie z czujników, na dużą skalę i niskim koszcie, w formie natywnej.
Kluczowe jest to, że jezioro nie wymaga zdefiniowania struktury przed załadowaniem; dane są przechowywane takimi, jakimi są, a strukturę nakłada się dopiero podczas odczytu i analizy.
To jest schema-on-read: interpretację danych decyduje się w czasie zapytania, nie w czasie zapisu. Zaletami są elastyczność i skala.
Ponieważ wszystko można przechowywać tanio bez wstępnego modelowania, jezioro może mieścić ogromne ilości różnorodnych surowych danych, utrzymując je dostępnymi do wszelkich późniejszych analiz, w tym analiz eksploracyjnych, data science i uczenia maszynowego, które potrzebują surowych, szczegółowych danych zamiast wstępnie zagregowanych tabel.
Jezioro jest naturalnym miejscem dla danych maszynowych o wysokiej częstotliwości i danych z czujników oraz dla otwartych pytań, których nie da się określić z góry.
Kompromis polega na tym, że surowe, niemodelowane dane trudniej wykorzystać bezpośrednio: bez wstępnego oczyszczenia i strukturyzacji, uzyskanie wiarygodnych odpowiedzi wymaga większego nakładu pracy w czasie analizy, a niezarządzane jezioro może zamienić się w „bagno danych” z danymi nieużytecznymi i słabo skatalogowanymi.
Kluczowy techniczny kontrast to schema-on-write kontra schema-on-read, podejście „najpierw struktura” versus „najpierw składowanie”. Hurtownia narzuca strukturę przed zapisaniem (schema-on-write): modelujesz dane, przekształcasz je, aby pasowały, i dopiero wtedy ładujesz, więc to, co jest przechowywane, jest już oczyszczone i gotowe do zapytań.
Jezioro najpierw przechowuje, a strukturę nakłada później (schema-on-read): zachowujesz surowe dane w formie natywnej i stosujesz strukturę podczas analizy, więc elastyczność jest zachowana, ale interpretacja jest odroczona. Ta jedna różnica determinuje większość pozostałych.
Schema-on-write sprawia, że hurtownie są szybkie i spójne dla zdefiniowanych pytań, ale sztywne i pracochłonne w zmianie, oraz ogranicza je głównie do danych ustrukturyzowanych.
Schema-on-read sprawia, że jeziora są elastyczne, skalowalne i mogą przechować dowolny typ danych, ale przenosi pracę nad oczyszczaniem i strukturyzacją na czas analizy i zwiększa ryzyko niespójności.
Mówiąc prościej: hurtownia decyduje z góry, co dane oznaczają i optymalizuje ich użycie w ten sposób; jezioro zachowuje opcje i decyduje o znaczeniu danych, gdy pojawi się pytanie.
Żadne podejście nie jest złe, optymalizują one przeciwne priorytety: prędkość i niezawodność dla znanych pytań kontra elastyczność i skala dla pytań nieznanych.
Praktyczny wniosek jest taki, że hurtownie i jeziora obsługują różne potrzeby analityczne.
Hurtownia danych jest idealna, gdy wiesz, co chcesz mierzyć i potrzebujesz to szybko i niezawodnie, powtarzalne raporty, pulpity KPI i zapytania BI, które organizacje uruchamiają codziennie.
Jej wymodelowane, oczyszczone dane dają spójne, wiarygodne odpowiedzi na te dobrze zdefiniowane pytania szybko, co jest dokładnie tym, czego wymaga raportowanie operacyjne i zarządcze.
Jezioro danych jest idealne, gdy pytania są otwarte lub jeszcze nieznane: analiza eksploracyjna, data science, rozwój modeli uczenia maszynowego i każda praca, która potrzebuje surowych, szczegółowych, różnorodnych danych.
Jego elastyczność pozwala analitykom i data scientistom swobodnie badać, łączyć nietypowe typy danych i odnajdywać wzorce, których stały schemat hurtowni nigdy by nie ujawnił.
Tak więc oba rozwiązania odpowiadają na różne rodzaje pytań: hurtownia służy pytaniom, które można określić z góry i które muszą być rozwiązywane niezawodnie i wielokrotnie; jezioro służy pytaniom odkrywanym w trakcie eksploracji.
Dlatego są one komplementarne, a nie konkurencyjne, organizacja potrzebuje zarówno szybkiego, niezawodnego raportowania, jak i elastycznych analiz eksploracyjnych.
Weźmy dane z produkcji. Fabryka generuje sygnały surowe o wysokiej częstotliwości z maszyn i czujników: przebiegi drgań, strumienie temperatury, logi zdarzeń, obrazy z kamer inspekcyjnych, ogromną, różnorodną i szybko napływającą objętość danych.
Te surowe dane trafiają naturalnie do jeziora danych: przechowywane tanio w formie natywnej, zachowane szczegółowo i dostępne dla data scientistów do eksploracji, trenowania modeli predykcyjnego utrzymania i badania pytań, których nikt nie określił z góry.
Z tego surowego materiału wyprowadza się dobrze zdefiniowane metryki operacyjne.
OEE, przestoje według przyczyny, produkcja według linii, wskaźniki jakości, są obliczane, oczyszczane i wymodelowane, a następnie ładowane do hurtowni danych, gdzie zasilają codzienne pulpity i raporty, na których menedżerowie i operatorzy polegają, szybko i spójnie.
Kierownik zakładu otwierający pulpit OEE zapytuje hurtownię: to znane pytanie, na które odpowiada się wiarygodnie w ciągu sekund z wymodelowanych danych.
Data scientist szukający wczesnego sygnału awarii łożyska pracuje w jeziorze: to pytanie otwarte, badane na surowych danych z czujników.
Ta sama fabryka potrzebuje obu: jeziora, aby przechować wszystkie surowe dane elastycznie do odkryć, oraz hurtowni, aby dostarczać zaufane, szybkie odpowiedzi na pytania, które już wiadomo, że trzeba monitorować.
Często jezioro zasila hurtownię, surowe dane są rafinowane do strukturalnych metryk.
Wybieraj według natury danych i pytań, i pamiętaj, że większość architektur potrzebuje obu rozwiązań.
Użyj hurtowni danych dla danych ustrukturyzowanych i dobrze zdefiniowanych, powtarzalnych potrzeb analitycznych: raportowania operacyjnego, pulpitów KPI, raportów finansowych i wydajnościowych, tam gdzie najważniejsze są prędkość, spójność i niezawodność dla znanych pytań.
Użyj jeziora danych dla dużych wolumenów surowych, różnorodnych danych oraz dla elastycznych, eksploracyjnych lub zaawansowanych analiz, data science, uczenia maszynowego i badania pytań nieznanych z góry, tam gdzie liczy się elastyczność i skala.
W praktyce oba coraz częściej są łączone: powszechny wzorzec polega na przechowywaniu wszystkich surowych danych w jeziorze i rafinowaniu wybranych, dobrze rozumianych danych do hurtowni na potrzeby raportowania, więc jezioro zapewnia elastyczną skalę, a hurtownia, wiarygodny, strukturalny dostęp.
Nowsze architektury „lakehouse” łączą oba modele w jednej platformie, nakładając cechy hurtowni pod względem struktury i niezawodności na magazyn podobny do jeziora.
Ramą postępowania nie jest wybór jednego, lecz dopasowanie do każdego obciążenia: niezawodne raportowanie znanych pytań do hurtowni, elastyczną eksplorację nieznanych pytań do jeziora, oraz dobre zarządzanie jeziorem, by nie stało się bezużytecznym bagnem danych.
Podział jezioro kontra hurtownia wpływa na sposób przechowywania i analizowania danych OEE. Wymodelowane metryki OEE, które napędzają codzienne pulpity.
Dostępność, Wydajność, Jakość, przestoje według przyczyny, produkcja według linii, to klasyczne dane hurtowni: dobrze zdefiniowane, powtarzalne i wymagające szybkich, wiarygodnych odpowiedzi, więc naturalnie trafiają do magazynu w stylu hurtowni zoptymalizowanego pod raportowanie.
Surowe, wysokoczęstotliwościowe dane maszynowe i z czujników będące podstawą, z których wykrywane są straty i na których budowane są modele predykcyjne, to klasyczne dane jeziora: duże wolumeny, różnorodne i wartościowe dla analiz otwartych, więc należą do jeziora.
Dobra architektura używa obu: jezioro przechowuje surowe dane maszyn (często zbierane za pomocą SCADA, DCS i urządzeń edge) i zasila wyrafinowane metryki OEE do hurtowni dla zaufanego raportowania.
To łączy się także z miejscem, gdzie odbywa się przetwarzanie, podział edge kontra chmura determinuje, jak surowe dane docierają do tych magazynów.
Prawidłowa architektura przechowywania oznacza, że raportowanie OEE jest szybkie i niezawodne, podczas gdy surowe dane pozostają dostępne do głębszych analiz, które wykrywają przewlekłe straty.
Fabrico przekształca surowe dane maszynowe i produkcyjne w wymodelowane metryki OEE potrzebne do raportowania, wyczyszczone, wiarygodne wskaźniki Dostępności, Wydajności i Jakości oraz przyczyny przestojów, które menedżerowie zapytują każdego dnia.
Niezależnie od tego, czy surowe dane leżą w jeziorze, a wymodelowane metryki w hurtowni, Fabrico dostarcza czysty, strukturalny obraz strat na ich podstawie, dzięki czemu produkcja i zarząd otrzymują szybkie, wiarygodne odpowiedzi, podczas gdy surowe dane pozostają dostępne do głębszych analiz.
Zarezerwuj demo, aby zobaczyć wymodelowane OEE zbudowane na podstawie danych Twoich maszyn.
Hurtownia danych przechowuje dane ustrukturyzowane, oczyszczone i wymodelowane, zoptymalizowane pod kątem szybkiego, wiarygodnego raportowania (schema-on-write). Jezioro danych przechowuje surowe dane dowolnego typu na dużą skalę i niskim kosztem, a strukturę stosuje się w czasie analizy (schema-on-read). Hurtownie nadają się do znanych pytań; jeziora do elastycznych, eksploracyjnych analiz.
Schema-on-write (hurtownia danych) definiuje i egzekwuje strukturę przed zapisaniem danych, więc dane są oczyszczone i gotowe do zapytań, ale sztywne. Schema-on-read (jezioro danych) przechowuje surowe dane takimi, jakimi są, i nakłada strukturę podczas analizy, co zachowuje elastyczność, ale odkłada pracę oczyszczania i interpretacji na czas zapytania.
Użyj jeziora danych dla dużych wolumenów surowych, różnorodnych danych oraz do elastycznych lub eksploracyjnych analiz, data science, uczenia maszynowego i badania pytań nieznanych z góry. Przechowuje dowolny typ danych tanio na dużą skalę, utrzymując dane szczegółowe dostępne, ale wymaga governance, aby nie stać się bezużytecznym bagnem danych.
Użyj hurtowni danych dla danych ustrukturyzowanych i dobrze zdefiniowanych, powtarzalnych potrzeb analitycznych: pulpity KPI, raportowanie operacyjne i finansowe, analityka biznesowa, tam, gdzie najważniejsze są prędkość, spójność i niezawodność dla znanych pytań. Jej wymodelowane dane dają szybkie, wiarygodne odpowiedzi na pytania, które można określić z góry.
Tak, zwykle. Powszechny wzorzec to przechowywanie surowych, wysokoczęstotliwościowych danych maszyn i z czujników w jeziorze dla elastycznej analizy i modelowania predykcyjnego, a następnie rafinowanie dobrze rozumianych metryk, takich jak OEE, do hurtowni dla szybkiego, niezawodnego raportowania. Jezioro często zasila hurtownię, a platformy lakehouse łączą oba modele.