Ключови изводи
Кратък отговор: Склад за данни и езеро за данни са два подхода за съхранение на данни за анализ.
Склад за данни съхранява структурирани, почистени и моделирани данни, организирани предварително (schema-on-write) и оптимизирани за бързи и надеждни отчети и бизнес интелигентност — той отговаря добре на познати въпроси.
Езеро за данни съхранява сурови данни от всякакъв тип — структурирани, полуструктурирани и неструктурирани — евтино и в голям мащаб, като структурата се прилага едва при четене (schema-on-read), което дава гъвкавост за изследване, наука за данните и машинно обучение.
Складовете разменят гъвкавост за скорост и консистентност; езерата разменят предварително зададена структура за гъвкавост и мащабируемост. Повечето съвременни архитектури използват и двата подхода, често с езерото като източник за склада.
Складът за данни е хранилище за структурирани, почистени и моделирани данни, проектирано и оптимизирано за отчети и бизнес интелигентност.
Преди данните да влязат в склада, те се обработват: извличат се от източниковите системи, трансформират се в последователна, определена структура и се зареждат в таблици, организирани според предварително зададена схема.
Това се нарича schema-on-write: структурата се решава и налага преди данните да бъдат съхранени, така че всичко в склада вече е чисто, последователно и готово за заявки.
Ползата е скорост и надеждност за познати въпроси: тъй като данните са моделирани предварително и оптимизирани за аналитични заявки, таблата и отчетите работят бързо и връщат последователни, доверени отговори. Складовете са традиционната основа на бизнес интелигентността.
KPI, финансови отчети, табла за представяне — където знаете предварително какво искате да измерите и се нуждаете от бързи и надеждни резултати.
Компромисът е в твърдостта и усилието: определянето на схемата предварително и трансформирането на всички входящи данни изисква работа, а складът обработва главно структурирани данни, които пасват на неговия модел.
Нови въпроси, които схемата не е предвидила, или разхвърляни типове данни, които не се вписват в чисти таблици, са неудобни за склад. Той превъзхожда в бързите отговори на добре дефинирани въпроси, но не и в откритото изследване.
Езерото за данни е хранилище, което съхранява сурови данни от почти всякакъв тип — структурирани таблици, полуструктурирани логове и JSON, и неструктурирани данни като изображения, видео и потоци от сензори — в голям мащаб и на ниска цена, в тяхната натурална форма.
Ключово е, че езерото не изисква дефиниране на структура преди зареждането; данните се съхраняват такива, каквито са, и структурата се прилага едва при четене и анализ.
Това е schema-on-read: вие решавате как да интерпретирате данните по време на заявката, не при съхранението. Предимствата са гъвкавост и мащабируемост.
Тъй като всичко може да се съхранява евтино без предварително моделиране, езерото може да съдържа огромни количества разнообразни сурови данни, като ги запазва достъпни за какъвто и да е анализ по-късно, включително експлораторен анализ, наука за данните и машинно обучение, които се нуждаят от сурови, детайлни данни вместо предварително агрегирани таблици.
Езерото е естественото място за данни с висок обем от машини и сензори, както и за отворени въпроси, които не можете да зададете предварително.
Компромисът е, че суровите, немоделирани данни са по-трудни за директна употреба: без предварително почистване и структуриране като в склада, получаването на надеждни отговори изисква повече усилие по време на анализа, а неуправлявано езеро може да се превърне в "блато от данни" — неизползваеми, слабо каталогизирани данни.
Определящият технически контраст е schema-on-write срещу schema-on-read — първо структура срещу първо съхранение. Складът налага структура преди съхранението (schema-on-write): вие моделирате данните, трансформирате ги да паснат и едва след това ги зареждате, така че това, което се съхранява, вече е чисто и готово за заявки.
Езерото първо съхранява, а после структурира (schema-on-read): запазвате суровите данни такива, каквито са, и прилагате структура при анализа, така че гъвкавостта се запазва, а тълкуването се отлага. Тази единствена разлика определя повечето от останалите.
Schema-on-write прави складовете бързи и последователни за предварително дефинирани въпроси, но и твърди и трудни за промяна, и ги ограничава главно до структурирани данни.
Schema-on-read прави езерата гъвкави, мащабируеми и способни да съдържат всякакъв тип данни, но прехвърля работата по почистване и структуриране към времето на анализа и създава риск от несъответствия.
Просто казано, складът определя предварително какво означават данните и е оптимизиран за използване именно по този начин; езерото оставя опциите отворени и решава какво означават данните, когато възникне въпросът.
Нито един от подходите не е грешен — те оптимизират срещуположни приоритети: скорост и надеждност за познатите въпроси срещу гъвкавост и мащаб за непознатите въпроси.
Практическият извод е, че складовете и езерата обслужват различни аналитични нужди.
Складът за данни е идеален, когато знаете какво искате да измерите и се нуждаете от това бързо и надеждно — повтарящи се отчети, табла с KPI и BI заявки, които организациите изпълняват всеки ден.
Неговите моделирани, почистени данни дават последователни, доверени отговори на тези добре дефинирани въпроси бързо, което е точно това, от което се нуждаят оперативните и управленски отчети.
Езерото за данни е идеално, когато въпросите са отворени или още неизвестни — за експлораторен анализ, наука за данните, разработка на модели за машинно обучение и всяка работа, която се нуждае от сурови, детайлни и разнообразни данни.
Неговата гъвкавост позволява на анализаторите и специалистите по данни да изследват свободно, да комбинират необичайни типове данни и да откриват модели, които фиксираната схема на склада никога не би разкрила.
Така двата отговарят на различни видове въпроси: складът е за въпросите, които можете да специфицирате предварително и трябва да бъдат отговорени надеждно и повтарящо се; езерото е за въпросите, които откривате по време на изследването.
Затова те са допълващи се, а не конкурентни — една организация се нуждае както от бързи и надеждни отчети, така и от гъвкави възможности за изследване.
Разгледайте производствени данни. Фабрика генерира високочестотни сурови сигнали от машини и сензори, вибрационни следи, температурни потоци, логове на събития, изображения от инспекционни камери — огромен, разнообразен и бързо течещ обем данни.
Тези сурови данни естествено попадат в езеро за данни: съхраняват се евтино в естествената си форма, запазват се детайлни и са достъпни за специалисти по данни да ги изследват, да тренират модели за предсказуема поддръжка и да разследват въпроси, които никой не е специфицирал предварително.
От този суров материал се изчисляват добре дефинираните оперативни метрики.
OEE, престои по причина, продукция по линия, нива на качество се изчисляват, почистват и моделират, след което се зареждат в склад за данни, където захранват ежедневните табла и отчети, на които мениджърите и операторите разчитат — бързо и последователно.
Ръководител на завод, който отваря табло за OEE, прави заявка към склада: познат въпрос, на който се отговаря надеждно за секунди от моделирани данни.
Специалист по данни, търсещ ранни признаци на повреда на лагер, работи в езерото: отворен въпрос, изследван върху сурови сензорни данни.
Същата фабрика се нуждае и от двете: езерото за да запази всички сурови данни за откриване и склада за да доставя доверени, бързи отговори на въпросите, които вече знае, че трябва да следи.
Често езерото захранва склада, като суровите данни се преработват в структурирани метрики.
Избирайте според характера на данните и въпросите, и признайте, че повечето архитектури се нуждаят и от двете.
Използвайте склад за данни за структурирани данни и добре дефинирани, повтарящи се аналитични нужди — оперативно отчитане, табла с KPI, финансово и представително BI — където скоростта, последователността и надеждността за познатите въпроси са най-важни.
Използвайте езеро за данни за големи обеми от сурови, разнообразни данни и за гъвкав, изследователски или напреднал анализ — наука за данните, машинно обучение и разследване на въпроси, които не са известни предварително — където гъвкавостта и мащабируемостта са най-важни.
На практика двата подхода все повече се комбинират: често се съхраняват всички сурови данни в езерото и се преработват избрани, добре разбрани данни в склада за отчитане, така че езерото предоставя гъвкав мащаб, а складът — надежден структуриран достъп.
По-новите "lakehouse" архитектури дори съчетават двата модела в една платформа, прилагайки структури и надеждност, характерни за складовете, върху съхранение, типично за езерата.
Рамката не е да изберете едното, а да съпоставите всеки работен товар: надеждното отчитане на познатите въпроси към склада, гъвкавото изследване на непознатите въпроси към езерото, и да управлявате езерото добре, за да не се превърне в неизползваемо блато от данни.
Разделението между езеро и склад за данни оформя как данните за OEE се съхраняват и анализират. Структурираните OEE метрики захранват ежедневните табла.
Наличност, Производителност, Качество, престои по причина, продукция по линия са класически складови данни: добре дефинирани, повтарящи се и изискващи бързи, надеждни отговори, затова естествено се съхраняват в типично складово хранилище, оптимизирано за отчети.
Подлежащите сурови, високочестотни машинни и сензорни данни — детайлните потоци, от които се откриват загуби и от които се изграждат предсказателни модели — са класически езерни данни: с висок обем, разнообразни и ценни за отворен анализ, затова принадлежат на езеро.
Добрата архитектура използва и двете: езерото съхранява суровите машинни данни (често улавяни чрез SCADA, DCS и edge устройства) и захранва склада с прецизирани OEE метрики за доверено отчитане.
Това също е свързано с мястото, където се извършва обработката — разделението edge срещу облачни изчисления определя как суровите данни достигат до тези хранилища.
Правилната архитектура за съхранение означава, че OEE отчетите са бързи и надеждни, докато суровите данни остават достъпни за по-дълбоки анализи, които откриват хронични загуби.
Fabrico превръща суровите машинни и производствени данни в структурирани OEE метрики, които са необходими за отчитане — прецизни, надеждни стойности за Наличност, Производителност и Качество и причините за престои, които мениджърите запитват всеки ден.
Независимо дали подлежащите сурови данни се намират в езеро и моделираните метрики в склад, Fabrico доставя чиста, структурирана картина на загубите върху тях, така че производството и ръководството да получават бързи, достоверни отговори, докато суровите данни остават достъпни за по-задълбочен анализ.
Запазете демо, за да видите структурирано OEE, изградено от вашите машинни данни.
Складът за данни съхранява структурирани, почистени и моделирани данни, оптимизирани за бързи и надеждни отчети (schema-on-write). Езерото за данни съхранява сурови данни от всякакъв тип в голям мащаб и на ниска цена, като структурата се прилага по време на анализа (schema-on-read). Складовете са подходящи за познати въпроси; езерата — за гъвкав, експлораторен анализ.
Schema-on-write (склад за данни) дефинира и налага структура преди данните да бъдат съхранени, така че те са чисти и готови за заявки, но това ги прави твърди. Schema-on-read (езеро за данни) съхранява суровите данни такива, каквито са, и прилага структура при анализа, запазвайки гъвкавостта, но отлагайки работата по почистване и тълкуване до момента на заявката.
Използвайте езеро за данни за големи обеми от сурови, разнообразни данни и за гъвкав или експлораторен анализ, наука за данните, машинно обучение и въпроси, които не са известни предварително. То съхранява всякакъв тип данни евтино и в мащаб, като запазва детайлните данни достъпни, но изисква управление, за да не се превърне в неизползваемо блато от данни.
Използвайте склад за данни за структурирани данни и добре дефинирани, повтарящи се аналитични нужди — табла с KPI, оперативни и финансови отчети, бизнес интелигентност — където скоростта, последователността и надеждността за познати въпроси са най-важни. Неговите моделирани данни дават бързи, достоверни отговори на въпроси, които можете да специфицирате предварително.
Да, обикновено. Честа практика е да се съхраняват сурови високочестотни машинни и сензорни данни в езеро за гъвкав анализ и предсказуемо моделиране, след което добре разбрани метрики като OEE да се преработват и зареждат в склад за бързо и надеждно отчитане. Езерото често захранва склада, а lakehouse платформите обединяват и двата модела.