Menu
Езеро от данни срещу хранилище за данни: два начина за съхранение на производствени данни

Езеро от данни срещу хранилище за данни: два начина за съхранение на производствени данни

Хранилище за данни съхранява структурирани, моделирани данни за бързо отчитане; езеро от данни съхранява сурови данни от всякакъв тип за гъвкав, мащабен анализ.
Езеро от данни срещу хранилище за данни: два начина за съхранение на производствени данни

Ключови изводи

  • Склад за данни съхранява структурирани, почистени и моделирани данни, оптимизирани за отчети и бизнес интелигентност (BI).
  • Езеро за данни съхранява сурови данни от всякакъв тип — структурирани, полуструктурирани и неструктурирани — в голям обем и на ниска цена.
  • Складът използва schema-on-write (структурата е дефинирана преди зареждането); езерото използва schema-on-read (структурата се прилага при анализа).
  • Складовете дават бързи и надеждни отговори на познати въпроси; езерата дават гъвкавост за експлораторен и напреднал анализ.
  • Повечето архитектури за данни използват и двата подхода, често с езерото, което захранва склада.

Кратък отговор: Склад за данни и езеро за данни са два подхода за съхранение на данни за анализ.

Склад за данни съхранява структурирани, почистени и моделирани данни, организирани предварително (schema-on-write) и оптимизирани за бързи и надеждни отчети и бизнес интелигентност — той отговаря добре на познати въпроси.

Езеро за данни съхранява сурови данни от всякакъв тип — структурирани, полуструктурирани и неструктурирани — евтино и в голям мащаб, като структурата се прилага едва при четене (schema-on-read), което дава гъвкавост за изследване, наука за данните и машинно обучение.

Складовете разменят гъвкавост за скорост и консистентност; езерата разменят предварително зададена структура за гъвкавост и мащабируемост. Повечето съвременни архитектури използват и двата подхода, често с езерото като източник за склада.

Какво е склад за данни

Складът за данни е хранилище за структурирани, почистени и моделирани данни, проектирано и оптимизирано за отчети и бизнес интелигентност.

Преди данните да влязат в склада, те се обработват: извличат се от източниковите системи, трансформират се в последователна, определена структура и се зареждат в таблици, организирани според предварително зададена схема.

Това се нарича schema-on-write: структурата се решава и налага преди данните да бъдат съхранени, така че всичко в склада вече е чисто, последователно и готово за заявки.

Ползата е скорост и надеждност за познати въпроси: тъй като данните са моделирани предварително и оптимизирани за аналитични заявки, таблата и отчетите работят бързо и връщат последователни, доверени отговори. Складовете са традиционната основа на бизнес интелигентността.

KPI, финансови отчети, табла за представяне — където знаете предварително какво искате да измерите и се нуждаете от бързи и надеждни резултати.

Компромисът е в твърдостта и усилието: определянето на схемата предварително и трансформирането на всички входящи данни изисква работа, а складът обработва главно структурирани данни, които пасват на неговия модел.

Нови въпроси, които схемата не е предвидила, или разхвърляни типове данни, които не се вписват в чисти таблици, са неудобни за склад. Той превъзхожда в бързите отговори на добре дефинирани въпроси, но не и в откритото изследване.

Какво е езеро за данни

Езерото за данни е хранилище, което съхранява сурови данни от почти всякакъв тип — структурирани таблици, полуструктурирани логове и JSON, и неструктурирани данни като изображения, видео и потоци от сензори — в голям мащаб и на ниска цена, в тяхната натурална форма.

Ключово е, че езерото не изисква дефиниране на структура преди зареждането; данните се съхраняват такива, каквито са, и структурата се прилага едва при четене и анализ.

Това е schema-on-read: вие решавате как да интерпретирате данните по време на заявката, не при съхранението. Предимствата са гъвкавост и мащабируемост.

Тъй като всичко може да се съхранява евтино без предварително моделиране, езерото може да съдържа огромни количества разнообразни сурови данни, като ги запазва достъпни за какъвто и да е анализ по-късно, включително експлораторен анализ, наука за данните и машинно обучение, които се нуждаят от сурови, детайлни данни вместо предварително агрегирани таблици.

Езерото е естественото място за данни с висок обем от машини и сензори, както и за отворени въпроси, които не можете да зададете предварително.

Компромисът е, че суровите, немоделирани данни са по-трудни за директна употреба: без предварително почистване и структуриране като в склада, получаването на надеждни отговори изисква повече усилие по време на анализа, а неуправлявано езеро може да се превърне в "блато от данни" — неизползваеми, слабо каталогизирани данни.

Първо структура срещу първо съхранение

Определящият технически контраст е schema-on-write срещу schema-on-read — първо структура срещу първо съхранение. Складът налага структура преди съхранението (schema-on-write): вие моделирате данните, трансформирате ги да паснат и едва след това ги зареждате, така че това, което се съхранява, вече е чисто и готово за заявки.

Езерото първо съхранява, а после структурира (schema-on-read): запазвате суровите данни такива, каквито са, и прилагате структура при анализа, така че гъвкавостта се запазва, а тълкуването се отлага. Тази единствена разлика определя повечето от останалите.

Schema-on-write прави складовете бързи и последователни за предварително дефинирани въпроси, но и твърди и трудни за промяна, и ги ограничава главно до структурирани данни.

Schema-on-read прави езерата гъвкави, мащабируеми и способни да съдържат всякакъв тип данни, но прехвърля работата по почистване и структуриране към времето на анализа и създава риск от несъответствия.

Просто казано, складът определя предварително какво означават данните и е оптимизиран за използване именно по този начин; езерото оставя опциите отворени и решава какво означават данните, когато възникне въпросът.

Нито един от подходите не е грешен — те оптимизират срещуположни приоритети: скорост и надеждност за познатите въпроси срещу гъвкавост и мащаб за непознатите въпроси.

Познати въпроси срещу изследване

Практическият извод е, че складовете и езерата обслужват различни аналитични нужди.

Складът за данни е идеален, когато знаете какво искате да измерите и се нуждаете от това бързо и надеждно — повтарящи се отчети, табла с KPI и BI заявки, които организациите изпълняват всеки ден.

Неговите моделирани, почистени данни дават последователни, доверени отговори на тези добре дефинирани въпроси бързо, което е точно това, от което се нуждаят оперативните и управленски отчети.

Езерото за данни е идеално, когато въпросите са отворени или още неизвестни — за експлораторен анализ, наука за данните, разработка на модели за машинно обучение и всяка работа, която се нуждае от сурови, детайлни и разнообразни данни.

Неговата гъвкавост позволява на анализаторите и специалистите по данни да изследват свободно, да комбинират необичайни типове данни и да откриват модели, които фиксираната схема на склада никога не би разкрила.

Така двата отговарят на различни видове въпроси: складът е за въпросите, които можете да специфицирате предварително и трябва да бъдат отговорени надеждно и повтарящо се; езерото е за въпросите, които откривате по време на изследването.

Затова те са допълващи се, а не конкурентни — една организация се нуждае както от бързи и надеждни отчети, така и от гъвкави възможности за изследване.

Пример

Разгледайте производствени данни. Фабрика генерира високочестотни сурови сигнали от машини и сензори, вибрационни следи, температурни потоци, логове на събития, изображения от инспекционни камери — огромен, разнообразен и бързо течещ обем данни.

Тези сурови данни естествено попадат в езеро за данни: съхраняват се евтино в естествената си форма, запазват се детайлни и са достъпни за специалисти по данни да ги изследват, да тренират модели за предсказуема поддръжка и да разследват въпроси, които никой не е специфицирал предварително.

От този суров материал се изчисляват добре дефинираните оперативни метрики.

OEE, престои по причина, продукция по линия, нива на качество се изчисляват, почистват и моделират, след което се зареждат в склад за данни, където захранват ежедневните табла и отчети, на които мениджърите и операторите разчитат — бързо и последователно.

Ръководител на завод, който отваря табло за OEE, прави заявка към склада: познат въпрос, на който се отговаря надеждно за секунди от моделирани данни.

Специалист по данни, търсещ ранни признаци на повреда на лагер, работи в езерото: отворен въпрос, изследван върху сурови сензорни данни.

Същата фабрика се нуждае и от двете: езерото за да запази всички сурови данни за откриване и склада за да доставя доверени, бързи отговори на въпросите, които вече знае, че трябва да следи.

Често езерото захранва склада, като суровите данни се преработват в структурирани метрики.

Кога да използвате кое

Избирайте според характера на данните и въпросите, и признайте, че повечето архитектури се нуждаят и от двете.

Използвайте склад за данни за структурирани данни и добре дефинирани, повтарящи се аналитични нужди — оперативно отчитане, табла с KPI, финансово и представително BI — където скоростта, последователността и надеждността за познатите въпроси са най-важни.

Използвайте езеро за данни за големи обеми от сурови, разнообразни данни и за гъвкав, изследователски или напреднал анализ — наука за данните, машинно обучение и разследване на въпроси, които не са известни предварително — където гъвкавостта и мащабируемостта са най-важни.

На практика двата подхода все повече се комбинират: често се съхраняват всички сурови данни в езерото и се преработват избрани, добре разбрани данни в склада за отчитане, така че езерото предоставя гъвкав мащаб, а складът — надежден структуриран достъп.

По-новите "lakehouse" архитектури дори съчетават двата модела в една платформа, прилагайки структури и надеждност, характерни за складовете, върху съхранение, типично за езерата.

Рамката не е да изберете едното, а да съпоставите всеки работен товар: надеждното отчитане на познатите въпроси към склада, гъвкавото изследване на непознатите въпроси към езерото, и да управлявате езерото добре, за да не се превърне в неизползваемо блато от данни.

Чести грешки

  • Силово насаждане на изследователска аналитика в склад. Твърдият schema-on-write се бори със сурови, разнообразни данни и отворени въпроси — тази работа принадлежи на езерото.
  • Извършване на ежедневни отчети директно върху сурови данни от езерото. Без моделиране отчетите за познати въпроси са бавни и непоследователни — преработете ги в склад.
  • Оставяне на езерото да се превърне в блато. Неразпределените, некаталогизирани сурови данни стават неизползваеми; езерата се нуждаят от метаданни и управление.
  • Отнасяне към тях като изключващи се варианти. Складовете и езерата са допълващи се; повечето архитектури използват и двете, често с езерото, което захранва склада.

Как се проявява това в OEE

Разделението между езеро и склад за данни оформя как данните за OEE се съхраняват и анализират. Структурираните OEE метрики захранват ежедневните табла.

Наличност, Производителност, Качество, престои по причина, продукция по линия са класически складови данни: добре дефинирани, повтарящи се и изискващи бързи, надеждни отговори, затова естествено се съхраняват в типично складово хранилище, оптимизирано за отчети.

Подлежащите сурови, високочестотни машинни и сензорни данни — детайлните потоци, от които се откриват загуби и от които се изграждат предсказателни модели — са класически езерни данни: с висок обем, разнообразни и ценни за отворен анализ, затова принадлежат на езеро.

Добрата архитектура използва и двете: езерото съхранява суровите машинни данни (често улавяни чрез SCADA, DCS и edge устройства) и захранва склада с прецизирани OEE метрики за доверено отчитане.

Това също е свързано с мястото, където се извършва обработката — разделението edge срещу облачни изчисления определя как суровите данни достигат до тези хранилища.

Правилната архитектура за съхранение означава, че OEE отчетите са бързи и надеждни, докато суровите данни остават достъпни за по-дълбоки анализи, които откриват хронични загуби.

Как Fabrico се вписва

Fabrico превръща суровите машинни и производствени данни в структурирани OEE метрики, които са необходими за отчитане — прецизни, надеждни стойности за Наличност, Производителност и Качество и причините за престои, които мениджърите запитват всеки ден.

Независимо дали подлежащите сурови данни се намират в езеро и моделираните метрики в склад, Fabrico доставя чиста, структурирана картина на загубите върху тях, така че производството и ръководството да получават бързи, достоверни отговори, докато суровите данни остават достъпни за по-задълбочен анализ.

Запазете демо, за да видите структурирано OEE, изградено от вашите машинни данни.

Свързано четиво

Често задавани въпроси

Каква е разликата между езеро за данни и склад за данни?

Складът за данни съхранява структурирани, почистени и моделирани данни, оптимизирани за бързи и надеждни отчети (schema-on-write). Езерото за данни съхранява сурови данни от всякакъв тип в голям мащаб и на ниска цена, като структурата се прилага по време на анализа (schema-on-read). Складовете са подходящи за познати въпроси; езерата — за гъвкав, експлораторен анализ.

Какво е schema-on-read и какво е schema-on-write?

Schema-on-write (склад за данни) дефинира и налага структура преди данните да бъдат съхранени, така че те са чисти и готови за заявки, но това ги прави твърди. Schema-on-read (езеро за данни) съхранява суровите данни такива, каквито са, и прилага структура при анализа, запазвайки гъвкавостта, но отлагайки работата по почистване и тълкуване до момента на заявката.

Кога трябва да използвам езеро за данни?

Използвайте езеро за данни за големи обеми от сурови, разнообразни данни и за гъвкав или експлораторен анализ, наука за данните, машинно обучение и въпроси, които не са известни предварително. То съхранява всякакъв тип данни евтино и в мащаб, като запазва детайлните данни достъпни, но изисква управление, за да не се превърне в неизползваемо блато от данни.

Кога складът за данни е по-добрият избор?

Използвайте склад за данни за структурирани данни и добре дефинирани, повтарящи се аналитични нужди — табла с KPI, оперативни и финансови отчети, бизнес интелигентност — където скоростта, последователността и надеждността за познати въпроси са най-важни. Неговите моделирани данни дават бързи, достоверни отговори на въпроси, които можете да специфицирате предварително.

Използват ли фабриките и езеро, и склад за данни?

Да, обикновено. Честа практика е да се съхраняват сурови високочестотни машинни и сензорни данни в езеро за гъвкав анализ и предсказуемо моделиране, след което добре разбрани метрики като OEE да се преработват и зареждат в склад за бързо и надеждно отчитане. Езерото често захранва склада, а lakehouse платформите обединяват и двата модела.

Последно от блога

Начертайте вашата пътна карта за надеждност
Изчислете потенциалната възвръщаемост: запазете час за демонстрация
Начертайте вашата пътна карта за надеждност
Като натиснете бутона Приемам, вие давате съгласието си за използването на `бисквитки`, докато ползвате до този уебсайт. За да научите повече за това как `бисквитките` се използват и управляват, моля, вижте нашата Политика за поверителност и Декларация за Бисквитките