Обложка канала

Ivan Begtin

3903 @begtin

I am focused on Open Data, Procurement, e-Government, Open Government and other tech stuff

Ivan Begtin

4 года назад
Открыть в
Полезное чтение про modern data stack - сравнение продуктов построения озер данных: Apache Hudi, Apache Iceberg и Delta [1]. Всё крутится вокруг экосистемы Apache Spark, со своими достоинствами и недостатками - обработка данных в реальном времени в Grab [2]. В основе MySQL + Kafka + Kafka Connect + Debezium. - построение современного стека работы с данными в Whatsnot [3]. У них не очень сложный стек, большая часть наблюдений за ним скорее через инфраструктурные инструменты вроде Datadog. - Benn Stancil пишет о том что для стартапов выручка не должна быть ключевым KPI [4], лично я несогласен, но чтение полезное. - описание свежей системы управления потоками данных DopplerTask [5] с открытым кодом. Написано на Javascript, из СУБД привязка явная к MySQL и есть low-code инструмент построения потоков задач. Больше напоминает n8, если честно Ссылки: [1] towardsdatascience.com/the-key…93c6866f [2] engineering.grab.com/real-ti…ngestion [3] medium.com/whatnot…1d03c3f9 [4] benn.substack.com/p/start…-revenue [5] medium.com/@ferasw…8167aba1 #datatools #opensource #reading #data #moderndatastack
The Key Feature Behind Lakehouse Data Architecture

Understanding the modern table formats and their current state

Medium