Полезное чтение про modern data stack
- сравнение продуктов построения озер данных: Apache Hudi, Apache Iceberg и Delta [1]. Всё крутится вокруг экосистемы Apache Spark, со своими достоинствами и недостатками
- обработка данных в реальном времени в Grab [2]. В основе MySQL + Kafka + Kafka Connect + Debezium.
- построение современного стека работы с данными в Whatsnot [3]. У них не очень сложный стек, большая часть наблюдений за ним скорее через инфраструктурные инструменты вроде Datadog.
- Benn Stancil пишет о том что для стартапов выручка не должна быть ключевым KPI [4], лично я несогласен, но чтение полезное.
- описание свежей системы управления потоками данных DopplerTask [5] с открытым кодом. Написано на Javascript, из СУБД привязка явная к MySQL и есть low-code инструмент построения потоков задач. Больше напоминает n8, если честно
Ссылки:
[1] towardsdatascience.com/the-key…93c6866f
[2] engineering.grab.com/real-ti…ngestion
[3] medium.com/whatnot…1d03c3f9
[4] benn.substack.com/p/start…-revenue
[5] medium.com/@ferasw…8167aba1
#datatools #opensource #reading #data #moderndatastack