В блоге PicNic Engeneering интересные подробности [1] внутренностей работы с данными в этом стартапе (PicNic - один из крупных онлайн ритейлеров со штаб квартирой в Нидерландах и $350 млрд. инвестициями [2])
Как пример цифровой среды компании изначально существующей в цифровом мире интересны цифры: - 120 микросервисов/источников данных/сервисов - около 1000 ежедневных ELT/ETL задач по сбору и агрегации данных - около 50% сотрудников не относящихся к технарям владеют SQL - средний бизнес аналитик делает до 300 SQL запросов в сутки - в хранилище данных 15 тысяч таблиц, 247 тысяч полей и 121 миллиард строк
Там же много рассказа про организацию работу, используемый стек технологий из смеси облачных решений и открытого кода.
Публикация ещё ноябрьская этого года, но своей актуальности не потеряла, а их блог [3] могу порекомендовать как хороший пример качественной коммуникации с сообществом, много любопытного по Data Engineering там есть, как технического, так и, что лично мне интереснее, организационного.
К сожалению, к государственным проектам такой опыт применим лишь в малой степени, потому большая часть примеров инфраструктуры данных крупных дата-стартапов построена на облачных решениях и общедоступных решениях. А в госпроектах куда ни ткни, либо тех технологической инфраструктуры удобной для быстрого запуска, или такие ограничения по безопасности что применять современные технологии/стеки невозможно.