Обложка канала

Ivan Begtin

3903 @begtin

I am focused on Open Data, Procurement, e-Government, Open Government and other tech stuff

Ivan Begtin

4 года назад
Открыть в
В блоге Spotify краткий пост о том как в компании команды переходят на систему управления потоками данных на базе Flyte [1], заменяя на него использовавшиеся ранее системы Luigi [2] и Flo [3]. В отличие от них Flyte [4] создавался с акцентом на задачи ML/Data science и с некоторыми особенностями которые отличают его от других движков. 1. Flyte построен на принципах что конфигурация это код. Вместо файлов YAML задачи описываются в коде на Python 2. Изначально разработан под расширение через код на Python 3. Автоматически отслеживает происхождение данных (data lineage) И ещё много всего, продукт весьма интересный и, что немаловажно, простой в использовании. А для тех кто ещё не определился на каком движке строить управление потоками данных, неплохая подборка в Awesome workflow engines [5] Ссылки: [1] engineering.atspotify.com/2022/03…-service [2] https://github.com/spotify/luigi [3] https://github.com/spotify/flo [4] https://flyte.org/ [5] meirwah.github.io/awesome…-engines #data #datatools #opensource #datapipelines
Why We Switched Our Data Orchestration Service

TL;DR Within Spotify, we run 20,000 batch data pipelines defined in 1,000+ repositories, owned by 300+ teams — daily. The majority of our pipelines rely on two tools: Luigi (for the Python folks) and Flo (for the Java folks). In 2019, the data orchestration team at Spotify decided to move away from

Spotify Engineering