Исследователи из DeepMind обучили генеративную модель, которая сегментирует действия на видеозаписи. Модель обучается распознавать действия без реальной разметки действий на видеозаписи. В качестве архитектуры исследователи выбрали полумарковскую модель. Алгоритм выдает сравнимые с state-of-the-art результаты.