Google представила нейросеть Imagen, которая генерирует изображения по описанию
Для распознавания текстового запроса нейросеть использует большие языковые модели — на них же основаны алгоритмы обработки естественной речи вроде GPT-3 от Open AI. В компании отметили, что Imagen воспринимает сложные запросы лучше, чем DALL-E 2. Google предложила фокус-группе сравнить иллюстрации, которые сгенерировали Imagen, DALL-E 2 и другие модели преобразования. Эксперимент показал, что люди чаще всего отдавали предпочтение изображениям, сгенерированным нейросетью Google.
Система работает в три этапа — сначала генерирует на основе полученных данных первое изображение размером 64х64 пикселей. Затем диффузионные модели поэтапно повышают разрешение полотна до 256х256 и 1024х1024 точек, параллельно с этим дорисовывая детали. Как и многие художники, ИИ начинает с грубого эскиза, который постепенно заполняется.