BachGAN — это нейросеть, которая генерирует изображения в высоком разрешении на основе карт расположения объектов. Модель принимает на вход схему с целевым расположением объектов. Нейросеть заполняет остаток изображения по схеме. BachGAN обходит существующие подходы на датасетах Cityscapes и ADE20K.
Taskmaster-2 — это датасет с 17,289 диалогов на 7 тем: рестораны, заказ еды, кино, отели, полеты, музыка и спорт. Все диалоги в датасете собирали с помощью системы Wizard of Oz (WOz), которую использовали при создании первой версии датасета. В WOz волонтеры через веб-интерфейс играют роль пользователя и взаимодействуют с оператором-человеком, который играет роль персонального ассистента.
Samsung AI опубликовали нейросетевую модель, которая заменяет освещение на изображении в зависимости от времени суток. HiDT объединяет в себе генеративную image-to-image модель и новую методику апсемплинга, которая позволяет генерировать изображения в высоком разрешении.
Transformer-OCR — нейросетевая модель, которую обучили распознавать надписи на изображениях. Модель обходит существующие state-of-the-art методы на 5 датасетах. Transformer-OCR состоит из двух модулей: модуль для извлечения признаков из входного изображения и модуль с трансформером, который принимает на вход карты признаков.
Исследователи из FAIR перенесли существующую модель для распознавания позы человека на шимпанзе. Модель основывается на архитектуре DensePose и R-CNN. Помимо модели, исследователи опубликовали два датасета с размеченными позами шимпанзе.
Исследователи из AllenAI опубликовали на Kaggle датасет с 29 тысячами открытых научных статей о COVID-19. Для COVID-19 Open Research Dataset доступны 10 соревнований в области обработки естественного языка.
За 2019 год Facebook заблокировал 2 миллиарда фейковых аккаунтов. Мошенники используют фейковые аккаунты, чтобы распространять спам, ссылки на фишинговые сайты или малварь. Deep Entity Classification (DEC) модель использует дескриптивные характеристики профиля для классификации фейковых профилей. Всего признаков, которые описывают профиль, более 20 тысяч.
SegVoxelNet — это нейросеть для распознавания средств передвижения в 3D. Модель принимает на вход облако точек с моделью дороги. На выходе она предсказывает границы объектов. SegVoxelNet обходит state-of-the-art подходы, которые принимают на вход только облако точек.
Исследователи из Google AI опубликовали библиотеку Neural Tangents. Библиотека позволяет строить и обучать бесконечно широкие нейронные модели. Одним из примеров использования библиотеки является задача ансамблирования моделей. Neural Tangents позволяет собирать и обучать ансамбли бесконечно широких нейросетей в 5 строчек кода.
DroneVehicle — это датасет с 15,532 RGB снимками с дронов. Для каждого изображения есть инфракрасный снимок. Разметка объектов доступна и для RGB, и для инфракрасных снимков. В датасете размечены границы объектов и классы объектов. Всего в датасете разметили 441,642 объектов для 31,064 изображений.
В Facebook появилась возможность конвертировать свою 2D фотографию в 3D с помощью функционала 3D Photos. Внутри 3D Photos — сверточная нейросеть, которая принимает на вход 2D фото и генерирует карту глубины этого фото.
Lexikon — это внутренняя рекомендательная система датасетов в Spotify. Цель Lexikon заключается в том, чтобы облегчить поиск данных для сотрудников, которые занимаются анализом данных.
Adversarial Deepfakes — это набор состязательных примеров для классификаторов, которые распознают фейковые видео. Данные были сгенерированы на основе датасета FaceForensics++. Дипфейки — это сгенерированные видеозаписи говорящих людей. Такие фейковые видео могут использоваться в злонамеренных целях для дезинформации, оскорбления или нанесения вреда репутации. Последние методы распознавания дипфейков основываются на сверточных нейросетях. Исследователи показывают, что существующие детекторы можно обойти, если модифицировать фейковые видео.
Google AI опубликовали шестую версию датасета Open Images, — Open Images V6. В Open Images добавили разметку взаимосвязей объектов на изображении, человеческих действий и лейблы изображений. Помимо этого, в шестой версии датасета есть локализованные нарративы для 500 тысяч изображений. Локализованный нарратив — это мультимодальная разметка изображения, которая состоит из синхронизированных голоса, текста и движения компьютерной мыши по изображению.
NASA запустили соревнование по разработке сенсора для распознавания и обхода препятствий планетоходом, который будет исследовать Венеру. AREE — это автоматизированный планетоход, который разрабатывается в NASA. Целью соревнования является внедрить в планетоход функционал по распознаванию и обходу препятствий. Примерами препятствий являются камни, расщелины и крутая местность.
DIDI — это датасет, который содержит изображения нарисованных диаграмм и данные о процессе отрисовки диаграмм. Всего в датасете 58,655 рисунков, которые нарисовали 364 добровольцев. Сбором датасета занимались исследователи из Google Research и ETH Zurich. Исследователи собрали DIDI, чтобы спровоцировать исследовании в области представления интерактивных графических символов.
CookGAN — это генеративно-состязательная нейросеть, которая синтезирует реалистичное изображение блюда на основе списка ингредиентов. Модель основывается на StackGAN. Для того, что бы соотносить списки ингредиентов с изображениями, исследователи обучают отдельную модель с механизмом внимания. Результаты ассоциативной модели используются затем в генеративной сети.
MonoLayout — это нейросетевая модель, которая генерирует схему дороги с высоты птичьего полета по одному изображению. Модель может генерировать схемы в реальном времени со скоростью до 30 кадров в секунду. MonoLayout обходит state-of-the-art модели на вариациях датасета KITTI: KITTI-Raw, KITTI-Object и KITTI Odometry.