Задача сжатия размера изображения с минимальной потерей качества — это одна из актуальных проблем в компьютерном зрении. Для ее решения state-of-the-art подходом является использование GAN. Исследователи из Google Research проэкспериментировали с архитектурами GAN для сжатия изображений. Предложенная модель (HiFiC), по результатам сравнений, обходит прошлые подходы даже в случае, если state-of-the-art модели используют битрейт в два раза выше.
Исследователи из OpenAI обучили GPT-2 модель дополнять и генерировать изображения. Обученная iGPT обходит state-of-the-art подходы в задаче классификации изображений. Несмотря на более высокие скоры по сравнению со сверточными моделями, обучение iGPT более ресурсоемкое. При этом модель не требует изменений в архитектуре для дообучения на новых задачах.
PIFuHD — это нейросетевая архитектура для восстановления 3D модели человека из 2D изображения. Подход обходит существующие архитектуры в детализированности генерируемых 3D моделей. Разработкой модели занимались исследователи из Facebook AI.
BentoML — это открытая библиотека для высокопроизводительного инференса ML-моделей. Инструмент облегчает процесс создания API методов для доступа к обученной модели. BentoML совместим со всеми крупными фреймворками машинного обучения: Tensorflow, Keras, PyTorch, XGBoost, scikit-learn и fastai.
YOLOv5 — обновленная версия YOLO, state-of-the-art модели для распознавания объектов в реальном времени. YOLOv5 выдает предсказания со скоростью 140 кадров в секунду. При этом модель весит меньше, чем YOLOv4, на ~90%.
Meta-Graph — это нейросетевая модель для предсказания утерянных связей в графах. Цель Meta-Graph заключается в том, что бы восстановить связи в графах, которые содержат только маленькую часть реальных связей. При этом предполагается, что графы — из одной области и представляют одно и то же. Кроме архитектуры модели, исследователи публикуют датасеты, на которых тестировали подход. Разработкой модели занимались исследователи из Uber AI.
RoadText-1K — это датасет для распознавания текста дорожных знаков с видеозаписей. Датасет в 20 раз больше, чем самый крупный существующий датасет для текста в видео. Данные состоят из 1000 видеозаписей, снятых во время езды по дороге. Для каждой видеозаписи доступна разметка текста вместе с границами надписи и транскриптом.
DEtection TRansformers (DETR) — это нейросетевой подход для распознавания объектов и паноптической сегментации объектов на изображении. DETR использует в своей основе архитектуру Transformer. Нейросеть выдает сравнимые с state-of-the-art результаты на датасете COCO. При этом в сравнении с стандартными моделями для распознавания объектов DETR имеет облегченную архитектуру.
Samsung AI опубликовали схему обучения модели для интерактивной сегментации. Пользователь указывает курсором на объект, а модель выдает предсказания границ объекта. Предложенный метод f-BRS обходит существующие state-of-the-art подходы. При этом, в сравнении с оригинальной BRS, предложенная схема на порядок быстрее выдает предсказания.
DeepMind совместно с Moorfields Eye Hospital и Google Health обучили нейросеть, которая распознает развитие заболевания сетчатки. Модель обучена детектировать развитие возрастной макулярной дегенерации (AMD) у пациента в следующие 6 месяцев. По результатам экспериментов, подход выдает сравнимые по точности или более точные заключения, чем эксперты.
Сервис онлайн-образования Яндекс.Практикум в поиске Наставников на факультет Data Science.
Мы помогаем людям расти — на работе и в жизни. Студенты могут освоить новую специальность, заговорить на иностранном языке и получать удовольствие от того, чем занимаются — каждый день. А поддерживают их на новом пути наставники.
✔️Что делает наставник? Наставник отвечает на вопросы студентов, проводит вебинары и помогает с трудностями на протяжении всего процесса обучения. Наставничество можно совмещать с основной работой, если вы готовы уделять проекту от 6 часов в неделю.
✔️Что нужно, чтобы стать наставником? Необходимо владение Python и знание библиотек Pandas, NumPy, Matplotlib, Seaborn и, желательно, Plotly. А также знание основ математического анализа, линейной алгебры, теории вероятности и статистики.
Если вы работали с проектами из сферы машинного обучения и хотите делиться знаниями, будем рады отклику: https://clck.ru/NmmiF
Нейросеть от NVIDIA сгенерировала работающую версию игры PAC-MAN без игрового движка. GameGAN — это первая нейросеть, которая способна мимикрировать игровые движки и генерировать новые игры.
MMFashion — это оперсорсный инструмент для анализа изображений одежды, который основан на PyTorch. Библиотека разрабатывается исследователями из Multimedia Lab в CUHK.
EfficientPS — это нейросетевая модель для паноптической сегментации объектов на изображении. На данный момент модель обходит state-of-the-art подходы на датасетах Cityscapes, KITTI, Mapillary Vistas и IDD.
DeepFaceLab — это опенсорсная система для создания дипфейков. Система рассчитана одновременно на пользователей без знаний о фреймворках глубокого обучения и на разработчиков, которые хотят усилить существующий пайплайн. Репозиторий проекта имеет 3 тысячи форков и 14 тысяч звезд на GitHub.
Восстановление цвета на изображении — это одна из открытых задач в компьютерном зрении. Исследователи из National Tsing Hua University и Virginia Tech обучили модель, которая учитывает распознанные instance-маски объектов при восстановлении цвета. Предложенная архитектура обходит существующие подходы.
Big Transfer — это подход для предобучения представлений изображений от Google AI. Предобученную модель затем можно использовать для дообучения на собственной задаче. Исследователи опубликовали предобученные модели и код для TF2, Jax и PyTorch.
Hateful Memes датасет состоит более чем из 10 тысяч примеров оскорбительных мемов. Разработкой датасета занимались исследователи из Facebook AI. На базе датасета запустили соревнование по распознаванию оскорбительных мемов. Призовой фонд соревнования составляет 100 тысяч долларов.