Обложка канала

Цифровой геноцид

DiTribe – канал, где делают именно так: пишут микроколонки об IT и публикуют красивые иллюстрации. Человеко-машинное взаимодействие и история интерфейсов в сфере научных интересов автора!

Цифровой геноцид

4 года назад
Открыть в
Алгоритмоцентрический дизайн. UX для дата-сцайнтистов, часть II С каждым днем все больше внимания привлекают вопросы взаимодействия с данными на уровне UX для дата-сцайнс и машинного обучения: понятно, что речь может идти и об уровне взаимодействия с разметчиками данных, и о создании serious games для обучения дата-сетов и много чем еще. Тут, кажется, есть ужасающая лакуна Большинство моделей машинного обучения основаны на человеческих примерах, но большинство текстов и курсов по машинному обучению сосредоточены только на алгоритмах. Часто вы можете получить самые современные результаты с хорошими данными и примитивными алгоритмами, но сложно получить самые современные результаты с хорошим алгоритмом на плохих данных. По мере роста NLP для рутинных задач в операционной деятельности должна расти роль и человеческого фактора для создания, оперирования и прочей работы с данными. Сейчас в РФ это все отдается на откуп менеджеров над разметчиками(Сбер), краудсорсингу (Яндекс.Толока) и некоторым развлекательным сервисам (ВК). При этом на западе и в Китае реализуются разные стратегии обучения людей для взаимодействия с алгоритмами: рискну предположить, что это качественно меняет психологию труда в эпоху ИИ Human-in-the-loop — это устойчивое название менеджерских практик и стратегий для: - Повысить точность модели машинного обучения. - Быстрее достичь целевой точности для модели машинного обучения. - Помощь человеку с помощью машинного обучения для повышения эффективности. Так как на конечную точность гораздо сильнее влияют данные, а не модель, то для построения рабочих прогнозов нужно ставить людей и сотрудников, которые будут находится в цикле итераций при разработке систем. В конечном итоге даже датасеты для обучения, типа MNIST - наборы данных, которые были тщательно отфильтрованы с использованием различных методов выборки, прежде чем фактические обучающие данные были созданы. Таким образом, если вы случайным образом выбираете какой-либо из этих популярных наборов данных, ваша выборка не является действительно случайной: это набор данных, который соответствует задачам при при создании этих наборов данных. Вы неосознанно использовали стратегию выборки, которая, вероятно, была создана вручную. В книге 2021 года Human-in-the-Loop Machine Learning представлена достаточно интересная и многообещающая концепция в деталях с конкретными руководствами и примерами использования. Автор - Роберт Монарх, PhD в области обработки естественного языка, достаточно четко улавливает суть проблемы у них(http://www.robertmunro.com/), там: Из-за дисбаланса в научных кругах я часто видел, как люди в промышленности делают та же ошибка. Они нанимают дюжину умных докторов наук, которые знают, как создавать современные алгоритмы, но не имеют опыта создания обучающих данных или размышлений о правильные интерфейсы для аннотации и маркировки. Именно такую ситуацию я наблюдал недавно на одном из крупнейших мировых автопроизводителей. Компания недавно наняла большое количество выпускники машинного обучения, но не смогли ввести в действие свой автономный автомобиль технологии, потому что новые сотрудники не могли масштабировать свою стратегию аннотирования данных.В итоге компания уволила всю эту команду. В последствии я посоветовал компании, как перестроить свою стратегию, используя алгоритмы и аннотации как одинаково важные, взаимосвязанные компоненты хорошего машинного обучения.