Обложка канала

Цифровой геноцид

DiTribe – канал, где делают именно так: пишут микроколонки об IT и публикуют красивые иллюстрации. Человеко-машинное взаимодействие и история интерфейсов в сфере научных интересов автора!

Цифровой геноцид

3 года назад
Открыть в
UX и AI: часть уже не знаю какая. Обучение жюри присяжных - Jury Learning Множество LLM и других систем научены на аннотаторах или разметчиках и тема human in the loop поднималась на страницах данного блога. Важно понимать, что большое число набранных живых людей разметчиков - условных толокеров - это также и вызов искажений, которые потенциально возможны при работе с данными. Компании и исследователи нанимают команды людей-аннотаторов для обозначения примеров в наборах данных для обучения ИИ, как правило, с краудсорсинговых платформ, и эти комментаторы привносят в таблицу свои собственные наборы точек зрения — и предубеждений. В исследовании, проведенном в 2019 году, ученые обнаружили, что составители этикеток с большей вероятностью будут комментировать фразы на афроамериканском диалекте английского языка (AAE) более токсичными, чем их эквиваленты на общеамериканском английском, ну и так далее В поисках решения проблемы предвзятости комментаторов исследователи из Стэнфорда недавно исследовали подход, который они называют “обучением присяжных”. Идея состоит в том, чтобы смоделировать “индивидуальные голоса” в обучающих наборах данных для разработки системы, которая позволяет разработчикам исследовать разные способы нанесения аннотаций и разметки. По сути это система фильтров и подбора толокеров - только с учетом их образования, происхождения, языка. Цель обучения с помощью присяжных — определить, какие люди или группы определяют прогноз системы и в какой пропорции, что позволяет разработчикам анализировать несогласие и реагировать на него. Авторы приводят вечный американский пример с токсичностью: например, вместо “токсично” или “не токсично”, система обучения присяжных могла бы выдавать прогноз типа “Для этой группы из шести комментаторов-мужчин и шести женщин, которая распределена поровну между белыми, испаноязычными, AAPI и чернокожими присяжными заседателями Прогнозируется, что 58% комментаторов согласятся с тем, что комментарии токсичны.” Гораздо интереснее, на мой взгляд, это то, что в интерфейсе условной Толоки теперь может появится возможность использования исполнителей и аннотаторов, которые бедные, богатые, мусульмане или христиане - и тем самым повысить клиентоориентированность и метрики опыта пользователя Ссылки на статью и на семинар: http://www.kayur.org/papers/chi2022-juries.pdf venturebeat.com/ai/stan…as-in-ai https://www.youtube.com/watch?v=Y3Kj_2ZNRfw&list=PLoROMvodv4rMyupDF2O00r19JsmolyXdD&ab_channel=StanfordOnline