DiTribe – канал, где делают именно так: пишут микроколонки об IT и публикуют красивые иллюстрации. Человеко-машинное взаимодействие и история интерфейсов в сфере научных интересов автора!
Восторг, голосовые ассистенты на ChatGPT и цензура
В работе исследуется влияние модерации на получение пользователями удовольствия от диалоговых систем ИИ. В то время как недавние достижения в языковых моделях (LLM) привели к появлению высокоэффективных диалоговых ИИ, которые все чаще используются в реальных условиях, растет общественная озабоченность по поводу безопасности ИИ и необходимости модерировать системы для поощрения безопасного языка и предотвращения вреда. Однако некоторые пользователи утверждают, что современные подходы к модерации ограничивают технологию, ставят под угрозу свободу выражения мнений и ограничивают ценность технологии. Возможно, что модерация не обязательно умаляет удовольствие пользователя. Жесткая модерация, похоже, имеет пагубный эффект, но модели, которые модерируются, чтобы быть более безопасными, могут улучшить взаимодействие с пользователем. Исследование показало, что за счет развертывания различных диалоговых ИИ на платформе Chai удержание пользователей может даже увеличиться с уровнем модерации и безопасным дизайном системы.
https://www.chai-research.com/
В разговорах между ИИ и человеком небезопасный контент может исходить как от человека, так и от разговорного ИИ. Если реакция человека идентифицируется как вредная, системы обычно возвращают ни к чему не обязывающие безопасные ответы или пытаются сменить субъекта. Однако злонамеренные пользователи также могут создавать необнаруживаемые подсказки со стороны противника , где, например, тщательно продуманный пользовательский ввод может запустить модель для создания оскорбительного контента.
Восприимчивость диалоговых ИИ к состязательности — открытая область исследований. При рассмотрении сгенерированных диалоговых ответов ИИ в литературе были предложены различные подходы для снижения риска создания небезопасного контента. Эти подходы можно разделить на три основные категории. Первый подход — это курирование данных, когда модели обучаются на безопасных данных, чтобы снизить вероятность создания вредоносного контента. Однако такие недостаточно открытые модели с трудом реагируют на оскорбительный пользовательский контент, а также восприимчивы к враждебным подсказкам. В качестве альтернативы или в дополнение к обработке данных можно ввести уровень безопасности с помощью системы обнаружения, которые могут идентифицировать сгенерированные системой небезопасные ответы и отклонить их. Наконец, набор методов исследует контролируемую генерацию, при которой модель обучается генерировать выходные данные при определенных условиях, предлагая пользователю/разработчику определенный уровень контроля над агрессивностью разговорной речи.
В исследовании авторы показывают, что модерация даже повышает метрики восторга при модерации и безопасности контента