💬 Исследователи из Калифорнийского университета в Сан-Диего разработали алгоритмы для очистки чат-ботов от оскорбительных выражений.
Ученые добавили токсичные подсказки в предварительно обученную языковую нейросеть, чтобы заставить ее генерировать ненормативную лексику. Затем они натренировали «злую модель» прогнозировать вероятность оскорбительного контента, «добрую» — избегать всего высоко оцененного «плохим» алгоритмом контента.
🔎 По данным исследователей, эффективность работы «хорошего» ИИ совпадает с показателями современных методов детоксикации речи и составляет 23%.
#исследование #NLP