Обложка канала

Quantum Quintum

Цинично про технологии, дизайн и будущее от Константина Кичинского (@constantinkichinsky), бывшего технологического евангелиста Microsoft.

Quantum Quintum

3 года назад
Открыть в
Передают, что система все-таки начала входить в рекурсию и нас ждет сингулярность, но не та, на которую все надеялись. Следите за руками: 1. Для обучения сеточек, чтобы они работали не хуже, а лучше людей, нужны сырые и размеченные данные, сделанные людьми (ака золотой стандарт). 2. Этих данных нужно много, поэтому применяют краудсорсинговые решения, например, Mechanical Turk от Amazon (или Toloka от Yandex). 3. На выходе получается LLM, упакованная в какой-то продукт, например, ChatGPT. 4. Часть генерируемых данных поступает на вход системе, проходя через человеческий отбор и разметку (п2). Но оказывается, что в отдельных задачах пункта 2, например, суммировании текста работнички фабрик разметки сами используют LLM для решения поставленной задачи. Логично же, что можно быстрее суммировать текст с помощью условного ChatGPT, скормить его в Amazon Mechanical Turk и получить свои заветные доллары. Больше задач за меньшее время = больше денег. И таких резюме не 2, не 3, не 5%, а 33-46% по оценкам исследователей. We reran an abstract summarization task from the literature on Amazon Mechanical Turk and, through a combination of keystroke detection and synthetic text classification, estimate that 33-46% of crowd workers used LLMs when completing the task. О том, что происходит при замыкании выхода на вход, можно себе представить по любой биологической системе. :) https://arxiv.org/abs/2306.07899@quantumauintum
Artificial Artificial Artificial Intelligence: Crowd Workers...

Large language models (LLMs) are remarkable data annotators. They can be used to generate high-fidelity supervised training data, as well as survey and experimental data. With the widespread...

arXiv.org