🔎 Исследование: законы масштабирования для больших языковых моделей могут применяться к алгоритмам обучения с подкреплением.
В 2020 году специалисты выявили, что производительность ИИ-системы меняется в зависимости от ее размера, количества обучающих данных и используемых вычислительных ресурсов. Они вывели оптимальные гиперпараметры для тренировки языковых моделей с учетом фиксированной мощности оборудования.
🗂 Позже специалисты Deepmind подтвердили эти законы, но указали на необходимость большого массива данных. Они заявили, что для оптимальной тренировки размер модели и количество обучающих токенов требуют одинакового масштабирования.
Теперь немецкие исследователи протестировали RL-агентов DeepMind AlphaZero для игр Connect Four и Pentago. Выяснилось, что производительность ИИ масштабируется согласно законам в зависимости от размера нейросети, «когда системы обучаются до сходимости на пределе огромных вычислений».
☝️ По словам ученых, AlphaGo Zero и AlphaZero, вероятно, используют небольшие алгоритмы, но могут работать лучше при задействовании более крупных моделей.
#исследование