Подготовка данных для машинного обучения – один из важнейших этапов разработки искусственного интеллекта. Сегодня в индустрии существует ряд мифов и гипотез о том, как правильно собирать датасеты. Команда Яндекс.Толоки собрала самые популярные из них - с некоторыми они столкнулись, развивая собственные ML-проекты, с другими - изучая опыт других компаний. В колонке на VC.ru руководитель Яндекс.Толоки Ольга Мегорская рассказывает о том, к каким выводам они пришли по итогам детального разбора ряда гипотез и дает прикладные советы о различных подходах к разметке.