Обложка канала

Алексей Чернобровов

Личный канал Алексея Чернобровова - консультанта в сфере Digital: Data Science, Big Data, BDSM, Digital Transformation, Artificial intelligence – и все вот эти модные слова.:) Анонсы мероприятий, вакансий, зарисовки личной жизни)

Алексей Чернобровов

4 года назад
Открыть в
5 методов обнаружения дрейфа данных в больших наборах данных Краткий пересказ статьи: evidentlyai.com/blog/da…datasets Одной из трудностей поддержки реальных проектовх, где есть машинное обучение, считается дрейф (смещение) данных. Этот эффект возникает, когда реальные данные, которые попадают на вход модели, начинают сильно отличаться от обучающего датасета. И ранее заложенные в ML-модель алгоритмы уже не работают как предполагалось. Поэтому нужно постоянно отслеживать изменения в распределении входных данных, чтобы убедиться в релевантности реальной среды заложенным в модель алгоритмом. Для определения дрейфа данных можно применить статистические тесты, чтобы сравнить новые данные со старыми. Однако, результаты тестирования могут отличаться для малых и больших наборов данных – подойдет не каждый статистический тест. Например, двухвыборочный критерий Колмогорова-Смирнова, который часто используется для обнаружения изменения распределения числовых признаков. В большинстве случаев это работает, но для больших наборов данных тест может быть слишком чувствительным. Поэтому следует учитывать поведение теста при выборе метрики дрейфа. Чтобы понять, какой статистический тест лучше, исследователи из Evidently AI провели несколько экспериментов и сравнили пять популярных статистических тестов: • Тест Колмогорова-Смирнова; • Индекс стабильности популяции (PSI); • Тест на расстояние Вассерштейна (Earth mover's distance); • Дивергенция Кульбака-Лейблера; • Дивергенция Дженсена-Шеннона. Рассматривались 3 фичи с разными характеристиками: • непрерывный признак с ненормальным распределением; • переменная со смещением распределения вправо; • признак с выбросами. Эти переменные были выбраны из трех разных общедоступных наборов данных, чтобы получить для эксперимента фичи с разными распределениями наблюдений. Размер выборки для каждой переменной от 500 000 до 1 миллиона наблюдений. Посмотреть выводы сравнения статистических критериев можно в оригинале статьи и самостоятельно проделать подобный тест, используя подготовленную исследователями Evidently соответствующую Python-библиотеку с открытым исходным кодом (https://github.com/evidentlyai/evidently). Она помогает оценивать, тестировать и отслеживать производительность моделей машинного обучения в производственной среде и имеет встроенный алгоритм, который выбирает подходящий тест дрейфа на основе типа объекта, количества наблюдений и уникальных значений.
Which test is the best? We compared 5 methods to detect data drift on large datasets

We ran an experiment to help build an intuition on how popular drift detection methods behave. In this blog, we share the key takeaways and the code to run the tests on your data.

Evidentlyai