Данные и ИИ
Качество данных: чек-лист перед анализом
Чек-лист качества данных перед анализом и обучением модели: пропуски, дубликаты, выбросы, репрезентативность, утечки — что проверить до старта.
Коротко
- Мусор на входе — мусор на выходе: качество данных решает исход анализа сильнее выбора модели.
- Проверьте пять вещей: пропуски, дубликаты, выбросы, репрезентативность, утечки.
- Отделяйте реальные выбросы (важны) от ошибок ввода (вредят) — это разные вещи.
- Утечка данных — самая коварная: модель «жульничает», подсматривая ответ через лишний признак.
В анализе данных есть неромантичная правда: 80% работы — это чистка данных, и именно она решает исход. Самая умная модель на грязных данных даст грязный результат — «мусор на входе, мусор на выходе». Вот чек-лист из пяти проверок, который стоит пройти прежде, чем считать что-либо.
1. Полнота: пропуски
Найдите отсутствующие значения. Важно не только сколько их, но и почему они пропали:
- случайны ли пропуски или системны (например, определённая группа не отвечала на вопрос)?
- чем заполнять (средним, медианой, отдельной категорией) или что удалить?
Системные пропуски — это скрытое смещение: их нельзя просто заполнить средним, не исказив картину.
2. Дубликаты
Повторяющиеся записи искажают статистику и дают модели ложный вес отдельным примерам — она «переучивается» на задвоенных данных. Найдите и уберите точные и скрытые дубликаты (та же запись с мелкими отличиями).
3. Выбросы: реальные или ошибки
Ключевое различие, которое многие путают. Выброс бывает:
- реальным экстремумом — крупная сделка, редкий отказ. Это ценная информация, удалять нельзя.
- ошибкой ввода — возраст 200 лет, отрицательная цена. Это мусор, надо исправить или убрать.
Задача — не «удалить все выбросы», а отличить одно от другого. Здесь же вспомните про среднее и медиану: выбросы перекашивают среднее, и медиана надёжнее.
4. Репрезентативность
Покрывают ли данные все важные группы и ситуации — или только удобные? Нерепрезентативные данные дают предвзятую модель: она хорошо работает на том, что видела, и плохо — на недопредставленном.
5. Утечки данных (самое коварное)
Утечка — когда среди признаков есть тот, что косвенно содержит ответ или был бы недоступен в момент реального прогноза. Модель «жульничает»: показывает блестящий результат на тесте и проваливается в жизни.
Пример: предсказываем болезнь, а в данных есть признак «назначено лекарство от неё». Модель просто читает ответ. Утечка незаметна и обесценивает весь анализ — проверяйте каждый подозрительно «сильный» признак: не подсматривает ли он будущее.
Пройдите эти пять пунктов — и большинство провалов анализа отсеются ещё до расчётов. Это скучная работа, но именно она отделяет надёжный результат от красивого мусора. Связанная тема — что вообще такое датасет и как его правильно делить.
Вопросы и ответы
Что проверить в данных перед анализом?
Пять вещей: пропуски (сколько и почему отсутствуют значения), дубликаты (повторы искажают статистику), выбросы (реальные экстремумы или ошибки ввода), репрезентативность (покрыты ли все важные группы) и утечки (нет ли среди признаков скрытого ответа). Эта проверка спасает от большинства провалов анализа.
Что такое утечка данных и почему она опасна?
Утечка — когда среди признаков есть тот, что косвенно содержит ответ или был бы недоступен в реальный момент прогноза. Модель «жульничает», показывая блестящий результат на тесте и проваливаясь в реальности. Пример: предсказывать болезнь, случайно включив в данные признак «выписано лекарство от неё». Коварна тем, что незаметна.
Все ли выбросы нужно удалять?
Нет. Выброс может быть реальным важным событием (крупная сделка, редкий отказ) — удалять его значит терять информацию. А может быть ошибкой ввода (возраст 200 лет) — тогда убрать. Задача не «удалить все выбросы», а отличить реальные экстремумы от ошибок и обойтись с каждым по-своему.
Источники и что почитать
- Этапы подготовки данных (data cleaning) и понятие data leakage — стандартная практика анализа данных.