
Для машинного обучения нужны данные, которые представляют реальную задачу, содержат полезные признаки и достаточно точно размечены. Огромный набор сам по себе не гарантирует качества. Если примеры устарели, собраны только из одного источника или содержат систематические ошибки, модель усвоит эти недостатки.
Что является примером
Один пример может быть строкой таблицы, фотографией, аудиозаписью, документом или последовательностью событий. Признаки – информация, которую модель получает: размеры объекта, пиксели, слова, время действия. Целевая переменная – ответ, который нужно предсказать.
Для обучения с учителем цель известна заранее. На снимке указывают вид растения, а в истории продаж – будущий спрос. В задачах без учителя меток может не быть, но требования к чистоте и репрезентативности сохраняются.
Почему важнее соответствие задаче
Если система будет распознавать дорожные знаки ночью, набор только из дневных кадров недостаточен. Если прогноз строится для разных регионов, примеры должны отражать их особенности. Модель плохо переносит условия, которых почти не встречала.
Нужны и обычные, и редкие случаи. При сильном дисбалансе модель может всегда выбирать наиболее частый класс и показывать высокую общую точность, оставаясь бесполезной для редкого важного события.
Как данные готовят
Специалисты удаляют точные дубликаты, исправляют повреждённые записи, приводят единицы измерения к одному виду и проверяют метки. Пропуски нельзя автоматически заменять одним числом без анализа: сам факт отсутствия значения иногда несёт смысл.
Набор делят на обучающую, проверочную и тестовую части. Одинаковые или тесно связанные объекты не должны попадать по разные стороны разделения, иначе модель фактически увидит ответы заранее.
Законность и безопасность
Доступность данных в интернете не означает разрешение использовать их для любой цели. Нужно учитывать авторские права, условия источника, персональные данные и согласие людей. Чувствительную информацию по возможности исключают, обезличивают и защищают доступ.
Следует записывать происхождение набора, правила разметки, период сбора и известные ограничения. Такая документация помогает понять, где модель применима и почему качество изменилось после обновления.
Хорошие данные – это не бесконечная свалка файлов, а управляемая выборка с понятной связью с задачей. Чем выше цена ошибки, тем важнее независимая проверка, анализ перекосов и наблюдение за тем, не изменился ли реальный мир после обучения.
Почему количество не заменяет качество
Миллион автоматически собранных записей может быть хуже десяти тысяч проверенных, если метки противоречат друг другу или примеры не относятся к будущей задаче. Большой набор лишь увереннее закрепляет систематическую ошибку. Сначала определяют, что представляет одна запись и как получен правильный ответ.
Инструкция для разметчиков должна разбирать спорные случаи. Несколько людей отмечают часть данных независимо, после чего различия анализируют. Это показывает, существует ли вообще однозначная метка.
Как избегают утечки
Будущая информация не должна попадать в признаки. При прогнозе платежа нельзя использовать поле, которое появляется после просрочки. Дубликаты одного объекта не распределяют между обучением и тестом. Иначе оценка показывает узнавание знакомого примера.
Связь данных и алгоритма подробно раскрыта в статье о том, как работает машинное обучение. Для временных задач тест всегда должен быть позже учебного периода.
Что делать с пропусками и редкими случаями
Пустое значение может означать отсутствие признака, ошибку сбора или отказ человека отвечать. Эти ситуации нельзя автоматически смешивать. Способ заполнения выбирают по смыслу и проверяют, не искажает ли он отдельные группы.
Редкие, но опасные случаи специально ищут и включают в проверку. Средняя метрика легко скрывает, что модель никогда не видела важный тип аварии или заболевания.
Как защищают людей в наборе
Удаление имени не всегда обезличивает запись. Сочетание даты, места и редкого события позволяет узнать человека. Собирают только необходимые поля, ограничивают доступ и определяют срок удаления. Общие ограничения перечислены в статье о том, какие данные нельзя передавать нейросети.
После запуска данные продолжают меняться. Нужно отслеживать новые категории, сдвиг распределения и ухудшение качества. Хороший набор – не разовый архив, а управляемая часть системы с происхождением, версиями и ответственным владельцем.
Как документируют происхождение
Для каждого источника записывают дату, способ сбора, разрешение на использование и выполненные преобразования. Версии набора нельзя молча перезаписывать: иначе невозможно объяснить, почему новый выпуск модели ведёт себя иначе. Изменения сопровождают журналом.
Синтетические примеры иногда закрывают редкие случаи, но модель может перенять ошибки генератора. Их отмечают отдельно и смешивают с реальными данными только после проверки специалистом. Тестовую выборку синтетикой не подменяют, если система должна работать с реальным миром.
Удаление записи тоже должно распространяться на производные копии, промежуточные таблицы и будущие версии. Если невозможно проследить происхождение, выполнить такое требование трудно. Именно поэтому каталог источников создают до обучения, а не после первой жалобы.
Ответственный также фиксирует причину каждого исключения или исправления записи.



