Data Scientist: от данных до деплоя моделейОткрытые материалыTrain, validation и test: как разделить данные
Train, validation и test: как разделить данные
Уроки курсаTrain, validation и test: как разделить данные
Pipeline обучается только на train
Импутация, масштабирование, словарь категорий, отбор признаков и oversampling тоже являются обучением. Их параметры fit-ят на train и применяют к validation/test. Если сначала нормализовать всю таблицу, статистики будущих частей проникнут в train.
Удобно собирать преобразования и модель в единый pipeline: cross-validation тогда повторяет fit преобразований внутри каждого fold. После выбора решения модель можно переобучить на train+validation и один раз оценить на нетронутом test — если это было частью плана.
Сохраняйте сами идентификаторы split и seed. Воспроизводимый baseline важнее случайно удачного разбиения, а расхождение offline и production часто начинается именно с неверной схемы оценки.
