Data Scientist: от данных до деплоя моделейОткрытые материалыTrain, validation и test: как разделить данные
Train, validation и test: как разделить данные
Уроки курсаTrain, validation и test: как разделить данные
Время и группы меняют split
Для прогноза будущего случайное перемешивание часто создаёт утечку: модель обучается на более поздних объектах и проверяется на прошлом. Делите по времени так, чтобы validation и test шли после train, а признаки вычислялись только из доступной на тот момент информации.
Связанные строки одного пользователя, пациента, устройства или документа должны попадать в одну часть. Иначе модель узнаёт особенности группы на train и демонстрирует завышенное качество на почти тех же объектах в test. Используйте group split.
Правильная схема соответствует production-вопросу: на каких объектах и в какой момент модель будет делать прогноз. Универсальной пропорции 80/10/10 нет.
