В таблице десять визитов пяти пациентов. Нужно оценить, как модель сработает на пациентах, которых она раньше не видела. Какое разбиение train/test отвечает этой цели?
Случайно разделить десять строк: визиты одного пациента могут оказаться в обеих частях, зато доля строк известна
Сначала разделить пациентов по patient_id, затем отправить все визиты каждого пациента только в одну часть
Удалить patient_id из признаков и случайно разделить визиты по строкам: тогда повтор пациента в train и test не важен
Отсортировать визиты по числу измерений и разрезать таблицу пополам: одинаковые пациенты автоматически окажутся вместе