Задача курса
False negatives модели: какие положительные случаи пропущены
Курс «Машинное обучение с нуля на Python: первая модель» · урок «Проект 2: логистическая модель и вывод»
Условие
Какие задержки модель пропустила
После сравнения модели риска задержки с простым ориентиром полезно посмотреть конкретные пропущенные задержки. Это описание ошибок на test; обнаруженное здесь не превращает повторную оценку на том же test в независимую.
Что уже дано
Скрытая подготовка снова создаёт df из того же delivery_risk.csv с пятью числовыми признаками и целью delayed. Песочница начинается заново, поэтому split, модель и baseline из прошлого урока нужно воспроизвести. Скачанный CSV доступен отдельно для локальной работы, в CODE редакторе используется равный ему df.
Что нужно сделать
Разделите X, y с исключением delayed из признаков. Повторите stratified split с test_size=0.2, random_state=42. Обучите model = LogisticRegression(max_iter=1000) и baseline = DummyClassifier(strategy='most_frequent') только на train. Получите model_predictions и baseline_predictions на одном X_test. В false_negatives сохраните строки X_test, для которых истинный delayed равен 1, а прогноз модели — 0, с индексом и исходным порядком колонок. Аналогично соберите baseline_false_negatives; отдельно сохраните их размеры в fn_counts с ключами model и baseline. Не переобучайте модель после анализа этих строк.
Ввод и вывод
stdin не используется. Печатать через print в stdout ничего не нужно. Проверяются общий split, прогнозы двух обученных моделей, таблицы пропусков и их размеры.
