Задача курса

False negatives модели: какие положительные случаи пропущены

Курс «Машинное обучение с нуля на Python: первая модель» · урок «Проект 2: логистическая модель и вывод»

Условие

Какие задержки модель пропустила

После сравнения модели риска задержки с простым ориентиром полезно посмотреть конкретные пропущенные задержки. Это описание ошибок на test; обнаруженное здесь не превращает повторную оценку на том же test в независимую.

Что уже дано

Скрытая подготовка снова создаёт df из того же delivery_risk.csv с пятью числовыми признаками и целью delayed. Песочница начинается заново, поэтому split, модель и baseline из прошлого урока нужно воспроизвести. Скачанный CSV доступен отдельно для локальной работы, в CODE редакторе используется равный ему df.

Что нужно сделать

Разделите X, y с исключением delayed из признаков. Повторите stratified split с test_size=0.2, random_state=42. Обучите model = LogisticRegression(max_iter=1000) и baseline = DummyClassifier(strategy='most_frequent') только на train. Получите model_predictions и baseline_predictions на одном X_test. В false_negatives сохраните строки X_test, для которых истинный delayed равен 1, а прогноз модели — 0, с индексом и исходным порядком колонок. Аналогично соберите baseline_false_negatives; отдельно сохраните их размеры в fn_counts с ключами model и baseline. Не переобучайте модель после анализа этих строк.

Ввод и вывод

stdin не используется. Печатать через print в stdout ничего не нужно. Проверяются общий split, прогнозы двух обученных моделей, таблицы пропусков и их размеры.

Попробуйте решить

РешениеPython
Без регистрации · результат не сохраняется