Задача курса
DummyClassifier mostfrequent: baseline для редкого класса
Курс «Машинное обучение с нуля на Python: первая модель» · урок «Проект 2: split и baseline риска задержки»
Условие
Карточка базовой линии риска задержки
Команда доставки собирается оценивать модель риска задержки. Сначала ей нужна зафиксированная точка сравнения на отложенных рейсах: как разделены данные, сколько задержек в каждой части и какие показатели даёт предсказатель самого частого train-класса. В следующем проектном шаге модель сравнят с этой базовой линией на том же test.
Что уже дано
В текущем запуске доступен DataFrame df с теми же 480 строками, что в выданном delivery_risk.csv. Пять числовых признаков — distance_km, items_count, warehouse_load, forecast_rain_mm, is_weekend; delayed — готовая бинарная метка (1 означает задержку). CSV не монтируется в редактор кода, а переменные из предыдущих уроков не сохраняются.
Что нужно сделать
Соберите воспроизводимую карточку baseline. Признаки должны сохранить исходный порядок столбцов и не содержать delayed. Для сопоставимости с последующим проектным шагом доля test — 20%, random_state=42, доли классов сохраняются приблизительно стратификацией по целевой метке. Базовая линия — DummyClassifier(strategy='most_frequent'), обученный только на train. Все показатели относятся к отложенному test и положительному классу 1; неопределённую precision считайте равной 0.
Проверяющая система читает следующие переменные после вашего кода:
Xиy— признаки и целевая метка;X_train,X_test,y_train,y_test— согласованные части одного разделения;baselineиbaseline_predictions— обученный ориентир и его прогнозы в порядкеX_test;baseline_metrics— словарь с ключамиaccuracy,precision,recall,f1;class_balance— словарь с ключамиall,train,testи числом задержек (класс 1) в каждой части.
Ввод и вывод
stdin не используется; печатать результат через print не нужно.
