Урок курса

Первый fit и predict на своих данных

Машинное обучение с нуля на Python: первая модель

В прошлом уроке мы разобрались, что данные делятся на признаки и цель, и научились выделять X и y из готовой таблицы. Теперь пройдём полный цикл: создадим DataFrame вручную, обучим на нём линейную регрессию и попросим её предсказать значения для новых строк.

DataFrame с признаками и целевой переменной: создание X и y

Начнём с данных, которые будут нашим сквозным примером. Мы моделируем прокат велосипедов: два признака — температура воздуха и влажность — и одна цель — количество прокатов за день.

import pandas as pd

data = {
    'температура': [10, 18, 25, 30],
    'влажность':   [60, 55, 70, 45],
    'прокатов':    [120, 210, 280, 350]
}
df = pd.DataFrame(data)

Таблица содержит четыре строки — это четыре наблюдения. Каждая строка описывает один день: какой была погода и сколько велосипедов взяли в аренду.

Теперь разделяем её на X и y:

y = df['прокатов']
X = df.drop(columns=['прокатов'])

y — это pandas Series с четырьмя числами: [120, 210, 280, 350]. X — DataFrame из двух столбцов, температура и влажность, и тех же четырёх строк.

Почему целевой столбец нельзя оставлять в X? Модель обучается искать связь между признаками и целью. Если передать прокатов как признак, правильный ответ окажется прямо во входных данных — это утечка целевой переменной в обучение. Качество модели на тренировочных данных может выглядеть искусственно высоким, но при реальном прогнозе значение цели недоступно: мы как раз и хотим его предсказать. После drop в X остаётся только то, что будет известно в момент прогноза: погодные условия без информации о результате.

Проверить, что столбцы разделены правильно, просто:

print(list(X.columns))  # ['температура', 'влажность']
print(y.name)           # 'прокатов'

Этот список столбцов важен — он понадобится позже, когда будем формировать новые строки для предсказания.

LinearRegression: создание объекта и обучение через fit

Когда X и y готовы, создаём модель и обучаем её:

from sklearn.linear_model import LinearRegression

model = LinearRegression()
model.fit(X, y)

LinearRegression() не требует обязательных аргументов — класс берёт разумные значения по умолчанию. Главное понять, что model — это обычный Python-объект, и до вызова fit он пустой: внутри нет никаких обученных параметров.

fit(X, y) меняет это. Метод просматривает все четыре строки, находит веса для температура и влажность методом наименьших квадратов и записывает их внутрь объекта model. После возврата из fit объект несёт в себе эти веса — они хранятся в атрибутах model.coef_ и model.intercept_, хотя на текущем этапе нам не нужно их разбирать вручную.

Важный момент: fit возвращает сам объект model, а не какой-то новый объект с параметрами. Состояние меняется внутри — именно поэтому достаточно написать model.fit(X, y) без присвоения результата. Код вида trained_model = model.fit(X, y) тоже сработает, но trained_model и model будут указывать на один и тот же объект.

Чтобы убедиться, что обучение прошло без ошибок, достаточно того, что строка выполнилась — исключений не возникло. На этом этапе модель готова к предсказаниям.

predict для новых строк: схема признаков и результат

Модель обучена на X с колонками ['температура', 'влажность']. Чтобы получить прогноз для новых дней, нужно собрать DataFrame точно с теми же столбцами в том же порядке — без столбца прокатов.

X_new = pd.DataFrame({
    'температура': [20, 27],
    'влажность':   [65, 50]
})

predictions = model.predict(X_new)
print(predictions)

Вывод:

[227.40235474 313.54886937]

predict возвращает NumPy-массив длиной 2 — по одному числу на каждую строку X_new. Первый элемент, 227.4, — прогноз для дня с температурой 20 и влажностью 65; второй, 313.5, — для температуры 27 и влажности 50. Именно такой вывод должен появиться у вас при запуске кода на тех же четырёх обучающих точках.

Теперь о том, что ломает предсказание. Схема X_new должна в точности совпадать со схемой X при fit. Два типичных нарушения:

Лишний столбец — например, если случайно добавить прокатов в X_new. Актуальный scikit-learn увидит несоответствие числа признаков и бросит ValueError.

Перестановка столбцов — если X_new содержит ['влажность', 'температура'] вместо ['температура', 'влажность']. При передаче именованного DataFrame sklearn использует имена столбцов и в последних версиях выдаст предупреждение или ошибку. При передаче безымянного NumPy-массива sklearn может выдать предупреждение о том, что у входа нет имён признаков — но это предупреждение касается только отсутствия имён, а не порядка значений. Если число столбцов совпадает, перепутанный порядок пройдёт без дополнительного сигнала: модель подставит значение влажности туда, где ожидает температуру, и вернёт неверный прогноз.

Диагностика простая:

print(list(X.columns))      # ['температура', 'влажность']
print(list(X_new.columns))  # должно быть то же самое

Если списки совпадают — схема верна, и predict вернёт корректный результат.

Попробуйте решить

Расход топлива для новых рейсов

Автопарк накапливает историю своих рейсов: для каждого из них диспетчеры записывают пройденное расстояние, среднюю скорость на маршруте и массу перевозимого груза, а также фиксируют, сколько топлива в итоге было израсходовано. Со временем эти записи превращаются в ценный архив, отражающий реальную зависимость между условиями поездки и аппетитом двигателя.

Зная, что расход топлива закономерно меняется вместе с тремя перечисленными характеристиками рейса, логистики хотят научиться предсказывать его заранее — до того как грузовик тронется в путь. Для этого накопленные данные используются как обучающий материал: три характеристики играют роль входных признаков, а фактический расход становится той величиной, которую модель учится воспроизводить.

Что уже дано

До вашего кода в том же пространстве имён создаются df — pandas DataFrame с историей рейсов — и new_trips — список двух словарей с данными будущих рейсов. В df столбцы расстояние_км, скорость_кмч, груз_т — числовые признаки, топливо_л — фактический расход. В new_trips цели нет.

Что нужно сделать

Создайте X и y, экземпляр LinearRegression с именем model, обучите его через fit(X, y). Из new_trips создайте DataFrame X_new с теми же тремя столбцами в том же порядке, что X. Сохраните результат model.predict(X_new) в predictions.

Ввод и вывод

stdin не используется. Печатать через print в stdout ничего не нужно. После вашего кода проверяются верхнеуровневые X, y, model, X_new, predictions. predictions — NumPy-массив из двух числовых прогнозов расхода в литрах, по одному для каждого нового рейса.

Продолжить с проверкой и прогрессом

Откройте интерактивный раннер с заданиями урока.

Перейти к интерактивному уроку