Загрузка и сохранение данных
Содержание курса
Предварительный анализ данных с pandas
После загрузки данных стоит получить общее представление о них:
-
Размерность таблицы:
df.shapeпокажет кортеж(число_строк, число_столбцов). -
Просмотр первых/последних строк:
df.head(n)иdf.tail(n)дают первые и последние n строк (по умолчанию n=5). Это помогает убедиться в структуре данных. -
Сводка информации:
df.info()выведет тип данных каждого столбца, сколько непустых значений и объём занимаемой памяти. Полезно для выявления пропусков и типов (например, убедиться, что числа не считались как строки). -
Описательная статистика:
df.describe()рассчитает основные статистики для числовых столбцов: count (количество), mean (среднее), std (стандартное отклонение), min, max, quartiles. Это даёт быстрое понимание диапазона и распределения чисел.
Например:
print("Размер датафрейма:", df.shape)
print("\nИнформация о данных:")
df.info()
print("\nСтатистики:")
display(df.describe())
(Здесь display используется для более красивого отображения таблицы статистик.)
Вы также можете обращаться к столбцам и выполнять операции:
-
df["score"]– серия (Series) со значениями столбца score. -
df["score"].mean()– среднее значение этого столбца. -
df["name"].unique()– уникальные имена из столбца name. -
Логические условия:
df[df["score"] > 80]– отфильтрует строки, где score > 80 (в нашем примере вернёт Ann и Ben).
Группировка и агрегирование: Pandas позволяет легко группировать данные и применять агрегатные функции:
# Если бы был столбец, например, класс класса, можно так:
# Средний балл по каждому классу
# df.groupby("class")["score"].mean()
В нашем случае класса нет, но сама возможность пригодится на реальных данных.
Применение: если у нас DataFrame df по ирисам (как в примере iris далее), можно сделать df.groupby("species").agg({"sepal_length": ["mean", "std"], "petal_length": "mean"}) – это рассчитает среднее и стд. отклонение для sepal_length и среднее для petal_length по каждому виду species.
