Загрузка и сохранение данных
Содержание курса
Чтение данных из файлов
Большинство проектов по анализу данных включает загрузку данных из внешних источников (файлов). Рассмотрим чтение самых распространённых форматов:
-
Текстовые файлы (TXT): Используем стандартные средства Python. Например:
with open("example.txt", "r", encoding="utf-8") as f: text = f.read() print(text[:100])Это откроет файл
example.txtна чтение и сохранив его содержимое в строкуtext(для демонстрации мы вывели первые 100 символов). Блокwithавтоматически закроет файл после чтения. -
CSV (Comma-Separated Values): Очень популярный формат табличных данных. Библиотека pandas делает работу с ним особенно простой:
import pandas as pd df = pd.read_csv("data.csv") df.head()Функция
pd.read_csvчитает CSV-файл и возвращает DataFrame. Методhead()покажет первые несколько строк, чтобы убедиться, что данные загрузились правильно (по умолчанию 5 строк). Если у CSV-разделитель не запятая или нет заголовка, есть параметры вродеsep=";",header=None. -
Excel (XLSX): Можно использовать
pd.read_excel("table.xlsx"), но нужна установка дополнительных пакетов (например, openpyxl). Похожим образомpd.to_excelсохраняет DataFrame в Excel. -
JSON:
pd.read_json("data.json")– прочитает JSON, если он в табличном формате, и сделает DataFrame. Иначе можно использовать модульjsonстандартной библиотеки.
Пример (CSV): Предположим, у нас есть файл students.csv с содержимым:
name,score Ann,87 Ben,90 Joe,78
Читаем его:
df = pd.read_csv("students.csv")
print("Всего строк:", len(df))
display(df)
Вывод будет:
Всего строк: 3
и таблица:
| name | score | |
|---|---|---|
| 0 | Ann | 87 |
| 1 | Ben | 90 |
| 2 | Joe | 78 |
Теперь DataFrame df содержит наши данные, и мы можем их анализировать (например, df["score"].mean()).
Чтение данных из интернета: В ноутбуке можно загружать данные по URL с помощью функций или системных команд:
-
Библиотека
requestsпозволяет скачивать файлы, либо можно использовать!wget/!curlкак shell-команду. Например:!wget -O data.csv https://raw.githubusercontent.com/пример/data.csvскачает файл по ссылке в текущую папку под именем data.csv.
-
В Google Colab и JupyterHub могут быть свои способы загрузки файлов (например, через интерфейс).
После скачивания файла таким образом, вы можете читать его обычными методами (например, pd.read_csv("data.csv")).
