Чтение CSV с pandas
CSV широко используется для экспорта и обмена наборами данных.
Когда используется pandas read_csv?
CSV служит для обмена данными между таблицами, бизнес-системами, аналитическими инструментами, API и базами данных. pandas.read_csv() загружает данные в DataFrame для очистки, фильтрации и анализа.
Распространённые сценарии
- Анализировать экспорт из Excel, Google Sheets или CRM.
- Загружать наборы данных для data science и машинного обучения.
- Исправлять пропуски, неверные типы и дубликаты перед импортом.
Совет: Для рабочих данных явно задавайте dtype, parse_dates, usecols и na_values.
Базовый пример
main.py
import pandas as pd
from io import StringIO
csv_text = "name,score\nAda,95\nLin,88\nSam,91"
students = pd.read_csv(StringIO(csv_text))
print(students)
Ожидаемый результат
name score
0 Ada 95
1 Lin 88
2 Sam 91
Продвинутый пример
Реальные CSV-файлы часто велики и содержат неточности. Этот пример выбирает нужные столбцы, разбирает даты, задаёт типы и распознаёт несколько форматов пропущенных значений.
advanced_csv.py
import pandas as pd
sales = pd.read_csv(
"sales.csv",
usecols=["order_date", "product", "quantity", "revenue"],
parse_dates=["order_date"],
dtype={"product": "string", "quantity": "Int64"},
na_values=["", "N/A", "unknown"],
)
sales = sales.dropna(subset=["order_date", "product"])
monthly_revenue = sales.groupby(
sales["order_date"].dt.to_period("M")
)["revenue"].sum()
print(monthly_revenue)
Как это работает
read_csv определяет заголовок и типы; dtype, parse_dates и na_values делают импорт явным.
Измените значения и запустите программу в онлайн-компиляторе Python CodeUtility без локальной установки Python.
Практические задания
Изменяйте входные данные и проверяйте граничные случаи перед работой с большими наборами.
- Добавьте строки, столбцы и пропуски.
- Объедините фильтрацию, сортировку и groupby.
- Загрузите реальный файл и проверьте dtype.