CSV-Dateien mit pandas lesen
CSV-Dateien werden häufig für Exporte, Datenaustausch und Analyse-Datasets verwendet.
Wofür wird pandas read_csv verwendet?
CSV-Dateien übertragen Daten zwischen Tabellenkalkulationen, Geschäftssystemen, Analysewerkzeugen, APIs und Datenbanken. pandas.read_csv() lädt sie als DataFrame zum Bereinigen, Filtern und Auswerten.
Typische Anwendungsfälle
- Exporte aus Excel, Google Sheets oder einem CRM analysieren.
- Datensätze für Data Science und Machine Learning laden.
- Fehlende, falsch typisierte oder doppelte Daten vor dem Import bereinigen.
Grundlegendes Beispiel
import pandas as pd
from io import StringIO
csv_text = "name,score\nAda,95\nLin,88\nSam,91"
students = pd.read_csv(StringIO(csv_text))
print(students)
Erwartete Ausgabe
name score
0 Ada 95
1 Lin 88
2 Sam 91
Fortgeschrittenes Beispiel
Reale CSV-Dateien sind oft groß und unvollständig. Dieses Beispiel wählt benötigte Spalten aus, parst Datumswerte, setzt Datentypen und erkennt mehrere Formen fehlender Werte.
import pandas as pd
sales = pd.read_csv(
"sales.csv",
usecols=["order_date", "product", "quantity", "revenue"],
parse_dates=["order_date"],
dtype={"product": "string", "quantity": "Int64"},
na_values=["", "N/A", "unknown"],
)
sales = sales.dropna(subset=["order_date", "product"])
monthly_revenue = sales.groupby(
sales["order_date"].dt.to_period("M")
)["revenue"].sum()
print(monthly_revenue)
So funktioniert es
StringIO stellt Text wie eine Datei bereit. read_csv erkennt Kopfzeile und Datentypen; bei realen Daten sollten dtype, parse_dates und na_values bewusst gesetzt werden.
Ändere die Werte und führe das Programm im CodeUtility Python Online-Compiler aus, ohne Python lokal zu installieren.
Übungsaufgaben
Verändere Eingaben und Randfälle, bevor du die Lösung mit größeren Datenmengen testest.
- Ergänze Zeilen, Spalten und fehlende Werte.
- Kombiniere Filtern, Sortieren und groupby in einer Auswertung.
- Lies eine reale Datei ein und überprüfe die Datentypen.