Leer CSV con pandas
CSV es habitual en exportaciones e intercambio de datasets.
¿Cuándo se utiliza pandas read_csv?
Los archivos CSV intercambian datos entre hojas de cálculo, sistemas empresariales, herramientas analíticas, APIs y bases de datos. pandas.read_csv() los carga en un DataFrame para limpiarlos, filtrarlos y analizarlos.
Casos de uso habituales
- Analizar exportaciones de Excel, Google Sheets o un CRM.
- Cargar datasets para ciencia de datos y machine learning.
- Corregir datos ausentes, tipos incorrectos o duplicados antes de importarlos.
Consejo: En datos de producción, define dtype, parse_dates, usecols y na_values para controlar la lectura.
Ejemplo básico
main.py
import pandas as pd
from io import StringIO
csv_text = "name,score\nAda,95\nLin,88\nSam,91"
students = pd.read_csv(StringIO(csv_text))
print(students)
Resultado esperado
name score
0 Ada 95
1 Lin 88
2 Sam 91
Ejemplo avanzado
Los CSV reales suelen ser grandes e imperfectos. Este ejemplo selecciona columnas, interpreta fechas, controla tipos y reconoce varios formatos de valores ausentes.
advanced_csv.py
import pandas as pd
sales = pd.read_csv(
"sales.csv",
usecols=["order_date", "product", "quantity", "revenue"],
parse_dates=["order_date"],
dtype={"product": "string", "quantity": "Int64"},
na_values=["", "N/A", "unknown"],
)
sales = sales.dropna(subset=["order_date", "product"])
monthly_revenue = sales.groupby(
sales["order_date"].dt.to_period("M")
)["revenue"].sum()
print(monthly_revenue)
Cómo funciona
read_csv detecta cabecera y tipos; dtype, parse_dates y na_values hacen explícita la importación.
Cambia los valores y ejecuta el programa en el compilador Python online de CodeUtility sin instalar Python.
Ejercicios prácticos
Modifica las entradas y prueba casos límite antes de usar conjuntos de datos mayores.
- Añade filas, columnas y valores ausentes.
- Combina filtrado, ordenación y groupby.
- Carga un archivo real y revisa sus dtypes.