Cuando ni Excel se lo puede tragar…
Así empezó mi semana, con un datasheet de más 16 MILLONES de líneas en un solo archivo... (y faltaba cruzarlo con otros archivos)
Si alguna vez intentaste abrir algo así en Excel, sabrás que no es posible (límite: poco más de 1 millón de filas)… y aunque lo fuera, tu equipo no lo aguantaría seguramente.
Y aquí es donde entra el santo grial de los datos: EDA (Exploratory Data Analysis).
EDA es básicamente pensar antes de actuar, como abrir una caja de Lego y ver qué hay antes de construir nada, el libro de instrucciones del Ikea para los datos.
- ¿Cuántas filas y columnas tengo?
- ¿Qué campos están vacíos o con errores?
- ¿Hay outliers que pueden romper el análisis?
- ¿Cómo se distribuyen los datos?
- ¿Necesita normalización?
Mi estrategia para archivos tan pesados:
1️⃣ Limpiar y normalizar datos con Python para quitar duplicados, formatear fechas, etc
2️⃣ Estructurar, si como en mi caso es JSON lo suyo sería desanidarlo a columnas tipo Excel para poder trabajarlo de una forma más "humana"
3️⃣ Explorar y visualizar para estadísticas rápidas para detectar rarezas que salten a la vista
4️⃣ Corregir antes de modelar para evitar sorpresas, el buen data quality
5️⃣ Ahora si, ya puedes introducir ML o IA generativa para poder sacar conclusiones..
PD: si tus datos son demasiado grandes hasta para Excel, no saltes al modelado. Haz EDA. Es la diferencia entre dominar tus datos o que ellos te dominen a ti.