Semestre 02, 2026
Antes de analizar o modelar, clasificamos las variables. El tipo de dato determina qué técnicas y transformaciones podemos aplicar.
| Nivel | Orden | Distancia | Cero real | Ejemplo |
|---|---|---|---|---|
| Nominal | No | No | No | color, país |
| Ordinal | Sí | No | No | satisfacción (1–5) |
| Intervalo | Sí | Sí | No | temperatura °C |
| Razón | Sí | Sí | Sí | edad, ingresos |
Una fuente de datos es el origen de donde provienen los datos que vamos a analizar.
Recolectadas por nosotros para un objetivo específico: encuestas, experimentos, sensores.
Recolectadas por terceros y reutilizadas: open data, estudios previos, datasets públicos.
| Formato | Uso típico |
|---|---|
CSV | Tablas simples, intercambio |
JSON | APIs, datos semiestructurados |
XLSX | Hojas de cálculo |
XML | Documentos con etiquetas |
Parquet | Datos columnares, grandes volúmenes |
SQL | Bases de datos relacionales |
Se suele decir que el 80% del trabajo de un análisis se va en obtener y limpiar los datos, no en modelar.
Hadley Wickham propone tres principios para estructurar los datos de forma que sean fáciles de analizar.
Documento que describe cada variable del conjunto de datos, de modo que sea auto-explicativo para cualquier persona ajena al proyecto. También se le llama diccionario de datos.
Por cada variable incluye:
| Variable | Descripción | Tipo | Medición | Valores |
|---|---|---|---|---|
id_cliente | Identificador único | string | Nominal | 10 caracteres |
edad | Edad del cliente en años | int | Razón | 18–99 |
genero | Género | string | Nominal | F, M, Otro |
satisfaccion | Nivel de satisfacción | int | Ordinal | 1–5 |
Cualquier persona debe poder repetir el análisis y obtener el mismo resultado.
Qué documentar:
proyecto/
├── data/
│ ├── raw/ # datos crudos, nunca se modifican
│ └── processed/ # datos limpios listos para analizar
├── notebooks/
├── src/
│ └── limpieza.py
├── codebook.md
└── README.md