← CC3084

Fuentes y Preparación de Datos

Semestre 02, 2026

Ciencia de Datos

Intersección de la ciencia de datos

Roles en la ciencia de datos

Roles de la ciencia de datos y cómo interactúan

Recordatorio: tipos de datos

Antes de analizar o modelar, clasificamos las variables. El tipo de dato determina qué técnicas y transformaciones podemos aplicar.

Cualitativas
  • Nominales: sin orden (género, color, país).
  • Ordinales: con orden (nivel educativo, satisfacción).
Cuantitativas
  • Discretas: contables (número de hijos).
  • Continuas: medibles (peso, edad, ingresos).

Niveles de medición

NivelOrdenDistanciaCero realEjemplo
NominalNoNoNocolor, país
OrdinalNoNosatisfacción (1–5)
IntervaloNotemperatura °C
Razónedad, ingresos

Estructura de los datos

Estructurados: filas y columnas (bases de datos, CSV).
Semiestructurados: con etiquetas, sin esquema rígido (JSON, XML).
No estructurados: texto, imágenes, audio, video.

Mapa mental de los datos

Mapa mental de tipos de datos, estructura y análisis

Fuentes de datos

Definición

Una fuente de datos es el origen de donde provienen los datos que vamos a analizar.

Según su origen

Primarias

Recolectadas por nosotros para un objetivo específico: encuestas, experimentos, sensores.

Secundarias

Recolectadas por terceros y reutilizadas: open data, estudios previos, datasets públicos.

Según su ubicación

Internas: generadas en la organización (ventas, logs, CRM).
Externas: provienen de fuera (redes sociales, portales públicos, proveedores).

Ejemplos comunes

Archivos: CSV, Excel, JSON.
Bases de datos SQL.
APIs web (REST).
Web scraping.
Sensores e IoT.
Portales de datos abiertos, logs y encuestas.

Formatos comunes

FormatoUso típico
CSVTablas simples, intercambio
JSONAPIs, datos semiestructurados
XLSXHojas de cálculo
XMLDocumentos con etiquetas
ParquetDatos columnares, grandes volúmenes
SQLBases de datos relacionales

Datos crudos vs. procesados

Crudos (raw)
  • Tal como se obtienen, sin modificar.
  • Suelen tener errores, formatos inconsistentes y faltantes.
  • Regla de oro: nunca se sobrescriben.
Procesados
  • Ya fueron limpiados y transformados.
  • Listos para el análisis y el modelado.

El flujo de preparación

Datos crudos
Limpieza / Transformación
Datos procesados
Análisis

Se suele decir que el 80% del trabajo de un análisis se va en obtener y limpiar los datos, no en modelar.

El proceso de ciencia de datos

Proceso de ciencia de datos: de la realidad a la decisión

Problemas comunes

Valores faltantes (NaN).
Registros duplicados.
Tipos de dato incorrectos.
Formatos inconsistentes.
Valores atípicos (outliers).
Errores de captura y typos.

Técnicas frecuentes

  • Faltantes: eliminar filas o imputar (media, mediana, moda).
  • Duplicados: eliminarlos.
  • Estandarizar formatos (fechas, texto, unidades).
  • Convertir al tipo de dato correcto.
  • Tratar outliers: revisarlos; no siempre se eliminan.

Datos ordenados (Tidy Data)

Hadley Wickham propone tres principios para estructurar los datos de forma que sean fáciles de analizar.

1Cada variable es una columna.
2Cada observación es una fila.
3Cada tipo de unidad observacional es una tabla.

Code book

Definición

Documento que describe cada variable del conjunto de datos, de modo que sea auto-explicativo para cualquier persona ajena al proyecto. También se le llama diccionario de datos.

Por cada variable incluye:

Nombre y descripción
Tipo de dato y nivel de medición
Unidades
Valores permitidos, rango o ejemplo

Ejemplo de code book

VariableDescripciónTipoMediciónValores
id_clienteIdentificador únicostringNominal10 caracteres
edadEdad del cliente en añosintRazón18–99
generoGénerostringNominalF, M, Otro
satisfaccionNivel de satisfacciónintOrdinal1–5

Reproducibilidad

Cualquier persona debe poder repetir el análisis y obtener el mismo resultado.

Qué documentar:

  • De dónde vienen los datos: fuente, fecha y versión.
  • Qué transformaciones se aplicaron y por qué.
  • Los supuestos y las decisiones tomadas.

Herramientas

README del proyecto.
Notebooks (Jupyter): narrativa + código.
Comentarios claros en el código.
Control de versiones con git.

Estructura de proyecto


proyecto/
├── data/
│   ├── raw/         # datos crudos, nunca se modifican
│   └── processed/   # datos limpios listos para analizar
├── notebooks/
├── src/
│   └── limpieza.py
├── codebook.md
└── README.md

Resumen

  • Clasifica los tipos de datos antes de analizar.
  • Las fuentes pueden ser primarias o secundarias y llegar en muchos formatos.
  • Preserva siempre los datos crudos; trabaja sobre copias procesadas.
  • La limpieza es el 80% del trabajo; busca datos ordenados (tidy data).
  • Documenta cada variable en un code book.
  • Documenta el proceso y el código para que sea reproducible.