← CC3084

Deep Learning

Semestre 02, 2026

Introducción a Deep Learning

Idea central

El deep learning es una rama del machine learning basada en redes neuronales con muchas capas. Domina hoy la visión por computadora, el lenguaje, el audio y, cada vez más, las series de tiempo.

De la IA al Deep Learning

IA: construir máquinas con comportamiento inteligente.
Machine Learning: aprender patrones a partir de datos, no de reglas.
Deep Learning: redes profundas que aprenden representaciones jerárquicas.
Todo DL es ML, y todo ML es IA; no al revés.

Por qué despegó ahora

Datos: la digitalización masiva produjo los grandes volúmenes que necesitan.
Cómputo: las GPU permiten entrenar redes con millones de parámetros.
Algoritmos: ReLU, dropout, Adam y mejores inicializaciones estabilizaron el entrenamiento.

Aprender las características

ML clásico

Un experto diseña las características a mano (feature engineering) y un modelo simple aprende sobre ellas.

Deep Learning

La red aprende las características sola, en varios niveles de abstracción, desde los datos crudos.

  • En un rostro: las primeras capas detectan bordes, las intermedias ojos y narices, y las últimas rostros completos. Nadie programó esos detectores.

La neurona artificial

La unidad básica combina varias entradas con pesos y produce una salida:

$$z = \sum_{i} w_i x_i + b \qquad a = \phi(z)$$

  • Primero suma las entradas ponderadas más un sesgo, y obtiene \(z\).
  • Luego aplica la función de activación \(\phi\) para producir la salida \(a\).

Las partes de la neurona

\(x_i\): entradas · \(w_i\): pesos que aprende la red.
\(b\): sesgo (bias), desplaza el resultado.
\(\phi\): función de activación, aporta la no linealidad.
Pesos y sesgos son los parámetros que se ajustan al entrenar.

Capas y redes

1Capa de entrada
  • Recibe los datos: una neurona por característica.
2Capas ocultas
  • Transforman la información; aquí está la "profundidad" del deep learning.
3Capa de salida
  • Produce el resultado: una clase, un número o una probabilidad.

Funciones de activación

Sin no linealidad, apilar capas sería inútil: la red se reduciría a algo lineal.

ReLU \(\max(0, z)\): la más usada en capas ocultas.
Sigmoide \(\frac{1}{1+e^{-z}}\): comprime a \((0,1)\), probabilidades.
Tanh: comprime a \((-1,1)\), centrada en cero.
Softmax: distribución de probabilidad para clasificación multiclase.

El paso hacia adelante

  • Predecir es pasar los datos por la red, capa por capa.
  • La salida de una capa es la entrada de la siguiente, hasta la capa final.
  • A esto se le llama forward pass o propagación hacia adelante.

Cómo aprende una red

La meta

Entrenar es encontrar los pesos que hacen que las predicciones se parezcan a los valores reales. La red repite un ciclo hasta que la pérdida es baja.

  • 1. Forward: la red predice a partir de las entradas.
  • 2. Pérdida: se mide qué tan mal predijo.
  • 3. Backpropagation: se calcula cómo corregir cada peso.
  • 4. Actualizar: se ajustan los pesos y se repite.

La función de pérdida

Mide qué tan lejos están las predicciones de los valores reales. Para regresión se usa el error cuadrático medio:

$$L = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{y}_i)^2$$

  • \(y_i\) es el valor real; \(\hat{y}_i\) es la predicción de la red.
  • \(y_i - \hat{y}_i\) es el error de cada ejemplo.
  • Al cuadrado: penaliza más los errores grandes y evita que se cancelen.
  • \(\frac{1}{n}\sum\) promedia el error sobre todos los ejemplos.

Descenso de gradiente

Ajusta cada peso en la dirección que reduce la pérdida:

$$w \leftarrow w - \eta \frac{\partial L}{\partial w}$$

  • \(\frac{\partial L}{\partial w}\) es el gradiente: hacia dónde sube la pérdida si movemos el peso.
  • El signo negativo nos mueve al lado contrario: hacia donde la pérdida baja.
  • \(\eta\) es la tasa de aprendizaje: el tamaño del paso.
  • Muy grande: inestable. Muy pequeña: aprende lento.

Backpropagation

El algoritmo clave

Calcula el gradiente de cada peso de forma eficiente: propaga el error desde la salida hacia atrás, capa por capa, usando la regla de la cadena.

  • Sin él, ajustar millones de pesos sería inviable.
  • Le dice al descenso de gradiente cuánto y hacia dónde mover cada peso.

El ciclo de entrenamiento

El ciclo forward → pérdida → backprop → actualizar se repite muchas veces.
Una pasada completa por todos los datos se llama época (epoch).
Con cada época, la pérdida suele bajar y las predicciones mejoran.

Cuántas épocas usar

No hay número fijo

Se decide observando la pérdida en un conjunto de validación (datos que la red no usa para entrenar).

  • Pocas épocas: underfitting, la red no aprendió lo suficiente.
  • Muchas épocas: overfitting, memoriza el entrenamiento y empeora en datos nuevos.
  • La regla: entrena mientras la pérdida de validación baje; detente cuando empiece a subir.
  • Early stopping: detiene el entrenamiento automáticamente en ese punto.

Arquitecturas

Definición

Una arquitectura es la forma en que se organizan y conectan las neuronas y capas de una red. Esa estructura decide qué tipo de datos y patrones puede aprender.

  • No existe una red única: cada arquitectura se adapta a un tipo de dato (tablas, imágenes, secuencias).
  • Elegir bien la arquitectura suele importar más que hacer la red más grande.

Las principales

MLP: capas densas. Datos tabulares.
CNN: patrones locales. Imágenes.
RNN: secuencias con memoria.
LSTM y GRU: memoria de largo plazo.
Transformers: atención.

MLP · Perceptrón multicapa

Qué es

Capas densas totalmente conectadas: cada neurona se conecta con todas las de la siguiente capa. Es la red más básica.

Para qué: datos tabulares (filas y columnas).
Cómo: combina todas las entradas a la vez, sin noción de posición ni orden.

CNN · Redes convolucionales

Qué es

Usan filtros (convoluciones) que se deslizan por la entrada para detectar patrones locales: bordes, texturas, formas.

Para qué: imágenes y video; también señales y series.
Clave: detectan un patrón sin importar en qué parte aparezca.

RNN · Redes recurrentes

Qué es

Procesan una secuencia paso a paso y mantienen un estado que resume lo visto hasta el momento: una memoria.

Para qué: datos secuenciales — texto, audio, series de tiempo.
Límite: olvidan dependencias de largo plazo (gradiente que se desvanece).

LSTM y GRU

Qué es

Variantes de RNN con compuertas (gates) que deciden qué recordar, qué olvidar y qué dejar pasar.

Ventaja: memoria de largo plazo, ideal para estacionalidad y contexto lejano.
Para qué: series de tiempo y secuencias largas.

Transformers

Qué es

Basados en el mecanismo de atención: relacionan todos los elementos de la secuencia entre sí a la vez, sin procesarlos uno por uno.

Para qué: lenguaje (GPT, BERT); cada vez más imágenes y series.
Ventaja: capturan dependencias muy largas y se entrenan en paralelo.

Fortalezas

Aprende características solo, sin feature engineering manual.
Escala: con más datos y cómputo, suele seguir mejorando.
Estado del arte en visión, lenguaje, audio y generación.
Flexible: se adapta a imágenes, texto, secuencias y más.

Debilidades

Necesita muchos datos; con pocos, gana un modelo simple.
Costoso: requiere GPU, tiempo y energía.
Caja negra: cuesta explicar sus decisiones.
Muchos hiperparámetros y riesgo de sobreajuste.

Deep learning o ML clásico

Datos pequeños o tabulares con buenas características: mejor ML clásico (árboles, boosting).
Datos grandes y no estructurados (imágenes, texto, señales): mejor deep learning.
Si hay que explicar cada decisión: la interpretabilidad puede pesar más que la exactitud.

Consideraciones éticas

Sesgos: la red aprende y amplifica los sesgos de los datos.
Costo energético y huella de carbono al entrenar modelos grandes.
Datos y privacidad: requiere grandes cantidades, a veces sensibles.
Reproducibilidad: depende de semillas, versiones y hardware.

Deep Learning para series de tiempo

El reto temporal

En una serie el orden importa: no podemos barajar las filas. Cada valor depende de los anteriores, y el modelo debe recordar el pasado para predecir el futuro.

  • Hay que respetar el orden cronológico al entrenar y al evaluar.

Ventanas deslizantes

De serie a problema supervisado

Usamos los últimos \(k\) valores para predecir el siguiente. Así convertimos la serie en pares (entrada, salida) que una red puede aprender.

Ejemplo con k = 3

La serie [10, 12, 13, 15, 16] produce:

X = [10, 12, 13] → y = 15
X = [12, 13, 15] → y = 16

MLP con ventanas

Qué hace

Toma la ventana de k valores pasados como una entrada plana y predice el siguiente con capas densas. Es el modelo de deep learning más simple para series: la línea base.

Casos de uso: pronóstico de un paso en series sin dependencias muy largas; punto de partida.
Ejemplo: predecir la venta de mañana a partir de las ventas de los últimos 7 días.

Redes recurrentes (RNN)

Procesan la serie valor por valor en orden y arrastran un estado oculto \(h_{t-1}\) que resume el pasado y se reinyecta en cada paso: así la red recuerda lo anterior.

$$h_t = \phi(W_x x_t + W_h h_{t-1} + b)$$

Casos de uso: series cortas o medianas donde el patrón depende de los valores recientes; pronóstico de un paso.
Ejemplo: predecir la temperatura de la próxima hora a partir de las últimas 24 horas.

El gradiente que se desvanece

  • Las RNN simples luchan con dependencias de largo plazo.
  • Al propagar el error muchos pasos hacia atrás, los gradientes se hacen diminutos.
  • La red termina olvidando lo que pasó hace tiempo. Esto motivó arquitecturas con memoria.

LSTM y GRU

Qué hace

Son RNN con compuertas (gates) que deciden qué guardar, qué olvidar y qué dejar pasar. Mantienen memoria de largo plazo y capturan patrones que las RNN simples olvidan.

Casos de uso: series con estacionalidad (diaria, semanal, anual), dependencias largas o varias variables.
Ejemplo: pronosticar la demanda eléctrica diaria de una ciudad captando su patrón semanal y estacional.

CNN 1D para series

Qué hace

Aplica filtros que se deslizan a lo largo del tiempo para detectar patrones locales (picos, subidas, formas) sin importar cuándo ocurren. Son muy rápidas.

Casos de uso: detección de patrones o formas y clasificación de señales; series con patrones locales repetidos.
Ejemplo: detectar latidos anómalos en una señal de electrocardiograma (ECG).

Transformers para series

Qué hace

Usan atención para relacionar cualquier par de instantes de la serie a la vez, capturando dependencias de muy largo plazo. Se entrenan en paralelo.

Casos de uso: series largas, muchas series a la vez, pronóstico multivariado y de varios pasos.
Ejemplo: pronosticar, con semanas de anticipación, la demanda de miles de productos de una tienda (Temporal Fusion Transformer).

Modelos híbridos

Qué hace

Combinan arquitecturas o incorporan variables externas. En un CNN + LSTM, la CNN extrae los patrones locales y la LSTM modela la evolución temporal.

Casos de uso: series complejas con patrones locales y dependencias largas, o con variables externas (clima, feriados, promociones).
Ejemplo: predecir ventas combinando el historial con datos externos, como si el día es feriado o hay promoción.

Consideraciones prácticas

Escalado: normaliza la serie; las redes son sensibles a la escala.
División temporal: la prueba es el tramo final, nunca una muestra aleatoria.
Horizonte: predecir varios pasos (multi-step) acumula error.
Métricas: MAE, RMSE o MAPE.

Cuándo usar deep learning

Métodos clásicos

ARIMA o suavizado exponencial: excelentes para series cortas, univariadas y con estructura clara.

Deep learning

Gana con muchos datos, relaciones no lineales, múltiples variables o patrones complejos.

Empieza con un modelo simple como línea base y sube a deep learning solo si el problema lo justifica.