Semestre 02, 2026
El deep learning es una rama del machine learning basada en redes neuronales con muchas capas. Domina hoy la visión por computadora, el lenguaje, el audio y, cada vez más, las series de tiempo.
Un experto diseña las características a mano (feature engineering) y un modelo simple aprende sobre ellas.
La red aprende las características sola, en varios niveles de abstracción, desde los datos crudos.
La unidad básica combina varias entradas con pesos y produce una salida:
$$z = \sum_{i} w_i x_i + b \qquad a = \phi(z)$$
Sin no linealidad, apilar capas sería inútil: la red se reduciría a algo lineal.
Entrenar es encontrar los pesos que hacen que las predicciones se parezcan a los valores reales. La red repite un ciclo hasta que la pérdida es baja.
Mide qué tan lejos están las predicciones de los valores reales. Para regresión se usa el error cuadrático medio:
$$L = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{y}_i)^2$$
Ajusta cada peso en la dirección que reduce la pérdida:
$$w \leftarrow w - \eta \frac{\partial L}{\partial w}$$
Calcula el gradiente de cada peso de forma eficiente: propaga el error desde la salida hacia atrás, capa por capa, usando la regla de la cadena.
Se decide observando la pérdida en un conjunto de validación (datos que la red no usa para entrenar).
Una arquitectura es la forma en que se organizan y conectan las neuronas y capas de una red. Esa estructura decide qué tipo de datos y patrones puede aprender.
Capas densas totalmente conectadas: cada neurona se conecta con todas las de la siguiente capa. Es la red más básica.
Usan filtros (convoluciones) que se deslizan por la entrada para detectar patrones locales: bordes, texturas, formas.
Procesan una secuencia paso a paso y mantienen un estado que resume lo visto hasta el momento: una memoria.
Variantes de RNN con compuertas (gates) que deciden qué recordar, qué olvidar y qué dejar pasar.
Basados en el mecanismo de atención: relacionan todos los elementos de la secuencia entre sí a la vez, sin procesarlos uno por uno.
En una serie el orden importa: no podemos barajar las filas. Cada valor depende de los anteriores, y el modelo debe recordar el pasado para predecir el futuro.
Usamos los últimos \(k\) valores para predecir el siguiente. Así convertimos la serie en pares (entrada, salida) que una red puede aprender.
La serie [10, 12, 13, 15, 16] produce:
Toma la ventana de k valores pasados como una entrada plana y predice el siguiente con capas densas. Es el modelo de deep learning más simple para series: la línea base.
Procesan la serie valor por valor en orden y arrastran un estado oculto \(h_{t-1}\) que resume el pasado y se reinyecta en cada paso: así la red recuerda lo anterior.
$$h_t = \phi(W_x x_t + W_h h_{t-1} + b)$$
Son RNN con compuertas (gates) que deciden qué guardar, qué olvidar y qué dejar pasar. Mantienen memoria de largo plazo y capturan patrones que las RNN simples olvidan.
Aplica filtros que se deslizan a lo largo del tiempo para detectar patrones locales (picos, subidas, formas) sin importar cuándo ocurren. Son muy rápidas.
Usan atención para relacionar cualquier par de instantes de la serie a la vez, capturando dependencias de muy largo plazo. Se entrenan en paralelo.
Combinan arquitecturas o incorporan variables externas. En un CNN + LSTM, la CNN extrae los patrones locales y la LSTM modela la evolución temporal.
ARIMA o suavizado exponencial: excelentes para series cortas, univariadas y con estructura clara.
Gana con muchos datos, relaciones no lineales, múltiples variables o patrones complejos.