← CC3084

Datos Geoespaciales, Sensores Remotos y SIG

Semestre 02, 2026

Introducción

Idea central

Casi todo dato lleva pegada una pregunta implícita: ¿dónde ocurrió? Cuando un dato incluye su ubicación en la superficie de la Tierra, es un dato geoespacial.

  • Una venta ocurre en una tienda, un caso de dengue en una aldea, una deforestación en una parcela concreta.
  • La ubicación no es solo dos columnas más: cambia las reglas del análisis.

La primera ley de la geografía

Tobler

Todo está relacionado con todo lo demás, pero las cosas cercanas están más relacionadas que las lejanas.

El precio de una casa se parece al de la casa de al lado.
La temperatura de hoy en un punto se parece a la de un kilómetro más allá.
Un brote tiende a aparecer en vecindarios contiguos.
Esta dependencia se llama autocorrelación espacial y rompe el supuesto de independencia.

Los tres bloques de la lección

1Datos geoespaciales
  • Cómo se representa la ubicación y en qué formatos vive.
2Sensores remotos
  • Cómo se capturan datos de la Tierra desde satélites, aviones y drones.
3SIG
  • Los sistemas y las operaciones para almacenar, consultar y analizar todo lo anterior.

Anatomía de un dato geoespacial

Componente espacial: dónde está. Una geometría o una celda de una cuadrícula.
Componente temporal: cuándo. La misma parcela no es igual en enero que en junio.
Atributos: qué hay ahí. Población, temperatura, tipo de cultivo, número de casos.
Con las tres dimensiones se llama espacio-temporal: series de tiempo por ubicación.

Fenómenos discretos y continuos

Discretos

Objetos con bordes definidos: un poste, una carretera, un municipio. Se representan bien como vectores.

Continuos

Magnitudes que existen en todo punto: elevación, temperatura, precipitación, reflectancia. Se representan bien como rásteres.

  • Elegir mal la representación es fuente frecuente de errores: forzar un fenómeno continuo a polígonos crea fronteras artificiales.

La forma de la Tierra

La Tierra no es una esfera perfecta ni una superficie plana, y esa incomodidad se cuela en todo dato geoespacial.

Geoide: la forma real, definida por el campo gravitatorio. Es irregular.
Elipsoide: una aproximación matemática al geoide, más simple de calcular.
Datum: el elipsoide más su anclaje al planeta. Define el origen de las coordenadas.
Dos coordenadas idénticas en datums distintos pueden apuntar a lugares separados por cientos de metros.

Coordenadas geográficas

Latitud

Ángulo hacia el norte o el sur desde el ecuador, de −90° a 90°.

Longitud

Ángulo hacia el este o el oeste desde el meridiano de Greenwich, de −180° a 180°.

  • Se expresan en grados, no en metros. Un grado de latitud son unos 111 km en cualquier parte.
  • Un grado de longitud mide 111 km en el ecuador y 0 km en los polos.
  • Calcular distancias o áreas restando grados es incorrecto: hay que proyectar o usar fórmulas sobre la esfera.

Proyecciones

Definición

La receta para pasar de la superficie curva de la Tierra a un plano. Toda proyección distorsiona algo; no existe una perfecta.

Conformes: preservan ángulos y formas locales, deforman áreas. En Mercator, Groenlandia parece del tamaño de África, siendo catorce veces más pequeña.
Equivalentes: preservan las áreas, deforman las formas. Útiles para mapas temáticos.
Equidistantes: preservan distancias, pero solo desde ciertos puntos o líneas.

Reglas prácticas de proyección

Para medir distancias y áreas, usa una proyección métrica local, no grados.
UTM divide el mundo en 60 husos de 6° y da coordenadas en metros. Guatemala cae en los husos 15 y 16 norte.
Para mapas web, la proyección de facto es Web Mercator: buena para navegar, mala para comparar áreas.

Códigos EPSG

Cada sistema de referencia de coordenadas (CRS) tiene un código que lo identifica sin ambigüedad.

EPSG:4326 — WGS84 en grados de latitud y longitud.
EPSG:3857 — Web Mercator, en metros, la de los mapas de la web.
EPSG:32615 y 32616 — UTM zonas 15N y 16N sobre WGS84, en metros.
Regla número uno: al combinar capas, verificar que todas estén en el mismo CRS.
  • Superponer datos en CRS distintos produce mapas que se ven bien y análisis que están mal.

El modelo vectorial

Representa el espacio con geometrías definidas por coordenadas.

Punto: una ubicación sin dimensión. Un hospital, un árbol, un evento de GPS.
Línea: una secuencia de puntos conectados. Una carretera, un río, una ruta de bus.
Polígono: una línea cerrada que encierra un área. Un municipio, una parcela, un lago.
Multi-geometrías: un registro con varias partes. Un archipiélago es un multipolígono.
  • Cada geometría lleva una tabla de atributos asociada.

El modelo ráster

Representa el espacio como una cuadrícula regular de celdas, cada una con un valor.

Es esencialmente una matriz, igual que una imagen digital.
La resolución espacial es el tamaño de la celda en el terreno: 10 m, 30 m, 250 m.
Cada banda es una matriz distinta sobre la misma cuadrícula.
Es el modelo natural para todo lo que viene de sensores remotos.

Cuándo usar cada modelo

Vectorial

Fronteras, redes, ubicaciones puntuales, datos censales. Preciso, ligero, fácil de consultar por atributos.

Ráster

Imágenes satelitales, elevación, clima, cualquier superficie continua. Fácil de operar celda por celda, pesado en almacenamiento.

  • En la práctica se combinan: recortar un ráster de NDVI con el polígono de un municipio y sacar el promedio es una operación cotidiana.

Formatos vectoriales

Shapefile: el formato histórico de ESRI. No es un archivo sino varios que deben viajar juntos, y limita los nombres de campo a 10 caracteres.
GeoJSON: JSON con geometrías. Legible, ideal para la web y para APIs. Se asume EPSG:4326.
GeoPackage: base SQLite con capas vectoriales y ráster en un solo archivo. El reemplazo moderno del shapefile.
KML y KMZ: el formato de Google Earth, orientado a visualización.
  • WKT y WKB son las representaciones de texto y binaria de una geometría, usadas dentro de bases de datos.

Formatos ráster

GeoTIFF: un TIFF con metadatos de georreferenciación incrustados. El estándar de facto.
COG: un GeoTIFF organizado para leerse por pedazos desde la nube sin descargar todo el archivo.
NetCDF y HDF: formatos multidimensionales para clima y series temporales; guardan cubos de datos.
Zarr: pensado para cubos de datos enormes en almacenamiento en la nube.

Estándares y servicios OGC

El Open Geospatial Consortium define estándares para que los sistemas se entiendan entre sí.

WMS: entrega mapas ya renderizados como imágenes.
WFS: entrega las geometrías vectoriales, no la imagen.
WCS: entrega datos ráster crudos.
STAC: catálogo estándar para buscar imágenes satelitales por fecha, área y sensor.

Sensores remotos

Definición

Cualquier instrumento que mide algo sin estar en contacto con el objeto medido. En la práctica: observar la Tierra desde el aire o el espacio.

  • Una fuente de energía ilumina la superficie.
  • La superficie refleja o emite radiación.
  • El sensor la capta y la convierte en una matriz de números georreferenciada.

Plataformas

Satélites: cobertura global y revisita periódica. Órbita polar heliosíncrona para observación de la Tierra, geoestacionaria para meteorología.
Aviones: mayor resolución, vuelo bajo demanda, cobertura limitada.
Drones: resolución de centímetros y control total del momento del vuelo, con cobertura de pocas hectáreas.
El dron es la vía más accesible para proyectos locales.

Sensores pasivos y activos

Pasivos

Miden energía que no producen ellos: dependen del Sol o de la emisión térmica. No ven de noche, salvo los térmicos, y las nubes los bloquean.

Activos

Emiten su propia energía y miden el retorno. Funcionan de noche y, según la longitud de onda, atraviesan nubes. LiDAR y radar son activos.

El espectro electromagnético

Los sensores no se limitan a lo que ve el ojo humano; cada región del espectro revela información distinta.

Visible: lo que vemos; color natural y análisis de vegetación en el rojo.
Infrarrojo cercano (NIR): la vegetación sana lo refleja intensamente. La banda estrella para agricultura.
Infrarrojo de onda corta (SWIR): humedad del suelo y la vegetación, incendios y minerales.
Infrarrojo térmico: temperatura de superficie, islas de calor, estrés hídrico.
Microondas: las usa el radar; atraviesan nubes y lluvia.

Firmas espectrales

La idea

Cada material refleja distinta proporción de energía en cada longitud de onda. Ese patrón es su firma espectral y funciona como una huella digital.

Vegetación sana: refleja poco en el rojo, que absorbe la clorofila, y muchísimo en el NIR.
Vegetación estresada o seca: sube la reflectancia en el rojo y baja en el NIR.
Agua: absorbe casi todo el NIR, por eso se ve muy oscura en esa banda.
Suelo desnudo: reflectancia moderada y creciente hacia el infrarrojo.
  • Clasificar cobertura terrestre consiste, en el fondo, en distinguir firmas espectrales.

Las cuatro resoluciones

Espacial: el tamaño del píxel en el terreno. 30 m en Landsat, 10 m en Sentinel-2, 250 m en MODIS.
Espectral: cuántas bandas y qué tan angostas. Un sensor hiperespectral tiene cientos.
Temporal: cada cuánto el satélite vuelve al mismo lugar. 16 días en Landsat, 5 en Sentinel-2, diaria en MODIS.
Radiométrica: cuántos niveles de intensidad distingue. 8 bits son 256 niveles; 12 bits son 4096.
  • El compromiso es físico: más resolución espacial implica menos área por escena y menor frecuencia de revisita.

Misiones y sensores frecuentes

Landsat: serie continua desde 1972, 30 m, gratuita. Insustituible para estudios de cambio a largo plazo.
Sentinel-2: 10–20 m, revisita de 5 días, 13 bandas, gratuita. El caballo de batalla actual.
Sentinel-1: radar SAR, ve a través de nubes; ideal para inundaciones y zonas tropicales.
MODIS y VIIRS: resolución gruesa pero cobertura diaria; clima, incendios, monitoreo global.
PlanetScope y WorldView: comerciales, resolución submétrica, revisita casi diaria.

LiDAR

Cómo funciona

Emite pulsos láser y mide el tiempo que tardan en volver, produciendo una nube de puntos en tres dimensiones.

Genera modelos de elevación muy precisos.
Distingue el modelo de superficie (con árboles y edificios) del modelo del terreno (suelo desnudo).
Restando ambos se obtiene la altura de la vegetación o de las construcciones.
Se usa en forestal, arqueología, urbanismo y modelado de inundaciones.

Radar y SAR

El radar de apertura sintética emite microondas y mide su retorno.

Atraviesa nubes, humo y lluvia, y funciona de noche.
Es la única opción confiable en regiones tropicales con nubosidad permanente.
Mide rugosidad y humedad más que color; su interpretación difiere de la de una imagen óptica.
La interferometría detecta deformaciones de milímetros: hundimientos, deslizamientos, actividad volcánica.

Preprocesamiento de imágenes satelitales

Una imagen recién bajada no está lista para analizarse.

Corrección radiométrica: convertir los números crudos del sensor a radiancia y luego a reflectancia física.
Corrección atmosférica: descontar el efecto de la atmósfera. Es la diferencia entre un producto de nivel 1 y uno de nivel 2.
Ortorrectificación: alinear la imagen con el terreno real, corrigiendo la distorsión del relieve.
Enmascarado de nubes: descartar píxeles con nube y sombra usando la banda de calidad.

Composición y armonización

Composición temporal: combinar varias fechas tomando la mediana de cada píxel para obtener una imagen sin nubes.
Mosaico y recorte: unir escenas vecinas y recortar al área de interés.
Remuestreo: llevar capas de distinta resolución a una cuadrícula común.
Vecino más cercano para datos categóricos, bilineal o cúbico para continuos.
  • Igual que en cualquier proyecto de ciencia de datos, esta etapa consume la mayor parte del tiempo.

Índices espectrales

Qué son

Combinaciones de bandas que resaltan un fenómeno concreto. Casi siempre son una diferencia normalizada, que produce valores acotados y menos sensibles a la iluminación.

  • Para un proyecto de ciencia de datos, son variables predictoras listas para usar.

NDVI

El índice de vegetación de diferencia normalizada es el más usado en teledetección.

$$ NDVI = \frac{NIR - Rojo}{NIR + Rojo} $$
  • La vegetación sana absorbe rojo y refleja NIR, así que la diferencia se dispara.

Interpretación del NDVI

Valores negativos: agua, nieve, nubes.
Cerca de 0: suelo desnudo, roca, área construida.
De 0.2 a 0.5: vegetación escasa o pastizales.
Arriba de 0.6: vegetación densa y sana.
  • El índice va de −1 a 1.

Otros índices frecuentes

NDWI: usa verde y NIR para detectar cuerpos de agua y humedad.
NDBI: usa SWIR y NIR para resaltar áreas construidas.
EVI: un NDVI corregido para el efecto del suelo y la atmósfera; no se satura en vegetación muy densa.
NBR: usa NIR y SWIR para medir severidad de incendios; la diferencia antes y después cuantifica el área quemada.

Sistemas de Información Geográfica

Definición

Un sistema para capturar, almacenar, consultar, analizar y visualizar datos con referencia geográfica.

  • No es solo un programa de mapas.
  • Es una base de datos donde la ubicación es un campo de primera clase.

Los cinco componentes

Hardware: computadoras, GPS, servidores.
Software: QGIS, ArcGIS, PostGIS, librerías de Python.
Datos: la parte más cara y más valiosa del sistema.
Personas: quienes diseñan el análisis e interpretan los resultados.
Métodos: los procedimientos y flujos de trabajo documentados.

El modelo de capas

La idea

Un SIG organiza el territorio en capas temáticas superpuestas sobre la misma zona: hidrografía, vías, uso del suelo, población, parcelas.

  • Cada capa es independiente y se combina con las demás cuando el análisis lo pide.
  • Esa separación permite responder preguntas que ninguna capa contesta por sí sola.

Consultas y zonas de influencia

Consulta por atributo: seleccionar registros por sus valores, como en SQL.
Consulta espacial: seleccionar por relación geométrica. Contiene, intersecta, está dentro de, toca, cruza.
Buffer: generar un área a cierta distancia de una geometría, como la zona de 500 m alrededor de un río.
Geocodificación: convertir una dirección de texto en coordenadas. La inversa es la geocodificación reversa.

Combinación de capas

Overlay: combinar capas mediante intersección, unión o diferencia.
Clip: recortar una capa con la forma de otra.
Disolución: fusionar geometrías vecinas que comparten un atributo, por ejemplo unir municipios en departamentos.
Unión espacial: pegarle a cada punto los atributos del polígono que lo contiene. La operación más común al preparar datos.
Análisis de redes: rutas más cortas, áreas de servicio, asignación de demanda a instalaciones.

Álgebra de mapas

Con rásteres, el análisis se vuelve aritmética entre matrices.

Locales: celda por celda, entre una o varias capas. Así se calcula el NDVI.
Focales: el valor de una celda sale de su vecindad. Suavizados, pendientes, detección de bordes.
Zonales: se resume una capa dentro de las zonas que define otra. El NDVI promedio por municipio.
Globales: usan todo el ráster. Distancia al elemento más cercano, cuencas visuales.

Un análisis encadenado

Dónde ubicar un nuevo centro de salud.

1Población y cobertura actual
  • Partir de la capa de población por sector censal.
  • Generar buffers de 30 minutos alrededor de los centros existentes con análisis de redes.
2Población desatendida
  • Restar esas áreas para quedarse con la población no cubierta.
  • Intersectar con la capa de vías para exigir accesibilidad.
3Filtrar y priorizar
  • Excluir zonas de pendiente alta y áreas protegidas.
  • Ordenar los polígonos candidatos por población servida.
  • Ninguna capa responde la pregunta sola; la respuesta sale de combinarlas.

Autocorrelación espacial

Si los valores altos tienden a estar cerca de otros altos, la autocorrelación es positiva. El índice de Moran la resume en un número.

$$ I = \frac{n}{\sum_i \sum_j w_{ij}} \cdot \frac{\sum_i \sum_j w_{ij}(x_i - \bar{x})(x_j - \bar{x})}{\sum_i (x_i - \bar{x})^2} $$
  • El peso \(w_{ij}\) expresa qué tan vecinas son las unidades \(i\) y \(j\).

Lectura del índice de Moran

Cerca de 1: patrón agrupado.
Cerca de 0: patrón aleatorio.
Cerca de −1: patrón disperso, como un tablero de ajedrez.
Con autocorrelación, los errores estándar salen subestimados y se declaran significativos efectos que no lo son.
  • Casi toda la estadística clásica supone observaciones independientes.

Detección de agrupamientos

Getis-Ord Gi*: identifica puntos calientes y fríos estadísticamente significativos, no solo valores altos.
Moran local (LISA): descompone el índice global y señala dónde está cada tipo de agrupamiento.
DBSCAN: agrupa por densidad sin fijar el número de grupos y marca el ruido. Muy usado con datos de GPS.
Densidad de kernel: convierte una nube de puntos en una superficie continua de intensidad.

Interpolación

A partir de mediciones en pocos puntos se estima el valor en todo el espacio.

IDW: cada punto conocido influye en proporción inversa a su distancia. Simple e intuitivo.
Kriging: modela la autocorrelación con un variograma y produce también la incertidumbre de la estimación.
Vecino natural y splines: alternativas que suavizan de forma distinta.

Trampas del análisis espacial

MAUP: los resultados cambian según el tamaño y el trazo de las unidades. Agregar por departamento o por municipio puede dar conclusiones opuestas.
Falacia ecológica: concluir algo sobre individuos a partir de agregados por zona.
Efecto de borde: las unidades del borde tienen menos vecinos, lo que sesga los estadísticos de vecindad.
Sesgo de cobertura: las zonas pobres o rurales están peor mapeadas, y esa ausencia se confunde con ausencia del fenómeno.

Clasificación de cobertura terrestre

La tarea clásica: asignar a cada píxel una clase de uso del suelo, como bosque, agua, cultivo, urbano o suelo desnudo.

Supervisada: se etiquetan a mano regiones de entrenamiento y se ajusta un clasificador. Random Forest y gradient boosting funcionan muy bien.
No supervisada: se agrupan los píxeles por similitud espectral con k-means y luego se interpreta cada grupo.
Las variables son las bandas, los índices espectrales y la textura.
La serie temporal del año completo es muy útil: los cultivos se distinguen por su fenología, no por una sola fecha.

Deep learning sobre imágenes satelitales

Continuidad

Todo lo visto en la lección de reconocimiento de imágenes aplica aquí, con algunos matices.

Las CNN clasifican parches y detectan objetos: edificios, embarcaciones, piscinas, deforestación.
U-Net y otras arquitecturas encoder–decoder segmentan píxel a píxel; es el estándar para mapear cobertura y extraer huellas de edificios.
La diferencia: hay más de tres canales, los valores no están en [0, 255], y el contexto geográfico y temporal importa.

Variables espaciales derivadas

El feature engineering espacial suele mejorar más un modelo que cambiar de algoritmo.

Distancia a la carretera, al río, al mercado o al centro urbano más cercano.
Densidad de puntos de interés en un radio dado.
Estadísticos de la vecindad: promedio del vecindario, pendiente, elevación.
Variables espectrales agregadas por zona: NDVI promedio y su variación en el tiempo.

Validación con datos espaciales

El error más caro

Una partición aleatoria deja puntos vecinos en entrenamiento y en prueba. Como los vecinos se parecen, el modelo aparenta un desempeño excelente que no se sostiene en territorio nuevo. Es fuga de información espacial.

Validación cruzada espacial: separar por bloques geográficos, regiones o conglomerados.
Con dimensión temporal, la partición debe respetar el tiempo: entrenar con años pasados y evaluar con años futuros.

El ecosistema de Python

GeoPandas: extiende pandas con una columna de geometría. Unión espacial, buffers, reproyección y overlays con sintaxis de DataFrame.
Shapely: la geometría de fondo; operaciones sobre puntos, líneas y polígonos.
Fiona y pyproj: lectura y escritura de formatos vectoriales, y transformación entre CRS.
Rasterio: leer y escribir rásteres como arreglos de NumPy.
rioxarray y xarray: cubos de datos multidimensionales, ideales para series de imágenes.
GDAL y OGR: la librería que está debajo de casi todo el ecosistema.

Visualización y análisis en la nube

Folium, Kepler.gl y plotly: mapas interactivos.
PySAL: estadística espacial, incluido el índice de Moran y Getis-Ord.
Google Earth Engine: catálogo planetario de imágenes con cómputo en la nube; evita descargar terabytes.

Escritorio y bases de datos

QGIS: SIG de escritorio libre y completo, con consola de Python.
ArcGIS Pro: la alternativa comercial dominante en instituciones.
PostGIS: extensión espacial de PostgreSQL, con predicados geométricos e índices espaciales. La forma seria de guardar datos geoespaciales.
SpatiaLite: el equivalente ligero sobre SQLite.

Reglas para mapas honestos

Normaliza siempre. Un mapa de conteos absolutos por municipio es, en el fondo, un mapa de dónde vive la gente.
Elige bien la clasificación. Intervalos iguales, cuantiles y cortes naturales dan mapas distintos con los mismos datos.
Paletas adecuadas: secuenciales para magnitudes, divergentes con punto medio, cualitativas para categorías. Nunca arcoíris para datos continuos.
Cuidado con la proyección: Web Mercator infla las latitudes altas.

Tipos de mapa

Coropletas: color por unidad administrativa, siempre con valores normalizados.
Símbolos proporcionales y mapas de puntos: para magnitudes por ubicación.
Densidad de kernel: muestra densidad de puntos, no intensidad del fenómeno. Se presta a confusión.
Isolíneas y mapas de flujo: superficies continuas y movimientos entre lugares.
Cartogramas y mapas de hexágonos: cuando el tamaño de las unidades distorsiona la lectura.

Aplicaciones

Agricultura de precisión: monitoreo con NDVI, estimación de rendimiento, detección temprana de estrés hídrico.
Gestión de desastres: mapeo de inundaciones con SAR, evaluación de daños tras un sismo, modelado de lahares.
Ambiente y clima: deforestación, cambio de cobertura, islas de calor, calidad del aire, glaciares.
Salud pública: mapeo de brotes, accesibilidad a servicios, identificación de zonas desatendidas.
Planificación urbana: mancha urbana, catastro, transporte público, ubicación óptima de servicios.
Logística y retail: optimización de rutas, áreas de cobertura, selección de sitios.

Casos en Guatemala

Monitoreo de la deforestación en el Petén.
Vigilancia del complejo volcánico de Fuego y Pacaya.
Mapeo de riesgo por deslizamientos en la cuenca del Amatitlán.
LiDAR arqueológico que reveló miles de estructuras mayas bajo la selva.
  • Un sistema de alerta temprana de seguridad alimentaria combina lluvia, NDVI y precios.

La ubicación es un dato personal

Reidentificación

Cuatro puntos espacio-temporales bastan para identificar de forma única a la mayoría de las personas en un conjunto de datos de movilidad. Anonimizar quitando el nombre no es suficiente.

Agregar a unidades suficientemente grandes o desplazar las coordenadas de forma controlada.
Publicar la ubicación exacta de un caso de enfermedad o de una vivienda es revelar a una persona.

Consideraciones éticas

Vigilancia: el rastreo masivo de ubicación plantea problemas de derechos que la técnica no resuelve.
Sesgo de datos: los mapas colaborativos están mucho más completos en zonas ricas y urbanas, y el modelo perpetúa esa desigualdad.
Poder del mapa: las fronteras, los nombres y las categorías nunca son neutrales.
Consentimiento: la ubicación se recolecta de forma pasiva desde teléfonos y aplicaciones, sin que el usuario entienda lo que cede.