← CC3084

Analítica de Redes Sociales

Semestre 02, 2026

Definición

Analítica de redes sociales

Conjunto de técnicas que estudian las relaciones entre actores sociales representándolas como un grafo, para medir su estructura y explicar el comportamiento que esa estructura produce.

La unidad de análisis

No es el individuo ni el documento, sino el vínculo. Un conjunto de personas descrito una por una es una tabla; ese mismo conjunto descrito por quién habla con quién es una red.

Dos cosas con el mismo nombre


Análisis de redes sociales (SNA)   estructura relacional modelada como grafo
                                   nodos, aristas, centralidad, comunidades
                                   origen: sociología, años 30

Analítica de social media          desempeño de contenido en plataformas
                                   alcance, impresiones, engagement, CTR
                                   origen: marketing digital, años 2000
Distinción

La primera pregunta cómo está organizado un colectivo; la segunda, cómo se comportó una publicación. Esta lección trata principalmente la primera y cierra con la segunda.

Relación con la minería de texto


Minería de texto     "este mensaje es negativo"      -> propiedad del contenido

Analítica de redes   "este mensaje llegó a 40,000
                      cuentas en 3 saltos"           -> propiedad de la estructura
Se complementan

Un texto tóxico importa poco si nadie lo replica, y una cascada masiva no se interpreta sin leer qué se está replicando. Lo visto sobre contenido se asume conocido y no se repite aquí.

El grafo como modelo

No dirigido la relación es simétrica A B C amistad, coautoría Dirigido la relación tiene sentido A B C seguir, citar, retuitear
Error frecuente

Que A siga a B no implica que B siga a A. Colapsar eso a una amistad simétrica inventa reciprocidad que no está en los datos.

Variantes que importan


No dirigido    la relación es simétrica         amistad en Facebook, coautoría
Dirigido       la relación tiene sentido        seguir, citar, retuitear
Ponderado      la arista lleva un número        cantidad de mensajes, duración
Bipartito      dos tipos de nodo                usuarios y grupos, autores y papers
Temporal       la arista existe en un instante  quién llamó a quién y cuándo
Multicapa      varias relaciones a la vez       misma gente en WhatsApp y en X
Nodo y arista

El nodo es el actor, sea una persona, una cuenta, una organización o un hashtag. La arista es la relación. Modelar es decidir esas dos cosas, y la decisión determina todo lo que se puede medir después.

Elegir qué es una arista

Con los mismos datos se construyen redes distintas, y cada una responde otra pregunta.


Red de seguimiento    A sigue a B         audiencia potencial, estructura estable
Red de retuits        A retuitea a B      difusión efectiva, qué se propagó
Red de menciones      A menciona a B      conversación, confrontación incluida
Red de respuestas     A responde a B      diálogo real, hilos
Red de co-hashtag     A y B usan #x       temas compartidos sin contacto directo
Red de co-audiencia   comparten           cercanía ideológica o temática
                      seguidores
Hallazgo típico

Una cuenta con muchos seguidores puede tener una red de retuits casi vacía. Ese contraste entre la red estable y la red de interacción ya es un resultado.

Representación en memoria

el grafo matriz de adyacencia lista de adyacencia 1 2 3 4 1 2 3 4 1 2 3 4 0 1 1 0 1 0 1 0 1 1 0 1 0 0 1 0 1: 2, 3 2: 1, 3 3: 1, 2, 4 4: 3 16 celdas para 4 aristas solo se guarda lo que existe
Dispersión

La matriz cuesta O(n²) y responde en O(1) si hay arista; la lista cuesta O(n + m) y recorrer vecinos es directo. Un usuario de una red con cientos de millones de cuentas conoce a unos cientos, así que una matriz densa para un millón de nodos pediría del orden de \(10^{12}\) celdas casi todas en cero. Por eso se trabaja con listas de adyacencia o matrices dispersas.

Quién es importante en la red

H P H — grado alto muchos vecinos, todos del mismo grupo P — intermediación alta solo dos vecinos, pero todo pasa por él
Centralidad

No hay una sola respuesta porque no hay una sola forma de ser importante. Quitar a H desconecta a cinco nodos; quitar a P parte la red en dos.

Grado

El número de vecinos. En redes dirigidas se separa en entrada y salida.

grado de entrada = 4 quiénes lo siguen grado de salida = 2 a quiénes sigue A
Grado de entrada: cuánta atención recibe. Seguidores, menciones recibidas, citas.
Grado de salida: cuánta actividad emite. A quién sigue, a quién menciona.
Limitación

Es la medida más barata y la más fácil de inflar. Comprar seguidores sube el grado de entrada sin cambiar nada más de la estructura, así que mide popularidad y no influencia.

Intermediación

Fracción de caminos más cortos entre pares de nodos que pasan por el nodo.

intermediación de V = 4 A B C D V A-C, A-D, B-C y B-D pasan por V A-B y C-D van directo y no lo necesitan
Qué detecta

Puentes. Un nodo puede tener grado bajo e intermediación altísima si es el único vínculo entre dos comunidades. Encuentra a quien controla el flujo, no a quien tiene más público.

Costo

El algoritmo de Brandes la calcula en \(O(nm)\) para grafos no ponderados. En redes grandes se estima muestreando nodos fuente.

Cercanía

Inverso de la distancia media a todos los demás nodos.

Desde el nodo central 2 1 0 1 2 suma = 6 cercanía = 4/6 = 0.67 Desde un extremo 0 1 2 3 4 suma = 10 cercanía = 4/10 = 0.40
Interpretación

Qué tan rápido puede alcanzar el nodo al resto de la red. Cercanía alta significa buena posición para difundir.

Advertencia

Solo tiene sentido dentro de una componente conexa. Si el grafo está partido, la distancia a los nodos inalcanzables es infinita y hay que calcularla por componente.

PageRank

Funciona de forma recursiva. Un nodo es importante si está conectado a nodos importantes.

PageRank de Y > PageRank de X X recibe 4 enlaces de cuentas sin peso Y recibe 1 enlace de una cuenta central X Y
Lectura

Con amortiguación \(d \approx 0.85\). Es la medida que Google usó para ordenar páginas web y funciona igual sobre grafos sociales, donde distingue a quien recibe mil enlaces irrelevantes de quien recibe diez de cuentas centrales.

Variante

La centralidad de vector propio es la misma idea sin amortiguación. PageRank es preferible en redes dirigidas porque maneja los nodos sin salidas.

Cuál usar


Grado            popularidad inmediata, alcance directo
Intermediación   control del flujo, puentes entre grupos
Cercanía         velocidad de difusión desde ese nodo
PageRank         prestigio robusto en redes dirigidas
Criterio

Los rankings no coinciden entre sí, y esa discrepancia es informativa. Elegir la métrica antes de tener clara la pregunta produce un ranking que no significa nada.

Métricas de red

dispersa densa 5 de 15 aristas posibles, densidad 0.33 12 de 15 aristas posibles, densidad 0.80 en una red social real la densidad queda muy por debajo de 0.001
  • Densidad: proporción de aristas existentes sobre las posibles. En redes grandes es minúscula.
  • Coeficiente de agrupamiento: probabilidad de que dos vecinos de un nodo sean vecinos entre sí.
  • Longitud media de camino y diámetro: qué tan lejos están los nodos entre sí.
  • Componentes conexas: casi siempre hay una componente gigante y muchos fragmentos.
  • Reciprocidad, asortatividad y k-core: qué fracción de aristas se corresponde, quién se conecta con quién, y cuál es el núcleo activo.

La distribución de grados no es normal

Si fuera como la estatura cuántas cuentas el promedio el promedio describe a casi todas Como son los seguidores de verdad cuántas cuentas casi todas están aquí unas pocas enormes el promedio el promedio cae donde casi no hay cuentas el eje horizontal es cuántos seguidores tiene una cuenta
Mecanismo propuesto

De cada 1,000 cuentas de una red real, unas 600 tienen menos de diez seguidores y una sola puede tener millones. El mecanismo propuesto es el acoplamiento preferencial, en el que los nodos nuevos se conectan con preferencia a los que ya tienen muchas conexiones, y el resultado es una red libre de escala.

El promedio deja de servir

Consecuencia metodológica

Con una ley de potencias, la media está dominada por la cola. Decir que una cuenta tiene un número de seguidores igual al promedio no describe a nadie.

Qué reportar

Medianas, cuantiles y la forma de la cola. Los histogramas se leen en escala logarítmica en ambos ejes.

Homofilia

Regularidad

Los nodos similares tienden a conectarse. Es de los patrones más robustos en redes sociales.

Problema causal

Si dos amigos se parecen, puede ser porque se influyeron o porque se hicieron amigos por parecerse. Los datos observacionales rara vez distinguen ambas cosas, y esa ambigüedad es la crítica estándar a los estudios de contagio social.

Cierre triádico

A B C A y C comparten un vecino A B C es probable que aparezca la arista
De aquí sale el coeficiente de agrupamiento alto que se observa en redes reales.
Es también la lógica de las recomendaciones de amistad, que sugieren a quienes comparten muchos vecinos.

Lazos fuertes y lazos débiles

Granovetter argumentó que los conocidos, no los amigos cercanos, son los que traen información nueva.

Los lazos fuertes se mueven en el mismo círculo cerrado y comparten la misma información.
Los lazos débiles cruzan hacia otros círculos y son la vía por la que entra lo que no se sabía.
Conexión con la estructura

Un lazo débil es, en términos de grafo, una arista puente, de esas que al quitarlas alargan mucho la distancia entre dos regiones. Es la misma idea que mide la intermediación, vista desde la arista en lugar del nodo.

Detección de comunidades

muchas aristas dentro de cada grupo pocas aristas entre grupos
Comunidad

Conjunto de nodos con muchas conexiones entre sí y pocas hacia afuera. Detectarlas es agrupamiento, pero sobre estructura en lugar de sobre vectores de atributos. Así aparecen las cámaras de eco, las facciones, los equipos y los grupos de cuentas que operan juntas.

Modularidad

Compara las aristas dentro de los grupos contra las que habría en una red aleatoria con la misma distribución de grados.

partición que sigue la estructura partición que la ignora 1 arista cruza los grupos, Q alto 8 aristas cruzan los grupos, Q bajo es la misma red: solo cambia cómo se agrupan los nodos
Advertencias

Valores útiles van de 0.3 a 0.7, pero un valor alto no garantiza significado. La modularidad tiene un límite de resolución que le impide ver comunidades pequeñas dentro de redes grandes, y encuentra particiones decentes incluso en grafos aleatorios.

Algoritmos


Girvan-Newman      quita iterativamente las aristas de mayor intermediación
                   intuitivo y jerárquico, pero no escala

Louvain            optimiza modularidad de forma voraz y jerárquica
                   muy rápido, el más usado en la práctica

Leiden             corrige un defecto de Louvain: comunidades mal conectadas
                   recomendado cuando la partición se va a interpretar

Label propagation  cada nodo toma la etiqueta mayoritaria de sus vecinos
                   casi lineal, resultado inestable entre corridas
Validación

No hay verdad de referencia. La partición se juzga por su interpretabilidad y por su estabilidad entre corridas y entre algoritmos.

Difusión y contagio

Algo empieza en un nodo y avanza por las aristas. En cada paso alcanza a los vecinos de quienes ya lo tienen.

t = 0 1 alcanzado t = 1 3 alcanzados t = 2 7 alcanzados
Lo que se propaga

Información, comportamientos, enfermedades, rumores. El mecanismo es el mismo en todos los casos. Solo puede llegar a donde hay una arista, así que la forma de la red decide hasta dónde llega y qué tan rápido.

Contagio simple y contagio complejo

En los dos casos un solo vecino ya lo tiene, y el resultado es distinto.

Contagio simple Contagio complejo con un vecino basta: se activa con un vecino no alcanza: sigue apagado así se mueve la información así se adoptan los comportamientos
Por qué importa la distinción

Un rumor lo repites porque lo oíste una vez. Cambiar de banco, de partido o de herramienta necesita que varios conocidos lo hayan hecho primero. Lo segundo pide refuerzo, y por eso viaja peor por los atajos y mejor dentro de los grupos densos.

Los modelos que formalizan esto


Cascada independiente   el contagio simple
                        cada vecino que ya lo tiene lo intenta una sola vez,
                        y lo logra con probabilidad p

Umbral lineal           el contagio complejo
                        cada nodo tiene su propio umbral y se activa cuando
                        la fracción de vecinos activos lo supera

SIR                     prestado de la epidemiología
                        susceptible -> infectado -> recuperado
                        agrega algo que los otros dos no tienen: se puede dejar
                        de contagiar

Anatomía de una cascada

Profunda y estrecha profundidad 5 Amplia y superficial amplitud máxima 6
Las cuatro medidas

El tamaño es cuántos nodos alcanzó, la profundidad cuántos saltos hay desde el origen, la amplitud máxima el nivel más poblado y la velocidad el tiempo que tardó en llegar a cada nivel. Las dos cascadas del dibujo tienen ocho nodos y son estructuralmente opuestas.

Detección de coordinación

La estructura delata cosas que el contenido esconde.

Co-retuit: cuentas que replican el mismo contenido en ventanas muy cortas forman conglomerados anormalmente densos.
Sincronía temporal: publicar en el mismo minuto de forma sistemática no ocurre por azar.
Contenido idéntico entre cuentas sin relación aparente.
Ciclo de vida: creación masiva en la misma fecha o reactivación simultánea de cuentas dormidas.

De la actividad a la red de similitud

Quién replicó qué cuentas publicaciones Red de similitud entre cuentas el grupo coordinado queda denso y separado
La técnica

Construir una red donde la arista pesa cuánto coinciden dos cuentas (co-retuit, co-hashtag o co-timing), y aplicar detección de comunidades sobre ella. No hace falta leer los mensajes, basta con ver quién repite a quién y cuándo.

Obtención de datos

Es la etapa que más proyectos mata, y su dificultad cambió radicalmente en los últimos años.


API oficial         estable y legal, con límites de tasa y costo
Scraping            frágil, suele chocar con los términos de servicio
Datos donados       los usuarios exportan y ceden sus propios datos
Conjuntos públicos  SNAP, Netzschleuder, Kaggle, repositorios de papers
Acceso regulado     DSA art. 40 en la UE, para investigadores acreditados

El cierre del acceso

Febrero de 2023

X eliminó el acceso gratuito a su API, incluido el track académico que durante años permitió descargar el archivo histórico de tuits. Los reemplazos de pago dejaron a cientos de proyectos sin fuente de datos.

14 de agosto de 2024

Meta cerró CrowdTangle, la herramienta con la que investigadores y periodistas seguían la circulación de contenido en Facebook e Instagram, y la sustituyó por Meta Content Library, con acceso más restringido.

Consecuencia

Mucha de la literatura clásica se construyó sobre datos que hoy no se pueden recolectar. Los proyectos actuales se apoyan en plataformas abiertas como Mastodon, Bluesky, Reddit y Telegram, en datos donados y en conjuntos ya publicados.

Casi nunca se tiene la red completa

Lo que se consigue es un pedazo, y la forma de agarrarlo decide qué queda fuera.


Por hashtag o palabra   solo ve a quien usó el término
                        pierde a quien participa sin usarlo

Bola de nieve           parte de unas semillas y sigue a sus vecinos,
                        y a los vecinos de esos
                        nunca sale de la componente donde empezó

Ventana temporal        solo las interacciones de un período
                        una semana no revela estructura estable

El sesgo del muestreo

Bola de nieve desde una semilla, dos saltos. La misma red, medida entera y medida por la muestra.

La red completa Lo que ve la muestra densidad 0.18 densidad 0.33 10 nodos, 8 aristas 6 nodos, 5 aristas
Por qué pasa

Un nodo de grado alto es vecino de casi todo el mundo, así que casi seguro cae en la muestra. Uno de grado bajo solo cae si la semilla estaba justo al lado, y lo desconectado no cae nunca. La muestra sale más densa y mejor conectada de lo que es la red, y con ella la densidad y la longitud media de camino dejan de estimar nada.

Construcción del grafo

Decisiones previas a medir nada, y todas cambian el resultado.

Desduplicar entidades: la misma persona con varias cuentas se unifica o no, y se decide explícitamente.
Umbral de arista: ¿una sola interacción crea vínculo, o hacen falta tres?
Ventana temporal: qué período define la red, y si se analiza estática o como instantáneas.
Autoenlaces, multiaristas y filtrado por k-core para que el núcleo sea visible.

Scraping

Web scraping

Extraer datos de un sitio leyendo las páginas que el servidor entrega a un navegador, en lugar de pedirlos por una interfaz diseñada para programas.

Por qué aparece aquí

Después del cierre de las APIs, para muchas preguntas de redes sociales es la única vía que queda. También es la más frágil, la más lenta y la que más problemas legales trae, así que se usa sabiendo lo que se está aceptando.

El proceso de scraping

Cola de URLs 1 solicitud por segundo Solicitud HTTP Guardar el HTML crudo Parsear y extraer nuevas URLs encontradas Normalizar entidades Construir el grafo
Guardar el crudo primero

El HTML se archiva antes de extraer nada. Cuando el parser resulte incorrecto, se vuelve a extraer del archivo en vez de volver a golpear el sitio, y el trabajo queda reproducible.

Estático contra dinámico


Página estática    el HTML ya trae el contenido
                   requests + BeautifulSoup, o Scrapy
                   rápido y barato

Página dinámica    el HTML llega vacío y JavaScript lo llena después
                   navegador sin interfaz: Playwright o Selenium
                   lento, pesado, se rompe con cada rediseño

Endpoint interno   la propia página llama a una API no documentada
                   se copia esa llamada desde las herramientas del navegador
                   lo más eficiente cuando funciona, lo más inestable
Cómo saber cuál es

Pedir la página sin ejecutar JavaScript y buscar el dato en la respuesta. Si aparece, es estática. Casi todas las redes sociales modernas son dinámicas, que es la razón de que scrapearlas cueste tanto.

Legalidad y ética

El precedente más citado

En hiQ Labs contra LinkedIn, la corte del Noveno Circuito de Estados Unidos sostuvo que raspar datos de páginas públicamente accesibles no constituye acceso no autorizado bajo la ley federal de fraude informático.

Noveno Circuito, abril de 2022

Lo que ese fallo no dice

La misma empresa perdió después por incumplir el contrato de uso del sitio. No violar una ley penal no es lo mismo que tener permiso, y ninguna de esas dos cosas resuelve la protección de datos personales ni la jurisdicción aplicable en Guatemala.

El scraping después del cierre de las APIs

Las bibliotecas que raspaban X sin autenticación dejaron de funcionar en 2023 al cerrarse el acceso anónimo.
Lo que queda exige cuentas autenticadas, lo que expone esas cuentas a suspensión y añade un problema ético.
Las plataformas abiertas publican APIs utilizables, y ahí el scraping deja de ser necesario.
Los conjuntos ya recolectados y publicados son a menudo la opción más honesta y la más reproducible.
Criterio para un proyecto de curso

La pregunta se elige en función de los datos que se pueden obtener de forma sostenible, no al revés.

Métricas de desempeño

Son los números que da la propia plataforma en su panel. Miden cómo le fue a una publicación, no cómo está armada la red.


Alcance          cuentas únicas que vieron el contenido
Impresiones      veces que se mostró, con repeticiones
Engagement       reacciones, comentarios, compartidos, guardados
Tasa de eng.     interacciones / alcance (o / seguidores; hay que declarar cuál)
CTR              clics / impresiones
Share of voice   menciones de la marca sobre el total de la categoría
Conversión       acciones de negocio atribuibles al contenido

Dónde engañan estas métricas

Las definiciones cambian por plataforma y por año, así que comparar la tasa de engagement entre dos redes casi nunca es válido.
Alcance e impresiones no son lo mismo, y confundirlos infla los resultados.
Un pico de menciones no dice si son elogios o linchamiento; ahí entra el análisis de sentimiento.
Son métricas de vanidad si no se atan a un objetivo. Sirven contra el propio historial, no como cifras absolutas.
La combinación útil

Medir cómo le fue a la publicación con estas métricas y explicar por qué se difundió con las de red.

Herramientas del ecosistema

HerramientaPara qué sirve
NetworkXGrafos en Python; la opción didáctica y la más común
igraphNúcleo en C con interfaces en Python y R; mucho más rápido
graph-toolRendimiento alto y modelos estadísticos de bloques
GephiVisualización interactiva y exploración; formato GEXF
Neo4jBase de datos de grafos con consultas en Cypher
ScrapyMarco de scraping con cola, reintentos y límite de ritmo
PlaywrightNavegador sin interfaz para páginas dinámicas
BeautifulSoupParseo de HTML para páginas estáticas
PyTorch GeometricRedes neuronales sobre grafos

Regla práctica de escala


Hasta decenas de miles de nodos    NetworkX es suficiente
Millones de nodos                  igraph o graph-tool
Consultas interactivas sobre
grafos persistentes                base de datos de grafos

Las piezas juntas

Estructura quién se conecta con quién Contenido qué se está diciendo El caso completo ninguna lo explica sola
La lección de las dos lecciones

La minería de texto mide el mensaje; la analítica de redes mide su recorrido. Un mensaje tóxico que nadie replica no es un problema, y una cascada de cien mil retuits no se interpreta sin leer qué se está replicando.

Preguntas que piden las dos mitades

Detectar una operación coordinada necesita la estructura; saber qué están empujando necesita el texto.
Un pico de menciones lo da la plataforma; si son elogios o linchamiento lo dice el análisis de sentimiento.
Las cascadas de noticias falsas se midieron por su forma, pero la etiqueta de verdadero o falso vino de leer el contenido.
Una comunidad detectada por modularidad no significa nada hasta que se lee de qué habla.