Semestre 02, 2026
Conjunto de técnicas que estudian las relaciones entre actores sociales representándolas como un grafo, para medir su estructura y explicar el comportamiento que esa estructura produce.
No es el individuo ni el documento, sino el vínculo. Un conjunto de personas descrito una por una es una tabla; ese mismo conjunto descrito por quién habla con quién es una red.
Análisis de redes sociales (SNA) estructura relacional modelada como grafo
nodos, aristas, centralidad, comunidades
origen: sociología, años 30
Analítica de social media desempeño de contenido en plataformas
alcance, impresiones, engagement, CTR
origen: marketing digital, años 2000
La primera pregunta cómo está organizado un colectivo; la segunda, cómo se comportó una publicación. Esta lección trata principalmente la primera y cierra con la segunda.
Minería de texto "este mensaje es negativo" -> propiedad del contenido
Analítica de redes "este mensaje llegó a 40,000
cuentas en 3 saltos" -> propiedad de la estructura
Un texto tóxico importa poco si nadie lo replica, y una cascada masiva no se interpreta sin leer qué se está replicando. Lo visto sobre contenido se asume conocido y no se repite aquí.
Que A siga a B no implica que B siga a A. Colapsar eso a una amistad simétrica inventa reciprocidad que no está en los datos.
No dirigido la relación es simétrica amistad en Facebook, coautoría
Dirigido la relación tiene sentido seguir, citar, retuitear
Ponderado la arista lleva un número cantidad de mensajes, duración
Bipartito dos tipos de nodo usuarios y grupos, autores y papers
Temporal la arista existe en un instante quién llamó a quién y cuándo
Multicapa varias relaciones a la vez misma gente en WhatsApp y en X
El nodo es el actor, sea una persona, una cuenta, una organización o un hashtag. La arista es la relación. Modelar es decidir esas dos cosas, y la decisión determina todo lo que se puede medir después.
Con los mismos datos se construyen redes distintas, y cada una responde otra pregunta.
Red de seguimiento A sigue a B audiencia potencial, estructura estable
Red de retuits A retuitea a B difusión efectiva, qué se propagó
Red de menciones A menciona a B conversación, confrontación incluida
Red de respuestas A responde a B diálogo real, hilos
Red de co-hashtag A y B usan #x temas compartidos sin contacto directo
Red de co-audiencia comparten cercanía ideológica o temática
seguidores
Una cuenta con muchos seguidores puede tener una red de retuits casi vacía. Ese contraste entre la red estable y la red de interacción ya es un resultado.
La matriz cuesta O(n²) y responde en O(1) si hay arista; la lista cuesta O(n + m) y recorrer vecinos es directo. Un usuario de una red con cientos de millones de cuentas conoce a unos cientos, así que una matriz densa para un millón de nodos pediría del orden de \(10^{12}\) celdas casi todas en cero. Por eso se trabaja con listas de adyacencia o matrices dispersas.
No hay una sola respuesta porque no hay una sola forma de ser importante. Quitar a H desconecta a cinco nodos; quitar a P parte la red en dos.
El número de vecinos. En redes dirigidas se separa en entrada y salida.
Es la medida más barata y la más fácil de inflar. Comprar seguidores sube el grado de entrada sin cambiar nada más de la estructura, así que mide popularidad y no influencia.
Fracción de caminos más cortos entre pares de nodos que pasan por el nodo.
Puentes. Un nodo puede tener grado bajo e intermediación altísima si es el único vínculo entre dos comunidades. Encuentra a quien controla el flujo, no a quien tiene más público.
El algoritmo de Brandes la calcula en \(O(nm)\) para grafos no ponderados. En redes grandes se estima muestreando nodos fuente.
Inverso de la distancia media a todos los demás nodos.
Qué tan rápido puede alcanzar el nodo al resto de la red. Cercanía alta significa buena posición para difundir.
Solo tiene sentido dentro de una componente conexa. Si el grafo está partido, la distancia a los nodos inalcanzables es infinita y hay que calcularla por componente.
Funciona de forma recursiva. Un nodo es importante si está conectado a nodos importantes.
Con amortiguación \(d \approx 0.85\). Es la medida que Google usó para ordenar páginas web y funciona igual sobre grafos sociales, donde distingue a quien recibe mil enlaces irrelevantes de quien recibe diez de cuentas centrales.
La centralidad de vector propio es la misma idea sin amortiguación. PageRank es preferible en redes dirigidas porque maneja los nodos sin salidas.
Grado popularidad inmediata, alcance directo
Intermediación control del flujo, puentes entre grupos
Cercanía velocidad de difusión desde ese nodo
PageRank prestigio robusto en redes dirigidas
Los rankings no coinciden entre sí, y esa discrepancia es informativa. Elegir la métrica antes de tener clara la pregunta produce un ranking que no significa nada.
De cada 1,000 cuentas de una red real, unas 600 tienen menos de diez seguidores y una sola puede tener millones. El mecanismo propuesto es el acoplamiento preferencial, en el que los nodos nuevos se conectan con preferencia a los que ya tienen muchas conexiones, y el resultado es una red libre de escala.
Con una ley de potencias, la media está dominada por la cola. Decir que una cuenta tiene un número de seguidores igual al promedio no describe a nadie.
Medianas, cuantiles y la forma de la cola. Los histogramas se leen en escala logarítmica en ambos ejes.
Los nodos similares tienden a conectarse. Es de los patrones más robustos en redes sociales.
Si dos amigos se parecen, puede ser porque se influyeron o porque se hicieron amigos por parecerse. Los datos observacionales rara vez distinguen ambas cosas, y esa ambigüedad es la crítica estándar a los estudios de contagio social.
Granovetter argumentó que los conocidos, no los amigos cercanos, son los que traen información nueva.
Un lazo débil es, en términos de grafo, una arista puente, de esas que al quitarlas alargan mucho la distancia entre dos regiones. Es la misma idea que mide la intermediación, vista desde la arista en lugar del nodo.
Conjunto de nodos con muchas conexiones entre sí y pocas hacia afuera. Detectarlas es agrupamiento, pero sobre estructura en lugar de sobre vectores de atributos. Así aparecen las cámaras de eco, las facciones, los equipos y los grupos de cuentas que operan juntas.
Compara las aristas dentro de los grupos contra las que habría en una red aleatoria con la misma distribución de grados.
Valores útiles van de 0.3 a 0.7, pero un valor alto no garantiza significado. La modularidad tiene un límite de resolución que le impide ver comunidades pequeñas dentro de redes grandes, y encuentra particiones decentes incluso en grafos aleatorios.
Girvan-Newman quita iterativamente las aristas de mayor intermediación
intuitivo y jerárquico, pero no escala
Louvain optimiza modularidad de forma voraz y jerárquica
muy rápido, el más usado en la práctica
Leiden corrige un defecto de Louvain: comunidades mal conectadas
recomendado cuando la partición se va a interpretar
Label propagation cada nodo toma la etiqueta mayoritaria de sus vecinos
casi lineal, resultado inestable entre corridas
No hay verdad de referencia. La partición se juzga por su interpretabilidad y por su estabilidad entre corridas y entre algoritmos.
Algo empieza en un nodo y avanza por las aristas. En cada paso alcanza a los vecinos de quienes ya lo tienen.
Información, comportamientos, enfermedades, rumores. El mecanismo es el mismo en todos los casos. Solo puede llegar a donde hay una arista, así que la forma de la red decide hasta dónde llega y qué tan rápido.
En los dos casos un solo vecino ya lo tiene, y el resultado es distinto.
Un rumor lo repites porque lo oíste una vez. Cambiar de banco, de partido o de herramienta necesita que varios conocidos lo hayan hecho primero. Lo segundo pide refuerzo, y por eso viaja peor por los atajos y mejor dentro de los grupos densos.
Cascada independiente el contagio simple
cada vecino que ya lo tiene lo intenta una sola vez,
y lo logra con probabilidad p
Umbral lineal el contagio complejo
cada nodo tiene su propio umbral y se activa cuando
la fracción de vecinos activos lo supera
SIR prestado de la epidemiología
susceptible -> infectado -> recuperado
agrega algo que los otros dos no tienen: se puede dejar
de contagiar
El tamaño es cuántos nodos alcanzó, la profundidad cuántos saltos hay desde el origen, la amplitud máxima el nivel más poblado y la velocidad el tiempo que tardó en llegar a cada nivel. Las dos cascadas del dibujo tienen ocho nodos y son estructuralmente opuestas.
La estructura delata cosas que el contenido esconde.
Construir una red donde la arista pesa cuánto coinciden dos cuentas (co-retuit, co-hashtag o co-timing), y aplicar detección de comunidades sobre ella. No hace falta leer los mensajes, basta con ver quién repite a quién y cuándo.
Es la etapa que más proyectos mata, y su dificultad cambió radicalmente en los últimos años.
API oficial estable y legal, con límites de tasa y costo
Scraping frágil, suele chocar con los términos de servicio
Datos donados los usuarios exportan y ceden sus propios datos
Conjuntos públicos SNAP, Netzschleuder, Kaggle, repositorios de papers
Acceso regulado DSA art. 40 en la UE, para investigadores acreditados
X eliminó el acceso gratuito a su API, incluido el track académico que durante años permitió descargar el archivo histórico de tuits. Los reemplazos de pago dejaron a cientos de proyectos sin fuente de datos.
Meta cerró CrowdTangle, la herramienta con la que investigadores y periodistas seguían la circulación de contenido en Facebook e Instagram, y la sustituyó por Meta Content Library, con acceso más restringido.
Mucha de la literatura clásica se construyó sobre datos que hoy no se pueden recolectar. Los proyectos actuales se apoyan en plataformas abiertas como Mastodon, Bluesky, Reddit y Telegram, en datos donados y en conjuntos ya publicados.
Lo que se consigue es un pedazo, y la forma de agarrarlo decide qué queda fuera.
Por hashtag o palabra solo ve a quien usó el término
pierde a quien participa sin usarlo
Bola de nieve parte de unas semillas y sigue a sus vecinos,
y a los vecinos de esos
nunca sale de la componente donde empezó
Ventana temporal solo las interacciones de un período
una semana no revela estructura estable
Bola de nieve desde una semilla, dos saltos. La misma red, medida entera y medida por la muestra.
Un nodo de grado alto es vecino de casi todo el mundo, así que casi seguro cae en la muestra. Uno de grado bajo solo cae si la semilla estaba justo al lado, y lo desconectado no cae nunca. La muestra sale más densa y mejor conectada de lo que es la red, y con ella la densidad y la longitud media de camino dejan de estimar nada.
Decisiones previas a medir nada, y todas cambian el resultado.
Extraer datos de un sitio leyendo las páginas que el servidor entrega a un navegador, en lugar de pedirlos por una interfaz diseñada para programas.
Después del cierre de las APIs, para muchas preguntas de redes sociales es la única vía que queda. También es la más frágil, la más lenta y la que más problemas legales trae, así que se usa sabiendo lo que se está aceptando.
El HTML se archiva antes de extraer nada. Cuando el parser resulte incorrecto, se vuelve a extraer del archivo en vez de volver a golpear el sitio, y el trabajo queda reproducible.
Página estática el HTML ya trae el contenido
requests + BeautifulSoup, o Scrapy
rápido y barato
Página dinámica el HTML llega vacío y JavaScript lo llena después
navegador sin interfaz: Playwright o Selenium
lento, pesado, se rompe con cada rediseño
Endpoint interno la propia página llama a una API no documentada
se copia esa llamada desde las herramientas del navegador
lo más eficiente cuando funciona, lo más inestable
Pedir la página sin ejecutar JavaScript y buscar el dato en la respuesta. Si aparece, es estática. Casi todas las redes sociales modernas son dinámicas, que es la razón de que scrapearlas cueste tanto.
En hiQ Labs contra LinkedIn, la corte del Noveno Circuito de Estados Unidos sostuvo que raspar datos de páginas públicamente accesibles no constituye acceso no autorizado bajo la ley federal de fraude informático.
La misma empresa perdió después por incumplir el contrato de uso del sitio. No violar una ley penal no es lo mismo que tener permiso, y ninguna de esas dos cosas resuelve la protección de datos personales ni la jurisdicción aplicable en Guatemala.
La pregunta se elige en función de los datos que se pueden obtener de forma sostenible, no al revés.
Son los números que da la propia plataforma en su panel. Miden cómo le fue a una publicación, no cómo está armada la red.
Alcance cuentas únicas que vieron el contenido
Impresiones veces que se mostró, con repeticiones
Engagement reacciones, comentarios, compartidos, guardados
Tasa de eng. interacciones / alcance (o / seguidores; hay que declarar cuál)
CTR clics / impresiones
Share of voice menciones de la marca sobre el total de la categoría
Conversión acciones de negocio atribuibles al contenido
Medir cómo le fue a la publicación con estas métricas y explicar por qué se difundió con las de red.
| Herramienta | Para qué sirve |
|---|---|
| NetworkX | Grafos en Python; la opción didáctica y la más común |
| igraph | Núcleo en C con interfaces en Python y R; mucho más rápido |
| graph-tool | Rendimiento alto y modelos estadísticos de bloques |
| Gephi | Visualización interactiva y exploración; formato GEXF |
| Neo4j | Base de datos de grafos con consultas en Cypher |
| Scrapy | Marco de scraping con cola, reintentos y límite de ritmo |
| Playwright | Navegador sin interfaz para páginas dinámicas |
| BeautifulSoup | Parseo de HTML para páginas estáticas |
| PyTorch Geometric | Redes neuronales sobre grafos |
Hasta decenas de miles de nodos NetworkX es suficiente
Millones de nodos igraph o graph-tool
Consultas interactivas sobre
grafos persistentes base de datos de grafos
La minería de texto mide el mensaje; la analítica de redes mide su recorrido. Un mensaje tóxico que nadie replica no es un problema, y una cascada de cien mil retuits no se interpreta sin leer qué se está replicando.