← CC3084

Minería de Texto

Semestre 02, 2026

Definición

Minería de texto

Proceso de extraer información útil, patrones y conocimiento a partir de grandes colecciones de texto escrito en lenguaje natural.

El problema de partida

El texto no viene en filas y columnas.

Un correo, un contrato o un tweet no tienen columnas numéricas listas para un modelo.
La minería de texto convierte ese texto en datos que un algoritmo puede analizar.

Por qué importa

La mayor parte de la información de una organización es texto no estructurado.
Ese conocimiento es inalcanzable para los métodos tabulares clásicos.
Analizarlo a mano no escala: nadie lee un millón de reseñas.
Correos, contratos, tickets, notas clínicas y redes sociales.

La idea central

Todo el campo se apoya en una sola transformación.


Texto crudo  ->  Texto limpio  ->  Números  ->  Modelo  ->  Conocimiento
Consecuencia

Una vez que el texto es un vector de números, le aplicamos cualquier método que ya conocemos: clasificación, regresión, agrupamiento o reducción de dimensionalidad.

El texto como dato no estructurado

No estructurado: sin esquema, sin tipos de dato, sin columnas fijas.
Alta dimensionalidad: el vocabulario tiene decenas de miles de términos.
Disperso: cada documento usa una fracción mínima del vocabulario.
Ambiguo: la misma palabra cambia de significado según el contexto.

La ambigüedad del lenguaje


"Fui al banco a sacar dinero."        ->  institución financiera
"Me senté en el banco del parque."    ->  mueble
"Un banco de peces cruzó la bahía."   ->  grupo de animales
Reto

La misma cadena de letras significa tres cosas distintas. Solo el contexto lo resuelve, y eso es justo lo que un conteo de palabras no captura.

El orden también significa


"El perro mordió al hombre."
"El hombre mordió al perro."
Observación

Las dos frases tienen exactamente las mismas palabras y significan cosas opuestas. Cualquier método que solo cuente palabras las considera idénticas.

El texto como dato no estructurado

Depende del orden: las mismas palabras en otro orden dicen otra cosa.
Ruidoso: faltas de ortografía, abreviaturas, emojis, jerga, mezcla de idiomas.
Consecuencia práctica

No se puede alimentar texto directamente a un modelo. Siempre hay preprocesamiento y vectorización antes del aprendizaje, y ahí vive buena parte del esfuerzo del proyecto.

Minería de texto y minería de datos

AspectoMinería de datosMinería de texto
EntradaDatos estructurados (tablas)Texto libre en lenguaje natural
PreprocesamientoLimpieza, imputación, escaladoTokenización, normalización, vectorización
DimensionalidadDecenas o cientos de variablesDecenas de miles de términos
DensidadMatriz densaMatriz dispersa
AmbigüedadBaja: cada columna significa una cosaAlta: polisemia, sarcasmo, contexto
En una frase

La minería de texto es minería de datos precedida por una etapa que fabrica las variables a partir del texto.

Minería de texto y NLP

NLP

Campo que estudia cómo hacer que una máquina procese lenguaje humano: sintaxis, morfología, semántica, generación de texto.

Minería de texto

Aplicación orientada a descubrir conocimiento en colecciones grandes de documentos.

Relación

La minería de texto usa NLP como herramienta. NLP es más amplio y persigue también objetivos que no buscan patrones, como traducir, resumir o generar.

Minería de texto y recuperación de información

Recuperación de información: dada una consulta, ¿qué documentos son relevantes? Es lo que hace un buscador.
Minería de texto: dada una colección, ¿qué patrones o conocimiento nuevo contiene?
La diferencia clave

La recuperación encuentra lo que ya está escrito. La minería produce información que no estaba explícita en ningún documento individual.

La diferencia con un ejemplo


Colección: 50,000 reseñas de un hotel

Recuperación:  "reseñas que mencionen el desayuno"
               -> devuelve las 3,200 reseñas que lo mencionan

Minería:       "¿de qué se queja la gente?"
               -> descubre que las quejas por ruido subieron
                  40% desde que abrió el bar del cuarto piso
Clave

Ninguna reseña individual dice eso. Es conocimiento que solo aparece al analizar la colección completa.

Minería de texto y minería web

Contenido: lo que dicen las páginas.
Estructura: la red de enlaces entre páginas.
Uso: cómo navegan los usuarios.
La minería de texto cubre la primera rama, pero se aplica también fuera de la web.

Resumen de la distinción

DisciplinaPregunta que responde
Recuperación de información¿Qué documento responde a mi consulta?
NLP¿Cómo entiende la máquina esta oración?
Minería de texto¿Qué patrones esconde esta colección?
Minería de datos¿Qué patrones esconde esta tabla?

Aplicaciones

Filtrado de spam en el correo.
Análisis de opinión de clientes en reseñas y encuestas.
Clasificación y enrutamiento de tickets de soporte.
Detección de noticias falsas y contenido tóxico.
Análisis de expedientes clínicos: síntomas, diagnósticos, efectos adversos.
Revisión de contratos y documentos legales.

Aplicaciones

Preselección de candidatos a partir de currículums.
Vigilancia tecnológica y análisis de literatura científica.
Predicción de mercados a partir de noticias financieras.
Recomendación basada en descripciones de contenido.
Lo que tienen en común

Todas parten de texto y terminan en una decisión: una etiqueta, un número, un grupo o un ranking.

El proceso de minería de texto

El flujo es estable, sin importar la aplicación.

1Recolección
  • Scraping, APIs, bases de datos, archivos.
2Preprocesamiento
  • Limpiar y normalizar el texto.
3Representación
  • Convertir el texto en vectores numéricos.
4Reducción
  • Quedarse con lo informativo.

El proceso de minería de texto

5Modelado
  • Clasificación, regresión, agrupamiento o tópicos.
6Evaluación
  • Medir con métricas adecuadas a la tarea.
7Interpretación
  • Traducir el resultado en conocimiento accionable.
Regla práctica

Las etapas 1 a 3 consumen la mayor parte del tiempo. La elección del algoritmo suele importar menos que la calidad de la representación.

Preprocesamiento

Objetivo

Reducir el ruido y la variabilidad innecesaria del texto sin perder la señal. Es donde se decide qué información sobrevive hasta el modelo.

Cada técnica que sigue elimina una fuente distinta de variabilidad.

Las técnicas de preprocesamiento

Limpieza de ruido
Normalización
Tokenización
Detección de idioma y traducción
Eliminación de palabras vacías
Stemming y lematización
Además

N-gramas para recuperar algo del orden perdido, y corrección de errores de escritura.

Limpieza de ruido

Quitar todo lo que no es lenguaje: etiquetas, enlaces, menciones, símbolos.


Original:  @tiendaXY Mira esto!!! <b>OFERTA</b>
           https://tienda.co/x3f 😍😍 #descuento

Limpio:    Mira esto OFERTA descuento
Decisión de diseño

Qué se borra depende de la tarea. En análisis de sentimientos los emojis cargan opinión y conviene conservarlos o traducirlos a palabras.

Normalización

Unificar formas que significan lo mismo para que el modelo las cuente como un solo término.


Mayúsculas:   "PRODUCTO"  "Producto"  "producto"   ->  producto
Acentos:      "cafe"      "café"      "CAFÉ"       ->  cafe
Puntuación:   "bueno!!!"  "bueno..."  "bueno"      ->  bueno
Números:      "2024"      "1998"                   ->  <NUM>
Cuidado

Quitar acentos en español fusiona palabras distintas: papa y papá, esta y está, publico y público.

Tokenización

Definición

Partir el texto en unidades mínimas de análisis, llamadas tokens. Es la primera decisión estructural: define cuáles son las piezas con las que trabaja todo lo demás.


"El servicio no fue bueno."

Tokens:  [ El ] [ servicio ] [ no ] [ fue ] [ bueno ] [ . ]

Niveles de tokenización


Texto:     "No me gustó. El envío tardó mucho."

Oraciones: [ No me gustó. ]  [ El envío tardó mucho. ]

Palabras:  [ No ] [ me ] [ gustó ] [ El ] [ envío ] [ tardó ] [ mucho ]

Caracteres:[ N ] [ o ] [   ] [ m ] [ e ] ...
Cuál usar

Palabras es lo habitual. Oraciones sirve para análisis de sentimientos por oración. Caracteres se usa en lenguas sin espacios y en detección de errores de escritura.

Tokenizar no es cortar por espacios


"Nueva York"        dos palabras, un solo concepto
"del"               contracción de "de" + "el"
"[email protected]" un token, no cuatro
"3.14"              un número, no "3" y "14"
"rock and roll"     tres palabras, un solo nombre
"no-conformidad"    ¿uno o dos tokens?
Además

El chino y el japonés se escriben sin espacios entre palabras, así que ahí el corte requiere un modelo entrenado, no una regla.

Tokenización por subpalabras

Es lo que usan los modelos modernos: parten las palabras raras en fragmentos frecuentes.


"inconstitucionalmente"

->  [ in ] [ constitucional ] [ mente ]
Ventaja

Ninguna palabra queda fuera del vocabulario: incluso una que el modelo nunca vio se representa como suma de fragmentos conocidos.

Detección de idioma

Una colección real casi nunca viene en un solo idioma. Antes de procesar hay que saber en cuál está cada documento.


"El producto llegó roto."           ->  español
"The product arrived broken."       ->  inglés
"O produto chegou quebrado."        ->  portugués
"El delivery llegó bien pero meh"   ->  español con inglés
Por qué importa

Las listas de palabras vacías, los lematizadores y los léxicos de sentimiento son específicos de cada idioma. Aplicar los de español a un texto en inglés produce basura.

Traducción

Llevar todo a un idioma común permite analizar la colección completa con un solo conjunto de herramientas.


Colección multilingüe          Traducida al español

"The room was filthy"     ->   "El cuarto estaba asqueroso"
"O quarto estava sujo"    ->   "El cuarto estaba sucio"
"La chambre était sale"   ->   "El cuarto estaba sucio"

Ahora las tres quejas se agrupan como un mismo problema.

Traducir o no traducir

A favor

Un solo idioma significa un solo léxico, un solo modelo y resultados comparables entre países. Es lo práctico cuando el idioma dominante es uno.

En contra

La traducción introduce errores propios y aplana matices: la ironía, la jerga local y los juegos de palabras rara vez sobreviven.

Alternativa moderna

Usar un modelo multilingüe, que representa frases de distintos idiomas en un mismo espacio sin traducirlas.

Eliminación de palabras vacías

Palabras vacías (stopwords)

Términos muy frecuentes que aportan estructura gramatical pero casi ninguna información sobre el tema del documento.


Español:  el, la, los, de, que, y, a, en, un, por, con, para...
Inglés:   the, of, and, to, in, is, that, for, it, with...

Cómo se ve el filtrado


Original:   "el servicio de la tienda fue muy bueno y rápido"

Vacías:      el · de · la · fue · muy · y

Resultado:  "servicio tienda bueno rápido"
Reduce el vocabulario y el tamaño de la matriz.
Deja solo los términos que hablan del contenido.

El peligro de quitar palabras vacías


Original:   "la película no me gustó nada"
Filtrado:   "película gustó"          <- ¡el sentido se invirtió!

Original:   "el cuarto no estaba sucio"
Filtrado:   "cuarto sucio"            <- dice lo contrario
Regla

En análisis de sentimientos, las negaciones (no, sin, nunca, tampoco) deben salir de la lista de palabras vacías. Son justo lo que invierte la polaridad.

La lista se ajusta al dominio


Colección de reseñas de hoteles:
  "hotel" aparece en el 98% de los documentos
  -> no distingue nada, funciona como palabra vacía

Colección de expedientes clínicos:
  "paciente", "consulta", "doctor"
  -> mismo caso: son ruido de fondo del dominio
Idea

Además de la lista estándar del idioma, conviene agregar los términos que saturan la colección concreta.

Stemming

Definición

Recortar la palabra a una raíz aproximada aplicando reglas de corte de sufijos. Es rápido y burdo: la raíz no tiene por qué ser una palabra real.


corriendo · corredor · corremos · correrá   ->   corr
jugando   · jugador  · juegos               ->   jug
niñas     · niños    · niñito               ->   niñ

Los errores del stemming


Corta de más (overstemming):
  universidad · universo · universal  ->  univers
  Tres conceptos distintos quedan como uno solo.

Corta de menos (understemming):
  fui · iba · ir
  El verbo irregular no se reduce: quedan como tres términos.
Contexto

El español tiene mucha más flexión verbal que el inglés, así que el stemming es aquí más agresivo y más propenso a error.

Lematización

Definición

Llevar la palabra a su forma de diccionario, el lema, usando análisis morfológico y el contexto de la oración. Es más lento y más correcto.


corriendo · corrió · correrá   ->   correr
fui       · iba    · vamos     ->   ir
mejores   · mejor              ->   bueno
casas     · casita             ->   casa

Stemming frente a lematización


Palabra        Stemming     Lematización

corriendo      corr         correr
mejores        mejor        bueno
fuimos         fu           ir
estudios       estudi       estudio
CriterioStemmingLematización
MétodoReglas de corteDiccionario y contexto
ResultadoPuede no ser palabraSiempre palabra real
VelocidadMuy rápidaMás lenta
PrecisiónBajaAlta

N-gramas

Tratar secuencias de n palabras consecutivas como una unidad, para recuperar parte del orden que se pierde al contar palabras sueltas.


Frase:      "no me gustó el servicio"

Unigramas:  no | me | gustó | el | servicio

Bigramas:   no me | me gustó | gustó el | el servicio

Trigramas:  no me gustó | me gustó el | gustó el servicio

Para qué sirven los n-gramas


Con unigramas:
  "no me gustó"     ->  no · me · gustó   (gustó parece positivo)

Con bigramas:
  "no me gustó"     ->  no me · me gustó  (la negación sobrevive)

Expresiones que solo existen juntas:
  "Nueva York" · "no obstante" · "servicio al cliente"
Costo

Cada nivel multiplica el vocabulario. Pasar de unigramas a bigramas puede llevar de 20,000 a cientos de miles de términos.

Corrección y jerga

En redes sociales y chats, el mismo concepto aparece escrito de muchas formas.


Original:   "q buenoo stá el prodcto, 100% recomendadoo!!! xd"

Corregido:  "que bueno está el producto, recomendado"

Variantes del mismo término:
  "porfa" · "xfa" · "porfavor" · "por favor"   ->  por favor
  "buenisimoo" · "buenísimo" · "wenisimo"      ->  buenísimo
Efecto

Sin esta normalización, cada variante ocupa una dimensión distinta del vocabulario y el modelo nunca junta suficientes ejemplos de ninguna.

El proceso completo sobre una frase


Original       @tienda Los ZAPATOS que compré NO llegaron!!! 😡
               https://x.co/a

Limpieza       Los ZAPATOS que compré NO llegaron

Normalización  los zapatos que compre no llegaron

Tokenización   [los] [zapatos] [que] [compre] [no] [llegaron]

Vacías         [zapatos] [no] [llegaron]      (se conserva "no")

Lematización   [zapato] [no] [llegar]

Bigramas       [zapato no] [no llegar]

Advertencias del preprocesamiento

Quitar palabras vacías puede destruir la señal: no y sin invierten la polaridad de una opinión.
El stemming agresivo une palabras de significado distinto.
Cada técnica depende del idioma: no se puede reutilizar la de otro sin revisarla.
Las decisiones dependen de la tarea: no existe un preprocesamiento universal.

Cómo decidir cada paso

TareaPalabras vacíasReducciónN-gramas
Clasificar temasQuitarLematizarUnigramas
Análisis de sentimientosConservar negacionesLematizarBigramas
Modelado de tópicosQuitar de forma agresivaLematizarUnigramas
Detección de autoríaConservar todoNingunaN-gramas de caracteres
Criterio

La pregunta siempre es la misma: lo que estoy borrando, ¿es ruido para esta tarea, o es justo la señal que necesito?

Representación del texto

Objetivo

Convertir documentos en vectores numéricos. Hay tres enfoques principales: bolsa de palabras, TF-IDF y embeddings.

Bolsa de palabras

Cada documento se representa por la frecuencia de cada término del vocabulario.


Vocabulario: [ buena · mala · película · actuación ]

"buena película"    ->  [ 1, 0, 1, 0 ]
"mala actuación"    ->  [ 0, 1, 0, 1 ]
"buena actuación"   ->  [ 1, 0, 0, 1 ]
Limitación

Se pierde el orden por completo. Para este método, la película mordió al actor y el actor mordió a la película son el mismo documento.

TF-IDF

Los términos frecuentes en todos los documentos aportan poco. TF-IDF los penaliza.

$$\text{tf-idf}(t, d) = \text{tf}(t, d) \times \log\frac{N}{\text{df}(t)}$$

Lectura

\(\text{tf}(t,d)\) es la frecuencia del término en el documento, \(N\) el total de documentos y \(\text{df}(t)\) cuántos lo contienen. Un valor alto significa frecuente aquí y raro en el resto: característico de ese documento.

TF-IDF con un ejemplo


Colección: 1,000 reseñas de restaurantes

Término     Aparece en      Peso IDF    ¿Informativo?

comida       950 reseñas      muy bajo    no distingue nada
bueno        780 reseñas      bajo        casi nada
rancio        14 reseñas      muy alto    sí, mucho
cucaracha      3 reseñas      altísimo    sí, señal fuerte

En la reseña "la comida estaba rancia":
  comida -> peso bajo · rancia -> peso alto
Resultado

El vector del documento queda dominado por rancia, que es exactamente lo que lo hace distinto de las otras 999 reseñas.

Embeddings

Vectores densos de pocas dimensiones donde la cercanía geométrica refleja cercanía semántica.

Word2Vec, GloVe y FastText: un vector fijo por palabra, aprendido del contexto.
Contextuales (BERT): el vector cambia según la oración y resuelve la ambigüedad.
De oración o documento (Sentence-BERT): un vector por texto, útil para similitud.

Qué captura un embedding


Palabras más cercanas a "médico":
  doctor · enfermera · hospital · clínica · paciente

Palabras más cercanas a "rancio":
  podrido · echado a perder · vencido · descompuesto

Relaciones que el espacio aprende solo:
  rey - hombre + mujer  ~  reina
  París - Francia + Guatemala  ~  Guatemala (capital)
Diferencia con TF-IDF

Para TF-IDF, médico y doctor son dos términos sin relación alguna. Para un embedding están casi en el mismo punto del espacio.

Embeddings contextuales

El vector de una palabra cambia según la oración en la que aparece.


"Fui al banco a sacar dinero."
   banco  ->  cerca de: cajero · cuenta · sucursal

"Me senté en el banco del parque."
   banco  ->  cerca de: silla · plaza · jardín
Avance

Es la solución al problema de la ambigüedad que planteamos al inicio: la misma palabra recibe dos representaciones distintas.

Comparación de representaciones

RepresentaciónDimensiónOrdenSemánticaCosto
Bolsa de palabrasVocabularioNoNoBajo
TF-IDFVocabularioNoNoBajo
Word2Vec / GloVe100–300NoMedio
BERT768+Sí, contextualAlto

Clasificación de texto

Definición

Tarea supervisada que asigna una etiqueta discreta a un documento. Es la aplicación más común de la minería de texto.


"Gana dinero rápido, haz clic aquí"          ->  spam
"Reunión mañana a las 10 en el aula 302"     ->  no spam

Tipos de clasificación


Binaria      "Gana dinero rápido"        ->  spam / no spam

Multiclase   "Guatemala ganó 2 a 0"      ->  deportes
             "El quetzal se devaluó"     ->  economía

Multietiqueta
             "El ministro de salud
              renunció tras el escándalo"
                    ->  [ política, salud ]

Algoritmos habituales

Naive Bayes multinomial: rapidísimo y muy buena línea base para texto.
Regresión logística: sólida e interpretable por sus coeficientes por término.
SVM lineal: histórico ganador sobre TF-IDF en alta dimensionalidad.
Random Forest y boosting: funcionan, pero sufren con matrices dispersas.
Redes neuronales (CNN 1D, LSTM): capturan orden y patrones locales.
Transformers ajustados: el estado del arte cuando hay datos y cómputo.

Qué aprende el modelo

Un clasificador lineal aprende un peso por término. Los pesos son legibles y explican la decisión.


Clasificador de spam — términos con más peso

Hacia spam:      gratis · gana · clic · urgente · premio
Hacia no spam:   reunión · adjunto · informe · gracias
Ventaja

Poder mirar esa lista es lo que permite auditar el modelo y detectar que aprendió algo absurdo antes de ponerlo en producción.

Recomendación

Línea base primero

Empieza siempre con TF-IDF más regresión logística o Naive Bayes. Un transformer solo se justifica si supera claramente esa referencia.

Predicción a partir de texto

Alcance

Clasificar no es lo único que se puede predecir. La predicción abarca cualquier salida estimada a partir del texto: una etiqueta, un número, un evento futuro o la siguiente palabra.

Predicción de valores numéricos

El texto se vectoriza y se usa como entrada de un modelo de regresión.


"Llegó tarde y la caja venía abierta"          ->  2 estrellas

"Cumple, nada especial"                        ->  3 estrellas

"Excelente calidad, superó mis expectativas"   ->  5 estrellas
Predecir el tiempo de resolución de un ticket por su descripción.
Estimar el precio de un inmueble usando la descripción del anuncio.

Texto como variable adicional

Muy común en la práctica: variables tabulares y variables derivadas del texto en un mismo modelo.


[ edad, ingreso, región ]  +  [ términos del comentario ]

              ->  modelo  ->  predicción

Predicción de eventos futuros

Usar el texto disponible hoy para anticipar algo que ocurrirá después.


Ticket de hoy                          Predicción

"Es la tercera vez que escribo
 y nadie responde"            ->   alta probabilidad de
                                   cancelar el servicio
Movimientos de mercado a partir de noticias financieras.
Riesgo de deserción estudiantil en respuestas abiertas de encuestas.

Predicción de la siguiente palabra


"El clima hoy está muy ___"

  caluroso   40%
  frío       25%
  agradable  15%
  húmedo      8%
Modelado de lenguaje

Estimar la probabilidad de la siguiente palabra dado lo anterior es el objetivo de entrenamiento sobre el que se construyeron los modelos de lenguaje modernos.

Tareas no supervisadas asociadas

Agrupamiento de documentos similares.
Modelado de tópicos: descubrir temas latentes sin etiquetas.
Detección de anomalías en texto.

Modelado de tópicos

Sin decirle nada, el modelo agrupa los términos que suelen aparecer juntos. El nombre del tema lo pone la persona.


Colección: 20,000 noticias sin etiquetar

Tópico 1   gol · partido · equipo · jugador · torneo    ->  Deportes
Tópico 2   paciente · síntoma · dosis · hospital        ->  Salud
Tópico 3   acción · mercado · inversión · bolsa         ->  Finanzas
Tópico 4   voto · congreso · partido · elección         ->  Política
Ojo

Partido aparece en dos tópicos con sentidos distintos. La interpretación siempre requiere criterio humano.

Análisis de sentimientos

Definición

También llamado minería de opinión. Determina la actitud, opinión o emoción expresada en un texto.


"Me encantó, volvería sin dudarlo"     ->  positivo
"Llegó tarde y frío"                   ->  negativo
"El pedido llegó el martes"            ->  neutro

Qué se puede detectar

Polaridad: positivo, negativo o neutro.
Intensidad: qué tan fuerte es esa polaridad.
Emociones: alegría, enojo, tristeza, miedo, sorpresa.
Subjetividad: si el texto expresa una opinión o un hecho.
Intención: queja, elogio, solicitud o amenaza.

Polaridad e intensidad


"Está bien"                     ->  positivo débil
"Está bueno"                    ->  positivo
"Está buenísimo"                ->  positivo fuerte
"Es lo mejor que he probado"    ->  positivo muy fuerte
Por qué importa

Un cliente que dice está bien y otro que dice es lo mejor que he probado no valen lo mismo para el negocio, aunque ambos sean positivos.

Niveles de análisis

Documento

Una sola polaridad para todo el texto.

Oración

Una polaridad por cada oración del texto.

Aspecto

Una polaridad por cada aspecto mencionado. Es el nivel más útil y también el más difícil.

Análisis por aspecto


"La comida estaba deliciosa pero el servicio fue lentísimo
 y el lugar es carísimo."

Documento          ->  mixto
Aspecto comida     ->  positivo
Aspecto servicio   ->  negativo
Aspecto precio     ->  negativo
Por qué importa

Una etiqueta única para todo el texto pierde información accionable. Al negocio le sirve saber qué aspecto concreto falla.

Enfoque basado en léxicos

Un diccionario asigna polaridad a cada palabra y se combinan las puntuaciones del texto.


Léxico:   excelente +3   ·   bueno +1
          malo      -1   ·   pésimo -3

"El servicio fue excelente pero la comida mala"
        +3                                -1     ->  +2  positivo
No requiere datos etiquetados y es totalmente interpretable.
No entiende contexto ni negación, y depende del dominio.

Enfoque supervisado

Se entrena un clasificador con textos ya etiquetados por personas.


Datos de entrenamiento

"Me encantó el servicio"          ->  positivo
"Nunca más vuelvo a este lugar"   ->  negativo
"Cumplió con lo prometido"        ->  neutro
   ... 10,000 ejemplos más ...
Se adapta al dominio y al vocabulario propio del problema.
Necesita datos etiquetados, que son caros de producir.

Enfoque con transformers

Se ajusta un modelo de lenguaje preentrenado o se usa uno ya afinado en sentimientos.

Mejor desempeño: entiende contexto, negación y construcciones largas.
Costo computacional alto y menor interpretabilidad.
Para español existen modelos afinados sobre corpus de opinión en la región.

El reto de la negación


"El hotel está mal"            ->  negativo

"El hotel no está mal"         ->  positivo
                                   (la palabra "mal" sigue ahí)

"No puedo decir que no me
 haya gustado"                 ->  positivo, con doble negación
Consecuencia

Un léxico simple falla en los tres casos. Aquí se ve por qué no conviene borrar las negaciones al filtrar palabras vacías.

El reto de la ironía


"Excelente, otra vez se cayó el sistema"
        ^ palabra positiva, mensaje negativo

"Qué maravilla esperar dos horas por un café frío"

"Me fascina que cancelen el vuelo sin avisar"
Dificultad

La ironía depende de conocimiento del mundo: hay que saber que un sistema caído es malo. Ningún conteo de palabras lo resuelve.

El reto del dominio


"impredecible"    en un auto     ->  negativo
                  en una novela  ->  positivo

"pequeño"         en un cuarto   ->  negativo
                  en un celular  ->  positivo

"largo"           en una espera  ->  negativo
                  en una batería ->  positivo
Implicación

Un léxico o un modelo entrenado en otro dominio se traslada mal. El vocabulario de opinión cambia radicalmente entre industrias.

Otros retos


Comparación   "mejor que el anterior"
              no dice si el producto es bueno

Jerga local   "está de a huevo" · "qué chilero" · "me cae gordo"

Emojis        "Llegó el pedido 😡"  vs  "Llegó el pedido 😍"
              el texto es idéntico, la opinión es opuesta

Recomendación práctica

Del léxico al modelo

Un léxico sirve para explorar rápido. Para producción, entrena o ajusta un modelo con datos del dominio real: el vocabulario de opinión cambia radicalmente entre industrias.

Evaluación de la clasificación

MétricaQué mide
ExactitudProporción de aciertos. Engañosa con clases desbalanceadas
PrecisiónDe lo que predije positivo, cuánto lo era
RecallDe lo positivo real, cuánto encontré
F1Media armónica de precisión y recall
Macro-F1Promedio de F1 por clase; trata igual a las clases raras

El problema del desbalance


10,000 correos:  9,700 legítimos  ·  300 spam

Modelo tramposo: "todo es legítimo"
  Exactitud:  97%     parece excelente
  Recall spam: 0%     no detectó un solo spam
En texto es la norma

El spam es minoritario, las quejas graves son minoritarias, las noticias falsas son minoritarias. Reportar solo exactitud oculta que el modelo falla justo en lo que importa. Usa F1, macro-F1 y la matriz de confusión.

Validación correcta

Partición estratificada para conservar la proporción de clases.
Validación cruzada cuando hay pocos datos.
Si el texto tiene componente temporal, la partición debe respetar el tiempo.
El vocabulario se aprende solo con el entrenamiento, nunca con la prueba.

Fuga de información


Incorrecto   construir el vocabulario con TODOS los documentos
             y después partir en entrenamiento y prueba

             -> el modelo ya vio términos de la prueba
             -> la métrica sale mejor de lo que será en producción

Correcto     partir primero, construir el vocabulario solo
             con el entrenamiento

Herramientas del ecosistema

HerramientaPara qué sirve
NLTKEnseñanza, tokenización, corpus y léxicos
spaCyNLP de producción: lematización, POS, entidades
scikit-learnVectorización, clasificación y agrupamiento
GensimWord2Vec, LDA y similitud entre documentos
TransformersModelos preentrenados y ajuste fino
pysentimientoSentimientos y emociones en español

Consideraciones éticas

El texto lo producen personas, y eso trae responsabilidades.

Privacidad: los textos contienen datos personales; anonimizar antes de analizar.
Sesgo: el modelo aprende los sesgos de los datos y los reproduce a escala.
Consentimiento: que un texto sea público no autoriza su análisis.
Transparencia: en decisiones que afectan personas debe poder explicarse el criterio.
Uso indebido: vigilancia, manipulación de opinión, perfilado no consentido.

Resumen

  • La minería de texto extrae patrones de texto no estructurado convirtiéndolo primero en datos numéricos.
  • El texto es difícil por su alta dimensionalidad, dispersión, ambigüedad y dependencia del orden.
  • Se distingue de la minería de datos por la entrada, de NLP por el objetivo y de la recuperación de información por lo que produce.
  • El preprocesamiento decide qué información llega al modelo: limpieza, normalización, tokenización, idioma, palabras vacías y reducción de formas.

Resumen

  • Tokenizar es cortar el texto en unidades; no basta con separar por espacios.
  • Quitar palabras vacías reduce el vocabulario, pero borrar las negaciones invierte el sentido.
  • El stemming corta por reglas y la lematización usa diccionario y contexto.
  • Las representaciones van de bolsa de palabras y TF-IDF hasta embeddings contextuales.

Resumen

  • La clasificación asigna etiquetas; la predicción abarca además valores numéricos, eventos futuros y la siguiente palabra.
  • El análisis de sentimientos usa léxicos, aprendizaje supervisado o transformers.
  • Sus mayores retos son la negación, la ironía y la dependencia del dominio.
  • Evalúa con F1 y macro-F1 ante clases desbalanceadas, y evita la fuga de información al construir el vocabulario.