Cómo funcionan los detectores de IA: perplejidad y burstiness
2026-06-06 | 10 min
Los detectores de inteligencia artificial son herramientas que analizan las propiedades matemáticas y estadísticas del texto para determinar si fue escrito por un humano o generado por un modelo de lenguaje como GPT-4o, Claude o Gemini. En Colombia, donde universidades como la UNal, los Andes y la Javeriana han adoptado estas herramientas, entender su funcionamiento interno es esencial para docentes, estudiantes e investigadores.
Este artículo explica los fundamentos técnicos detras de los detectores de IA, con un enfoque especial en cómo estos mecanismos interactuan con las particularidades del español colombiano. Si alguna vez te has preguntado por que un detector marca un texto como "probablemente IA" o que significan términos como perplejidad y burstiness, aqui encontraras las respuestas.
El principio fundamental: los modelos de IA son predecibles
Para entender cómo funcionan los detectores, primero hay que entender como escriben los modelos de IA. Un modelo de lenguaje como GPT-4o funciona prediciendo la siguiente palabra más probable en una secuencia. Cuando le pides que escriba sobre la economía colombiana, el modelo calcula probabilidades para cada posible siguiente palabra y, en general, elige entre las opciones más probables.
Este comportamiento genera texto que, aunque suena fluido y coherente, tiene una caracteristica estadística distintiva: es altamente predecible. Cada palabra tiende a ser la que un modelo estadístico esperaria en esa posición. Los humanos, en cambio, somos mucho más impredecibles. Elegimos palabras por razón estética, por asociaciones personales, por influencia de nuestro dialecto regional, o simplemente porque nos parecen más expresivas en ese momento.
Los detectores de IA explotan esta diferencia fundamental. Usan sus propios modelos estadísticos para medir que tan "sorprendente" o "predecible" es un texto, y a partir de esas mediciones, estiman la probabilidad de que haya sido generado automáticamente.
Perplejidad: midiendo lo "sorprendente" del texto
La perplejidad es la metrica más importante que usan los detectores de IA. En términos simples, mide que tan "sorprendente" es un texto para un modelo estadístico de lenguaje. Si cada palabra del texto es exactamente la que el modelo predijo como más probable, la perplejidad es baja. Si el texto contiene elecciones inesperadas, la perplejidad es alta.
Matematicamente, la perplejidad se calcula como la exponencial de la entropia promedio del texto. Pero no necesitas ser matematico para entender el concepto. Piensa en la perplejidad como una medida de "creatividad lexica": un texto con perplejidad baja es uno donde cada palabra es la opcion obvia; un texto con perplejidad alta contiene sorpresas linguisticas.
En la practica, el texto generado por IA tiene perplejidad consistentemente baja, generalmente entre 15 y 40 puntos en una escala estandarizada. El texto humano, en cambio, muestra perplejidad más alta y, sobre todo, más variable, tipicamente entre 40 y 120 puntos, con picos ocasionales mucho mayores.
Para el español colombiano, esta distincion es particularmente relevante. Los colombianos tendemos a mezclar registros linguisticos con facilidad: un ensayo académico puede incluir una expresion coloquial para ilustrar un punto, o un modismo regional que un modelo de IA jamas produciria. Estas desviaciones del lenguaje "esperado" elevan la perplejidad y hacen que el texto humano sea más distinguible.
Burstiness: la variación entre oraciones
La burstiness (o "rafagueo") mide que tan variable es la complejidad entre las diferentes oraciones de un texto. Es complementaria a la perplejidad: mientras la perplejidad mide la predictibilidad a nivel de palabra, la burstiness mide la consistencia a nivel de oracion.
Cuando un humano escribe, produce oraciones de longitudes y complejidades muy diferentes. Una oracion puede ser corta y directa ("Eso no funciona."), seguida de otra larga y elaborada con multiples clausulas subordinadas. Esta variación natural refleja nuestro proceso de pensamiento, que es inherentemente irregular.
Los modelos de IA, en contraste, tienden a producir oraciones de longitud y complejidad similar. GPT-4o, por ejemplo, tiene una marcada preferencia por oraciones de 15 a 25 palabras, con estructura sintatica regular. Claude 3.5 es ligeramente más variable, pero aun asi mucho más uniforme que un escritor humano tipico.
La burstiness se cuantifica midiendo la desviacion estandar de la perplejidad entre oraciones. Un texto de IA tipico tiene una burstiness de 0.1 a 0.3, mientras que un texto humano suele estar entre 0.5 y 1.2. Los detectores usan esta metrica en combinación con la perplejidad general para aumentar la confianza de su clasificación.
Senales adicionales que analizan los detectores
Ademas de perplejidad y burstiness, los detectores modernos examinan multiples senales adicionales:
Uniformidad estructural: Los modelos de IA tienden a organizar el texto de maneras previsibles. Si les pides un ensayo, producen una introduccion, tres o cuatro puntos de desarrollo, y una conclusion, casi siempre con la misma proporcion de texto en cada sección. Los humanos somos mucho más irregulares en la distribución del contenido.
Frases formulaicas: Cada modelo tiene expresiones que usa con frecuencia desproporcionada. GPT-4o, por ejemplo, tiende a usar frases como "es importante destacar que", "en este sentido", y "cabe senalar que" con mucha más frecuencia que un escritor humano tipico. Claude prefiere "vale la pena considerar" y "es fundamental entender que". Los detectores mantienen bases de datos de estas frases formulaicas y las usan como senales complementarias.
Variación lexica: Se mide la diversidad del vocabulario usado. Los modelos de IA tienden a repetir palabras clave con más frecuencia y a usar un vocabulario más uniforme que los humanos. Un escritor colombiano puede alternar entre "plata", "dinero", "lucas", "recursos" y "billete" en un mismo texto, mientras que un modelo de IA se mantendria más consistente.
Patrones de puntuacion: Los modelos de IA usan la puntuacion de maneras estadísticamente distinguibles. Tienden a usar menos puntos suspensivos, menos signos de exclamacion, y más comas en posiciones predecibles. En español, tambien tienden a usar los signos de apertura de interrogacion y exclamacion de forma más rigida que muchos escritores reales.
El proceso de detección paso a paso
Cuando subes un texto a un detector de IA, como nuestro detector gratuito, ocurre el siguiente proceso:
- Tokenizacion: El texto se divide en tokens (palabras o subpalabras). Para el español, esto incluye manejar acentos, enye y caracteres especiales correctamente.
- Calculo de perplejidad: El detector usa su propio modelo de lenguaje para calcular la probabilidad de cada token dada la secuencia anterior. Esto produce un valor de perplejidad por token y un promedio general.
- Calculo de burstiness: Se divide el texto en oraciones y se calcula la perplejidad de cada una. La variación entre estas perplejidades individuales da la burstiness.
- Detección de patrones: Se buscan frases formulaicas conocidas, patrones de puntuacion tipicos de IA, y otros indicadores estructurales.
- Clasificacion final: Todas las senales se combinan en un modelo de clasificación (generalmente una red neuronal o un ensemble de arboles de decision) que produce una probabilidad final de que el texto sea generado por IA.
Por que el español colombiano es un caso especial
Los detectores de IA enfrentan desafios particulares con el español colombiano por varias razones:
Mezcla de registros: Los colombianos mezclamos el registro formal e informal con naturalidad. Un estudiante de la Javeriana puede escribir un parrafo académico impecable y en el siguiente usar una expresion como "eso es una chimba" para enfatizar un punto. Esta mezcla eleva la perplejidad del texto y generalmente favorece la clasificación correcta como humano.
Regionalismos: El español colombiano varia enormemente entre regiones. Un estudiante de Barranquilla escribe diferente a uno de Pasto, y ambos escriben diferente a uno de Bogota. Los detectores que no han sido entrenados con suficiente diversidad regional pueden confundir estos patrones.
Español académico formal: Ironicamente, el español académico muy formal es el tipo de texto que más problemas causa. Cuando un estudiante escribe de manera extremadamente estructurada y formal, sin regionalismos ni coloquialismos, su texto se parece estadísticamente al que produciria una IA. Esto explica por que los falsos positivos son más comunes en textos académicos formales.
Limitaciones fundamentales de los detectores
Es crucial entender que ningun detector de IA es perfecto ni puede serlo. Estas son las limitaciones fundamentales de la tecnologia actual:
Son probabilisticos, no deterministas: Un detector no puede decir con certeza absoluta si un texto es de IA o humano. Solo puede asignar una probabilidad. Un resultado de "82% probabilidad de IA" no es una prueba, es una estimacion estadística que puede estar equivocada.
No detectan edicion humana sobre texto de IA: Si alguien genera un texto con ChatGPT y luego lo edita significativamente (cambia palabras, reorganiza parrafos, anade sus propias ideas), el texto resultante puede ser indetectable. Los detectores solo ven el producto final, no el proceso.
Son vulnerables a técnicas de evasion: Existen humanizadores de IA que modifican el texto generado para reducir sus senales estadísticas. Estas herramientas alteran la perplejidad y burstiness artificialmente, lo que puede enganar a los detectores.
El sesgo de entrenamiento: La mayoria de los detectores fueron entrenados predominantemente con textos en ingles. Aunque se han adaptado para español, su rendimiento puede ser inferior al que tienen en ingles, especialmente con variantes regionales como el español colombiano.
Consejos practicos para el contexto colombiano
Si eres docente en una universidad colombiana, estas recomendaciones pueden ayudarte a usar los detectores de IA de manera responsable:
- Nunca uses un solo detector: Verifica con al menos dos herramientas diferentes. Si ambas coinciden, la confianza aumenta. Si difieren, se requiere revision humana. Consulta nuestra comparativa de detectores para elegir.
- Considera el tipo de texto: Un ensayo argumentativo informal tendra perplejidad alta (parece humano). Un informe técnico formal tendra perplejidad baja (puede parecer IA aunque sea humano).
- Ten en cuenta el contexto del estudiante: Un estudiante cuya lengua materna no es español, o que viene de una region con patrones linguisticos particulares, puede generar resultados atipicos.
- Usa los detectores como punto de partida, no como veredicto final: Si un detector marca un texto, esto justifica una conversacion con el estudiante, no una sancion automatica.
Para una guia completa sobre como implementar estos principios en tu institucion, visita nuestra guia para detectar IA en trabajos académicos. Y si quieres probar cómo funciona la detección en la practica, usa nuestro detector gratuito con tus propios textos.
¿Quieres saber si tu texto parece escrito por IA?
Analiza tu texto ahora