PerplejidadPerplexity
El número de opciones entre las que duda el modelo
- La perplejidad convierte en un solo número entre cuántas opciones duda el modelo al elegir la siguiente palabra.
- Un valor de 2 significa que duda, en promedio, entre unas dos opciones; un 50, entre unas cincuenta. Cuanto más bajo, mejor acierta.
- Se mide de forma sencilla: se le da un texto y se promedia, de principio a fin, qué tan bien acierta la siguiente palabra.
- Si cambia el criterio para cortar en trozos o el texto usado para evaluar, los valores ya no se pueden comparar directamente.
- Que sea bajo no significa que dé buenas respuestas. No mide si algo es cierto ni si sirve de algo.
Contenido
1La analogía
Por la noche, con el control remoto en la mano, ¿cuántos canales se te vienen a la cabeza? En una casa que ve siempre el mismo programa a la misma hora, basta con marcar un número y ya. En una noche sin decidir qué ver, se pasa un buen rato yendo y viniendo entre cinco o seis canales, comprobando cada pantalla. El número de canales por los que se pasó ese día es el tamaño de esa indecisión.
La IA tiene esa misma indecisión al decidir la siguiente palabra. Después de "la capital de Corea del Sur es", el canal es, en la práctica, uno solo. Después de "los fines de semana suelo", hay decenas de canales que valdría la pena encender, y ninguno resulta raro. Promediar esta indecisión a lo largo de todo el texto y convertirla en un solo número es la perplejidad.
Un valor de 8 significa que, en promedio, se duda entre unos ocho canales. Cuanto más bajo salga el valor medido sobre el mismo texto, menos vueltas de mando da ese modelo.
2En detalle
Una escala que convierte la duda en cantidad
Mirar solo la probabilidad no da mucha intuición. Decir que la probabilidad de acertar la siguiente palabra es 0,2 dice menos que decir que se duda entre cinco opciones. La perplejidad es esa escala: convierte la duda en un número que se lee como cantidad de opciones.
El mejor valor posible es 1: significaría que la siguiente palabra está siempre fija, sin excepción. En un texto real esto no ocurre nunca, porque incluso lo que escribe una persona sigue teniendo, a cada rato, lugares que podrían continuar de varias formas.
Que el valor suba significa que hay más canales que valdría la pena encender. Con un texto de un tema desconocido o un formato nunca visto, el valor sube de golpe.
Se mide con una prueba de adivinar
Se le da al modelo un texto entero y se le hace leerlo trozo a trozo, desde el principio. Justo antes de leer cada trozo se le pregunta "¿qué crees que viene después?", y se comprueba cuánta probabilidad le había puesto al trozo que realmente vino.
Donde acierta bien, la sorpresa es pequeña; donde se equivoca de plano, la sorpresa es grande. Promediar esta sorpresa a lo largo de todo el texto y convertirla para que se lea como cantidad de opciones da la perplejidad.
Que no haga falta que una persona lo corrija es la gran ventaja de este método. Con solo tener el texto, se calcula solo, así que se puede vigilar de forma continua incluso durante el entrenamiento.
Para comparar, las condiciones deben coincidir
Más que el valor en sí, lo que hay que cuidar es la comparación. No se pueden comparar valores medidos con textos distintos. Un valor medido con noticias y otro medido con una novela antigua parten, de entrada, de una dificultad distinta.
Cuando el criterio para cortar el texto en trozos también es distinto, la comparación se tuerce. Con la misma frase, un modelo que corta en trozos pequeños y otro que corta en trozos grandes terminan con un número distinto de aciertos que contar. Y, entre modelos distintos, ese criterio también suele ser diferente.
Por eso la perplejidad encaja más como forma de vigilar si un mismo modelo va mejorando, que como forma de ordenar el ranking entre modelos distintos. Si el valor baja de forma constante mientras avanza el entrenamiento, es señal de que va aprendiendo bien.
Lo que esta escala no ve
Que el valor sea bajo significa que acierta bien la siguiente palabra, no que dé buenas respuestas. Si algo es cierto, si respondió de verdad a la pregunta, si le sirve de algo a quien lee: nada de eso queda en este número.
La capacidad de seguir instrucciones tampoco entra aquí. Al ajustar el modelo para que responda según lo que pide la persona, la perplejidad a veces incluso sube, aunque para quien lo usa el modelo se haya vuelto mucho más útil.
Por eso hoy ya no se usa este valor como calificación única. Se coloca junto a la evaluación humana, la tasa de acierto por tarea y la comparación directa entre modelos.
Dónde resulta útil
El uso más común es vigilar el entrenamiento. Si el valor baja y después se detiene, se lee como señal de que ya no queda mucho que aprender o de que algo se atascó. Si el valor sube de golpe, conviene revisar si algo falló en los datos.
También se usa al ajustar un modelo para un campo concreto. Ver cuánto bajó, antes y después del ajuste, el valor medido con textos médicos o legales da una idea de cuánto se adaptó a ese tono.
Sirve también para medir qué tan desconocido le resulta un texto al modelo. Un documento con un valor inusualmente alto probablemente sea de un tipo que no vio durante el entrenamiento.
3Con más precisión
La perplejidad promedia, entre el número de trozos, la probabilidad que el modelo le puso al texto de evaluación, y después invierte ese valor para que se lea como cantidad de opciones. Si acierta todos los trozos a la perfección, da 1; cuanto menos acierte, más crece. Nace de la misma raíz que el valor de error que se intenta reducir durante el entrenamiento, así que se mueve en paralelo con la curva de aprendizaje.
La analogía también tiene sus costuras. El número de canales es un entero, pero la perplejidad sale como un decimal, algo así como 12,4, y no significa que de verdad se hayan reducido los candidatos a doce: traduce a cantidad de canales qué tan pareja está repartida la probabilidad, así que puede haber decenas de miles de candidatos y aun así salir un valor bajo si la fuerza se concentra en uno o dos. Además, un canal se ve a simple vista, pero este valor se mueve según cuál sea el texto usado para evaluar, así que un solo número, aislado, no dice si es bueno o malo. Cuando el texto de evaluación se coló dentro del entrenamiento, el valor también cae en picada sin que el modelo acierte mejor de verdad, así que conviene comprobar que entrenamiento y evaluación no se solapen.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que una perplejidad baja significa una buena IA, pero en realidad solo significa que acierta bien la siguiente palabra, algo aparte de si la respuesta es cierta o útil.
Es fácil pensar que se puede comparar el valor tal cual entre modelos distintos, pero en realidad la comparación solo vale si coinciden el texto de evaluación y el criterio para cortar en trozos.
Es fácil confundirla con el nombre de un buscador de IA conocido, pero en realidad es el nombre de una escala para medir modelos de lenguaje, y fue ese servicio el que tomó prestado el nombre de aquí.
7Resumen en una línea
En resumenLa perplejidad es la escala que convierte en número cuántos canales recorre el mando a distancia al elegir la siguiente palabra, y cuanto más baja, menos duda el modelo.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02