Puntuación de confianzaConfidence Score
El número de seguridad que el modelo se pone a su propia respuesta
- La puntuación de confianza es el número que el modelo se pone a sí mismo junto a su respuesta. Siempre viene pegada a la respuesta.
- Ese número no es una probabilidad medida contando aciertos. Es un valor de cálculo interno que se comprime para que quede entre 0 y 1.
- La puntuación es algo que los candidatos se reparten entre sí. Si solo hay tres opciones posibles, una de las tres se lleva siempre una puntuación alta.
- Aunque el modelo vea algo que nunca aprendió, igual sale una puntuación. No existe la respuesta "no lo sé".
- Su verdadero significado solo se revela cuando se cuenta cuántas veces acertó de verdad entre todo lo que marcó con un número como 80.
Contenido
1La analogía
Junto al semáforo de un cruce peatonal aparece un número que marca el tiempo que queda. Si el número es grande, se cruza tranquilo; si es pequeño, se corre. Ese único número decide si cruzar o no.
Pero ese número no sale de medir si esa persona en concreto alcanza a cruzar. El semáforo solo muestra el horario que tenía programado de antemano. En un día con muchas bolsas o con el paso lento, aunque el número se vea generoso, puede que no dé tiempo a cruzar.
La puntuación que una IA entrega junto a su respuesta ocupa ese mismo lugar. Que diga "gato 80%" es un valor que salió de un cálculo, no el resultado de contar que, de cien fotos como esa, ochenta fueran realmente un gato. Cuánto se puede confiar en ese número hay que comprobarlo aparte.
2En detalle
De dónde sale la puntuación
En el último paso de un modelo que clasifica, sale un valor por cada candidato. Estos valores no tienen un límite fijo, así que tal cual son difíciles de leer. Por eso se convierten todos en positivos y se dividen entre sí, ajustando las cosas para que la suma dé 1. El porcentaje que se ve en pantalla es ese resultado.
Aquí aparece una propiedad importante: como la suma da 1, alguien se tiene que llevar una puntuación alta por fuerza. Si los únicos candidatos son gato y perro, sea cual sea la foto, uno de los dos va a superar la mitad, no importa si en realidad es un auto o un papel tapiz.
Por eso una puntuación alta significa "esto se parece más a esta opción que a las demás", no "esto es lo correcto". Según quién sea el rival con el que se compara, la puntuación de la misma foto puede cambiar mucho.
El 80% puede no ser 80%
Si se reúnen solo los casos donde el modelo dio una puntuación de 90 y se cuenta cuántos acertaron de verdad, el resultado sorprende. Es habitual que no sean noventa, sino unos setenta. El modelo se ve a sí mismo mejor de lo que en realidad es; a esta costumbre se le llama exceso de confianza.
También pasa al revés. Un modelo entrenado con más cautela puede acertar en realidad noventa y cinco veces y aun así darse solo un 70. En cualquiera de los dos casos, si se lee el número tal cual, la decisión sale torcida.
Corregir esto exige contar cuántas veces acierta cada franja de puntuación y ajustar el número según ese conteo. Ese ajuste tiene su propio nombre y sus propias técnicas: basta con quedarse con la idea de que solo después de ese trabajo se puede leer un 80 como algo parecido a "ocho de cada diez veces".
Hasta lo que nunca aprendió recibe una puntuación
Este es el punto que exige más cuidado. Si a un modelo entrenado solo con gatos y perros se le pasa la foto de un auto, no sale un "no lo sé". Se elige uno de los dos, y hasta puede salir con una puntuación bastante alta. Es porque el modelo no pregunta "¿qué es esto?", sino solo "¿de los candidatos que aprendí, a cuál se parece más?".
Por eso es peligroso leer una puntuación alta como "lo sabe con certeza". Una puntuación alta ante algo que el modelo nunca vio puede ser, más bien, la señal de que no tiene ni idea de la situación. Para evitarlo, se agrega un candidato aparte para "ninguna de las anteriores", o se coloca un mecanismo separado que revise primero si la entrada cae dentro de lo que el modelo conoce.
Dónde poner la línea
En un servicio real, en vez de mostrar la puntuación tal cual, se traza una línea y solo se reacciona cuando se supera. Dónde se coloque esa línea cambia por completo el carácter del sistema.
Si la línea se pone baja, se dejan de perder menos casos, pero aumentan las respuestas equivocadas. Si se pone alta, bajan las respuestas equivocadas, pero también se filtran casos que sí eran correctos. Qué opción conviene lo decide el uso: donde pasar algo por alto es grave, conviene una línea baja; donde avisar algo por error es un problema, conviene una línea alta.
Dónde no conviene comparar puntuaciones
La puntuación que da un modelo y la que da otro no están medidas con la misma regla. Un 70 de un modelo puede ser más fiable que un 95 de otro. Para comparar dos modelos hay que mirar, sobre los mismos datos de prueba, cuántos aciertos tuvo cada uno en realidad, no la puntuación en sí.
Dentro de un mismo modelo también cambia el significado si cambia la situación. Con una foto oscura, borrosa o tomada desde un ángulo poco visto durante el entrenamiento, la puntuación puede salir mucho más alta de lo que corresponde a la exactitud real. La puntuación no es una calificación absoluta y fija: es un dato de referencia que vale para ese momento.
3Con más precisión
Los valores finales de un modelo de clasificación se pasan por una función exponencial y se dividen por la suma total, y así se obtienen valores que suman 1. Se leen como si fueran una probabilidad, pero no son un valor ajustado a la tasa real de aciertos. Ajustar esa diferencia entre lo que el modelo dice y lo que realmente ocurre es justo el trabajo de otra técnica dedicada a eso. En los modelos que detectan objetos hay que leer con más cuidado todavía, porque la puntuación final sale de multiplicar "la confianza de que aquí hay algo" por "la confianza de que la etiqueta es la correcta".
También hay puntos donde la analogía se queda corta. El número del semáforo tiene una unidad clara, los segundos; la puntuación de confianza no tiene ninguna unidad. El semáforo le muestra el mismo número a todo el mundo que está delante; la puntuación de confianza se genera de nuevo para cada entrada distinta. Y el número del semáforo baja de verdad a medida que pasa el tiempo, mientras que la puntuación de confianza no baja sola solo porque la respuesta haya sido incorrecta. Quien sabe si estuvo mal siempre es alguien de afuera.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que una puntuación de 80% significa "acierta ochenta de cada cien veces", pero en realidad, a menos que se haya ajustado aparte, suele alejarse bastante de la tasa real de aciertos.
Es fácil pensar que una puntuación baja significa que el modelo no sabe, pero en realidad es habitual que salga una puntuación muy alta incluso ante algo que el modelo desconoce por completo.
Es fácil pensar que comparar las puntuaciones de dos modelos dice cuál es mejor, pero en realidad no están medidas con la misma regla, así que hay que compararlas por el resultado sobre los mismos datos de prueba.
7Resumen en una línea
En resumenLa puntuación de confianza es el número que el modelo se pone a su propia respuesta, y no se puede leer como una probabilidad hasta que se comprueba, aparte, cuántas veces acertó de verdad.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02