Verdad de referenciaGround Truth

La respuesta verdadera fijada de antemano para entrenar y calificar

Puntos clave
  • La verdad de referencia es la respuesta verdadera que sirve de criterio para entrenar y para calificar. Sin ella no se puede distinguir lo correcto de lo incorrecto.
  • No aparece por sí sola. Casi siempre la fija una persona después de revisar cada dato.
  • Si el criterio está torcido, el puntaje también sale torcido, y como el error es silencioso, cuesta darse cuenta.
  • Hay muchos casos donde no existe una sola respuesta posible. Ahí, se junta el juicio de varias personas para armar el criterio.
  • La verdad de referencia usada para entrenar y la usada para calificar no se pueden mezclar. Si se mezclan, el puntaje sale inflado.
Contenido

1La analogía

Cuando se afina un piano, lo primero es hacer sonar un diapasón. Se guarda ese único sonido en el oído y, con esa referencia, se ajusta la primera cuerda. A partir de ahí, esa cuerda ya ajustada sirve de referencia para afinar el resto, una por una.

Sin este primer sonido, la afinación ni siquiera puede empezar: se puede tensar y aflojar la cuerda, pero no hay base para decidir si quedó bien o mal. Solo cuando existe una referencia aparecen el "correcto" y el "incorrecto". La verdad de referencia que se usa para enseñar y calificar a la IA cumple ese mismo papel de diapasón.

Lo más peligroso es cuando la referencia está apenas torcida. La afinación puede terminar de forma muy prolija, y dentro del piano todas las cuerdas suenan en armonía entre sí. Pero al tocar junto a otro instrumento, todo queda desajustado. No falló quien afinó: falló la referencia que se tomó al principio.

2En detalle

Sin un criterio no existe lo correcto ni lo incorrecto

Ya sea entrenando la IA o midiendo su rendimiento, junto a cada dato tiene que estar anotado qué era en realidad. Con esa respuesta se puede calcular, durante el entrenamiento, cuánto se alejó el resultado para corregir el rumbo, y después de terminar, contar cuántas veces acertó.

La exactitud, la precisión y la exhaustividad se apoyan todas sobre este criterio. Sin criterio no hay nada que calcular. Por eso, al hablar de evaluación, la verdad de referencia se atiende antes que la métrica.

De dónde viene el criterio

El método más común es que una persona revise los datos uno por uno y le asigne una respuesta. Ese trabajo es el etiquetado, y la verdad de referencia es justamente el resultado de ese trabajo.

También hay casos donde la respuesta ya está registrada de antemano, como el historial de fallas de un equipo o las mediciones que dejó un instrumento. Estos datos exigen menos mano humana, lo cual es una ventaja, pero traen el riesgo de que un día sin registro o una fila mal anotada terminen convertidos en el criterio, tal cual.

Cuando hay demasiados datos para que una persona los revise todos, se combinan otros métodos: asignar respuestas con reglas automáticas y que una persona revise solo una parte, o dejar que un modelo ya entrenado escriba un borrador que una persona corrige. Se ahorra trabajo, pero la calidad del criterio baja en la misma medida.

Cuando el criterio está torcido, todo se desvía en silencio

También la verdad de referencia trae errores. Porque el dato era ambiguo, porque quien lo anotó estaba cansado, o porque la guía era confusa. No es raro que, en un lote grande de datos, unos cuantos puntos porcentuales de las respuestas estén mal.

Este error trabaja dos veces: durante el entrenamiento hace que el modelo aprenda siguiendo la respuesta equivocada, y al calificar marca como incorrecto algo que en realidad estaba bien respondido. En bastantes casos donde el puntaje no sube por más que se retoque el modelo, la causa está justo aquí.

Por eso, cuando un punto tiene un puntaje sospechosamente bajo, antes de sospechar del modelo conviene volver a leer unas decenas de casos de esa verdad de referencia. Es el equivalente a hacer sonar de nuevo el diapasón.

Muchas veces no hay una sola respuesta posible

Si en una foto hay o no hay un gato, la respuesta es una sola. Pero si una frase es positiva o negativa, o cuál de dos resúmenes es mejor, cambia de una persona a otra.

En estos casos no se toma el juicio de una sola persona como la verdad de referencia. Se le da el mismo dato a varias personas y se toma como criterio la opinión mayoritaria, o se anota además cuánto se dividieron las opiniones. Si ni siquiera las personas coinciden más de seis veces de cada ocho, pedirle a la IA que supere ese nivel ya es pedir demasiado.

Cuando la tarea es generar texto nuevo, la respuesta correcta ni siquiera se puede escribir en una sola línea. Ahí se usan varias respuestas de referencia a la vez, o se reemplaza el criterio pidiéndole a una persona que compare directamente.

El criterio para calificar se guarda aparte, bajo llave

Los datos usados para entrenar y los que se van a usar para calificar se separan desde el principio. Si se califica con los mismos datos que se usaron para entrenar, lo que se mide es cuánto memorizó las respuestas, no cuánto aprendió de verdad.

Separarlos no siempre alcanza. Es común que el mismo contenido, solo con la forma cambiada, termine metido en los dos lados: una versión recortada de una foto en el entrenamiento y el original en la calificación, por ejemplo. Ese tipo de filtración infla el puntaje en silencio.

3Con más precisión

La verdad de referencia no es un valor verdadero por naturaleza, sino un valor que quienes evalúan acordaron considerar verdadero. A un criterio construido con cuidado y con la participación de varias personas se le suele llamar criterio de oro, y a uno anotado de forma automática o con poca revisión, criterio de plata, para distinguirlos.

También existe una manera de medir su calidad: hacer que varias personas anoten el mismo dato y calcular cuánto coinciden. Si esa coincidencia es baja, significa que la guía es confusa o que el dato mismo es ambiguo, y hay que corregir el criterio antes de tocar el modelo. Cuando se publica un conjunto de datos, mostrar ese número junto con el procedimiento seguido ayuda a que quien lo use después sepa hasta dónde puede confiar en el puntaje.

La analogía también tiene sus límites. La altura de un diapasón está fijada físicamente y no se mueve, pero la verdad de referencia es un juicio de las personas que la construyeron, así que cambia si cambia el objetivo. Un mismo dato puede llevar una verdad de referencia distinta según qué se quiera medir con él.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la verdad de referencia siempre es correcta, pero en realidad la anota una persona, así que trae errores, y esos errores dañan a la vez el entrenamiento y la calificación.

  • Es fácil confundir la verdad de referencia con el etiquetado, pero en realidad el etiquetado es el trabajo de asignar la respuesta, y la verdad de referencia es el criterio mismo que queda como resultado de ese trabajo.

  • Es fácil pensar que basta con tener muchos datos, pero en realidad, muchas veces, una cantidad menor de datos con un criterio bien definido vale más que diez veces esa cantidad con un criterio inestable.

7Resumen en una línea

En resumenLa verdad de referencia es la respuesta verdadera que sirve de criterio para entrenar y calificar, y si ese criterio se tuerce, todos los puntajes se tuercen con él en silencio.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02