Prueba de referenciaBenchmark
Conjunto común de pruebas para medir a varios candidatos por igual
- Una prueba de referencia es un conjunto de preguntas y una forma de calificar, iguales para todos los candidatos.
- Lo importante no es la dificultad, sino que las condiciones sean las mismas para todos. Si las condiciones cambian, los puntajes no se pueden comparar.
- Si las preguntas están a la vista de todos, quien se preparó de antemano sale con ventaja. El puntaje se infla más de lo que refleja la capacidad real.
- Un puntaje alto no significa que sirva para lo que yo necesito. Lo que mide puede no parecerse a mi tarea.
- Con el tiempo, todos terminan sacando el máximo y la prueba deja de distinguir. Por eso siguen apareciendo pruebas de referencia nuevas.
Contenido
1La analogía
Para comparar cuánto dura una pila hace falta un banco de pruebas. Se coloca una pila de cada marca, una por una, en el mismo aparato, a la misma temperatura y con la misma intensidad encendida, y se cronometra cuántas horas pasan hasta que se apaga. El aparato, las condiciones y la forma de medir son exactamente los mismos.
Solo así los resultados se pueden poner uno junto al otro. Si una pila se mide en una linterna y otra en un reloj de pared, los números que salen no se pueden comparar. Mismo aparato, mismas condiciones, misma medición: solo con estas tres cosas el número empieza a significar algo.
Una prueba de referencia para medir una IA se construye con la misma idea. Se le da a varios candidatos el mismo conjunto de preguntas y se califica siempre de la misma forma para sacar un número.
Eso sí, el banco de pruebas solo informa sobre lo que mide. Que una pila dure mucho encendida sin parar no garantiza que también dure en un aparato que se usa unos minutos al día.
2En detalle
Una prueba de referencia no es solo un conjunto de preguntas
Lo que se llama prueba de referencia suele traer tres cosas dentro: el conjunto de preguntas por resolver, la forma acordada de decidir si una respuesta es correcta, y las condiciones de ejecución, como cuántas veces se pregunta y en qué formato.
Si cualquiera de las tres cambia, el número se mueve. Con la misma pregunta, recibir una sola respuesta o recibir varias y quedarse con la mejor puede abrir una diferencia considerable en el puntaje. Por eso lo normal es publicar el puntaje junto con las condiciones en que se obtuvo.
Lo que mide es toda la prueba de referencia
Existen cientos de pruebas de referencia y cada una mide algo distinto. Unas miden la capacidad de encontrar un dato en un texto largo, otras la de llegar a una respuesta en varios pasos, y otras si el código funciona de verdad al ejecutarlo.
Por eso decir "tiene un puntaje alto" no dice nada por sí solo. Hay que añadir en qué prueba lo tiene para que el dato tenga sentido. Una pila que aguanta mucho en el frío y una que entrega mucha potencia en poco tiempo destacan en cosas distintas.
Elegir la prueba adecuada para una tarea propia es sencillo: basta con leer unas cuantas preguntas de esa prueba. Si se parecen a lo que se quiere pedirle a la IA, sirven de referencia; si no tienen nada que ver, ese puntaje es de otra historia.
Cuando las preguntas se hacen públicas, las respuestas se filtran
Las pruebas de referencia suelen publicarse para que las use cualquiera. El problema es que las preguntas y respuestas publicadas se dispersan por internet, y pueden colarse entre los datos que una IA recoge para entrenarse.
Cuando eso pasa, es como haber visto el examen antes de hacerlo. En vez de resolver entendiendo, se recuerda una respuesta ya vista, y el puntaje sale alto pero se derrumba en cuanto se cambia un poco la pregunta. A este fenómeno se le llama filtración de datos de evaluación.
Por eso ahora se combinan métodos como no publicar las respuestas y calificar por cuenta propia, o renovar las preguntas cada cierto tiempo.
Los puntajes envejecen con el tiempo
Una prueba de referencia recién creada empieza con puntajes bajos, porque casi nadie la resuelve bien todavía. Con los años, varios candidatos llegan a puntajes altos y, al final, casi todos se acercan al máximo.
Cuando el máximo se vuelve común, esa prueba ya no distingue el orden. Es como si las condiciones del examen se volvieran tan sencillas que cualquier producto sacara la nota máxima. Ahí es cuando una prueba nueva, más difícil o que mide desde otro ángulo, toma su lugar.
Lo que una prueba de referencia no puede decir
Una prueba de referencia califica preguntas de un formato fijo con reglas fijas, así que de entrada no puede medir lo que no cabe en ese formato: si la respuesta se lee bien, si el modelo admite lo que no sabe, o qué costumbres desarrolla con un uso largo.
En un servicio real también importan la velocidad y el costo, y eso suele quedar fuera de la prueba. Por eso el puntaje de una prueba de referencia sirve para acortar la lista de candidatos, y la decisión final es más segura si se apoya en una prueba hecha con los propios datos.
3Con más precisión
Una prueba de referencia es un paquete publicado que reúne datos de evaluación, reglas de calificación y condiciones de ejecución. Existen pruebas combinadas que reúnen varias en un solo puntaje, y también se mezclan formas donde una persona compara las respuestas directamente o donde otra IA hace de jueza.
Al leer un puntaje conviene tener cuidado: incluso midiendo al mismo candidato con la misma prueba, el resultado cambia un poco cada vez por el azar propio de generar respuestas. Por eso una diferencia de uno o dos puntos puede bastar para invertir el orden entre dos candidatos que en la práctica rinden igual. Un resultado que se mide varias veces y reporta también cuánto varía de una vez a otra es siempre más confiable que un número suelto.
También hay un punto donde la comparación cojea. En el banco de pruebas de pilas se puede trazar una línea —tantas horas ya es suficiente—, pero en las pruebas de referencia casi nunca existe esa línea. Nadie fija a partir de qué puntaje algo ya sirve; solo queda el orden relativo frente a otros candidatos. Esa lista ordenada es la tabla de clasificación.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que un puntaje alto significa que hace bien cualquier tarea, pero en realidad solo significa que se le da bien lo que mide esa prueba de referencia.
Es fácil pensar que un puntaje publicado es justo por definición, pero en realidad, si las preguntas y respuestas se colaron en los datos de entrenamiento, el puntaje puede inflarse más allá de la capacidad real.
Es fácil pensar que una diferencia pequeña de puntos ya asegura el orden, pero en realidad, al medir de nuevo el número se mueve unos puntos, y ese orden puede invertirse con facilidad.
7Resumen en una línea
En resumenUna prueba de referencia es un conjunto de exámenes que se aplica del mismo modo a varios candidatos para compararlos, y no dice nada sobre lo que queda fuera de lo que mide.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02