Evaluación y datos42

Cómo se mide si una IA funciona bien y con qué datos se entrena. Exactitud, precisión y exhaustividad, benchmarks, etiquetado, sesgo, aumento de datos: las palabras necesarias para leer una tabla de resultados.

Nivel
Aumento de datosData Augmentation

Transformar los datos que ya tienes para multiplicar su variedad

Entrenamiento Intermedio
CalibraciónCalibration

Hacer que la probabilidad declarada coincida con el acierto real

Avanzado
Calidad de los datosData Quality

Qué tan confiables son los datos que se usan para entrenar

Básico
CaracterísticaFeature

Un dato que la IA mira para decidir

Básicos Básico
Ciencia de datosData Science

Todo el proceso de sacar respuestas útiles de los datos

Básicos Básico
Conjunto de datosDataset

El conjunto de datos ordenado para enseñar a la IA

Básicos Básico
Conjunto de validaciónValidation Set

Datos apartados solo para revisar, nunca para entrenar

Entrenamiento Básico
Cuadro delimitadorBounding Box

El recuadro que envuelve un objeto y su posición exacta

Visión Básico
Curva de aprendizajeLearning Curve

La línea que dibuja cómo cambia el puntaje según pasan las vueltas

Entrenamiento Básico
Datos sintéticosSynthetic Data

Datos de práctica creados en lugar de los reales

Intermedio
Desequilibrio de clasesClass Imbalance

Cuando un tipo de caso domina casi todos los datos

Intermedio
Detección de contenido de IAAI Content Detection

Distinguir si algo fue hecho por la IA

Ética Básico
Error cuadrático medioMean Squared Error

Castigo que resulta de elevar al cuadrado la distancia y promediarla

Intermedio
EtiquetaLabel

La respuesta correcta que alguien anotó de antemano

Básicos Básico
EtiquetadoLabeling

El trabajo en que una persona le pone una respuesta a cada dato

Básico
Evaluación humanaHuman Evaluation

La evaluación que hace una persona mirando el resultado directamente

Básico
ExactitudAccuracy

La proporción de aciertos entre todas las decisiones tomadas

Básico
ExplicabilidadExplainability

El grado en que la IA puede mostrar por qué llegó a un juicio

Ética Intermedio
Fidelidad al promptPrompt Adherence

La vara que mide si el resultado siguió lo pedido

Generativa Intermedio
Fuga de datosData Leakage

Información de evaluación que se cuela en el entrenamiento

Intermedio
Limpieza de datosData Cleaning

Preparar los datos reunidos hasta dejarlos listos para usar

Básico
LLM como juezLLM-as-a-Judge

Un modelo de lenguaje que puntúa qué tan buena es una respuesta

Intermedio
Matriz de confusiónConfusion Matrix

Tabla que reparte los aciertos y errores en cuatro casillas

Intermedio
Métrica de evaluaciónEvaluation Metric

El criterio fijado de antemano para decidir qué cuenta como bueno

Básico
PerplejidadPerplexity

El número de opciones entre las que duda el modelo

LLM Avanzado
Precisión y exhaustividadPrecision & Recall

Qué tan puros son los elegidos y cuánto de lo real se encontró

Intermedio
Prueba A/BA/B Test

Probar dos versiones a la vez y comparar los resultados reales

Básico
Prueba de referenciaBenchmark

Conjunto común de pruebas para medir a varios candidatos por igual

Básico
Puntuación de confianzaConfidence Score

El número de seguridad que el modelo se pone a su propia respuesta

Visión Básico
Puntuación EloElo Rating

El número de nivel que se arma acumulando resultados de duelos

Intermedio
Puntuación F1F1 Score

El punto que junta la precisión y la exhaustividad en un número

Intermedio
RobustezRobustness

La capacidad de seguir funcionando aunque las condiciones cambien

Intermedio
ROC y AUCROC & AUC

El rendimiento medido moviendo el umbral, resumido en curva y número

Avanzado
Sesgo de la IAAI Bias

Cuando el sesgo de los datos queda grabado en el juicio de la IA

Ética Básico
Sesgo de muestreoSampling Bias

Una inclinación de los datos que nace de a quién se eligió

Intermedio
Sesgo del conjunto de datosDataset Bias

Cuando los datos recopilados ya están inclinados hacia un lado

Básico
SobreajusteOverfitting

Memorizar los ejercicios de práctica y fallar con los nuevos

Entrenamiento Intermedio
SubajusteUnderfitting

Tan simple que ni siquiera acierta con los datos de práctica

Entrenamiento Intermedio
Tabla de clasificaciónLeaderboard

La tabla que ordena los puntajes de evaluación de mayor a menor

Básico
Validación cruzadaCross-Validation

Dividir los datos en partes, turnarlas y promediar los resultados

Entrenamiento Avanzado
Valor atípicoOutlier

Un valor que queda muy alejado del resto

Básico
Verdad de referenciaGround Truth

La respuesta verdadera fijada de antemano para entrenar y calificar

Básico