Evaluación y datos42
Cómo se mide si una IA funciona bien y con qué datos se entrena. Exactitud, precisión y exhaustividad, benchmarks, etiquetado, sesgo, aumento de datos: las palabras necesarias para leer una tabla de resultados.
Transformar los datos que ya tienes para multiplicar su variedad
CalibraciónCalibrationHacer que la probabilidad declarada coincida con el acierto real
Calidad de los datosData QualityQué tan confiables son los datos que se usan para entrenar
CaracterísticaFeatureUn dato que la IA mira para decidir
Ciencia de datosData ScienceTodo el proceso de sacar respuestas útiles de los datos
Conjunto de datosDatasetEl conjunto de datos ordenado para enseñar a la IA
Conjunto de validaciónValidation SetDatos apartados solo para revisar, nunca para entrenar
Cuadro delimitadorBounding BoxEl recuadro que envuelve un objeto y su posición exacta
Curva de aprendizajeLearning CurveLa línea que dibuja cómo cambia el puntaje según pasan las vueltas
Datos sintéticosSynthetic DataDatos de práctica creados en lugar de los reales
Desequilibrio de clasesClass ImbalanceCuando un tipo de caso domina casi todos los datos
Detección de contenido de IAAI Content DetectionDistinguir si algo fue hecho por la IA
Error cuadrático medioMean Squared ErrorCastigo que resulta de elevar al cuadrado la distancia y promediarla
EtiquetaLabelLa respuesta correcta que alguien anotó de antemano
EtiquetadoLabelingEl trabajo en que una persona le pone una respuesta a cada dato
Evaluación humanaHuman EvaluationLa evaluación que hace una persona mirando el resultado directamente
ExactitudAccuracyLa proporción de aciertos entre todas las decisiones tomadas
ExplicabilidadExplainabilityEl grado en que la IA puede mostrar por qué llegó a un juicio
Fidelidad al promptPrompt AdherenceLa vara que mide si el resultado siguió lo pedido
Fuga de datosData LeakageInformación de evaluación que se cuela en el entrenamiento
Limpieza de datosData CleaningPreparar los datos reunidos hasta dejarlos listos para usar
LLM como juezLLM-as-a-JudgeUn modelo de lenguaje que puntúa qué tan buena es una respuesta
Matriz de confusiónConfusion MatrixTabla que reparte los aciertos y errores en cuatro casillas
Métrica de evaluaciónEvaluation MetricEl criterio fijado de antemano para decidir qué cuenta como bueno
PerplejidadPerplexityEl número de opciones entre las que duda el modelo
Precisión y exhaustividadPrecision & RecallQué tan puros son los elegidos y cuánto de lo real se encontró
Prueba A/BA/B TestProbar dos versiones a la vez y comparar los resultados reales
Prueba de referenciaBenchmarkConjunto común de pruebas para medir a varios candidatos por igual
Puntuación de confianzaConfidence ScoreEl número de seguridad que el modelo se pone a su propia respuesta
Puntuación EloElo RatingEl número de nivel que se arma acumulando resultados de duelos
Puntuación F1F1 ScoreEl punto que junta la precisión y la exhaustividad en un número
RobustezRobustnessLa capacidad de seguir funcionando aunque las condiciones cambien
ROC y AUCROC & AUCEl rendimiento medido moviendo el umbral, resumido en curva y número
Sesgo de la IAAI BiasCuando el sesgo de los datos queda grabado en el juicio de la IA
Sesgo de muestreoSampling BiasUna inclinación de los datos que nace de a quién se eligió
Sesgo del conjunto de datosDataset BiasCuando los datos recopilados ya están inclinados hacia un lado
SobreajusteOverfittingMemorizar los ejercicios de práctica y fallar con los nuevos
SubajusteUnderfittingTan simple que ni siquiera acierta con los datos de práctica
Tabla de clasificaciónLeaderboardLa tabla que ordena los puntajes de evaluación de mayor a menor
Validación cruzadaCross-ValidationDividir los datos en partes, turnarlas y promediar los resultados
Valor atípicoOutlierUn valor que queda muy alejado del resto
Verdad de referenciaGround TruthLa respuesta verdadera fijada de antemano para entrenar y calificar