Métodos de entrenamiento58
Cómo aprende la IA a partir de datos. Aprendizaje supervisado, no supervisado y por refuerzo, ajuste fino, sobreajuste, función de pérdida, descenso de gradiente: los pasos escondidos tras la palabra «entrenar», uno a uno.
Quien actúa y el tablero que responde a esa acción
AgrupamientoClusteringJuntar lo parecido sin ninguna etiqueta previa
Ajuste finoFine-TuningRetocar un poco más un modelo ya entrenado con datos nuevos
Ajuste por instruccionesInstruction TuningEtapa donde el modelo aprende a responder según la instrucción
Algoritmo genéticoGenetic AlgorithmMezclar y variar un poco varios candidatos para ir eligiendo
AlineaciónAlignmentAjustar la capacidad de la IA a lo que las personas desean
Aprendizaje automáticoMachine LearningEnseñar con ejemplos en vez de escribir las reglas
Aprendizaje autosupervisadoSelf-Supervised LearningAprender tapando parte de los datos y adivinando lo tapado
Aprendizaje contrastivoContrastive LearningAcercar lo que es igual y alejar lo que es distinto al aprender
Aprendizaje federadoFederated LearningJuntar solo el resumen de lo aprendido, sin juntar los datos
Aprendizaje no supervisadoUnsupervised LearningEncontrar la estructura de los datos sin ninguna respuesta puesta
Aprendizaje por imitaciónImitation LearningAprender copiando tal cual el actuar de quien ya sabe hacerlo
Aprendizaje por refuerzoReinforcement LearningAprender a base de intentar y corregir según la puntuación recibida
Aprendizaje por transferenciaTransfer LearningLlevar a una tarea nueva la base ya aprendida en otra
Aprendizaje semisupervisadoSemi-Supervised LearningAprender con poco dato etiquetado y mucho dato sin etiquetar
Aprendizaje supervisadoSupervised LearningAprender una regla a partir de ejemplos con la respuesta ya puesta
Aumento de datosData AugmentationTransformar los datos que ya tienes para multiplicar su variedad
Colapso de modoMode CollapseCuando quien genera repite sin parar lo único que le funciona
Colapso del modeloModel CollapseCuando la IA aprende de lo que ella misma creó y pierde diversidad
Conjunto de validaciónValidation SetDatos apartados solo para revisar, nunca para entrenar
ConvergenciaConvergenceEl estado en que el valor deja de mejorar y se mantiene fijo
Curva de aprendizajeLearning CurveLa línea que dibuja cómo cambia el puntaje según pasan las vueltas
Descenso de gradienteGradient DescentMoverse poco a poco hacia donde el error se hace más pequeño
Destilación de conocimientoKnowledge DistillationPasar el criterio de un modelo grande a uno pequeño
Desvanecimiento del gradienteVanishing GradientSeñal de aprendizaje que se debilita hasta desaparecer entre capas
DQNDeep Q-NetworkHacer que una red neuronal recuerde la tabla de valores Q
DropoutApagar al azar partes del modelo mientras entrena
EntrenamientoTrainingEl proceso de ajustar los parámetros poco a poco con ejemplos
ÉpocaEpochLa unidad que cuenta una vuelta completa a los datos de entrenamiento
Error cuadrático medioMean Squared ErrorCastigo que resulta de elevar al cuadrado la distancia y promediarla
Exploración y explotaciónExploration vs ExploitationEl equilibrio entre usar lo conocido o probar algo nuevo
Fuga de datosData LeakageInformación de evaluación que se cuela en el entrenamiento
Función de pérdidaLoss FunctionEl número que mide cuánto se aleja la respuesta de la correcta
GeneralizaciónGeneralizationLa capacidad de acertar también con datos nuevos
GradienteGradientLa señal que indica hacia dónde y cuánto moverse para reducir el error
HiperparámetroHyperparameterEl valor que una persona fija antes de empezar a entrenar
Ley de escaladoScaling LawRegla que muestra cuánto mejora el rendimiento al crecer la escala
LoRADejar el cuerpo intacto y entrenar solo un pequeño añadido
Mini-loteMini-BatchProcesar los datos en tandas, dando un paso por cada una
Mínimo localLocal MinimumUn punto atrapado, aunque exista uno más bajo cerca
Modelo del mundoWorld ModelUn modelo que guarda cómo funciona el mundo y lo ensaya antes
Olvido catastróficoCatastrophic ForgettingPerder una destreza anterior mientras se aprende algo nuevo
OptimizadorOptimizerLa regla que recibe el gradiente y decide cómo mover los valores
Parada tempranaEarly StoppingDetener el entrenamiento cuando el puntaje empieza a empeorar
PolíticaPolicyLa norma que fija qué hacer en cada situación
PreentrenamientoPretrainingEtapa donde se aprende lo básico antes de decidir para qué se usará
Punto de controlCheckpointUna copia que guarda el estado del entrenamiento a mitad de camino
Q-learningAnotar y corregir la puntuación esperada de cada acción
RecompensaRewardEl puntaje de bien o mal que llega después de actuar
RegresiónRegressionDar un número dentro de una escala continua
RegularizaciónRegularizationPenalizar que los valores del modelo crezcan demasiado
RetropropagaciónBackpropagationEl procedimiento que reparte el error hacia atrás, paso a paso
RLHFAjusta el tono de la respuesta con preferencias humanas
RuidoNoiseLa mancha mezclada que también es el punto de partida de la creación
SobreajusteOverfittingMemorizar los ejercicios de práctica y fallar con los nuevos
SubajusteUnderfittingTan simple que ni siquiera acierta con los datos de práctica
Tasa de aprendizajeLearning RateEl valor que decide cuánto se mueve cada paso
Validación cruzadaCross-ValidationDividir los datos en partes, turnarlas y promediar los resultados