RegresiónRegression

Dar un número dentro de una escala continua

Puntos clave
  • La regresión es una predicción cuya respuesta sale como un número dentro de una escala continua. Precio, peso, tiempo: cualquier cosa donde tenga sentido un valor intermedio.
  • Si la respuesta es una casilla, es clasificación; si es un número, es regresión. Se distinguen viendo si un valor intermedio tiene sentido.
  • El modelo no memoriza valores. Encuentra la relación entre la entrada y la respuesta, de modo que si la entrada cambia, la respuesta se mueve con ella, y con esa relación da valores nuevos.
  • El rendimiento de la regresión no se mide con acertó o no acertó, sino con cuánto se desvió. Ese tamaño del desvío es la brújula del aprendizaje.
  • Frente a una entrada fuera del rango que había en los datos, estira la escala sin más para responder. Por eso es fácil que salgan valores absurdos.
Contenido

1La analogía

En un puesto de un mercado, apenas alguien agarra una bolsa de papas, el vendedor la pone en la balanza. Mira dónde se detuvo la aguja y dice el precio: si son 900 g, tanto; si pasa un poco de 1 kg, tanto más. No elige entre bolsas enteras, sino que el precio queda definido por en qué punto de la escala cayó el peso. La regresión es justamente esto: señalar un número dentro de una escala continua.

El vendedor no memorizó un precio para cada peso posible. Tiene un ojo entrenado con los años: si el peso sube, el precio sube en la misma medida, y si los granos son más grandes, agrega un poco más. Por eso, aunque aparezca un peso que nunca había visto, igual puede decir un precio.

Cuando hay regateo, se nota qué tan afinado está ese ojo. Si el precio que dice el vendedor y el precio al que termina vendiendo se alejan seguido, la próxima vez empieza a mover el precio que ofrece.

2En detalle

La respuesta está sobre una escala

Lo que separa regresión de clasificación es la forma de la respuesta. Repartir la correspondencia entre destinada a Madrid y destinada a Sevilla no tiene valores intermedios. No existe una bolsa que sea mitad para un lado y mitad para el otro. En cambio, el precio de las papas tiene todos los valores intermedios que quieras. Entre 3.200 y 3.300 está 3.250, y ese valor también tiene sentido.

Si un valor intermedio tiene sentido, suele ser regresión; si no lo tiene, suele ser clasificación. El precio de una casa, el tiempo que falta para que llegue un pedido, la temperatura de mañana: regresión. Si un correo es spam, si una foto es de un perro o un gato: clasificación.

El mismo problema puede caer de un lado o del otro según cómo se plantee la pregunta. Preguntar cuántos puntos sacó alguien en un examen es regresión; preguntar si aprobó o no es clasificación. Qué preguntar lo decide la persona.

No memoriza valores, encuentra una relación

Lo que hace un modelo de regresión es fijar una relación entre la entrada y la respuesta. Cuánto sube el precio cuando el peso aumenta 100 g, cuánto se agrega si el grano es más grande: esa clase de relación. Con solo esa relación, se puede dar un precio aunque llegue un peso que no estaba en la tabla.

Para fijar esa relación se miran varias pistas a la vez. El peso, el tamaño del grano, la temporada, el lugar de origen: todo empuja un poco el precio, cada uno con distinta fuerza, y encontrar esa fuerza en los datos es justamente aprender.

La relación no tiene por qué ser una línea recta. Puede manejar relaciones curvas, como un precio que sube con el peso pero se vuelve más suave al entrar en el rango de venta al por mayor. Solo que cuanto más margen se le da para curvarse, más termina copiando también el ruido de los datos, así que hay que tener cuidado.

El tamaño del desvío es la brújula

La clasificación se califica con acertó o no acertó, pero la regresión no se puede contar así. Decir 3.190 en vez de 3.200 y decir 8.000 en vez de 3.200 son dos errores, pero de un peso completamente distinto. Por eso, en la regresión, la diferencia entre el valor dicho y el valor real se usa como calificación.

Si se juntan varias de estas diferencias y se saca un promedio, se sabe en promedio cuánto se desvía el modelo. Sumar las diferencias tal cual haría que un exceso y un defecto se cancelaran entre sí, así que normalmente se agranda la diferencia antes de sumarla. Es una forma de castigar más fuerte a los errores grandes.

Este valor es a la vez la calificación y la brújula del aprendizaje. Hacia dónde y cuánto se desvió indica justamente hacia dónde mover la relación. Es como cuando, en un regateo, el precio que se ofreció salió siempre demasiado alto, y la próxima vez se empieza a ofrecer un poco más bajo.

Fuera del rango conocido, la escala se estira

Donde la regresión exige más cuidado es en el rango que no estaba en los datos. Si a un vendedor que solo vendió entre 100 g y 2 kg le preguntan el precio de una bolsa de 20 kg, va a estirar tal cual el ojo que tiene hasta ahora para decir un precio. Pero en ese tramo suele haber un precio mayorista aparte, y el ojo entrenado ya no sirve.

El modelo hace exactamente lo mismo. Dentro del rango que vio en el entrenamiento acierta bien, pero fuera de ese rango, simplemente extiende la relación tal cual. Por eso puede entregar sin ningún problema una edad negativa o un valor negativo donde no debería haberlo.

Si de antemano se conoce el rango posible, conviene ponerle un límite a la respuesta, y no basta con mirar solo el valor predicho: importa de qué zona de los datos salió.

3Con más precisión

La regresión es un problema que recibe una entrada y entrega un número continuo. Como aprende con ejemplos que ya tienen su respuesta, pertenece al aprendizaje supervisado junto con la clasificación, solo que la respuesta es un número real y no una categoría. Como vara para medir el rendimiento es común elevar la diferencia al cuadrado y promediar; cuando se quiere castigar menos los errores grandes, se usa el valor absoluto de la diferencia. Como hacia qué dirección y cuánto se desvió la respuesta se convierte directamente en la señal de aprendizaje, la regresión es también la forma de problema que más claramente le indica al aprendizaje hacia dónde ir.

También aquí la analogía tiene sus costuras. El vendedor del mercado dice un precio conociendo razones, como el costo y el mercado, pero el modelo de regresión no conoce ninguna razón. Solo sigue el rastro de lo que se movió junto en los datos, y por eso también aprende relaciones que en realidad están invertidas: con datos de que se vendieron muchos paraguas en los días que llovió mucho, también se puede construir una regresión, aunque vender más paraguas no hace que llueva.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la regresión es trazar una línea recta, pero en realidad también maneja relaciones curvas y usa varias pistas a la vez.

  • Es fácil creer que es un problema más difícil que la clasificación, pero en realidad solo cambia la forma de la respuesta, y el mismo problema se puede plantear tanto como regresión como clasificación.

  • Es fácil pensar que, al responder con un número, es más precisa, pero en realidad, fuera del rango que había en los datos, simplemente estira la escala, y eso puede hacer que se desvíe mucho más.

7Resumen en una línea

En resumenLa regresión es una predicción que da, en vez de una casilla, un número dentro de una escala continua, y cuánto se desvió es a la vez la calificación y la brújula del aprendizaje.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02