ClasificaciónClassification

Elegir una entre las casillas ya decididas de antemano

Puntos clave
  • La clasificación es meter lo que entra en una de las casillas ya decididas de antemano. Primero está la lista de casillas, y después se mete en una.
  • El modelo no elige una casilla directamente. Le pone una nota a cada casilla y elige la que tiene la nota más alta.
  • Quien decide las casillas es una persona. Hace falta mostrarle muchísimos ejemplos con el nombre de la casilla ya puesto para que aprenda cómo es esa casilla.
  • Aunque llegue algo que no está en la lista, el modelo igual elige por la fuerza una de las casillas que ya tiene. Una respuesta de "fuera de casillas" hay que construirla aparte.
  • Si la respuesta es una casilla, es clasificación; si es un número continuo, es regresión. Esa diferencia separa el método que se usa y la forma de calificar el resultado.
Contenido

1La analogía

En la trastienda de una oficina de correos hay sacas alineadas por región. Cada saca lleva una etiqueta -destino Madrid, destino Barcelona, destino Valencia- y cada envío que entra va a parar a una de esas sacas. La lista de sacas ya estaba decidida antes de que llegara el correo, y aunque hoy llegue una dirección rarísima, no aparece una saca nueva. La clasificación es justo esto: elegir una casilla ya fijada.

El criterio para elegir son unas pocas pistas escritas en el sobre: el código postal, el nombre del barrio, el tipo de sello. Si las pistas son claras, la saca se decide enseguida; si la letra está corrida, uno duda un buen rato entre dos sacas.

Y si llega un envío con la dirección totalmente borrada, tampoco se puede dejar fuera de las sacas. Hay que meterlo en la más probable, o dejar preparada aparte una saca de "revisar".

2En detalle

La lista de casillas tiene que existir primero

Lo primero que se hace en clasificación es que una persona decida la lista de casillas que pueden ser la respuesta. Separar fotos en perro y gato, o en perro, gato y otros, cambia por completo el modelo que se termina construyendo. Si se fijan dos casillas, por más fotos nuevas que lleguen, la salida solo puede ser perro o gato.

Decididas las casillas, hay que reunir muchísimos ejemplos de cada una. Cientos de fotos de perro con la etiqueta "perro", cientos de fotos de gato con la etiqueta "gato": ese material con etiqueta es el material de entrenamiento.

Cómo se cortan las casillas no es cuestión de técnica, sino de criterio. Que una oficina de correos reparta las sacas por comunidad o por provincia depende de la logística de reparto, no lo decide el modelo.

Se pone nota a cada casilla y se elige la más alta

El modelo no agarra una saca directamente. Por dentro le pone una nota a cada casilla y elige la que sale más alta: destino Madrid 0,82, destino Barcelona 0,11, destino Valencia 0,07, por ejemplo.

Con esa nota se nota que hay casos distintos aunque la respuesta sea igual. Un 0,82 contra un 0,11 y un 0,42 contra un 0,39 dan las dos veces la misma respuesta, Madrid, pero en el segundo caso casi es cara o cruz.

Por eso, en un servicio real solo se procesa automáticamente cuando la nota pasa de cierto nivel, y si es baja, se manda a que lo revise una persona. Dónde se traza esa línea cambia la proporción entre lo que se pasa por alto y lo que se mete mal.

Qué parte del sobre se mira decide el resultado

El resultado de una clasificación depende más de qué pista se le dio que del modelo en sí. Un clasificador al que solo se le da el código postal y otro al que también se le da el nombre del barrio no pueden rendir igual. Al revés, darle demasiadas pistas inútiles también confunde.

Lo complicado es cuando una pista rara funciona bien por casualidad. Si por azar solo los envíos con destino Madrid llevaban pegada una pegatina azul, el modelo saca buena nota mirando solo la pegatina, y en cuanto cambia la política de pegatinas, se desploma desde ese día.

También es un problema que la cantidad de ejemplos varíe mucho entre casillas. Si nueve de cada diez son destino Madrid, con solo responder siempre Madrid ya sale un 90% de aciertos. Mirando solo la nota parece que rinde bien, pero es un modelo que no aprendió nada.

Cuando llega algo que no está en ninguna casilla

El clasificador solo puede responder con las casillas que conoce. Si a un modelo que solo aprendió perro y gato le entra una foto de coche, no puede decir coche: elige perro o gato, y encima con una nota bastante alta.

En la oficina de correos sería como si llegara un envío internacional y solo hubiera sacas nacionales. Hay que meterlo en alguna, así que entra en la que más se le parece, y a partir de ahí sigue rodando mal.

Por eso, los clasificadores que se usan de verdad suelen llevar aparte una casilla de "otros", o un mecanismo que aplaza la respuesta cuando la nota es baja. El momento más peligroso es cuando se cree que la lista de casillas ya está completa.

3Con más precisión

La clasificación es el problema de asociar una entrada con una de las categorías fijadas de antemano. Si hay dos respuestas se llama clasificación binaria, y si hay tres o más, clasificación múltiple. Como el entrenamiento necesita ejemplos con la etiqueta de la respuesta correcta, pertenece al aprendizaje supervisado, y por eso arranca desde un punto distinto que la agrupación por parecido sin etiquetas, que es la clustering. La nota que da el modelo suele ajustarse para que la suma total dé 1 y así se lea como una probabilidad, pero si no se calibra bien, ese número puede no coincidir con el acierto real.

La analogía también tiene sus costuras. Una saca de correos se decide con una pista segura, la dirección, pero un modelo de clasificación no tiene una pista segura así: solo tiene la tendencia estadística que sacó de los ejemplos, así que el mismo envío podría ir a otra saca si cambiara el material de entrenamiento. Tampoco las casillas están siempre tan claramente separadas como en correos. Un mismo texto puede ser a la vez una consulta y una queja. En esos casos, en vez de obligar a elegir una sola casilla, se construye el modelo para que pueda marcar varias casillas a la vez.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que clasificación y clustering son lo mismo, pero en realidad en la clasificación las casillas ya están decididas de antemano y en la clustering se agrupa lo parecido sin ninguna casilla previa.

  • Es fácil pensar que si la exactitud es alta, el clasificador es bueno, pero en realidad, si los ejemplos se amontonan en una sola casilla, la exactitud sale alta aunque no haya aprendido nada.

  • Es fácil suponer que ante algo desconocido responderá que no lo sabe, pero en realidad elige una de las casillas que conoce, y encima con una nota alta.

7Resumen en una línea

En resumenLa clasificación es ponerle una nota a cada casilla ya fijada de antemano y elegir la más alta, y cómo se arma la lista de casillas decide la mitad del resultado.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02