Sesgo del conjunto de datosDataset Bias
Cuando los datos recopilados ya están inclinados hacia un lado
- El sesgo del conjunto de datos es el estado en que los datos ya reunidos están inclinados hacia un lado. Existe desde antes de construir el modelo.
- Casi nunca aparece porque alguien lo busque a propósito: surge porque solo se acumula lo que es fácil de conseguir.
- El lado con menos datos falla más seguido, pero el puntaje general parece intacto, porque el lado grande lo sostiene.
- Cuando se usa para juzgar personas, el mismo grupo vuelve a quedar en desventaja una y otra vez.
- Lo que hay que corregir no es el modelo sino los datos. Todo empieza por abrir el montón y contarlo.
Contenido
1La analogía
Imagina abrir un depósito donde se guardan los registros de temperatura de todo el país. Hay carpetas apiladas hasta el techo, pero al revisarlas una por una casi todas vienen de las grandes ciudades. De los pueblos de montaña hay apenas unas hojas sueltas, y de las islas pequeñas no hay ni una.
Nadie decidió medir solo las ciudades. Instalar un equipo de medición exige electricidad y conexión, y si se descompone alguien tiene que ir a repararlo. Por eso los equipos se instalaron primero donde era fácil llegar, y con los años los registros se acumularon únicamente ahí.
El problema aparece cuando se confía en ese depósito tal cual. Mirando solo los papeles, el verano de todo el país se parece al verano de las ciudades, y si con estos registros se planea la calefacción para todo el territorio, el cálculo funciona bien en las ciudades y falla en la montaña y en las islas. Ese error casi no se nota, porque ahí no hay registros con qué comprobarlo.
El sesgo del conjunto de datos es justamente esto: que las carpetas del depósito estén inclinadas hacia un solo lado.
2En detalle
La inclinación suele nacer donde es fácil llegar
Los datos no reflejan el mundo de forma pareja. Se acumula más de lo que es fácil de conseguir, de lo que ya deja rastro, de lo que tiene una voz más fuerte. Lo mismo pasa con los textos e imágenes que se recogen de internet: ciertos idiomas y ciertas regiones aparecen en cantidades enormes, mientras que otros casi no aparecen.
A veces lo que queda registrado es directamente una decisión pasada. Si se usan como datos las decisiones tomadas en los últimos años, junto con ellas entran también las costumbres de esa época: los datos parecen anotar hechos, pero en realidad también anotan qué eligió alguien en su momento.
Lo más difícil es que lo que falta no se cuenta. Una carpeta que nunca llegó al depósito tampoco aparece en el índice, así que notar qué falta exige revisar por fuera, con otra fuente.
Donde hay menos datos se falla más, y ese error casi no se ve
Un modelo entrenado con datos inclinados funciona bien en el lado grande y mal en el lado pequeño. Pero esa diferencia no aparece en el resultado final. Al calcular la exactitud general, el lado grande pesa tanto que, aunque el lado pequeño falle por completo, el número total baja apenas unos puntos.
Por eso conviene medir por partes: por región, por condición, por cada grupo con pocos datos. Al separar los resultados se descubre que detrás de un 90 general puede esconderse una fila entera de 60, y esta comprobación hay que dejarla lista desde que se recopilan los datos, porque cada dato necesita venir marcado con la información que permita distinguir a qué grupo pertenece.
Cuando se juzga a personas, la desventaja se acumula
Con los registros de temperatura, un error se corrige volviendo a medir. Pero cuando datos inclinados se usan para elegir o evaluar personas, la historia cambia. El grupo que aparece poco en los datos recibe puntajes más bajos una y otra vez, y ese resultado vuelve a sumarse a los datos siguientes.
Con cada vuelta la inclinación se afirma más: el grupo elegido con menos frecuencia queda con menos registros, y con menos registros vuelve a salir en desventaja la próxima vez. Es una estructura donde una pequeña inclinación inicial crece con el tiempo, así que una vez instalada es difícil revertirla.
Por eso, en las decisiones que afectan a personas conviene mantener un seguimiento continuo de los resultados por grupo, junto con un procedimiento donde una persona pueda intervenir y revertir algo si se ve fuera de lugar.
Juntar más datos, por sí solo, no resuelve nada
Como parece un problema de falta de datos, la primera idea suele ser recopilar más. Pero si se sigue recopilando de la misma manera, la inclinación crece en la misma proporción. Instalar diez estaciones más en las ciudades no hace que aparezcan registros de las islas.
Lo que hace falta no es cantidad, sino dirección: recopilar a propósito en los lados vacíos, darle más peso a esos datos durante el entrenamiento y, si aun así no alcanza, dejar esa parte de la decisión en manos de una persona en lugar del modelo.
Llegar a un equilibrio perfecto casi nunca es posible. Por eso conviene, además, dejar anotada sin ocultarla la inclinación que queda. Si la ficha del conjunto de datos deja claro qué grupos están representados y cuáles faltan, quien lo use después podrá conocer sus límites de antemano.
3Con más precisión
El sesgo del conjunto de datos no es una sola cosa. Hay una inclinación que nace del canal por el que se recopilan los datos y que deja fuera a ciertos grupos; otra que arrastra las costumbres de decisiones pasadas al copiar registros históricos; y otra que nace del juicio inclinado de las personas que asignan las respuestas. Como los orígenes son distintos, las formas de corregirlo también lo son.
Conviene separar este término de otros parecidos. El sesgo de muestreo se refiere a que el método de selección está inclinado; el sesgo de la IA, a que el modelo entrenado termina dando resultados inclinados en la práctica. El sesgo del conjunto de datos queda en el medio: describe la forma que tiene, ahora mismo, el montón de datos que se tiene en las manos.
La analogía también tiene sus límites. Una estación de medición nueva empieza a generar registros desde el momento en que se instala, pero algunos datos nunca llegaron a quedar registrados y no hay forma de recuperarlos. En esos casos, en lugar de inventar algo para llenar el vacío, a veces es mejor optar por no emitir una decisión en ese grupo.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que el sesgo del conjunto de datos aparece solo si alguien tuvo mala intención, pero en realidad basta con que se acumule únicamente lo fácil de conseguir para que aparezca.
Es fácil creer que recopilar más datos diluye el sesgo, pero en realidad, si se sigue recopilando de la misma manera, la proporción inclinada se mantiene o incluso crece.
Es fácil pensar que una exactitud general alta significa que no hay sesgo, pero en realidad el puntaje total casi no baja aunque el grupo con menos datos falle por completo.
7Resumen en una línea
En resumenEl sesgo del conjunto de datos es el estado en que los datos recopilados están inclinados hacia un lado, y mientras el puntaje general parece intacto, el lado con menos datos sigue fallando en silencio.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02