DatosData
Cada línea de registro con la que aprende la IA
- Los datos son registros que dejan constancia de algo que pasó en el mundo. Todo el material con el que aprende la IA sale de aquí.
- Una línea de registro es un suceso, y cada casilla que forma esa línea es un rasgo de ese suceso.
- No solo los números son datos. El texto, la foto, el sonido y hasta el rastro de un clic, si caben en una casilla, son el mismo tipo de material.
- Cuando en una línea también está escrita la respuesta correcta, es un dato con etiqueta. El aprendizaje supervisado crece comiendo este tipo de líneas.
- Lo que no quedó escrito, no existe. Un registro que falta es invisible para la IA desde el principio.
Contenido
1La analogía
Al abrir la libreta de gastos, hay una línea para cada cosa: 3 de mayo, metro, 1,40 €. En la línea siguiente, 3 de mayo, pan, 4 €. Una sola línea no dice casi nada. Pero cuando se juntan cien líneas, aparece solo cuánto se gastó este mes en transporte, o si el gasto sube los fines de semana. Los datos son justo esa línea, una tras otra. Lo que pasó antes de convertirse en registro no se puede manejar por grande que haya sido, y en cuanto se convierte en registro, ya se puede contar, comparar y aprender de ello. Si se cuela una línea sin la fecha o con el monto mal apuntado, la suma también se descuadra.
2En detalle
Una línea es un suceso, la casilla es su rasgo
En la libreta de gastos, cada línea trae la fecha, dónde se gastó, el monto y el método de pago. Una línea guarda entero "algo que pasó ese día", y cada casilla es un trozo de ese algo; en una tabla, a la fila horizontal se le llama fila y a la columna vertical, columna.
Al construir una IA, estas casillas reciben nombres aparte. A la casilla que sirve de material para predecir se le llama característica, y a la casilla con la respuesta que hay que acertar, etiqueta. La misma tabla se convierte en un problema distinto según qué casilla se marque como respuesta: con el monto, predecir el gasto; con el método de pago, adivinar cómo se paga.
Cómo se diseñan las casillas cambia el rendimiento. No es lo mismo dejar la fecha tal cual que sacar de ahí el día de la semana para hacer una casilla nueva: que el gasto suba el fin de semana solo salta a la vista si esa casilla existe.
Aunque no sea un número, es un dato
Una foto también es un dato: cada punto de la pantalla es un valor de brillo, y esos valores alineados en filas y columnas forman la foto. El sonido es una fila de valores que suben y bajan con el tiempo, y el texto, cortado en trozos, se convierte en números.
El rastro de usar una aplicación también es un dato: qué pantalla se abrió, cuántos segundos, qué se pasó por alto, todo se va acumulando en filas. Buena parte de los datos de hoy los anota la propia máquina, sin que nadie los escriba a propósito.
Aunque la forma cambie, el modo de tratarlo converge en uno solo: cualquier material termina convertido en un conjunto de números antes de poder entrar en un modelo. Por eso un mismo modelo puede manejar juntos foto, sonido y texto.
La línea con respuesta y la línea sin ella
Imaginemos que en la libreta de gastos hay líneas marcadas a mano con "esto era necesario" o "esto fue un derroche". Esa marca es la etiqueta: con muchas líneas así, se le puede enseñar a la IA que una línea de ese tipo es un derroche.
Poner la etiqueta suele hacerlo una persona: nombrar el objeto de una foto, marcar la emoción de una frase, anotar qué sonido es cada cosa. Cuesta tiempo y dinero, y a menudo etiquetar sale más difícil que juntar los datos.
Por eso también se desarrolló el método de usar el registro sin etiqueta: juntar líneas parecidas para encontrar grupos, o tapar un trozo de la frase y hacer que se adivine, para que el sistema se fabrique sus propias respuestas.
Lo que no quedó escrito no existe
Si en la libreta solo se apuntan los pagos con tarjeta y se olvida el efectivo, el gasto mensual queda por debajo del real: no es que el cálculo esté mal, es que el material ya venía inclinado hacia un lado.
Con la IA pasa lo mismo: si solo se juntaron fotos de día, la noche se vuelve un mundo que no existe; si solo se juntó la voz de una región, otras formas de hablar no tuvieron oportunidad de aprenderse. El modelo no imagina por su cuenta lo que falta en los datos para rellenarlo. El hueco se queda vacío tal cual, y de ahí sale una respuesta equivocada.
Por eso, al mirar los datos, hay que fijarse en qué falta tanto como en qué hay: revisar quién no quedó registrado suele venir antes que mirar el número de rendimiento.
Se tarda más en limpiar que en reunir
El registro real siempre es desordenado: el formato de fecha cambia de línea en línea, el nombre de un mismo comercio aparece escrito de varias formas, y hay líneas con el monto en blanco o duplicadas por error.
A esta tarea se le llama limpieza de datos: decidir qué hacer con las casillas vacías, unificar lo que se escribió de varias formas, y revisar los valores que se salen de lo esperado. En la práctica, suele ser la etapa que más tiempo consume.
Si el material no está parejo, por muy bueno que sea el modelo, el resultado se tambalea, y ordenar los datos suele subir más el rendimiento que cambiar de modelo.
3Con más precisión
Los datos son un conjunto de valores anotados en un formato fijo a partir de hechos observados. A lo que tiene filas y columnas claras, como una tabla, se le llama datos estructurados, y a lo que no tiene ese molde, como una foto o un documento, datos no estructurados. Al conjunto que se reúne y ordena con un propósito para entrenar se le llama, aparte, dataset: uno es el material en sí, y el otro ese material ya empaquetado para un problema en concreto.
La analogía también tiene sus costuras. La libreta de gastos la escribe uno mismo, así que más o menos se sabe qué falta; los datos que usa la IA casi siempre los reunió otra persona hace tiempo, y es difícil saber con qué criterio se filtraron. Además, una línea de la libreta tiene sentido por sí sola, pero el valor que recibe un modelo es un número al que se le borró el significado, mucho más difícil de revisar para notar algo raro. Por eso, en la práctica importa dejar documentado de dónde y cómo se reunieron los datos, y qué se dejó fuera.
4Pruébalo
- Teachable Machine ailearn.space Unas pocas fotos tuyas se convierten tal cual en material de entrenamiento. Prueba a sumar más fotos o cambiar el fondo, y mira cómo cambia el resultado
- Curso intensivo de machine learning de Google ailearn.space Con dibujos, muestra paso a paso cómo unos datos en filas y columnas se dividen en características y etiquetas
5Malentendidos comunes
Es fácil pensar que dato significa número, pero en realidad el texto, la foto, el sonido y el rastro de un clic también son datos, y hoy buena parte de lo que aprende la IA es justamente de este tipo.
Es fácil pensar que los datos son un hecho neutral tal cual son, pero en realidad, desde el momento en que se decide qué anotar y qué no, ya entra la elección de una persona.
Es fácil pensar que basta con reunir mucho, pero en realidad, si se acumulan más registros duplicados, erróneos e inclinados hacia un lado, el rendimiento puede bajar en vez de subir.
7Resumen en una línea
En resumenLos datos son cada línea de registro que deja constancia de algo que pasó en el mundo, y la IA solo puede aprender hasta donde llega lo que quedó escrito en esa línea.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02