Big Data

Datos tan acumulados que cambian hasta la herramienta para tratarlos

Puntos clave
  • El Big Data es un estado en el que los registros se acumulan más de lo que una persona puede manejar, hasta el punto de que cambia la propia herramienta con la que se trabaja.
  • El criterio no es un número de gigabytes: es si basta con una persona y un ordenador o no.
  • No es solo cuestión de cantidad. También pesan la velocidad a la que se acumula y lo distinto que es cada formato.
  • Un solo registro es trivial, pero cuando se juntan decenas de millones aparece el pulso de toda una ciudad.
  • Que se haya acumulado mucho no significa que sea un buen dato. Vienen de la mano las personas que faltan y los problemas de privacidad.
Contenido

1La analogía

Cada vez que pasas la tarjeta de transporte, queda una línea: a qué hora y en qué estación subiste. Solo tu historial es apenas el registro de tu ida y vuelta al trabajo, pero en todo el país se registran decenas de millones de líneas cada día, y con esa cantidad ni recorrer la tabla con la vista sirve de nada: no cabe en un archivo ni en un ordenador. A cambio, aparece algo que antes no se veía: a qué hora se satura cada estación de transbordo, hacia dónde se dispersa la gente que pierde el último tren. El punto en el que cambia la forma de trabajar y cambia lo que se puede ver, ahí empieza el Big Data.

2En detalle

El criterio de "grande" no es un número

El Big Data no tiene una línea acordada de "a partir de tantos gigabytes". El criterio es relativo: en el momento en que no se abre con la herramienta actual, ni el cálculo termina con el método actual, ese dato ya es Big Data ahí mismo.

El registro de un día en una sola parada se abre sin problema en una hoja de cálculo; el de un mes ya pesa más, y el de un año en todo el país no se abre. Es el mismo tipo de registro, pero al crecer la cantidad se cruza la línea que obliga a cambiar de herramienta.

Por eso el Big Data es menos una propiedad del dato y más una relación entre el dato y la herramienta. Lo que hace diez años era difícil de manejar hoy se procesa en un portátil.

Repartir y calcular por partes

Si no cabe en un ordenador, solo hay un camino: repartirlo entre varios. Se divide el registro nacional por región, se guarda cada parte en una máquina distinta, cada una calcula solo su porción, y al final se juntan los resultados.

Cuantas más máquinas se suman, más cantidad se puede manejar, pero aparecen preocupaciones nuevas: si una falla, se pierde su trozo, así que hay que guardar cada parte repetida, y repartir el trabajo para que el ir y venir entre máquinas no supere al tiempo de cálculo.

Repartir en varias máquinas algo que cabía en una sola incluso hace las cosas más lentas: el costo de repartir y volver a juntar pesa más que la ganancia. Por eso, en la práctica, lo primero que se pregunta es si esa cantidad de verdad merece repartirse.

La velocidad y el formato también pesan

El registro de la tarjeta se sigue generando en este mismo instante: mientras se ordena el de ayer, ya se acumuló otro tanto de hoy. Procesar solo cuando todo ya está reunido nunca alcanza a seguir el ritmo, así que hace falta un método que procese sin parar, a medida que va entrando.

El formato tampoco es uniforme. El registro de la tarjeta es una tabla con columnas claras, pero la señal de los autobuses o los mensajes de quejas que se usan junto a él vienen en formatos muy distintos. Además, el formato cambia con el tiempo, así que las columnas de un registro antiguo y uno reciente no coinciden.

Por eso, al hablar de Big Data se mencionan juntos cantidad, velocidad y variedad: basta con que cualquiera de los tres crezca para que el método anterior deje de aguantar.

Un registro es trivial, pero juntos revelan un patrón

Un solo registro no dice casi nada: solo que alguien subió en tal estación un martes por la mañana. Pero al superponer decenas de millones, aparece algo que no estaba en ningún registro individual: a qué hora se satura cada tramo, por qué ruta cambia de tren la gente los días de lluvia.

Buena parte de por qué la IA funciona tan bien hoy se debe a esto: mostrar muchísimos ejemplos en vez de escribir reglas solo funciona cuando hay ejemplos de sobra, y eso llegó cuando internet se llenó de texto e imágenes que una máquina podía leer.

Al mismo tiempo hace falta capacidad de cálculo: por muchos datos que haya, si no hay equipo para revisarlos, no sirven de nada. La IA de hoy nació cuando coincidieron la acumulación de datos y la aceleración del equipo de cálculo.

Mucho no significa bien elegido

En el registro nacional de la tarjeta de transporte falta quien no la usa: quien camina, va en bicicleta o conduce su propio coche no deja ni una línea, por muchos registros que haya.

Que la cantidad crezca no llena solo el hueco. Si se acumulan decenas de millones de registros ya inclinados hacia un lado, esa inclinación empieza a parecer un hecho, y eso es todavía más peligroso: un número grande inspira más confianza de la que merece.

También viene de la mano el problema de la privacidad: si el historial de una sola persona se acumula lo bastante, aunque se le borre el nombre, se termina viendo dónde vive y dónde trabaja. Por eso se publica agrupado en bloques, o con un ruido que impida identificar a nadie.

3Con más precisión

Al explicar el Big Data se suelen usar tres ejes: volumen, velocidad y variedad. A veces se añaden veracidad, si se puede confiar en el valor, y valor, la utilidad real, para hacer cinco ejes. Del lado del procesamiento, la base es el procesamiento distribuido: guardar los datos repartidos en varias máquinas, trocear el cálculo y juntar los resultados. Ninguno de estos ejes se mide con una regla fija; cada equipo termina decidiendo, según sus propias herramientas, a partir de qué punto conviene tratar un registro como Big Data.

La analogía también tiene sus costuras. El registro de la tarjeta es una tabla ordenada con columnas fijas, mucho más prolija que el Big Data real, donde lo habitual es un registro con formatos mezclados y errores dentro. Además, la tarjeta se mira después de que todo ya se juntó, mientras que en la práctica es más común sacar resultados mientras los datos todavía se acumulan. La propia palabra Big Data ya se usa menos hoy, y va cediendo terreno a expresiones como canal de datos o plataforma de datos, que nombran directamente la forma de trabajar.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que a partir de tantos terabytes ya es Big Data, pero en realidad no hay una línea fija: la línea es el momento en que la herramienta actual deja de dar abasto.

  • Es fácil pensar que más datos significa un resultado más preciso, pero en realidad si los registros ya vienen inclinados hacia un lado, cuantos más se acumulen, más crece esa inclinación.

  • Es fácil pensar que Big Data e IA son lo mismo, pero en realidad el Big Data es el trabajo de manejar el material, y la IA es el trabajo de aprender reglas con ese material: son etapas distintas.

7Resumen en una línea

En resumenEl Big Data es el estado en el que los registros se acumulan más de lo que una persona puede contar y obliga a cambiar de herramienta, y a cambio deja ver un patrón que no se notaba mirando un registro a la vez.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02