Base de datos vectorialVector Database
Un almacén de números organizado para hallar lo más cercano
- Una base de datos vectorial es un almacén que guarda conjuntos de números y saca rápido los más cercanos.
- Si una base de datos normal busca el valor exacto, esta busca el valor más parecido: encuentra algo aunque no comparta ni una letra con la pregunta.
- No mide todo uno por uno. Agrupa de antemano lo parecido en zonas y solo rebusca en las zonas relevantes.
- Por eso la respuesta puede desviarse un poco. Es un intercambio: se cede algo de precisión a cambio de mucha velocidad.
- En las estructuras donde la IA consulta documentos internos o manuales para responder, ocupa el lugar donde se saca el material.
Contenido
1La analogía
Quien sabe dónde está el pepino abre el refrigerador y la mano va directo al cajón de verduras. No rebusca de arriba abajo por todos los estantes. Las verduras están con las verduras, las guarniciones con las guarniciones, las bebidas con las bebidas, así que basta con abrir ese cajón. Una base de datos vectorial es un refrigerador así, con compartimentos para lo parecido.
Gracias a los compartimentos, aunque haya muchísimas cosas, el tiempo de búsqueda no crece demasiado: aunque el refrigerador sea el doble de grande, basta con revisar el cajón de verduras. Si en cambio todo estuviera amontonado sin orden, el tiempo de búsqueda crecería exactamente igual que la cantidad de cosas.
Eso sí, si confías en el compartimento y abres solo uno, puedes pasar por alto un pepino que quedó en el cajón de al lado. Ser rápido a cambio de fallar muy de vez en cuando es la naturaleza de este método.
2En detalle
Busca lo parecido, no lo idéntico
La base de datos que usamos habitualmente trae filas que cumplen la condición exactamente: una persona cuyo apellido empieza con «Gómez», un producto con un precio de diez mil pesos o menos. Si una sola letra es distinta, no lo encuentra.
La base de datos vectorial pregunta distinto: «dame los diez más cercanos a este conjunto de números». Así se puede encontrar un documento guardado como «política de reembolsos» con la pregunta «¿cómo hago para que me devuelvan el dinero?», porque los embeddings de los dos textos quedan en una posición cercana.
El resultado llega con un orden y un puntaje que indica cuán cerca está. Con ese puntaje se puede filtrar y descartar lo que quedó demasiado lejos.
Antes de medir todo, se reduce por zonas
Si hay un millón de elementos guardados, medir la distancia un millón de veces por cada pregunta es demasiado lento. Por eso, al guardar, se agrupa de antemano lo parecido y se arma una especie de mapa. Un método muy usado consiste en tender una red que conecta caminos entre vecinos, y al buscar, partir de cualquier punto e ir moviéndose siempre hacia el vecino más cercano hasta acercarse al destino.
Este método es entre decenas y cientos de veces más rápido que medir todo. A cambio, muy de vez en cuando se le escapa el verdadero primer lugar. Por eso a este tipo de búsqueda se le llama «encontrar lo cercano de forma aproximadamente exacta», y se puede ajustar con una perilla cuán minuciosa es la revisión: cuanto más minuciosa, más precisa y más lenta.
Antes de guardar, se corta y se convierte en números
Los documentos no se guardan enteros de una pieza. Si un documento largo entero se convierte en un solo conjunto de números, el contenido se aplasta: solo queda de qué trata a grandes rasgos, y los detalles desaparecen.
Por eso el documento se corta en trozos pequeños, por párrafo o por sección, y se crea y se guarda un embedding para cada trozo. Si se corta demasiado fino, se pierde el contexto de alrededor; si se corta demasiado grueso, el foco se difumina. Decidir este tamaño influye mucho en el rendimiento real.
A cada trozo se le adjunta información como el texto original, la fuente y la fecha de creación. Esta información hace falta después para citar la fuente en la respuesta o para excluir documentos viejos.
Se combina con filtros de condición
Buscar solo por significado no basta muchas veces, como cuando hay que poner una condición: «entre los documentos desde el año pasado», «entre el material de este departamento». Por eso la mayoría de las bases de datos vectoriales tienen una función que primero reduce el rango con la información guardada junto al vector, y solo después busca lo cercano dentro de ese rango.
También se mezcla con el método antiguo que revisa si las palabras coinciden exactamente, porque para lo que debe coincidir letra por letra —números de producto, nombres de personas—, la búsqueda por significado más bien es débil. Combinar los resultados de ambos métodos y reordenarlos es una configuración común en la práctica.
Dónde se usa
El uso más frecuente es la estructura donde la IA consulta nuestro propio material para responder. Cuando llega una pregunta, primero se sacan de la base de datos vectorial algunos párrafos relacionados, y esos párrafos se meten al modelo junto con la pregunta para que arme la respuesta. Así el modelo puede manejar normas internas o material reciente que nunca aprendió.
La misma estructura se usa también para recomendar productos o artículos parecidos, para encontrar documentos duplicados con contenido casi idéntico, y para buscar una foto a partir de otra foto.
3Con más precisión
Una base de datos vectorial es un sistema que guarda vectores de muchas dimensiones y ofrece una búsqueda de vecinos más cercanos. En vez de comparar con todo, usa métodos aproximados; los más representativos son conectar a los vecinos con una red de varias capas, y dividir el espacio en varias zonas.
El grado de parecido se mide casi siempre con la similitud coseno o con la distancia. El resultado solo es correcto si la medida usada para crear el índice coincide con la que se usa al buscar. A veces se usa un producto aparte, y a veces se le agrega una función vectorial a una base de datos que ya existía.
Aquí la analogía cojea. El cajón del refrigerador es un lugar que una persona definió diciendo «aquí van las verduras», pero las zonas de una base de datos vectorial se dividen automáticamente por la distancia entre números. Cosas que a los ojos de una persona son de un mismo tipo pueden terminar dispersas en varias zonas. Además, el pepino que sacas del refrigerador es, sin duda, un pepino, pero el párrafo que trae una búsqueda vectorial solo tiene una dirección parecida a la pregunta, sin ninguna garantía de que contenga la respuesta correcta.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que la base de datos vectorial redacta la respuesta, pero en realidad solo saca material que parece relevante; quien escribe la respuesta es el modelo de lenguaje.
Es fácil pensar que el resultado de la búsqueda siempre trae lo más cercano posible, pero en realidad, por ganar velocidad, solo revisa los alrededores y a veces se le escapa el verdadero primer lugar.
Es fácil pensar que, al cargar material, el modelo lo aprende, pero en realidad el modelo se queda igual: solo se vuelve a buscar el material cada vez que se pregunta y se le entrega junto con la pregunta.
7Resumen en una línea
En resumenLa base de datos vectorial es como un refrigerador con compartimentos para lo parecido: un almacén que saca rápido el material con un significado cercano.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02