Búsqueda semánticaSemantic Search
Encuentra lo que se parece en significado, no en letras
- La búsqueda semántica encuentra lo que se parece en significado, no lo que comparte letras.
- Convierte el documento y la pregunta en conjuntos de números que llevan el significado, y mide cuán cerca quedan esas posiciones.
- El cálculo de los documentos se hace de antemano. Al buscar, solo se convierte la pregunta y se compara, así que va rápido.
- A cambio de encontrar algo aunque cambie la redacción, es débil con lo que debe coincidir exactamente, como números de referencia, nombres o cifras.
- Por eso en la práctica se ejecutan la búsqueda por letras y la búsqueda por significado juntas, y se combinan los resultados.
Contenido
1La analogía
Hay un fichero de tarjetas de presentación en el cajón. Si están ordenadas alfabéticamente, solo las encuentras cuando sabes el nombre. Si quieres encontrar al contratista que te arregló el techo el año pasado y no recuerdas su nombre, tienes que hojear el fichero desde el principio.
Así que decides anotar al reverso de cada tarjeta a qué se dedica esa persona, y agrupar en el mismo compartimento los trabajos parecidos: impermeabilización, goteras y obras de azotea en uno; electricidad y cableado en otro. Ahora, si abres el cajón con la frase «me gotea el techo», tu mano va directo a ese compartimento aunque no sepas el nombre.
No importa que la palabra «gotera» nunca aparezca escrita en la tarjeta. Este método decide el compartimento por cuán cercano es el trabajo, no por las letras escritas.
2En detalle
Busca por significado, no por letras
La búsqueda antigua se fijaba en si las letras coincidían. Solo escribiendo «reparación de goteras» aparecía el documento que tenía esas letras. Un documento que describía lo mismo con «se filtra el agua» no compartía ni una letra y quedaba relegado.
La búsqueda semántica convierte la pregunta y el documento, cada uno, en un conjunto de números con el significado, y los compara entre sí. Documentos que dicen lo mismo con otras palabras, documentos con errores de tipeo, incluso documentos escritos en otro idioma, caen en el mismo compartimento.
También cambia el hecho de que puedas hacer una pregunta larga. Puedes escribir tal cual una frase como «la lavadora que compré el mes pasado solo hace ruido al desaguar», porque no cuenta la búsqueda dividiéndola en palabras sueltas.
La posición se calcula de antemano
Si hubiera que leer todos los documentos cada vez que se busca, sería demasiado lento. Por eso el lado de los documentos se convierte de antemano en conjuntos de números y se guarda así. Solo hace falta calcular una vez, cuando se agrega o se modifica un documento.
Cuando llega una búsqueda, lo único que se calcula en ese momento es la pregunta. Basta con elegir, entre lo que ya está guardado, los documentos cercanos a esa posición. También se usan métodos que, en vez de comparar con todos uno por uno, reducen rápido a los candidatos cercanos.
El valor calculado de antemano está emparejado con el modelo que lo convirtió. Si cambias ese modelo por uno nuevo, los valores guardados con el anterior ya no sirven y hay que recalcular todo de nuevo.
La cercanía se mide con la dirección
¿Cómo se decide cuán cerca están dos posiciones? El método más usado no mide la distancia, sino si apuntan hacia el mismo lado. Si las dos flechas son paralelas, están cerca; si apuntan a lados distintos, están lejos.
Hay una razón para descartar la longitud y mirar solo la dirección. Un texto corto y uno largo con el mismo contenido tienen flechas de distinta longitud. Si se cuenta la longitud tal cual, siempre suben los documentos largos. Mirando solo la dirección, sube lo que se parece en contenido, sin importar la longitud.
A este método se le llama similitud coseno. El orden que entrega la búsqueda semántica es, al final, el resultado de medir con esta regla.
Lo que hace bien y lo que hace mal
Buscar por significado no siempre gana. Que dos cosas se parezcan en significado no quiere decir que coincidan exactamente. En búsquedas donde una sola letra distinta ya es otra cosa —números de pieza, números de cuenta, nombres de personas—, la búsqueda por significado más bien se pierde.
También es débil con las condiciones negativas. «Fotos sin gatos» y «fotos de gatos» quedan con posiciones de significado muy cercanas, así que un resultado que es justo lo contrario aparece igual entre los primeros.
Las palabras nuevas o las abreviaturas que solo se usan dentro de una empresa también son difíciles. Si el modelo nunca vio esa palabra durante el entrenamiento, no queda claro en qué compartimento ponerla, y termina agrupada con vecinos equivocados.
Las dos búsquedas se ejecutan juntas
Por eso, en la práctica, no se usa solo una. Se ejecutan a la vez la búsqueda por letras y la búsqueda por significado, y se combinan los dos resultados para reordenarlos. Si escribes un número de pieza, la búsqueda por letras lo captura con precisión; si escribes la pregunta con tus propias palabras, la búsqueda por significado saca su fuerza.
Después de combinarlas, a veces se filtra una vez más: se toman solo las decenas de mejores candidatos y se vuelven a ordenar con un modelo más minucioso. Así se sube la precisión gastando mucho menos que revisar todo con cuidado desde el principio.
Esta búsqueda también va al frente de la estructura donde la IA busca material, lo lee y contesta. Si al principio se agarra el documento equivocado, por más bien que se lea después, la respuesta sale torcida.
3Con más precisión
Convertir un documento o una pregunta en un conjunto de números se llama embedding, y al almacén que guarda esos conjuntos y encuentra rápido los más cercanos se le llama base de datos vectorial. Para reducir los candidatos se usa un método aproximado que separa solo lo cercano, en vez de comparar con todo. Es un intercambio: se cede algo de precisión a cambio de mucha más velocidad.
Aquí la analogía cojea. Los compartimentos del fichero los dividió una persona y les puso nombre, pero la búsqueda semántica no tiene compartimentos con nombre. Lo único que hay son coordenadas y distancias, y lo que parece un compartimento es solo un grupo de cosas cercanas entre sí. Por eso es difícil explicar por qué subió un documento en concreto. La búsqueda por letras puede señalar qué palabra coincidió, pero la búsqueda por significado solo puede decir que los números quedaron cerca. Además, el fichero mete a una persona en un solo compartimento, pero un documento largo no cabe entero en una sola posición, así que se corta por párrafos y cada uno recibe su propia posición. Dónde se hace ese corte cambia bastante el resultado de la búsqueda.
4Pruébalo
- Semantris (asociación de palabras con IA) ailearn.space Escribe una palabra cercana en significado a la que aparece en pantalla y sube la puntuación. Notarás enseguida que funciona aunque no compartan ni una letra
- Kkomantle (el Wordle del significado) ailearn.space Te dice con un número cuán cerca está tu palabra de la respuesta. Compruebas que la distancia de significado se mide de verdad
5Malentendidos comunes
Es fácil pensar que la búsqueda semántica entiende la pregunta, pero en realidad solo mide cuán cerca están las posiciones de la pregunta y del documento.
Es fácil pensar que, por buscar por significado, siempre es mejor que la búsqueda por letras, pero en realidad se pierde más en búsquedas que deben coincidir exactamente, como números de pieza o nombres.
Es fácil pensar que, una vez cargado un documento, se mantiene actualizado solo, pero en realidad hay que recalcular el valor guardado cada vez que se modifica el documento o se cambia el modelo.
7Resumen en una línea
En resumenLa búsqueda semántica encuentra documentos cuya posición de significado queda cerca, en vez de documentos que solo comparten letras.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02