RAGRetrieval-Augmented Generation
Buscar material y tenerlo al lado antes de responder
- RAG (Retrieval-Augmented Generation, generación aumentada por recuperación) es buscar material relacionado antes de responder y pegarlo junto a la pregunta.
- No vuelve a entrenar al modelo. Con solo cambiar el material, hasta un documento de ayer se usa hoy en la respuesta.
- Se usa para contenido que el modelo no puede saber: reglamentos internos, avisos recientes, notas propias.
- Se puede mostrar qué material y qué parte se usó, lo que facilita la revisión de una persona.
- Si el material traído es el equivocado, la respuesta también sale mal. Cómo se parte y cómo se busca el material define el resultado.
Contenido
1La analogía
En la ventanilla del banco, si se pregunta "si cancelo esta cuenta, ¿qué pasa con los intereses?", el empleado no responde de memoria todo el reglamento. Primero busca en pantalla las condiciones de ese producto y el historial del cliente, y recién después orienta mirando lo que apareció.
Se puede armar el mismo orden cuando se le pregunta a una IA sobre el reglamento de una empresa o sobre un documento propio. En vez de dejar que responda directo apenas llega la pregunta, primero se busca en un montón de material el tramo relacionado con esa pregunta y se lo pega al lado de la pregunta. El modelo lee ese tramo que llegó pegado y escribe la respuesta. Esta forma, que le agrega adelante el paso de ir a buscar, es RAG (Retrieval-Augmented Generation, generación aumentada por recuperación).
Aunque cambie el empleado de la ventanilla, el reglamento que aparece en pantalla sigue igual. Si el reglamento se modifica, en vez de volver a capacitar al empleado, se cambia el documento de la pantalla. Que la respuesta siga al material con solo tocar del lado del material es la ventaja de esta forma.
2En detalle
Entre la pregunta y la respuesta se mete un paso
Normalmente, la IA, al recibir una pregunta, escribe la respuesta solo con lo que quedó incorporado durante el entrenamiento. Al sumarle RAG, entre medio se mete un paso de consulta. Al llegar la pregunta, primero se rastrea el montón de material, se sacan unos pocos tramos que parecen relacionados, y esos tramos se le entregan al modelo junto con la pregunta.
Para el modelo, es solo que la pregunta se alargó un poco: es como si delante de "si cancelo esta cuenta, ¿qué pasa con los intereses?" se hubiera pegado "responde consultando el siguiente material" junto con unos párrafos del reglamento. Por eso no hace falta volver a entrenar al modelo.
Como se sabe qué tramo se miró al armar la respuesta, también se le puede agregar la fuente al final. Que una persona pueda abrir el original y comprobarlo es especialmente importante en el trabajo.
Se parte el material en piezas chicas y se busca
Pegar un documento entero es como amontonar un fajo de papeles frente a la ventanilla. Por eso el material se parte de antemano en trozos del tamaño de un párrafo. Al llegar la pregunta, se eligen solo unos pocos de esos trozos y se pegan.
Para elegir se mezclan dos caminos: uno busca trozos donde se repite exactamente la misma palabra, y el otro busca trozos con un significado cercano. Buscando por significado, si se pregunta por "cancelación", también aparece un tramo que dice "pago anticipado". Usar los dos caminos juntos reduce lo que se termina pasando por alto.
Dónde se corta cada trozo también sacude mucho la calidad de la respuesta. Si se corta justo en el medio de una tabla, queda un trozo con solo números sueltos, y si se corta demasiado grande, se arrastran frases que no vienen al caso.
No hace falta cambiar el modelo
Otra forma de meterle el mismo contenido al modelo es el ajuste fino. Sería como volver a capacitar al empleado de la ventanilla: lleva tiempo y costo, y hay que repetirlo cada vez que cambia el reglamento.
RAG, en vez de capacitar, cambia la pantalla. Un aviso que se subió hoy se refleja de inmediato en la respuesta, y un documento equivocado se borra y listo. También se puede manejar, del lado del material, quién puede ver qué documento.
Por eso, para conocimiento que cambia seguido, conviene RAG, y para algo que tiene que quedar incorporado, como el tono o el formato de salida, conviene el ajuste fino. Muchos lugares usan las dos cosas juntas.
Los puntos donde suele fallar
El problema más común es traer el trozo equivocado. Si en pantalla aparece el reglamento de otro cliente, por más prolijo que sea el empleado, la orientación va a estar mal. Esto pasa cuando el material no está bien ordenado o hay versiones parecidas mezcladas.
Traer demasiado también es un problema. Hay un límite de cuánto se puede ver de una vez, y si se mezclan tramos que no vienen al caso, la frase importante queda tapada: tres o cuatro trozos bien elegidos funcionan mejor que veinte elegidos a las apuradas.
También pasa que el material traído no tiene la respuesta. Si en ese caso no se le hizo decir "no está en el material", el modelo llena el vacío con lo que ya sabía. Parece una respuesta escrita mirando el material, pero no lo es.
Hace pareja con la fundamentación
RAG es la forma de ir a buscar el material, y la fundamentación es la tarea de atar cada frase de la respuesta a ese material. En la ventanilla, mostrar el reglamento en pantalla es RAG, y que lo que dice el empleado no se salga de esa frase es la fundamentación.
Si, con el material al lado, se agrega una frase con una suposición propia, la fundamentación se rompió: traer bien el material y hacer que se hable solo dentro de ese rango son dos tareas que hay que cuidar por separado.
3Con más precisión
RAG es una estructura que une un buscador con un generador. El documento se parte en trozos, se convierte cada uno en un bloque de números que guarda su significado y se almacena así, y la pregunta también se convierte de la misma forma para sacar los trozos más cercanos. Los trozos que se sacan se insertan en el prompt, y el resto sigue el mismo proceso de generación de siempre. Los pesos del modelo no cambian en absoluto: lo único que cambia es la entrada.
También hay puntos donde la analogía no encaja. El empleado de la ventanilla sabe qué es lo que no sabe y por eso abre la pantalla; en esta forma, en cambio, la consulta se dispara casi siempre de manera automática con cada pregunta. Se arrastran trozos hasta en preguntas que ni necesitaban material, y al revés, cuando una pregunta sí necesita material y la búsqueda falla, el modelo igual arma la respuesta solo con los trozos que tiene en la mano. Es como un empleado que no duda de lo que aparece en pantalla, así que la calidad de la búsqueda se convierte en la calidad de la respuesta. Por eso, en la práctica, antes de retocar la respuesta se revisa primero el paso de búsqueda.
4Pruébalo
- NotebookLM (notas con IA sobre tu propio material) ailearn.space Sube tus documentos y, al preguntar, cada respuesta marca en qué material y en qué parte se basó
- ChatPDF (conversar con un PDF) ailearn.space Sube un PDF y pregúntale algo; verás de un vistazo cómo busca el material y arma la respuesta con eso
5Malentendidos comunes
Es fácil pensar que sumar RAG hace desaparecer las alucinaciones, pero en realidad, si se trae un material equivocado, sale una respuesta errónea pero convincente, incluso con fuente pegada.
Es fácil creer que RAG le enseña conocimiento nuevo al modelo, pero en realidad el modelo sigue igual, y solo se le pone material al lado en el momento de responder.
Es fácil pensar que cuantos más documentos se metan, mejor, pero en realidad, cuanto más se acumula material desordenado, más sube la probabilidad de que se traiga un trozo equivocado.
7Resumen en una línea
En resumenRAG es, como un empleado de ventanilla que en vez de recitar de memoria muestra el reglamento en pantalla y orienta con eso, la forma de buscar el material relacionado y tenerlo al lado antes de responder.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02