RECURSOS DE INTELIGENCIA ARTIFICIAL
RAG: conceptos
Comprende cómo RAG combina recuperación de información y modelos generativos para incorporar contexto externo antes de generar una respuesta.
FUNDAMENTOS
Qué es RAG
RAG corresponde a Retrieval-Augmented Generation, que puede traducirse como generación aumentada mediante recuperación de información.
Su idea fundamental consiste en recuperar información relevante desde una fuente externa y proporcionar esa información al modelo generativo como parte del contexto utilizado para elaborar una respuesta.
Consulta
↓
Recuperación de información
↓
Contexto relevante
↓
Modelo generativo
↓
RespuestaDe esta forma, la generación no depende únicamente de la información representada en los parámetros del modelo. El sistema puede aportar información adicional en el momento de realizar la consulta.
OBJETIVO
Por qué utilizar RAG
Un modelo de lenguaje no contiene necesariamente toda la información que necesita una aplicación.
Puede ser necesario trabajar con:
- documentación interna;
- manuales técnicos;
- bases de conocimiento;
- normativas;
- catálogos;
- procedimientos;
- información actualizada;
- documentos específicos de una organización.
RAG permite recuperar información desde esas fuentes cuando se realiza una consulta y utilizarla como contexto para la generación.
Información externa
↓
Recuperación
↓
Contexto
↓
Modelo
↓
RespuestaDIFERENCIAS
RAG no es volver a entrenar el modelo
Incorporar documentos mediante RAG no significa necesariamente modificar los parámetros del modelo.
En un sistema RAG, la información se recupera normalmente durante la interacción y se incorpora al contexto que recibe el modelo.
RAG Documentos
↓
Recuperación
↓
Contexto
↓
Modelo ya entrenadoEsto es diferente del entrenamiento o del ajuste de un modelo, donde se modifican parámetros mediante un proceso de aprendizaje.
La distinción es importante: actualizar una colección documental puede permitir que un sistema RAG utilice nueva información sin necesidad de volver a entrenar el modelo generativo.
ARQUITECTURA
Componentes básicos
Una arquitectura RAG puede contener diferentes componentes según el caso de uso. Conceptualmente podemos distinguir:
- fuentes de información;
- preparación de documentos;
- representación e indexación;
- mecanismo de recuperación;
- construcción del contexto;
- modelo generativo;
- evaluación de la respuesta.
Fuentes
↓
Preparación
↓
Índice
↓
Recuperación
↓
Contexto
↓
Modelo
↓
RespuestaNo todas las implementaciones utilizan exactamente los mismos componentes ni las mismas técnicas.
RECUPERACIÓN
Recuperación de información
La recuperación consiste en localizar información potencialmente relevante para una consulta dentro de una colección.
La colección puede contener documentos, fragmentos de texto, registros u otros tipos de información preparados para ser consultados.
Consulta
↓
Sistema de recuperación
↓
Colección
↓
Resultados relevantesLa calidad de esta fase es fundamental. Si el sistema no recupera la información necesaria, el modelo no podrá utilizarla simplemente porque exista en la colección.
FUENTES
Fuentes de información
Antes de diseñar la recuperación es necesario identificar qué fuentes contienen la información que debe utilizar el sistema.
Por ejemplo:
- documentos PDF;
- páginas internas;
- manuales;
- bases de conocimiento;
- preguntas frecuentes;
- documentación técnica;
- registros estructurados.
La procedencia, calidad, actualización y permisos de acceso de esas fuentes forman parte del diseño del sistema.
PREPARACIÓN
Preparación de documentos
Los documentos originales pueden necesitar procesamiento antes de incorporarse a un sistema de recuperación.
Entre las tareas posibles se encuentran:
- extraer el contenido;
- eliminar elementos irrelevantes;
- preservar información estructural útil;
- normalizar determinados formatos;
- añadir metadatos;
- dividir el contenido en fragmentos.
Documento
↓
Extracción
↓
Preparación
↓
Fragmentación
↓
IndexaciónUna mala preparación puede afectar a todas las fases posteriores.
FRAGMENTACIÓN
Documentos y fragmentos
En lugar de recuperar siempre documentos completos, es habitual dividirlos en unidades más pequeñas o chunks.
Documento
↓
Fragmento 1
↓
Fragmento 2
↓
Fragmento 3El objetivo es crear unidades suficientemente pequeñas para facilitar una recuperación precisa, pero suficientemente completas para conservar el significado necesario.
El tamaño adecuado depende del tipo de contenido, de su estructura y de la tarea. No existe un tamaño universal válido para todos los sistemas RAG.
FRAGMENTACIÓN
Solapamiento entre fragmentos
Cuando un documento se divide, una idea relevante puede quedar situada justo en el límite entre dos fragmentos.
Una estrategia posible consiste en introducir cierto solapamiento entre fragmentos consecutivos.
Fragmento A
↓
Parte compartida
↓
Fragmento BEl solapamiento puede ayudar a conservar contexto, pero también aumenta la cantidad de información almacenada y puede producir resultados redundantes.
Su utilidad debe evaluarse en relación con los documentos y las consultas reales.
ORGANIZACIÓN
Metadatos
Los fragmentos pueden almacenarse junto con información adicional que describa su procedencia o características.
Algunos ejemplos de metadatos son:
- documento de origen;
- título;
- sección;
- fecha;
- categoría;
- idioma;
- permisos de acceso.
Los metadatos pueden utilizarse para filtrar resultados, conservar la trazabilidad o aplicar restricciones durante la recuperación.
REPRESENTACIÓN
Embeddings
Un embedding es una representación numérica de un elemento, como un texto, en un espacio vectorial.
En sistemas de recuperación semántica, los embeddings permiten representar consultas y fragmentos para comparar sus relaciones en ese espacio.
Texto
↓
Modelo de embeddings
↓
Vector numéricoDos textos no necesitan contener exactamente las mismas palabras para obtener representaciones relacionadas.
Sin embargo, un embedding no debe interpretarse como una comprensión perfecta del significado. La calidad de la representación depende del modelo utilizado y del tipo de contenido.
INDEXACIÓN
Índice vectorial
Una vez calculadas las representaciones vectoriales de los fragmentos, pueden almacenarse en una estructura preparada para realizar búsquedas por similitud.
Fragmentos
↓
Embeddings
↓
Índice
↓
BúsquedaDependiendo de la arquitectura, esta función puede realizarse mediante una base de datos vectorial, un motor de búsqueda u otra tecnología que permita trabajar con representaciones vectoriales.
RAG no obliga a utilizar un producto concreto ni una única tecnología de almacenamiento.
BÚSQUEDA
Búsqueda semántica
En una búsqueda semántica, la consulta se representa de forma que pueda compararse con las representaciones de los documentos o fragmentos almacenados.
Consulta
↓
Embedding de consulta
↓
Comparación
↓
Fragmentos relacionadosEste enfoque permite recuperar contenido relacionado conceptualmente, incluso cuando la consulta y el documento no utilizan exactamente las mismas palabras.
La similitud semántica no garantiza por sí sola que el resultado sea correcto o suficiente para responder a la consulta.
RECUPERACIÓN
Búsqueda semántica y búsqueda por términos
La recuperación no tiene por qué depender exclusivamente de embeddings.
Las búsquedas basadas en palabras o términos pueden resultar muy útiles cuando la consulta contiene elementos exactos como:
- identificadores;
- códigos;
- nombres de productos;
- versiones;
- referencias técnicas;
- expresiones específicas.
Algunos sistemas combinan diferentes métodos de recuperación para aprovechar las ventajas de cada enfoque.
ESTRATEGIA
Recuperación híbrida
Una estrategia híbrida combina más de un método de búsqueda, por ejemplo recuperación basada en términos y recuperación semántica.
Consulta
↓
Búsqueda por términos
+
Búsqueda semántica
↓
Resultados combinadosEste enfoque puede resultar útil cuando las consultas contienen tanto conceptos generales como términos que deben coincidir con precisión.
La conveniencia de utilizar recuperación híbrida debe comprobarse con las consultas y documentos reales del sistema.
SELECCIÓN
Selección de resultados
Un sistema de recuperación puede encontrar numerosos fragmentos relacionados con una consulta. No todos tienen por qué incorporarse al contexto del modelo.
Resultados candidatos
↓
Selección
↓
Fragmentos relevantes
↓
ContextoEl número de resultados, los criterios de similitud, los filtros y otras reglas influyen en qué información llega finalmente al modelo.
Recuperar demasiada información irrelevante puede ser tan problemático como recuperar demasiado poca.
ORDENACIÓN
Reordenación de resultados
Algunas arquitecturas incorporan una segunda fase para volver a evaluar los resultados recuperados y ordenar primero los fragmentos que parecen más relevantes.
Recuperación inicial
↓
Resultados candidatos
↓
Reordenación
↓
Resultados seleccionadosEsta técnica suele denominarse reranking. No es un componente obligatorio de RAG, pero puede utilizarse para mejorar la selección antes de construir el contexto.
CONTROL
Filtros y permisos
No toda la información almacenada debe estar necesariamente disponible para cualquier usuario o consulta.
Los metadatos y los controles de acceso pueden utilizarse para limitar qué documentos participan en una búsqueda.
Usuario
↓
Permisos
↓
Colección autorizada
↓
RecuperaciónEl control de acceso debe aplicarse en la arquitectura del sistema. No debería depender únicamente de pedir al modelo que no muestre determinada información.
CONTEXTO
Incorporar la información al contexto
Después de recuperar los fragmentos relevantes, el sistema construye la información que proporcionará al modelo generativo.
Consulta
+
Fragmentos recuperados
+
Instrucciones
↓
Contexto
↓
ModeloLas instrucciones pueden indicar al modelo cómo debe utilizar los fragmentos, qué formato debe seguir o qué hacer cuando la información recuperada no sea suficiente.
La cantidad de información incorporada también está condicionada por los límites de contexto del modelo utilizado.
GENERACIÓN
Generación de la respuesta
El modelo recibe la consulta junto con el contexto preparado por el sistema y genera una respuesta.
Consulta
↓
Recuperación
↓
Contexto
↓
Modelo generativo
↓
RespuestaEl objetivo es que la respuesta se apoye en la información recuperada cuando esta sea relevante para la tarea.
Sin embargo, proporcionar documentos al modelo no garantiza que los utilice correctamente ni que todas las afirmaciones generadas estén respaldadas por ellos.
TRAZABILIDAD
Fuentes y trazabilidad
Una aplicación RAG puede conservar información sobre la procedencia de los fragmentos recuperados y utilizarla para mostrar las fuentes relacionadas con una respuesta.
Fragmento
↓
Documento de origen
↓
Metadatos
↓
ReferenciaMostrar referencias puede facilitar la comprobación de la información, pero una cita no garantiza automáticamente que la afirmación generada esté realmente respaldada por esa fuente.
Cuando la precisión sea importante, debe comprobarse que existe una relación real entre la afirmación y el contenido citado.
MANTENIMIENTO
Actualizar la información
Una de las ventajas prácticas de separar la información documental de los parámetros del modelo es que la colección puede actualizarse de forma independiente.
Documento actualizado
↓
Procesamiento
↓
Índice actualizado
↓
Nueva recuperaciónEsto puede facilitar el trabajo con información que cambia con mayor frecuencia que el modelo generativo.
El sistema debe definir cómo detectar documentos nuevos, modificados o eliminados para mantener coherente el índice utilizado durante la recuperación.
EVALUACIÓN
Evaluar la recuperación
Para evaluar un sistema RAG conviene analizar por separado si la recuperación está encontrando la información necesaria.
Algunas preguntas útiles son:
- ¿el documento relevante existe en la colección?
- ¿el contenido se ha fragmentado adecuadamente?
- ¿la consulta recupera el fragmento necesario?
- ¿los resultados irrelevantes desplazan información útil?
- ¿los filtros permiten acceder a las fuentes correctas?
Consulta
↓
Resultados recuperados
↓
¿Contienen la información necesaria?
↓
EvaluaciónSi la información correcta nunca llega al contexto, modificar únicamente el prompt del modelo puede no resolver el problema.
EVALUACIÓN
Evaluar la generación
También debe evaluarse qué hace el modelo con la información recuperada.
Podemos comprobar:
- si responde a la pregunta;
- si utiliza correctamente el contexto;
- si omite información relevante;
- si añade afirmaciones no respaldadas;
- si respeta el formato esperado;
- si reconoce cuándo el contexto es insuficiente.
Contexto correcto
↓
Generación
↓
Respuesta
↓
¿Está fundamentada?
↓
EvaluaciónRecuperación y generación son problemas relacionados, pero conviene diagnosticarlos por separado.
DIAGNÓSTICO
Dónde puede fallar un sistema RAG
Un resultado incorrecto puede tener distintos orígenes.
Fuente incorrecta
↓
Preparación incorrecta
↓
Recuperación incorrecta
↓
Contexto insuficiente
↓
Generación incorrectaPor ejemplo, el problema puede encontrarse en:
- documentos desactualizados;
- fragmentación deficiente;
- metadatos incorrectos;
- recuperación poco relevante;
- filtros inadecuados;
- demasiado contexto irrelevante;
- instrucciones poco claras;
- una respuesta generada que no respeta las fuentes.
Identificar la fase donde aparece el problema permite realizar ajustes más precisos.
LIMITACIONES
Limitaciones de RAG
RAG puede mejorar el acceso del modelo a información relevante, pero no elimina las limitaciones de los sistemas generativos.
- la colección puede contener información incorrecta o desactualizada;
- la recuperación puede no encontrar el contenido necesario;
- pueden recuperarse fragmentos irrelevantes;
- una fragmentación deficiente puede separar información relacionada;
- el contexto disponible es limitado;
- el modelo puede interpretar incorrectamente el contenido;
- la respuesta puede incluir afirmaciones no respaldadas;
- las fuentes pueden contener contenido no confiable.
Por ello, RAG debe evaluarse como un sistema completo y no únicamente como una conexión entre una base de datos y un modelo de lenguaje.
SEGURIDAD
Documentos no confiables
Los documentos recuperados pueden proceder de fuentes que contienen información incorrecta, manipulada o incluso instrucciones diseñadas para alterar el comportamiento de una aplicación basada en modelos de lenguaje.
El contenido documental debe tratarse como datos y no asumirse automáticamente como una instrucción confiable.
Documento externo
↓
Contenido no confiable
↓
Controles de la aplicación
↓
Contexto
↓
ModeloLos permisos, la validación de fuentes y los controles sobre acciones sensibles deben implementarse fuera del modelo cuando corresponda.
DATOS
Privacidad y control de acceso
Una colección utilizada por RAG puede contener información con distintos niveles de sensibilidad.
Antes de recuperar un fragmento deben considerarse aspectos como:
- quién realiza la consulta;
- qué documentos puede consultar;
- qué información puede enviarse al modelo;
- qué información puede mostrarse en la respuesta;
- qué registros deben conservarse.
Recuperar un documento técnicamente relevante no significa que el usuario esté autorizado a acceder a su contenido.
EJEMPLO
Ejemplo conceptual
Imaginemos una aplicación que responde preguntas sobre la documentación técnica interna de una organización.
Un usuario pregunta:
¿Cómo debo solicitar acceso al entorno de pruebas?El sistema puede realizar el siguiente proceso:
Pregunta
↓
Búsqueda en documentación autorizada
↓
Recuperación del procedimiento relevante
↓
Contexto para el modelo
↓
Generación de la respuesta
↓
Referencia al documentoSi el procedimiento cambia, la organización puede actualizar el documento y su índice sin que ese cambio implique necesariamente volver a entrenar el modelo generativo.
Para que el sistema sea fiable, también debe comprobarse que recupera la versión correcta del procedimiento y que el modelo responde de acuerdo con ella.
ERRORES FRECUENTES
Confusiones que conviene evitar
- confundir RAG con entrenamiento o ajuste del modelo;
- asumir que RAG requiere obligatoriamente una tecnología concreta;
- considerar que embeddings y búsqueda semántica son exactamente lo mismo;
- utilizar un tamaño de fragmento fijo como regla universal;
- recuperar demasiada información sin comprobar su relevancia;
- pensar que si un documento existe en la colección será recuperado automáticamente;
- intentar corregir con el prompt un problema que realmente pertenece a la recuperación;
- asumir que proporcionar la fuente elimina las alucinaciones;
- considerar que una cita garantiza que una afirmación está respaldada;
- ignorar permisos y controles de acceso durante la recuperación;
- evaluar únicamente la respuesta final sin analizar qué información fue recuperada.
VISIÓN GENERAL
Flujo completo de un sistema RAG
El funcionamiento conceptual puede dividirse en una fase de preparación y una fase de consulta.
Durante la preparación:
Documentos
↓
Procesamiento
↓
Fragmentación
↓
Representación
↓
IndexaciónDurante una consulta:
Pregunta
↓
Recuperación
↓
Selección de contexto
↓
Modelo generativo
↓
Respuesta
↓
VerificaciónLa calidad final depende del funcionamiento conjunto de ambas fases.
RESUMEN
Ideas fundamentales
- RAG combina recuperación de información y generación.
- La información recuperada se incorpora al contexto del modelo.
- RAG no implica necesariamente modificar los parámetros del modelo.
- Los documentos suelen prepararse y dividirse antes de indexarlos.
- No existe un tamaño de fragmento universalmente correcto.
- Los embeddings permiten representar contenido mediante vectores.
- La recuperación puede utilizar búsqueda semántica, términos u otros mecanismos.
- Diferentes métodos pueden combinarse mediante recuperación híbrida.
- Recuperar más contenido no significa necesariamente recuperar mejor.
- Los metadatos pueden facilitar filtros, trazabilidad y control de acceso.
- La recuperación y la generación deben evaluarse por separado.
- RAG no elimina automáticamente las respuestas incorrectas o no fundamentadas.
- Los permisos deben aplicarse antes de proporcionar información sensible al modelo.
- Un sistema RAG necesita mantenimiento y evaluación continua.
SIGUE APRENDIENDO
Recursos relacionados
Esta ficha se relaciona directamente con el resto de recursos de Inteligencia Artificial:
- Fundamentos de inteligencia artificial — conceptos generales sobre datos, modelos, entrenamiento e inferencia.
- Machine learning: conceptos — aprendizaje, modelos, evaluación y generalización.
- IA generativa y LLM — modelos de lenguaje, tokens, contexto e inferencia.
- Prompt engineering — instrucciones, contexto, restricciones y evaluación de respuestas.
PARA AMPLIAR
Documentación de referencia
Documentación técnica para ampliar los conceptos de esta ficha.