Mejorar los modelos de IA con RAG (generación aumentada por recuperación)

Bien diseñadas, las canalizaciones de generación aumentada por recuperación (RAG) pueden ayudar a las organizaciones a convertir sus datos inactivos en motores decisivos para la actividad empresarial.

Objetivos de aprendizaje

Después de leer este artículo podrás:

  • Definir la generación aumentada por recuperación (RAG)
  • Crear canalizaciones RAG con éxito
  • Identificar las mejores estrategias para medir el éxito de una canalización RAG

Copiar enlace del artículo

¿Qué es la generación aumentada por recuperación (RAG) y por qué es útil?

La generación aumentada por recuperación (RAG) es una técnica utilizada en el desarrollo de la inteligencia artificial (IA) que mejora los modelos de lenguaje de gran tamaño (LLM), ya que les proporciona acceso a fuentes de datos internas y externas que no se incluyeron en su entrenamiento original (por ejemplo, investigaciones de terceros, documentación de productos o la base de conocimiento interna de una empresa).

Mediante RAG, los equipos pueden consultar los conocimientos autorizados de la organización y los recursos de terceros en lenguaje natural, y evitar así interrumpir a otros compañeros o tener que realizar búsquedas prolongadas en sistemas fragmentados.

Dado que el LLM utiliza los datos complementarios en tiempo de ejecución, las alucinaciones son menos probables y todo el mundo trabaja con la misma fuente de información. El resultado es una mayor precisión de los LLM gracias a una información fiable y fundamentada.

¿Cuáles son los pasos necesarios para crear canalizaciones RAG con éxito?

RAG ayuda a las empresas a mejorar los modelos de IA que utilizan (de proveedores como OpenAI o Anthropic) sin el tiempo, el gasto y los recursos técnicos adicionales necesarios para volver a entrenarlos con conocimientos específicos para el caso de uso previsto. Por lo tanto, RAG democratiza la mejora de los LLM.

Afortunadamente, la creación de canalizaciones RAG no requiere una infraestructura enorme ni conocimientos de deep learning. Por lo tanto, empezar es fácil. El sencillo proceso, que consta de tres partes, comienza con la identificación de los casos de uso, la selección de las fuentes de datos adecuadas y la creación de la canalización RAG.

Paso 1: Idear posibles casos de uso de RAG

En primer lugar, determina qué fuentes de datos serían más útiles para que los equipos accedan a ellas mediante el uso de instrucciones en lenguaje natural. Céntrate en los puntos de fricción de gran impacto, como los recursos que los equipos consultan habitualmente para obtener respuestas, los sistemas donde suelen encontrarse cuellos de botella, o los procesos donde surgen una y otra vez las mismas preguntas.

Para encontrar los casos de uso de RAG más prometedores, plantea a tus equipos internos las siguientes preguntas:

     
  • ¿Cuáles son las solicitudes más habituales de conocimiento institucional que se encuentra en la mente de las personas o en documentos escritos de difícil acceso? Algunos ejemplos son los procedimientos operativos estándar y la forma de resolver los problemas más habituales. Con la ayuda de RAG, un asistente de facturación de autoservicio podría responder a preguntas habituales de los usuarios, por ejemplo: "¿Dónde puedo descargar mis facturas anteriores?".
  •  
  • ¿Qué preguntas se escalan con frecuencia entre los equipos? Las consultas sobre nuevas políticas técnicas, por ejemplo, probablemente surgen a menudo. Mediante RAG, un asistente de políticas de atención al cliente puede explicar la política de reembolso de una empresa.
  •  
  • ¿Qué archivos o tareas requieren consultas manuales y repetitivas en varios lugares, como Confluence, SharePoint y wikis internos? Un asistente de cumplimiento habilitado para RAG podría extraer información de las directrices de RR. HH. para responder a preguntas como: "¿Qué módulos de formación se requieren para los nuevos empleados en Europa?".
  •  
  • ¿Qué necesidades o requisitos formales deben cumplirse? Algunos casos de uso habituales son la respuesta a auditorías, a solicitudes de propuestas (RFP) y en relación con el cumplimiento normativo. Gracias a RAG, un asistente de RFP de ventas puede utilizar plantillas aprobadas por el departamento de cumplimiento para generar respuestas a las RFP.
  •  
  • ¿Qué información se aplica a todos los usuarios? Por ejemplo, los documentos de formación e incorporación de la empresa son útiles de forma global. Una guía interactiva para la incorporación de clientes podría utilizar RAG para guiar a los nuevos usuarios a través de los pasos de formación, recuperando los materiales prácticos más recientes.

Prioriza los casos de uso de RAG en los que la combinación del razonamiento generativo con el conocimiento interno y externo pueda resolver problemas tangibles, reducir el cambio de contexto, eliminar las tareas repetitivas y mejorar la coherencia entre los equipos.

Paso 2: Identificar internamente las fuentes de datos relevantes para RAG

La solidez de los sistemas RAG depende de las características de los datos que recuperan. Por lo tanto, la calidad, la integridad, la gobernanza y la estructura de las fuentes de datos disponibles afectan directamente a la calidad de la respuesta.

Los datos aptos para RAG cumplen los siguientes requisitos:

     
  • Responden a preguntas habituales: algunas fuentes idóneas son las preguntas frecuentes sobre productos, la documentación de políticas, las guías de procesos internos y el mapa de la conformidad.
  •  
  • Son precisos y se mantienen actualizados: busca documentos sobre los que no haya dudas acerca de quién es su propietario y que se actualicen periódicamente.
  •  
  • Tienen una estructura suficiente para la fragmentación: los archivos Markdown, los PDF, los documentos HTML, los archivos JSON y los wikis se pueden dividir en secciones lógicas. Si los conjuntos de datos incluyen capturas de pantalla o archivos PDF basados en imágenes, herramientas como Cloudflare Workers AI pueden convertir las imágenes en vectores que los LLM pueden leer.

Evita las fuentes de datos que añadan ruido o incoherencias. Esto incluye:

     
  • Datos en formatos no estructurados y desordenados, por ejemplo, hilos de Slack o cadenas de correo electrónico sin procesar, a menos que se hayan limpiado, verificado y formateado.
  •  
  • Conjuntos de datos dinámicos y en constante cambio, como los paneles de control que incluyen métricas en tiempo real.
  •  
  • Archivos duplicados, en conflicto u obsoletos, que pueden causar confusión durante la recuperación y añadir errores.

Colabora con las partes interesadas internas y el equipo de informática para inventariar, eliminar los duplicados y asignar un propietario permanente a cada fuente de datos.

Paso 3: Crear una canalización RAG

A continuación, procesa y organiza los conjuntos de datos en una estructura que sea adecuada para la recuperación semántica. Un flujo de trabajo RAG típico incluye cinco partes: la ingesta, la incrustación, el almacenamiento en una base de datos vectorial, la recuperación de consultas y la generación de respuestas.

1. Ingesta

Comienza recopilando los archivos y documentos relevantes de los repositorios, los grupos de almacenamiento o los sistemas de contenido compartidos. A continuación, céntrate en las tareas siguientes:

  • Fragmentación: para una recuperación precisa, divide el contenido mediante programación en secciones lógicas que creen unidades semánticamente coherentes (p. ej., párrafos, encabezados, preguntas frecuentes y bloques de código).
  • Normalización: limpia y estandariza los datos en todos los formatos (p. ej., de PDF a texto, de HTML a Markdown).
  •  
  • Etiquetado de los metadatos: añade metadatos útiles (p. ej., propietario, fecha de creación, sistema) para facilitar la recuperación filtrada.

2. Incrustación

Utiliza un modelo de incrustación, como los modelos de incrustación BGE, para convertir cada fragmento de texto en un vector numérico que capture su significado semántico.

3. Almacenamiento en una base de datos vectorial

Almacena las incrustaciones y todos los metadatos asociados en una base de datos vectorial escalable, como Cloudflare Vectorize. Esto permite las consultas y el filtrado eficientes para bases de conocimiento a gran escala.

4. Recuperación de consultas

Cuando un usuario envía una instrucción, el sistema: convierte la consulta en un vector, busca en la base de datos vectorial fragmentos apropiados y similares semánticamente, y aplica filtros basados en metadatos para ajustar la recuperación (por ejemplo, limitando el acceso a información específica en función del rol o el departamento).

5. Generación de respuestas

Por último, los fragmentos recuperados se inyectan en las instrucciones como contexto adicional antes de pasarlos al LLM. El LLM utiliza este contexto para generar una respuesta significativa y precisa que se basa en datos internos y externos.

¿Deberías colaborar con el equipo de informática en la ejecución e implementación de RAG?

Poner en marcha una canalización RAG útil requiere un esfuerzo conjunto. Sin embargo, estas tareas dependen del equipo de informática: liderar la ejecución, gestionar las infraestructuras como las canalizaciones de datos, escalar la base de datos vectorial, controlar el acceso e integrar los sistemas.

Aun así, el departamento de informática no puede gestionar el proceso en solitario. Comienza por formar equipos interdisciplinares, que incluyan, por ejemplo, miembros de TI, expertos en la materia y las partes interesadas de la empresa. En conjunto, estos equipos deben identificar los casos de uso y las fuentes de datos fiables, definir los estándares de la autoridad de contenido y asignar la propiedad para garantizar la precisión y la vigencia de los conjuntos de datos.

Aplica controles de acceso para restringir los datos confidenciales según la función del usuario o la unidad de negocio, y asegúrate de que se implementan medidas de protección de encriptación y cumplimiento en todo el sistema.

Comienza la implementación con un programa piloto, itera según los resultados y, a continuación, amplíala a los equipos.

¿Cuál es la mejor manera de medir el éxito de tu canalización RAG?

Incorpora métricas de éxito desde el principio del proceso a fin de evaluar la eficacia y el valor empresarial del sistema RAG.

En concreto, evalúa el sistema con respecto a indicadores clave de rendimiento (KPI) como:

  • Precisión de la recuperación: ¿se muestran los documentos y las respuestas correctos?
  •  
  • Relevancia y veracidad de las respuestas: ¿los usuarios reciben respuestas actualizadas y fiables?
  •  
  • Latencia: ¿se entregan las respuestas en un plazo aceptable?
  •  
  • Adopción y satisfacción de los usuarios: ¿los usuarios utilizan realmente el sistema y mejoran su eficiencia?
  •  
  • Gobernanza de datos: ¿se mantienen las medidas de seguridad y de cumplimiento cuando se agregan nuevas fuentes de datos?

La evaluación de RAG suele requerir un proceso de validación que incluya usuarios humanos a fin de verificar la precisión. Para mejorar la implementación de la canalización RAG a lo largo del tiempo, solicita continuamente comentarios a los usuarios, analiza las métricas de rendimiento en los registros de consulta y de recuperación, revisa la higiene del contenido y evalúa el progreso con respecto a los objetivos empresariales.

¿Cómo puedes simplificar la creación de flujos de trabajo RAG?

La creación manual de una canalización RAG requiere integrar el almacenamiento, las bases de datos vectoriales, los modelos de incrustación, los LLM y la lógica personalizada de indexación/recuperación, así como mantener el sistema a medida que los datos cambien. Se necesita tiempo y colaboración, y la complejidad de estas tareas puede desviar a los equipos de otros proyectos de gran impacto. Por ello, la adopción de RAG es inviable para algunas organizaciones, a pesar de sus posibles ventajas.

Cloudflare AI Search (anteriormente AutoRAG) puede facilitar esta iniciativa.

AI Search es una canalización RAG totalmente gestionada creada en la plataforma para desarrolladores de Cloudflare. En solo cuatro pasos, los usuarios pueden conectar fuentes de datos, como sitios web corporativos, catálogos de productos de comercio electrónico y documentación para desarrolladores. AI Search gestiona la ingesta, la conversión de Markdown, la fragmentación, la incrustación y el almacenamiento en Vectorize. A continuación, realiza la recuperación semántica y genera respuestas con Workers AI.

AI Search elimina la pesada carga a nivel de infraestructura que implica la creación de canalizaciones RAG, ya que automatiza la escala, el almacenamiento y la inferencia de IA, al mismo tiempo que garantiza un acceso seguro y adecuado a las fuentes de datos internas dentro de los sistemas RAG. Además, AI Search reindexa continuamente los datos en segundo plano, y garantiza la vigencia de las respuestas a medida que se actualizan las fuentes internas.

¿Por qué deberías utilizar RAG?

Los datos de tu organización son un activo estratégico formidable. La creación de una canalización RAG segura permite que los miembros de tu equipo y tus clientes accedan a estos datos. Esto mejora los LLM corporativos con las directrices, los procesos y la base de conocimiento exclusivos que diferencian a tu empresa y a tu mercado.

En pocas palabras: RAG mejora los modelos más utilizados al incorporar el conocimiento interno de la empresa y recursos aprobados de terceros, para que te beneficies de la ventaja que ofrece la IA en tiempo real.

Tanto si utilizas un proceso de creación manual o AI Search, comienza con los casos de uso adecuados, selecciona datos de alta calidad y colabora para ofrecer respuestas rápidas, precisas y fundamentadas.

¿Todo listo para empezar? Crea tu propio RAG interno en cuatro sencillos pasos.

Preguntas frecuentes

¿Qué es la generación aumentada por recuperación (RAG)?

La generación aumentada por recuperación (RAG) es un método para mejorar los modelos lingüísticos de gran tamaño (LLM), ya que les proporciona acceso a fuentes de datos internas y externas que no formaban parte de su entrenamiento original.

¿Cuáles son las principales ventajas que ofrece la utilización de RAG?

RAG permite a los equipos consultar el conocimiento de la organización y recursos de terceros utilizando lenguaje natural. Esto evita las interrupciones a otros compañeros y reduce el tiempo dedicado a las búsquedas manuales. También democratiza la mejora de los modelos de IA de proveedores como OpenAI o Anthropic, sin necesidad del tiempo, el gasto o los recursos técnicos necesarios para un nuevo entrenamiento completo.

¿Cuáles son los pasos para crear una canalización RAG?

Los pasos para crear una canalización RAG son: idear los posibles casos de uso, identificar las fuentes de datos adecuadas y crear la propia canalización RAG. La creación de esta canalización implica las tareas siguientes: la ingesta de contenido, utilizar un modelo de incrustación para convertir texto en vectores, almacenar las incrustaciones y los metadatos en una base de datos vectorial, permitir la recuperación de consultas y facilitar la generación de respuestas.

¿Cuáles son algunos ejemplos de casos de uso de RAG de gran impacto?

Algunos casos de uso de RAG de gran impacto son la creación de: un asistente de facturación de autoservicio, un asistente de políticas de atención al cliente, un asistente de cumplimiento de las directrices de RR. HH., un asistente de RFP de ventas y una guía interactiva para la incorporación de clientes. Estos casos de uso pueden contribuir a resolver problemas tangibles, reducir las tareas repetitivas y mejorar la coherencia entre los equipos.

¿Qué tipos de fuentes de datos son adecuados para un sistema RAG?

Las fuentes de datos relevantes para RAG deben ser precisas, tener un mantenimiento periódico y estar suficientemente estructuradas para poder dividirlas en secciones lógicas, como los archivos Markdown, los PDF, los documentos HTML o los archivos JSON. También deben responder las consultas más habituales, como las preguntas frecuentes sobre productos o las guías de procesos internos.

¿Cuáles son las cinco partes de un flujo de trabajo RAG típico?

Un flujo de trabajo RAG típico consta de cinco partes: ingesta, incrustación, almacenamiento en bases de datos vectoriales, recuperación de consultas y generación de respuestas.

¿Cómo se puede medir el éxito de una canalización RAG?

El éxito de una canalización RAG se puede medir utilizando diversos indicadores clave de rendimiento (KPI), como la precisión de la recuperación, la relevancia y la veracidad de la respuesta, la latencia, la adopción y la satisfacción de los usuarios, y la gobernanza de datos. Los comentarios continuos de los usuarios y el análisis de las métricas de rendimiento pueden contribuir a mejorar la implementación a lo largo del tiempo.

¿Qué ventaja ofrece la utilización de un modelo de incrustación en una canalización RAG?

Un modelo de incrustación, como los modelos de incrustación BGE, convierte fragmentos de texto en vectores numéricos que capturan su significado semántico. Estos vectores se almacenan en una base de datos vectorial para una consulta y un filtrado eficientes.

¿Cómo simplifica Cloudflare AI Search la creación de flujos de trabajo RAG?

Cloudflare AI Search es una canalización RAG completamente gestionada que automatiza la ingesta, la fragmentación, la incrustación y el almacenamiento en Vectorize. También gestiona la recuperación semántica y la generación de respuestas con Workers AI, lo que elimina la necesidad de gestionar manualmente la infraestructura.