Agente IA telefónico con sistema RAG, paso a paso
De qué trata esta lección
Cuando un agente de voz necesita responder sobre mucha documentación, traerse por API una lista de artículos llena el contexto y le obliga a decidir cuál sirve. Con RAG solo recupera el fragmento que necesita, y en este episodio te enseño a montarlo.
Usamos LightRAG, una librería open source con interfaz visual, para cargar la base de conocimiento, y la conectamos a nuestro agente de 008 Agent mediante una tool. Luego lo probamos por voz y revisamos en la sesión lo limpia que llega la respuesta.
Puntos clave
- Consultar una base de conocimientos por API devuelve muchos artículos y carga el contexto; el RAG devuelve solo el fragmento relevante.
- LightRAG es open source, admite formatos como txt, Markdown, Excel o PowerPoint y genera además un grafo de conocimiento.
- En la tool de RAG el único parámetro dinámico es la consulta; el resto (rerank, instrucciones de respuesta y número de fragmentos) va fijo.
- En el prompt basta con indicar cuándo consultar la base de conocimiento y que no cite las referencias.
- En un despliegue SIP el agente pone la llamada en espera mientras consulta el RAG, lo que mejora mucho la experiencia.
- Sin diccionario de pronunciación, el agente pronuncia mal algunos términos técnicos.
Contenido de la lección
De vuelta con la serie de agentes IA de voz
Vuelvo al canal tras unas semanas complicadas por las vacaciones y la vuelta al trabajo, con el objetivo de subir un vídeo cada diez días y seguir con series como la de Copilot Studio y, sobre todo, esta de agentes IA de voz. La idea sigue siendo la misma: vídeos más largos compartiendo pantalla, donde vemos tecnologías nuevas y te enseño paso a paso cómo hacer las cosas.
Por qué usar RAG en un agente IA telefónico
En los episodios anteriores creamos el agente y le dimos tools. Ahora le damos conocimiento extra. Piensa en un departamento de soporte que consulta su base de conocimientos por API: recibe un listado de artículos que se cargan en el contexto, y el agente tiene que decidir cuál resuelve la duda.
Con RAG recuperamos solo el fragmento que el agente debe devolver al usuario, de forma dinámica y manteniendo el contexto lo más limpio posible. Para montarlo usamos 008 Agent como plataforma de voz y LightRAG como librería de RAG.
LightRAG: base de conocimiento y grafo
LightRAG es un proyecto open source que permite construir un RAG de forma sencilla y con una interfaz muy limpia. Puedes subir archivos en formatos como txt, Markdown, Excel o PowerPoint; yo cargué artículos de la base de conocimientos de 008 Agent para tener un caso casi real.
Además de trocear los documentos para los embeddings, genera un grafo de conocimiento con nodos conectados por temáticas y ofrece un entorno para probar las consultas.
Configurar la tool de base de conocimiento en 008 Agent
Al agente de pruebas del primer episodio le añadimos una tool de base de conocimientos que llama a LightRAG. El único parámetro dinámico es la consulta del usuario; el rerank, las instrucciones sobre cómo devolver la respuesta y el número de fragmentos a consultar van fijos.
En el prompt solo le indicamos que, ante cualquier pregunta sobre 008 Agent, consulte siempre la base de conocimientos con esa tool y que nunca diga las referencias de la respuesta.
Demo por voz y análisis de la sesión
En el deployment web, mientras el agente llama a la tool aparecen tres puntos y no puedes interactuar; en un despliegue SIP pondría la llamada en espera con su música. Le pregunto por una herramienta de 008 para procesar audio de llamadas y responde con precisión.
En la sesión vemos que la respuesta del RAG es un texto de muy pocas palabras que apenas ensucia el contexto, frente al JSON enorme que devolvería una API con diez artículos. También vemos fallos de pronunciación en términos que no estaban en el diccionario.
Cuándo tiene sentido un agente de voz con RAG
El RAG tiene todo el sentido cuando el agente necesita un volumen enorme de conocimiento, donde trabajar solo con una API tiene limitaciones. Por ejemplo, un bufete de abogados con muchísimos artículos, PDFs, Words o PowerPoint: con LightRAG los subes, se convierten en vectores, se genera el grafo y lo usas vía API como tool de tu agente de forma ágil.