RAG: chatbots que responden con tus documentos
El mayor problema de los LLMs en la empresa es que no saben nada de tu empresa — y cuando no saben, a veces se lo inventan. La técnica que lo resuelve se llama RAG (Retrieval-Augmented Generation, generación aumentada con recuperación), y es la base de prácticamente todos los asistentes corporativos serios que se despliegan hoy.
Cómo funciona RAG, paso a paso
- Indexación: tus documentos (PDFs, manuales, wikis, contratos, tarifas…) se trocean y se convierten en embeddings — representaciones numéricas de su significado — que se guardan en una base de datos vectorial.
- Recuperación: cuando alguien pregunta, el sistema busca los fragmentos de documento más relevantes por significado, no por palabra exacta. "¿Cuál es el plazo de devolución?" encuentra el párrafo correcto aunque esté redactado como "el cliente dispondrá de catorce días naturales…".
- Generación: el LLM recibe la pregunta junto a esos fragmentos y redacta la respuesta basándose solo en ellos, citando el documento y la página.
La diferencia clave: sin RAG el modelo responde "de memoria"; con RAG
responde consultando tu documentación. Menos inventos, respuestas auditables y conocimiento siempre
actualizado — actualizar el asistente es tan simple como subir el PDF nuevo.
Qué aporta frente a otras opciones
| Enfoque | Conoce tu empresa | Coste de actualizar | Trazabilidad |
|---|---|---|---|
| LLM genérico (ChatGPT tal cual) | No | — | Ninguna |
| Fine-tuning puro | Parcial (se "deforma" con el tiempo) | Alto: reentrenar | Baja |
| RAG | Sí | Mínimo: subir el documento | Alta: cita la fuente |
En la práctica combinamos ambas: RAG para el conocimiento y, cuando hace falta, fine-tuning para el tono y el formato de las respuestas.
Ingredientes de un RAG bien hecho
- Buen troceado (chunking): respetando la estructura del documento (capítulos, tablas, cláusulas), no a cuchillo cada N caracteres.
- Búsqueda híbrida: vectorial + palabra clave (BM25) para no fallar con códigos, referencias y siglas.
- Re-ranking: un segundo modelo reordena los fragmentos candidatos antes de responder.
- Guardarraíles: si la respuesta no está en los documentos, el asistente lo dice — nunca improvisa.
- Evaluación continua: un conjunto de preguntas de prueba con respuesta conocida que se ejecuta en cada cambio. Medimos precisión de recuperación y fidelidad de las respuestas.
- Permisos: cada usuario solo puede obtener respuestas de los documentos a los que tiene acceso. Fundamental en RRHH o legal.
Cómo lo implantamos en 4 semanas
- Semana 1: recopilación documental, diseño del troceado y pipeline de indexación.
- Semana 2: primer asistente funcional con vuestra documentación real.
- Semana 3: evaluación con preguntas reales del equipo, ajuste de recuperación y guardarraíles.
- Semana 4: despliegue (cloud o servidores propios), formación y métricas de uso.
El resultado: un asistente que responde como vuestro mejor empleado el día que más documentación se ha leído — todos los días, a todas horas.
¿Lo vemos con tus documentos? Escríbenos a
nuestro formulario de contacto y montamos una demo con una muestra real de vuestra
documentación. También puedes leer qué es un LLM y cómo aplicarlo a tu
empresa.