GraphRAG / Arquitectura RAG

Sistemas personalizados de generación aumentada por recuperación que combinan búsqueda vectorial, razonamiento con grafos y recuperación agéntica para fundamentar la IA en los datos empresariales.

La brecha entre «fragmentos semánticamente similares» y «respuestas correctas y completas» es donde fracasa la mayoría de los despliegues empresariales de RAG. El Laboratorio de IA de Stanford halló que el 40% de las respuestas de RAG alucina incluso cuando se recuperan los documentos correctos. La recuperación funcionó. La fundamentación no.

Por qué RAG recupera documentos, no respuestas

Esto ocurre porque la similitud vectorial estándar no puede distinguir entre un pasaje temáticamente relevante y uno que realmente responde a la pregunta. Cuando su equipo de cumplimiento normativo pregunta «¿cuáles son los requisitos de notificación para una brecha de datos que afecta a residentes de la UE menores de 16 años?» y su sistema devuelve tres fragmentos sobre notificación de brechas según el RGPD sin las disposiciones específicas sobre la edad, la respuesta parece correcta pero está peligrosamente incompleta.

Nuestro enfoque consiste en construir sistemas de recuperación diseñados para cerrar esta brecha. La arquitectura que elegimos depende de sus documentos, sus consultas y su tolerancia a las respuestas erróneas. A veces se trata de una recuperación híbrida BM25 + densa con un reranker cross-encoder. A veces es una canalización completa de GraphRAG con extracción de entidades y resumen comunitario. A veces es un bucle de recuperación agéntica que descompone preguntas complejas, recupera de forma iterativa y se autocorrige antes de generar. No recurrimos por defecto a la opción más compleja: recurrimos a la que resuelve su problema de recuperación a un coste que pueda sostener.

Tres arquitecturas de recuperación, elegidas según sus patrones de consulta

Adaptamos la arquitectura a sus patrones de consulta en lugar de recurrir por defecto a la complejidad. Los tres patrones que se indican a continuación cubren la mayoría de las necesidades en producción.

ArquitecturaIdeal paraPunto de referencia clave / señal de coste
Recuperación híbrida + rerankingEl punto de partida para la mayoría de los despliegues de RAG en producción; consultas por palabras clave + semánticas, búsquedas en un solo documento, respuestas tipo FAQRecall@5 0.816, MRR@3 0.605; latencia del reranker de 50–100 ms
Recuperación aumentada por grafos (GraphRAG)Razonamiento multirrasgo (multi-hop) entre entidades y relaciones; comprensión global a nivel de corpusHasta un 99% de precisión en consultas corporativas complejas; indexación de 4 a 8 veces superior a RAG estándar
Recuperación agénticaConsultas complejas que requieren descomposición, enrutamiento multiestrategia y autocorrecciónEl patrón más potente en 2026, el más costoso; +100–800 ms por consulta

Recuperación híbrida con reranking

Aquí es donde deberían comenzar la mayoría de los sistemas RAG en producción. BM25 gestiona la coincidencia exacta de palabras clave (códigos de error, SKU de productos, números de citación regulatoria), mientras que las incrustaciones (embeddings) densas capturan la intención semántica. La fusión recíproca de rangos (RRF, k=60) fusiona los dos conjuntos de resultados sin los problemas de normalización de puntuación que afectan a los enfoques de fusión aprendida.

Un reranker cross-encoder se sitúa por encima: BGE-reranker-v2-m3 en GPU ofrece una latencia de 50–100 ms sin coste recurrente de API, o Cohere Rerank para los equipos que prefieren infraestructura gestionada. Las pruebas comparativas en producción demuestran que esta canalización de dos etapas supera a todos los métodos de una sola etapa. La recuperación contextual de Anthropic es una técnica que se superpone a esta capa, reduciendo los fallos de recuperación en un 49% (un 67% con reranking) al anteponer el contexto a nivel de documento a cada fragmento antes de la incrustación.

Recuperación aumentada por grafos (GraphRAG)

Cuando sus preguntas requieren sintetizar información a través de múltiples documentos o razonar sobre relaciones entre entidades, la similitud vectorial por sí sola no es suficiente. Un equipo legal que pregunte «¿qué filiales de AcquiringCo tienen acciones regulatorias pendientes en jurisdicciones donde opera TargetCo?» necesita resolución de entidades, recorrido de relaciones y razonamiento multirrasgo (multi-hop).

Construimos grafos de conocimiento a partir de sus documentos, utilizando una extracción basada en dependencias que alcanza el 94% del rendimiento basado en LLM a una fracción del coste en tokens (detallado en nuestra investigación sobre GraphRAG con verificación de citas). GraphRAG de Microsoft : su enfoque (agrupamiento de Leiden + resumen comunitario) funciona para consultas de comprensión global a nivel de corpus, pero sus costes de indexación son de 4 a 8 veces superiores a los de RAG estándar. Lo utilizamos de forma selectiva:

  • Resúmenes comunitarios para consultas globales.
  • Recorrido de grafos de propiedades para preguntas sobre relaciones entre entidades.
  • Recuperación vectorial estándar para todo lo demás.

Como almacén de soporte del grafo, FalkorDB gestiona cargas de trabajo de RAG con lectura intensiva a 6,693 QPS con arranques en frío inferiores al milisegundo, mientras que Neo4j sigue siendo la opción adecuada cuando se necesita RBAC maduro, agrupamiento (clustering) y agregación compleja.

Recuperación agéntica

El patrón más potente en 2026 y el más costoso de implementar correctamente. Un bucle de recuperación agéntica descompone las consultas complejas en subconsultas, enruta cada una hacia la estrategia de recuperación adecuada (vectorial, grafo o base de datos estructurada), evalúa si los resultados son suficientes e itera hasta alcanzar los umbrales de confianza.

Implementamos esto en LangGraph, donde la abstracción de máquina de estados proporciona ramificación condicional, nodos de interrupción con intervención humana (human-in-the-loop) y auditabilidad determinista. Las capas de RAG correctivo añaden entre 100 y 800 ms de latencia por consulta, pero detectan errores de recuperación antes de que lleguen al LLM. Este patrón está listo para producción en Morgan Stanley, PwC y ServiceNow. No está listo para equipos sin capacidad dedicada de MLOps para monitorizar y ajustar los bucles de recuperación.

Qué ocurre antes de la incrustación: acertar con la fragmentación

La fragmentación (chunking) es donde los sistemas RAG fallan silenciosamente. La fragmentación ingenua de tamaño fijo produce puntuaciones de fidelidad de 0.47–0.51. La fragmentación semántica alcanza 0.79–0.82, pero requiere calcular la incrustación de cada frase en su corpus. La estrategia adecuada depende de sus documentos:

  • Presentaciones regulatorias estructuradas — el análisis sintáctico con reconocimiento de diseño preserva la jerarquía de secciones.
  • PDFs de contenido mixto con tablas y gráficos — la fragmentación guiada por visión (tratando cada página como una imagen para detectar el diseño y extrayendo luego las regiones de texto) mejora la precisión de recuperación en un 8–15% frente al análisis exclusivo de texto.
  • Documentos narrativos extensos — la fragmentación tardía (late chunking) procesa el documento completo a través del transformer en primer lugar, de modo que la incrustación de cada token refleje el contexto bidireccional, y luego aplica los límites de fragmento tras el paso hacia adelante.

Probamos entre tres y cuatro estrategias de fragmentación con su conjunto real de consultas antes de elegir una. El entorno de evaluación (métricas de fidelidad y precisión de contexto de RAGAS, juicios de relevancia específicos del dominio) se entrega como parte de la canalización, no como una ocurrencia tardía. El 60% de los nuevos despliegues de RAG incluye ahora una evaluación sistemática desde el primer día, frente a menos del 30% a principios de 2025. Integramos la evaluación en su CI/CD para que la calidad de recuperación se mida en cada despliegue, no cuando los usuarios se quejan.

¿Cuánto cuesta operar un sistema RAG empresarial?

Una empresa de fabricación gastó $400,000 en desplegar un sistema RAG, para luego descubrir que las operaciones continuas costaban $18,000/mes — más del doble de su previsión. El modelo de costes que pasaron por alto: el reranking. Las API de incrustación cuestan $20–120 por cada mil millones de tokens. El alojamiento de bases de datos vectoriales para 10M de vectores cuesta entre 1.5 y 3 veces más con servicios gestionados (Pinecone, Weaviate Cloud) frente a opciones autohospedadas (Qdrant, pgvector). Pero el reranking con volúmenes de consulta de producción es donde los presupuestos se disparan: Cohere Rerank cuesta $2 por cada 1,000 consultas, mientras que BGE-reranker-v2-m3 autohospedado en una sola GPU iguala esa latencia a un coste de cero por consulta, aunque se paga por la instancia de GPU.

GraphRAG añade otra capa de costes. La construcción del grafo de conocimiento consume entre 4 y 8 veces más tokens que el texto de origen para la extracción de entidades y el resumen comunitario. El mantenimiento consume entre el 40 y el 60% del presupuesto de ingeniería del primer año porque la resolución de entidades, la deduplicación y las actualizaciones de ontologías son un trabajo continuo, no una configuración única. La extracción basada en dependencias (PLN clásico en lugar de llamadas a LLM) reduce los costes de construcción aproximadamente en un 90% manteniendo el 94% de la calidad de extracción. Dimensionamos cada proyecto con proyecciones explícitas de costes recurrentes mensuales que cubren incrustación, almacenamiento, recuperación, reranking y mantenimiento del grafo.

Cuándo vale la pena GraphRAG (y cuándo no)

Necesita recuperación aumentada por grafos cuando sus consultas requieren razonamiento multirrasgo (multi-hop) entre entidades y relaciones:

  • Due diligence de fusiones y adquisiciones que abarca cientos de presentaciones de filiales.
  • Síntesis de evidencia clínica a través de bases de datos de interacción farmacológica.
  • Análisis de riesgos de la cadena de suministro que conecta redes de proveedores con acciones regulatorias.

GraphRAG ofrece su mayor precisión de búsqueda en consultas corporativas complejas y multicapa en pruebas comparativas (consulte una demostración operativa de recuperación legal verificada por citas). No lo necesita cuando sus consultas son búsquedas en un solo documento, respuestas tipo FAQ o búsquedas basadas en palabras clave: la recuperación híbrida BM25 + densa con un reranker gestiona esto a una fracción del coste y la complejidad. Si su corpus tiene menos de 5 millones de vectores y sus preguntas no cruzan los límites de los documentos, pgvector con indexación HNSW es realmente suficiente. Evaluamos esto antes de recomendar una arquitectura y le diremos cuándo la opción más simple es la correcta.

La pregunta de «¿siquiera necesitamos RAG?» también es importante. Con ventanas de contexto que superan 1M+ de tokens (Gemini 3 Pro con 10M), algunos equipos se plantean introducir corpus enteros en el prompt. El problema: una sola consulta de 1M de tokens cuesta $2–10, lo cual es insostenible con el volumen de consultas empresariales. La calidad del contexto se degrada a partir de ciertos umbrales incluso dentro de los límites anunciados. RAG sigue siendo la arquitectura adecuada para cualquier sistema que gestione consultas repetidas sobre conjuntos de documentos amplios y dinámicos.

¿Cuál es la superficie de ataque de una canalización RAG?

La investigación PoisonedRAG (USENIX Security 2025) demostró que cinco documentos cuidadosamente manipulados e inyectados en un corpus de un millón de documentos pueden alterar las respuestas de la IA con más del 90% de éxito. Su canalización de recuperación es una vía de ingesta para contenido adversario. OWASP reconoce ahora formalmente las debilidades en vectores e incrustaciones (LLM08:2025) y la inyección de prompts a través de documentos recuperados (LLM01:2025) como principales riesgos de seguridad en LLM.

Incorporamos trazabilidad de procedencia de documentos, detección de anomalías a nivel de incrustación y capas de saneamiento de entrada en la canalización de recuperación. Cada pasaje recuperado incluye metadatos de origen y puntuación de confianza. La capa de generación está restringida para citar pasajes específicos, y las afirmaciones que no puedan fundamentarse en el contenido recuperado se señalan en lugar de admitirse sin más. Esto no es opcional para ningún sistema RAG desplegado en entornos regulados, como se detalla en nuestra investigación sobre la protección de LLM empresariales privados.

Qué entregamos

Cada proyecto produce:

  • Una arquitectura de recuperación elegida para sus patrones de consulta y tipos de documentos específicos.
  • Una estrategia de fragmentación e incrustación evaluada con respecto a sus consultas reales.
  • Un entorno de evaluación de nivel de producción con métricas RAGAS y casos de prueba específicos del dominio.
  • Proyecciones de costes explícitas que cubren incrustación, almacenamiento, recuperación, reranking y cualquier mantenimiento del grafo.
  • Refuerzo de seguridad frente a ataques basados en la recuperación.
  • Una pila de monitorización que detecta la degradación de la calidad de recuperación antes de que lo hagan los usuarios.

También le indicamos cuándo su configuración actual es adecuada y la inversión en una recuperación más compleja no resultará rentable.

Puntos clave

  • Comenzar con recuperación híbrida + reranking por defecto — cubre la mayor parte de RAG en producción (consultas por palabra clave + semánticas, búsquedas en un solo documento, respuestas FAQ) al menor coste y complejidad, por lo que debe considerarse la línea base antes de recurrir a opciones más pesadas.
  • Reservar GraphRAG para preguntas multirrasgo (multi-hop) entre documentos — due diligence de fusiones y adquisiciones, síntesis de evidencia clínica, riesgo en la cadena de suministro. Su indexación y mantenimiento continuo solo resultan rentables cuando las consultas cruzan genuinamente los límites de los documentos; por debajo de unos pocos millones de vectores que no lo hacen, pgvector es suficiente.
  • Decidir la fragmentación antes de calcular los embeddings — compare varias estrategias con su conjunto real de consultas e integre un entorno de evaluación RAGAS en CI/CD, de modo que la calidad se mida en cada despliegue en lugar de descubrir fallos cuando los usuarios se quejen.
  • Dimensionar el coste recurrente (run-rate) desde el principio — incrustación, alojamiento de bases de datos vectoriales, reranking y cualquier mantenimiento del grafo. El coste operativo, especialmente el reranking, es donde los presupuestos se desbordan, así que exija proyecciones mensuales explícitas.
  • Adoptar la recuperación agéntica solo con un equipo dedicado de MLOps — es el patrón más potente pero añade latencia y nuevos modos de fallo; sin un equipo para monitorizar y ajustar los bucles, manténgase en la recuperación híbrida.
  • Reforzar la canalización como superficie de ataque — trazabilidad de procedencia y puntuación de confianza, detección de anomalías en embeddings, saneamiento de entradas y generación condicionada por citas, ya que el contenido recuperado es una vía de ingesta adversaria (amenazas de tipo PoisonedRAG; OWASP LLM08:2025 y LLM01:2025).

GraphRAG / Arquitectura RAG

FAQ

Preguntas Frecuentes

¿Cuánto cuesta crear y operar un sistema RAG empresarial?

Los costes de desarrollo oscilan entre 15.000 y 30.000 USD para una prueba de concepto focalizada y entre 500.000 y 2 millones de USD para un despliegue empresarial completo creado desde cero, lo que suele requerir entre 6 y 12 meses con más de 6 ingenieros dedicados. Los enfoques basados en plataformas llegan a producción en 2-6 semanas con costes mensuales predecibles. El ritmo de gasto operativo continuo (run-rate) es donde la mayoría de los equipos se sorprende: las API de incrustación (embedding) cuestan entre 20 y 120 USD por cada mil millones de tokens, las bases de datos vectoriales gestionadas cuestan entre 1.5 y 3 veces más que las autohospedadas para más de 10 millones de vectores, y el reranking con volumen de producción (Cohere a 2 USD por cada 1.000 consultas o instancias de GPU autohospedadas) a menudo duplica el presupuesto operativo proyectado. GraphRAG añade costes adicionales: el mantenimiento del grafo de conocimiento consume entre el 40 y el 60% del presupuesto de ingeniería del primer año. Definimos el alcance de cada proyecto con proyecciones explícitas de run-rate mensual para que no haya sorpresas de costes tras el despliegue.

¿Por qué nuestro sistema RAG alucina incluso cuando recupera los documentos correctos?

La similitud vectorial recupera pasajes temáticamente relevantes, no necesariamente pasajes que respondan a la pregunta. El Laboratorio de IA de Stanford halló que el 40% de las respuestas de RAG alucinan incluso cuando se recuperan los documentos correctos. Los fallos se acumulan: la fragmentación ingenua de tamaño fijo produce puntuaciones de fidelidad de 0.47-0.51 porque fragmenta unidades semánticas y corta el contexto entre párrafos. La etapa de reranking puede no estar ajustada a los patrones de relevancia de su dominio. Y el paso de generación carece de restricciones de fundamentación (grounding), por lo que el modelo interpola entre fragmentos recuperados en lugar de citarlos. Solucionar esto requiere fragmentación específica del dominio, un reranker ajustado a sus criterios de relevancia, generación restringida con requisitos de citación y un entorno de evaluación (métricas de fidelidad de RAGAS) integrado en CI/CD.

¿Cuál es la diferencia entre GraphRAG de Microsoft y la recuperación general aumentada por grafos?

GraphRAG de Microsoft es una implementación específica: extrae entidades y relaciones de documentos mediante llamadas a LLM, las agrupa en comunidades mediante el algoritmo de agrupamiento de Leiden y genera resúmenes comunitarios precalculados para responder a consultas de comprensión global («¿cuáles son los temas principales en este corpus?»). La recuperación general aumentada por grafos es más amplia: se construye o utiliza un grafo de conocimiento existente (grafo de propiedades, ontología de dominio o grafo de entidades extraídas) y se recorre durante la recuperación para responder a preguntas de múltiples saltos (multi-hop) que requieren conectar información a través de varios documentos. El enfoque de Microsoft destaca en el resumen a nivel de corpus, pero conlleva costes de indexación significativamente mayores y la resolución de entidades se basa principalmente en nombres, lo que genera problemas con etiquetas ambiguas. Utilizamos resúmenes comunitarios al estilo de Microsoft de forma selectiva para consultas globales y recorridos de grafos de propiedades para preguntas de relaciones entre entidades.

¿Deberíamos utilizar Pinecone, Weaviate, Qdrant o pgvector para nuestra canalización RAG?

Depende del volumen de vectores, los patrones de consulta y la capacidad operativa. pgvector con HNSW es realmente suficiente por debajo de 5 millones de vectores si ya utiliza PostgreSQL, y no supone ningún coste adicional. Pinecone concentra el 70% del mercado gestionado y ofrece el camino más sencillo hacia producción con un rendimiento consistente, pero se paga una prima por esa simplicidad. Qdrant (basado en Rust) ofrece latencias p50 inferiores a 5 ms con el mejor filtrado de metadatos y mejoras de 4x en QPS frente a la competencia en determinados conjuntos de datos. Weaviate combina búsqueda vectorial con BM25 híbrido y capacidades de grafos de conocimiento a través de su interfaz GraphQL. Con 10 millones de vectores, los servicios gestionados cuestan entre 1.5 y 3 veces más que las soluciones autohospedadas. Evaluamos sus patrones reales de consulta frente a dos o tres opciones antes de recomendar una.

¿Está el RAG agéntico listo para producción en 2026?

Sí, con salvedades. Morgan Stanley, PwC y ServiceNow operan patrones de RAG agéntico en producción. LangGraph proporciona el marco más maduro con abstracciones de máquina de estados, ramificación condicional, interrupciones con intervención humana (human-in-the-loop) y pistas de auditoría deterministas. Las capas de RAG correctivo reducen las recuperaciones irrelevantes en un 25-40%, pero añaden entre 100 y 800 ms de latencia por consulta. Las advertencias: la recuperación agéntica introduce nuevos modos de fallo, incluidos bucles de recuperación, decisiones de enrutamiento incorrectas y sobrerrecuperación cuando la calibración de confianza falla. Se necesita capacidad dedicada de MLOps para monitorizar y optimizar estos sistemas. Si su equipo no puede asumir la monitorización continua de la calidad de recuperación, la recuperación híbrida con reranking es un punto de partida más fiable.

Con ventanas de contexto que superan el millón de tokens, ¿todavía necesitamos RAG?

Sí, para cualquier sistema con consultas reiteradas sobre conjuntos de documentos extensos o dinámicos. Gemini 3 Pro ofrece 10 millones de tokens, Claude admite 200K y GPT-4 gestiona 128K. Sin embargo, una sola consulta de 1 millón de tokens cuesta entre 2 y 10 USD, lo que con miles de consultas empresariales diarias asciende a cientos de miles al mes. Además, la calidad del contexto se degrada al superar ciertos umbrales incluso dentro de los límites anunciados. El patrón de convergencia en 2026 es híbrido: RAG recupera el contenido más relevante y luego los modelos de contexto amplio razonan sobre el conjunto recuperado. Cada tecnología hace lo que mejor sabe hacer. El contexto amplio reemplaza a RAG solo para análisis puntuales de un único documento extenso, no para cargas de trabajo en producción.

¿Cómo protegemos nuestra canalización RAG frente a ataques basados en la recuperación?

La investigación PoisonedRAG (USENIX Security 2025) demostró que cinco documentos manipulados en un corpus de un millón de documentos pueden alterar las respuestas de la IA con más del 90% de éxito. OWASP reconoce ahora formalmente las debilidades en vectores e incrustaciones (LLM08:2025) y la inyección de prompts a través de contenido recuperado (LLM01:2025). La defensa requiere múltiples capas: seguimiento de procedencia de documentos con puntuación de confianza por fuente, detección de anomalías a nivel de incrustación para señalar inserciones adversarias, saneamiento de entradas en el contenido ingerido, generación restringida que exige la citación de pasajes específicos y monitorización en tiempo de ejecución para detectar cambios bruscos de distribución en los patrones de recuperación. Esto no es opcional para despliegues en sectores regulados.

¿Deberíamos construir nuestro sistema RAG internamente o contratar una consultora?

El 73% de las implementaciones de RAG empresarial se llevan a cabo en grandes organizaciones porque los equipos más pequeños carecen del equipo técnico necesario para flujos de trabajo paralelos en ingeniería de datos, ML e infraestructura. Construir desde cero requiere más de 6 ingenieros dedicados y entre 6 y 12 meses para alcanzar la paridad de funciones con lo que un proyecto especializado ofrece en cuestión de semanas. El coste oculto es el mantenimiento: las canalizaciones de RAG necesitan un ajuste continuo, y los equipos internos a menudo son redirigidos al desarrollo de producto mientras la calidad de recuperación se degrada. Una consultora tiene sentido cuando se necesita calidad de producción más rápido de lo que se puede contratar, cuando el problema de recuperación es lo suficientemente específico del dominio como para que las plataformas comerciales se queden cortas o cuando se desea una evaluación honesta de la arquitectura antes de comprometerse con un desarrollo. Entregamos el sistema y el marco de evaluación para que su equipo pueda mantenerlo y evolucionarlo.

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.