Grounding, Citação e Verificação
Sistemas de verificação que garantem que cada afirmação gerada por IA seja rastreável até uma fonte real, com pipelines de citação, checagem de entailment e avaliação de precisão factual.
Sua IA cita fontes. Ela não as verifica.
A resposta de IA mais perigosa é aquela que parece citada. Um sistema de geração aumentada por recuperação retorna um trecho, o modelo gera uma resposta e uma citação surge ao lado dela. O usuário presume que a citação sustenta a afirmação. Em 57% dos casos, isso não acontece.
Um estudo de 2025 revelou que mais da metade das citações geradas por RAG exibe racionalização post-hoc: o modelo decide sua resposta primeiro e depois varre os documentos recuperados em busca de correspondências superficiais de tokens para fabricar uma referência. A citação é real. O documento existe. O trecho foi retirado daquele documento. Mas o trecho não sustenta, de fato, a afirmação.
Este não é um problema de recuperação. Seu pipeline de recuperação pode retornar os documentos corretos e suas citações ainda assim estarem erradas. Nossa abordagem é construir a camada de verificação que se posiciona entre a geração da sua IA e seus usuários — não uma recuperação melhor, não prompts melhores, mas uma verificação independente projetada para que cada afirmação no resultado seja realmente sustentada pela fonte que ela referencia — a arquitetura que estabelecemos em nosso whitepaper sobre a construção da verdade além do wrapper de LLM.
Por que recuperação somada a prompting não é verificação
A maioria das equipes trata o grounding como um problema de recuperação: fragmentos melhores, um reclassificador, "responda apenas com base no contexto fornecido" no prompt do sistema. Isso ignora a falha essencial. O modelo não está desobedecendo — ele está cumprindo a instrução de forma infiel, encontrando tokens no contexto que coincidem superficialmente e anexando uma citação. O trecho não sustenta a afirmação por entailment.
A verificação é um sistema distinto com um objetivo distinto. O componente de geração produz afirmações candidatas com anotações de fontes e otimiza a fluência. O componente de verificação avalia de forma independente se cada fonte citada realmente sustenta a afirmação anotada, otimizando para entailment: esta fonte sustenta logicamente esta afirmação específica? Quando funcionam como subsistemas independentes — o padrão de sistema duplo detalhado em nossa pesquisa sobre verificação neuro-simbólica — uma alucinação precisa enganar a ambos para atingir o usuário.
Implementamos essa arquitetura de sistema duplo utilizando modelos NLI ajustados para detecção de entailment, combinados com a decomposição de fatos atômicos. Na Google DeepMind, a abordagem SAFE demonstrou que dividir respostas em fatos atômicos individuais antes da verificação supera expressivamente a checagem em nível de sentença: o SAFE concorda com anotadores humanos 72% das vezes e, em divergências, a verificação automatizada está correta em 76% dos casos a um custo 20x menor. Adaptamos isso ao seu domínio, pois a definição de um "fato atômico" em uma petição jurídica difere daquela em um sumário clínico ou em uma divulgação financeira.
O que as APIs de grounding dos provedores realmente fazem (e o que não fazem)
Todos os principais provedores de nuvem lançaram recursos de grounding nos últimos 18 meses. Nenhum deles resolve o problema por completo.
| Oferta do provedor | O que faz | Resultado comprovado | Onde encontra limites |
|---|---|---|---|
| Citations API da Anthropic | Divide documentos de origem em sentenças e cita automaticamente afirmações na saída do Claude. | A Endex relatou que as alucinações de fontes caíram de 10% para 0% e as referências por resposta aumentaram 20% após a integração — a oferta de provedor mais robusta para citação de documento único em perguntas e respostas diretas. | Não lida com síntese de múltiplas fontes, verificação temporal ou checagem de precisão numérica. |
| Google Vertex AI Grounding | Oferece modo de alta fidelidade utilizando um modelo Gemini ajustado para respostas aderentes ao contexto, com vinculação de fontes em nível de sentença. | Forte para aplicações ancoradas na web. | Limitado para bases internas de documentos. |
| Azure AI Groundedness Detection | Fornece pontuação binária de ancorado/não ancorado no modo rápido, ou explicações detalhadas no modo de raciocínio com autocorreção. | Útil como filtro pós-geração. | Não verifica a precisão da citação no nível do trecho. |
| Amazon Bedrock Contextual Grounding | Gera pontuações de confiança com limites configuráveis. | Afirma detectar 75%+ das alucinações em tarefas de extração. | Não foi projetado para verificação em nível de citação. |
A lacuna em todas as quatro: elas detectam quando o modelo se desvia do contexto fornecido, mas não verificam se a citação específica vinculada a uma afirmação específica é realmente sustentada por entailment. Essa camada de verificação é o que projetamos e construímos.
Três arquiteturas de verificação, alinhadas ao seu perfil de risco
Verificação de entailment baseada em NLI
Para equipes que precisam de verificação por afirmação sem o custo de latência da decomposição completa. Cada afirmação gerada é emparelhada com seu trecho citado e avaliada por um modelo NLI quanto a entailment, contradição ou neutralidade; afirmações classificadas como "contradição" ou "neutra" são sinalizadas ou suprimidas. Isso adiciona 50–200 ms por afirmação, suporta cargas de trabalho de alta taxa de transferência e captura o modo de falha mais comum: citações que apontam para trechos tematicamente relevantes, mas que não oferecem sustentação.
Utilizamos ensembles calibrados de NLI (a abordagem HALT-RAG ) em vez de modelos únicos, pois modelos individuais de NLI apresentam pontos cegos específicos de domínio que os ensembles atenuam.
Decomposição de fatos atômicos com verificação aumentada por busca
Para domínios de alto risco onde a checagem por afirmação é insuficiente porque uma única sentença pode conter múltiplas declarações verificáveis. Decompomos cada resposta em fatos individuais, geramos consultas de verificação direcionadas para cada um e checamos tanto em relação às fontes citadas quanto a referências autorizadas externas. Esta é a abordagem derivada do SAFE.
Ela captura erros que o NLI em nível de sentença ignora: uma sentença pode ser parcialmente sustentada (dois fatos corretos, um forjado) e o NLI frequentemente pontuará a sentença inteira como sustentada por entailment. A decomposição custa 3–5x mais em inferência , mas captura significativamente mais erros. Utilizamos isso para peças jurídicas, documentação clínica, demonstrações financeiras e qualquer domínio onde um único número incorreto traga consequências materiais.
Verificação contínua com checagem temporal e numérica
Para ambientes regulamentados onde a validade das fontes muda com o tempo. Isso expande a abordagem de decomposição com três checagens adicionais:
- Verificação temporal — este regulamento estava em vigor na data referenciada pela afirmação?
- Verificação numérica — esta porcentagem corresponde com exatidão à tabela de origem, e não de forma aproximada?
- Checagem de consistência cruzada entre afirmações — múltiplas afirmações fundamentadas na mesma resposta contradizem umas às outras?
Mantemos índices de atualização de fontes que monitoram quando os documentos citados foram validados pela última vez, disparando uma nova verificação quando o material de origem é atualizado. Esta é a arquitetura voltada a organizações onde uma citação a uma norma revogada ou a uma estatística desatualizada acarreta risco de conformidade, detalhada em nossa pesquisa sobre aplicação de citações estatutárias em IA governamental.
Medindo a qualidade do grounding (as métricas que realmente importam)
O cenário de avaliação é fragmentado. O HHEM da Vectara pontua a consistência factual, mas mede a fidelidade da sumarização, não a precisão das citações. O RAGAS checa o grounding, mas não a atribuição. O benchmark ALCE avalia a precisão e a revocação de citações em conjuntos de dados acadêmicos que não refletem os padrões corporativos. Pesquisas do Allen Institute constataram que a precisão de citações em RAG fica em média entre 65–70% sem treinamento específico de atribuição.
Nossa abordagem consiste em construir avaliações que medem o que realmente importa, operando continuamente com alertas baseados em limites pré-definidos:
- Precisão de citação — os trechos citados sustentam suas afirmações?
- Revocação de citação — as afirmações verificáveis estão adequadamente atribuídas?
- Acurácia de entailment — a taxa de aprovação no NLI.
- Especificidade da fonte — atribuição em nível de parágrafo versus nível de documento.
Quando a verificação completa é desnecessária
A verificação completa tem custo elevado. A decomposição atômica com checagem aumentada por busca adiciona 2–5 segundos e US$ 0,01–0,05 por resposta com os preços atuais dos modelos. Para um assistente interno de conhecimento que responde a 10.000 consultas por dia, isso representa US$ 100–500/dia apenas em custos de verificação, além da geração e da recuperação.
Nem toda aplicação necessita disso. Ajudamos você a alinhar a profundidade da verificação ao risco real — essa avaliação faz parte de cada projeto, e indicaremos quando uma abordagem mais simples for adequada ao seu caso de uso.
| Aplicação | Risco em caso de erro | Verificação sob medida |
|---|---|---|
| Chatbot interno de FAQ | Respostas erradas são inconvenientes, mas não prejudiciais | Melhorias na qualidade da recuperação somadas a uma checagem básica de ancoragem (Azure ou Bedrock) são provavelmente suficientes. |
| Ferramenta de pesquisa jurídica | Uma citação forjada pode resultar em sanções judiciais | Decomposição completa com verificação de entailment é o mínimo indispensável. |
| Suporte à decisão clínica | Uma interação medicamentosa alucinada pode causar danos a pacientes | Verificação contínua com checagem temporal e escalonamento com intervenção humana (human-in-the-loop). |
O que entregamos
Um projeto é dimensionado para entregar o seguinte — o mesmo nível de verificação demonstrado em nossa demonstração funcional de IA governamental com imposição de citações:
- Uma arquitetura de verificação alinhada ao seu perfil de risco, orçamento de latência e tipos de documentos de origem.
- Pipelines de verificação baseados em NLI ou em decomposição integrados à sua stack de recuperação existente.
- Um framework de avaliação de qualidade de citações com métricas de precisão, revocação, acurácia de entailment e especificidade da fonte.
- Monitoramento contínuo com alertas baseados em limites definidos.
- Integração com seu fluxo de conformidade para exigências de trilha de auditoria — telemetria FINRA, transparência do EU AI Act, rastreabilidade FDA.
- Uma suíte de testes com sondas de alucinações conhecidas calibradas para o seu domínio.
- O modelo de custos de verificação, permitindo decisões informadas sobre onde implantar a verificação completa versus checagens mais leves.
Principais conclusões
- Uma citação de aparência correta não é uma citação verificada — 57% das citações em RAG não sustentam de fato sua afirmação, e a falha é silenciosa porque a fonte é real.
- A verificação é um sistema independente da recuperação: uma checagem autônoma de entailment que a alucinação precisa enganar pela segunda vez.
- As APIs de grounding dos provedores (Anthropic, Google Vertex, Azure, Bedrock) detectam desvios de contexto, mas nenhuma verifica a precisão das citações no nível do trecho.
- Três arquiteturas dimensionadas por nível de risco — entailment via NLI (50–200 ms/afirmação), decomposição de fatos atômicos (3–5x mais inferência) e verificação temporal/numérica contínua.
- A verificação completa custa US$ 0,01–0,05 por resposta; alinhamos a profundidade ao custo de uma única alucinação não detectada que alcance seus usuários.
Grounding, Citação e Verificação
AssistirDefesa de Responsabilidade por Produto de IA | Veriprajna
A responsabilidade por IA corporativa está migrando da negligência para a responsabilidade objetiva por produto. A Veriprajna constrói arquiteturas de IA defensáveis, trilhas de auditoria prontas para litígio e pacotes de posicionamento de seguro para equipes jurídicas que enfrentam a era pós-Seção 230.
AssistirVerificação de IA & Conformidade Anti-AI-Washing | Veriprajna
Comprove suas alegações de IA antes que os reguladores perguntem. A Veriprajna constrói arquitetura de verificação de IA, sistemas AIBOM e pacotes de comprovação de alegações para conformidade com SEC, FTC e procuradores-gerais estaduais.
AssistirSubscrição de Risco de Enchente com IA | Veriprajna
Mais de dois terços dos danos causados por enchentes nos EUA ocorrem fora das zonas de alto risco da FEMA. Se o seu motor de tarifação ainda se ancora na Zona AE vs. Zona X, você está precificando o risco incorretamente nos dois lados: cobrando a mais da casa elevada dentro da zona e cobrando a menos da casa sobre laje fora dela.
AssistirEngenharia de Precisão e Confiabilidade de IA para E-Commerce | Veriprajna
Compradores que interagem com IA convertem a uma taxa 4x maior do que os que não interagem. Mas uma única especificação de produto alucinada, uma única política de devolução inventada, uma única recomendação insegura compartilhada nas redes sociais custa mais do que o projeto inteiro economiza. Nós construímos as camadas de verificação, fundamentação e conformidade que tornam a IA de e-commerce realmente confiável.
AssistirValidação de IA Empresarial para Setores Regulados | Veriprajna
A Klarna substituiu 700 atendentes de suporte ao cliente por IA. Os custos caíram 40%. Então a satisfação despencou, os contatos repetidos dispararam e o 1º trimestre de 2025 terminou com um prejuízo líquido de US$ 99 milhões.
AssistirIA Governamental Que Cita a Lei, em Vez de Inventá-la | Veriprajna
O chatbot MyCity de Nova York disse a locadores que eles poderiam recusar vouchers da Section 8. Disse a empresas que elas poderiam ignorar a proibição de estabelecimentos sem dinheiro em espécie. Disse a empregadores que eles poderiam ficar com as gorjetas dos trabalhadores.
AssistirModernização de COBOL Legado com Inteligência de Grafo de Conhecimento | Veriprajna
70-80% dos projetos de modernização de mainframe fracassam. Não porque a tecnologia esteja errada, mas porque as ferramentas tratam o código como texto em vez de topologia. Construímos o mapa da sua base de código antes de tocar em uma única linha, para que sua migração tenha êxito onde outras queimaram milhões e não entregaram nada.
AssistirIntegridade de Implantação de Atualizações de Software e Resiliência de TI | Veriprajna
Em 19 de julho de 2024, um único arquivo de configuração derrubou 8,5 milhões de máquinas Windows em menos de 90 minutos. Não foi malware.
Perguntas Frequentes
Quanto custa implementar a verificação de citações de IA?
Os custos de verificação variam conforme a profundidade. A checagem de entailment baseada em NLI adiciona 50–200 ms e frações de centavo por afirmação. A decomposição de fatos atômicos com verificação aumentada por busca adiciona 2–5 segundos e US$ 0,01–0,05 por resposta. Para um sistema que processa 10.000 consultas por dia, a decomposição completa demanda US$ 100–500/dia em custos exclusivos de verificação, além da geração e recuperação. O custo de implementação depende da sua infraestrutura existente: equipes com uma stack madura de RAG necessitam de trabalho de integração e configuração do framework de avaliação. Equipes partindo do zero precisam de recuperação, geração e verificação construídas em conjunto. Dimensionamos cada projeto com projeções explícitas de custo por consulta, tornando os gastos com verificação previsíveis, e ajudamos você a adequar a profundidade da verificação ao risco real em vez de aplicar a abordagem mais cara em todas as áreas.
Por que as citações de IA falham mesmo quando a recuperação retorna os documentos corretos?
Porque recuperação e verificação são problemas distintos. A recuperação localiza trechos tematicamente relevantes. A citação exige que o trecho específico implique logicamente (entailment) a afirmação específica realizada. Um estudo de 2025 revelou que 57% das citações geradas por RAG apresentam racionalização post-hoc: o modelo define sua resposta primeiro e depois localiza correspondências superficiais de tokens nos documentos recuperados para construir uma citação. O trecho é real. A citação parece correta. Mas o trecho não sustenta de fato a afirmação. Isso falha de forma silenciosa porque o formato da citação está correto, a fonte existe e o texto pertence àquela fonte. Apenas a verificação de entailment, checando se a fonte sustenta logicamente a afirmação, captura esse modo de falha.
Qual é a diferença entre grounding, atribuição e fidelidade?
Esses termos são frequentemente confundidos, mas medem aspectos diferentes. O grounding avalia se a saída do modelo é baseada no contexto fornecido e não em conhecimento paramétrico. A fidelidade avalia se a saída representa com precisão o conteúdo de suas fontes, sem distorções. A atribuição avalia se cada afirmação é rastreável até uma fonte específica e citável. Uma resposta pode ter grounding (baseada em documentos recuperados), mas ser infiel (deturpando o que esses documentos dizem). Ela pode ser fiel, porém sem atribuição (precisa, mas sem meio de verificar qual fonte sustenta qual afirmação). A verificação exige os três pilares: a resposta precisa ter grounding em fontes fornecidas, ser fiel ao que essas fontes dizem e ser atribuída no nível da afirmação, permitindo que cada declaração seja verificada de forma independente.
Como a Citations API da Anthropic se compara ao grounding do Google Vertex AI?
Eles resolvem problemas adjacentes, porém diferentes. A Citations API da Anthropic divide seus documentos de origem em sentenças e cita automaticamente afirmações na saída do Claude. A Endex relatou que as alucinações de fontes caíram de 10% para 0% após a integração. Funciona bem para perguntas e respostas sobre documento único com atribuição clara em nível de trecho. O Grounding do Google Vertex AI utiliza um modelo Gemini ajustado em modo de alta fidelidade para aderir com mais rigor ao contexto fornecido, com vinculação de fontes em nível de sentença e recuperação dinâmica que equilibra resultados de busca com o conhecimento do modelo. O Vertex é mais forte para aplicações ancoradas na web. Nenhum dos dois lida com verificação de síntese de múltiplas fontes, checagem temporal ou validação de precisão numérica. Ambos são componentes úteis em uma stack de verificação, mas nenhum constitui um sistema de verificação completo por si só.
Qual verificação é necessária para IA em ambientes jurídicos e de saúde?
Os setores jurídico e de saúde representam os ambientes de citação de maior risco. Pesquisadores de Stanford constataram que LLMs jurídicos alucinam entre 58% e 88% das vezes em questões verificáveis, com precedentes e decisões judiciais alucinados em pelo menos 75% dos casos. Na saúde, 91,8% dos médicos pesquisados relataram ter encontrado alucinações médicas, e 84,7% as consideraram capazes de causar danos aos pacientes. Para esses domínios, implementamos decomposição de fatos atômicos com verificação de entailment em cada afirmação, checagem temporal para garantir que regulamentos ou diretrizes citadas estejam vigentes, verificação numérica para dosagens, estatísticas e citações legais, além de escalonamento com intervenção humana quando a confiança automatizada fica abaixo de limites específicos do setor. A FDA classificou a alucinação como um novo risco para dispositivos médicos baseados em IA, e o relatório de supervisão da FINRA de 2026 exige trilhas de auditoria para o raciocínio de agentes de IA.
Como medir a qualidade das citações em produção?
Monitoramos quatro métricas continuamente. Precisão de citação: dos trechos citados, qual porcentagem realmente sustenta a afirmação associada por meio de verificação de entailment. Revocação de citação: das afirmações que deveriam ter citações, qual porcentagem está devidamente atribuída. Acurácia de entailment: a taxa de aprovação de pares afirmação-citação no NLI. Especificidade da fonte: se as citações apontam para o parágrafo exato que dá suporte versus apenas o documento. Pesquisas do Allen Institute indicam que a precisão de citações em RAG fica em média entre 65% e 70% sem treinamento de atribuição. O HHEM da Vectara avalia a fidelidade de sumarização em uma escala de 0 a 1, mas não afere a acurácia de citações. O RAGAS checa grounding, mas não atribuição. Construímos um framework de avaliação unificado que mapeia essas métricas para sua tolerância ao risco, executa no seu pipeline de CI/CD e emite alertas quando qualquer indicador cai abaixo do limite definido.
O que é decomposição de fatos atômicos e quando devemos usá-la?
A decomposição de fatos atômicos divide a resposta do modelo em declarações verificáveis individuais antes de checar cada uma contra sua fonte citada. O método SAFE da Google DeepMind comprovou que essa abordagem concorda com anotadores humanos em 72% das vezes e, onde há discordância, o sistema automatizado está correto em 76% dos casos, com custo 20 vezes menor do que a revisão humana. A percepção central: uma única sentença costuma conter múltiplos fatos, sendo alguns sustentados e outros forjados. O NLI em nível de sentença frequentemente classifica uma frase parcialmente fundamentada como inteiramente sustentada por entailment porque os fatos corretos dominam o sinal. A decomposição identifica o fato forjado dentro de uma sentença que aparenta estar correta. Utilize-a quando uma única declaração errada trouxer consequências materiais: peças jurídicas, prontuários clínicos, demonstrações financeiras, submissões regulatórias. Para aplicações de menor risco, como bots internos de FAQ, a verificação de NLI em nível de sentença costuma ser suficiente.
Quando a verificação completa de citações é desnecessária?
A verificação completa baseada em decomposição acrescenta de 2 a 5 segundos de latência e US$ 0,01–0,05 por resposta. Para um bot interno de conhecimento com 10.000 consultas diárias, isso representa US$ 100–500/dia apenas em custos de verificação. Se respostas incorretas forem apenas inconvenientes, mas não causarem danos, uma checagem básica de ancoragem (Azure Content Safety ou Bedrock Contextual Grounding) combinada com melhorias na recuperação costuma ser suficiente por uma fração do custo. A verificação completa compensa o investimento quando saídas erradas acarretam impactos financeiros, legais, clínicos ou regulatórios. O critério de decisão: qual é o custo de uma única alucinação não detectada alcançar um usuário? Se a resposta for calculada em valores de responsabilidade civil, multas regulatórias ou riscos à saúde do paciente, a verificação se paga. Se o impacto for apenas um chamado no suporte, métodos mais leves atendem.
Construa sua IA com confiança.
Faça parceria com uma equipe que tem profunda experiência na construção da próxima geração de IA empresarial. Deixe-nos ajudá-lo a projetar, construir e implementar uma estratégia de IA em que você possa confiar.
Veriprajna consultoria de Deep Tech é especializada na construção de sistemas de IA críticos para a segurança nas áreas de saúde, finanças e domínios regulatórios. Nossas arquiteturas são validadas em relação a protocolos estabelecidos, com documentação de conformidade abrangente.