AIは情報源を引用しますが、それを検証しているわけではありません。
最も危険なAI出力とは、引用元が示されているように見えるものです。検索拡張システムが一節(パッセージ)を返し、モデルが回答を生成し、その隣に出典が表示されます。ユーザーはその引用が主張を裏付けていると思い込みます。しかし実際には、 57%のケースで裏付けられていません。
2025年の研究によると、RAG生成による引用の半数以上が「事後合理化(post-hoc rationalization)」を示していることが判明しました。モデルがまず回答を決定し、その後に検索された文書をスキャンして表面的に一致するトークンを探し、参照を捏造するのです。引用自体は実在します。文書も存在します。一節はその文書からの引用です。しかし、その一節は実際には主張を裏付けていません。
これは検索(リトリーバル)の問題ではありません。検索パイプラインが適切な文書を返したとしても、引用が誤っている可能性は依然として存在します。当社のアプローチは、AIの生成とユーザーの間に介在する検証レイヤーを構築することです——検索の改善やプロンプトの調整ではなく、出力内の各主張が参照先の情報源によって実際に裏付けられるよう設計された独立した検証であり、そのアーキテクチャは LLMラッパーを超えた真実性の構築に関する当社のホワイトペーパーで提示されています。
なぜ「検索+プロンプティング」だけでは検証にならないのか
大半のチームはグラウンディングを検索の問題として扱っています。チャンクの最適化、リランカーの導入、システムプロンプトでの「提供されたコンテキストのみに基づいて回答せよ」という指示などがその典型です。しかし、これでは本質的な失敗原因を見落としています。モデルは指示に逆らっているのではなく、不誠実に従っているのです。コンテキスト内で表面的に一致するトークンを見つけ出し、引用として結びつけているに過ぎません。その一節は、主張を論理的に含意(entail)していないのです。
検証とは、別個の目的を持つ独立したシステムです。生成コンポーネントは情報源の注記を伴う主張候補を生成し、流暢性を最適化します。一方、検証コンポーネントは、引用された各情報源が注記された主張を実際に裏付けているかを独立して評価し、 含意(entailment):すなわち「この情報源はこの特定の主張を論理的に裏付けているか?」を最適化します。これらを独立したサブシステムとして運用する場合—— ニューロシンボリック検証に関する当社の研究 で詳述したデュアルシステム・パターンにおいて——ハルシネーションがユーザーに届くには、両方のシステムを欺かなければなりません。
当社は、含意検出のためにファインチューニングされたNLIモデルと原子的事実分解(atomic fact decomposition)を組み合わせ、このデュアルシステム・アーキテクチャを実装します。Google DeepMindの SAFE アプローチが示したように、検証前に回答を個々の原子的事実に分解する手法は、文レベルのチェックを劇的に上回る成果をあげています。SAFEは人間のアノテーターと 72% の割合で一致し、判断が分かれた場合でも、自動検証は 76% の確率で正しく、かつコストは 20分の1(20x低コスト)です。当社はお客様のドメインに合わせてこの手法を適合させます。なぜなら、法的準備書面における「原子的事実」の定義は、臨床サマリーや財務開示資料における定義とは異なるからです。
主要ベンダーのグラウンディングAPIが実際にできること(そしてできないこと)
過去18か月間に、主要なクラウドプロバイダー各社がグラウンディング機能を提供し始めました。しかし、そのいずれも問題を根本から解決するものではありません。
| ベンダーの提供機能 | 機能の内容 | 実証された成果 | 限界と課題 |
|---|---|---|---|
| AnthropicのCitations API | ソース文書を文単位にチャンク分割し、Claudeの出力内の主張に自動で引用を付与。 | Endex社の報告によると、導入後に情報源ハルシネーションが10%から0%に激減し、回答あたりの参照数が20%増加しました。単純なQAにおける単一文書の引用としては最も優れたベンダー機能です。 | 複数ソースの統合、時間的(時系列)検証、または数値の正確性検証には対応していません。 |
| Google Vertex AI Grounding | ファインチューニングされたGeminiモデルを用いた高忠実度モードを提供し、文レベルの情報源付与を伴うコンテキスト準拠の回答を生成。 | Webグラウンディングを活用したアプリケーションに強み。 | 社内文書コーパスへの対応には制限があります。 |
| Azure AI Groundedness Detection | 高速モードでのグラウンディング有無のバイナリスコアリング、または推論モードでの自動修正を伴う詳細な説明を提供。 | 生成後のフィルタリングとして有用。 | 一節(パッセージ)レベルでの引用精度は検証しません。 |
| Amazon Bedrock Contextual Grounding | 設定可能な閾値に基づいて確信度スコアを生成。 | 抽出タスクにおいて75%以上のハルシネーションを検出すると主張。 | 引用レベルの検証向けには設計されていません。 |
4社すべてに共通するギャップ:モデルが提供されたコンテキストから逸脱したことは検出できても、特定の主張に付与された個別の引用が、論理的含意によって実際に裏付けられているかまでは検証しません。まさにその検証レイヤーこそ、当社が設計・構築するものです。
リスクプロファイルに応じた3つの検証アーキテクチャ
NLI(自然言語推論)に基づく含意検証
完全な分解によるレイテンシコストをかけずに主張ごとの検証を必要とするチーム向け。生成された各主張は引用された一節とペアにされ、NLIモデルによって含意、矛盾、または中立が評価されます。「矛盾」または「中立」と判定された主張にはフラグが付けられるか、抑制されます。これにより 主張あたり50〜200msのレイテンシが追加されますが、高スループットのワークロードを処理し、最も一般的な失敗パターンである「話題としては関連しているが裏付けにはなっていない一節を指す引用」を捕捉できます。
当社では、単一モデルではなく、キャリブレーションされたNLIアンサンブル( HALT-RAG 手法)を採用しています。個々のNLIモデルにはドメイン固有の死角が存在しますが、アンサンブルによってそれらを平滑化できるためです。
検索拡張検証を伴う原子的事実分解
1つの文に検証可能な複数の言明が含まれうるため、主張単位のチェックだけでは不十分な高リスク領域向け。各回答を個々の事実に分解し、それぞれに対して的を絞った検証クエリを生成した上で、引用された情報源と外部の権威ある参照先の双方と照合します。これはSAFEから派生したアプローチです。
文レベルのNLIが見落とすエラーを捕捉します。たとえば、1つの文が部分的に裏付けられている場合(2つの事実は正しく、1つが捏造)、NLIは文全体を含意と判定してしまうことがよくあります。分解には 3〜5倍の推論コスト がかかりますが、格段に多くのエラーを捕捉できます。当社はこれを、法的申立書、臨床文書、財務開示、その他1つの誤った数値が重大な影響を及ぼすあらゆる領域に適用しています。
時間的・数値的検証を伴う継続的検証
情報源の有効性が時間の経過とともに変化する規制環境向け。分解アプローチを拡張し、以下の3つの追加チェックを実施します:
- 時間的検証 ——その主張が言及している日付において、該当する規制は施行されていたか?
- 数値検証 ——このパーセンテージは、概算ではなくソースの表と完全に一致しているか?
- 主張間の整合性チェック ——同一の回答内にある複数のグラウンディングされた主張同士が矛盾していないか?
当社は、引用された文書が最後に検証された日時を追跡する情報源鮮度インデックスを保持し、元資料が更新された際には再検証をトリガーします。これは、改廃された規制や古い統計の引用がコンプライアンスリスクとなる組織向けのアーキテクチャであり、詳細については 政府系AIにおける法令引用の強制に関する当社の研究で論じられています。
グラウンディング品質の測定(真に重要な評価指標)
評価手法の状況は断片化しています。VectaraのHHEMは事実の一貫性をスコアリングしますが、測定しているのは要約の忠実度(faithfulness)であり、引用精度ではありません。RAGASはグラウンディングをチェックしますが帰属(アトリビューション)は測定しません。ALCEベンチマークは学術データセット上で引用適合率/再現率を評価しますが、エンタープライズの実態を反映していません。アレン人工知能研究所(Allen Institute)の研究によると、帰属トレーニングを行わない場合、RAGにおける引用精度の平均は 65〜70% にとどまります。
当社のアプローチは、重要な要素を的確に測定し、閾値に基づくアラート機能を備えて継続的に稼働する評価基盤を構築することです:
- 引用適合率 ——引用された一節は、その主張を実際に裏付けているか?
- 引用再現率 ——検証可能な主張に、適切な情報源が付与されているか?
- 含意精度 ——NLIモデルの合格率。
- 情報源の特異性 ——文書全体レベルではなく段落レベルでの帰属付与。
完全な検証が過剰となるケース
完全な検証にはコストがかかります。検索拡張チェックを伴う原子的分解は、現在のモデル価格設定で 2〜5秒のレイテンシ および 回答あたり$0.01〜0.05 を追加します。1日あたり10,000件のクエリに回答する社内ナレッジボットの場合、これは生成と検索の費用に加えて、検証コストだけで 1日あたり$100〜500 に相当します。
すべてのアプリケーションにここまでの検証が必要なわけではありません。当社は、検証の深度を実際のリスクと適合させる支援を行います——このアセスメントはすべてのエンゲージメントに含まれており、お客様のユースケースに対してよりシンプルなアプローチで十分である場合は、その旨を率直にお伝えします。
| 対象アプリケーション | 誤りがあった場合のリスク | 最適化された検証アプローチ |
|---|---|---|
| 社内FAQチャットボット | 誤った回答は不便だが、実害はない | 検索品質の向上に加えて、基本的なグラウンディング検証(AzureまたはBedrock)を組み合わせるだけで十分と考えられます。 |
| リーガルリサーチツール | 架空の引用が裁判所の制裁金につながる可能性がある | 含意検証を伴う完全な原子的分解が最低限必要です。 |
| 臨床意思決定支援 | 捏造された薬物相互作用が患者に危害を及ぼす可能性がある | 時間的検証およびHuman-in-the-loopによるエスカレーションを伴う継続的検証。 |
提供成果物
エンゲージメントは以下を提供するようスコープされます——これは 引用強制を備えた政府系AIの実働デモで提示しているものと同等の検証クラスです:
- お客様のリスクプロファイル、レイテンシ許容量、およびソース文書タイプに適合した検証アーキテクチャ。
- 既存の検索スタックと統合された、NLIベースまたは分解ベースの検証パイプライン。
- 適合率、再現率、含意精度、および情報源特異性の各指標を備えた引用品質評価フレームワーク。
- 閾値ベースのアラート機能を備えた継続的モニタリング。
- 監査証跡要件(FINRAテレメトリ、EU AI Act透明性、FDAトレーサビリティ)に向けたコンプライアンスワークフローとの統合。
- お客様のドメイン向けに調整された既知のハルシネーション検出プローブのテストスイート。
- 完全な検証を展開すべき箇所と軽量なチェックで済ませる箇所を的確に判断するための検証コストモデル。
重要ポイント
- 一見正しそうに見える引用であっても、検証されたとは言えません。RAGによる引用の57%は実際には主張を裏付けておらず、情報源自体は実在するため、その破綻は表面化せず見過ごされます。
- 検証は検索とは異なる別個のシステムです。ハルシネーションがユーザーに届くには、独立した含意チェックを再度欺く必要があります。
- 主要ベンダーのグラウンディングAPI(Anthropic、Google Vertex、Azure、Bedrock)はコンテキストの逸脱を検出しますが、一節レベルでの引用精度を検証できるものはありません。
- リスクに応じて拡張可能な3つのアーキテクチャ:NLI含意検証(主張あたり50〜200ms)、原子的事実分解(3〜5倍の推論コスト)、および継続的な時間的・数値的検証。
- 完全な検証コストは回答あたり$0.01〜0.05です。当社は、検出されなかった単一のハルシネーションがユーザーに届いた場合の損失コストに合わせて、検証の深度を最適化します。
グラウンディング・引用&検証
視聴AI製造物責任ディフェンス | Veriprajna
エンタープライズのAI責任は、過失責任から厳格な製造物責任へと移行しています。Veriprajnaは、Section 230以後の時代に直面する法務チームのために、防御可能なAIアーキテクチャ、訴訟対応の監査証跡、保険ポジショニングパッケージを構築します。
視聴AI検証 & アンチAIウォッシング・コンプライアンス | Veriprajna
規制当局に問われる前に、あなたのAIの主張を実証する。VeriprajnaはSEC、FTC、州司法長官のコンプライアンス向けに、AI検証アーキテクチャ、AIBOMシステム、主張の実証パッケージを構築します。
視聴AIを活用した洪水リスク引受 | Veriprajna
米国の洪水被害の3分の2以上は、FEMAの高リスクゾーンの外で発生しています。貴社のレーティングエンジンがいまだにゾーンAE対ゾーンXを基準にしているなら、両側でリスクを誤って価格設定していることになります。ゾーン内の高床式住宅には過剰請求し、ゾーン外のスラブ・オン・グレード住宅には過少請求しているのです。
視聴EコマースAI精度・信頼性エンジニアリング | Veriprajna
AIと関わる買い物客は、関わらない買い物客の4倍の率でコンバージョンします。しかし、たった一つの幻覚的な製品仕様、一つの捏造された返品ポリシー、一つの安全性を欠いたレコメンデーションがSNSで共有されれば、プロジェクト全体の節約額を上回るコストが発生します。当社は、EコマースAIを本当に信頼できるものにする検証・グラウンディング・コンプライアンスのレイヤーを構築します。
視聴規制業界向けエンタープライズAI検証 | Veriprajna
Klarnaは700名のカスタマーサービス担当者をAIに置き換えました。コストは40%下がりました。その後、顧客満足度は崩壊し、再問い合わせが急増し、2025年第1四半期は9,900万ドルの純損失で終わりました。
視聴法律を捏造せず、引用する行政AI | Veriprajna
ニューヨーク市のMyCityチャットボットは、家主にセクション8バウチャーの受け取りを拒否できると伝えました。事業者にはキャッシュレス禁止を無視できると伝えました。雇用主には従業員のチップを取得できると伝えました。
よくあるご質問
AI引用検証の実装にはどのくらいのコストがかかりますか?
検証コストは深度に応じてスケールします。NLIベースの含意チェックは主張あたり50〜200msと1セント未満の費用を追加します。検索拡張検証を伴う原子的事実分解は、回答あたり2〜5秒と$0.01〜0.05を追加します。1日あたり10,000クエリを処理するシステムの場合、完全な分解は生成と検索の費用に加えて、1日あたり$100〜500の検証コストがかかります。構築コストは既存のインフラによって異なります。成熟したRAGスタックを持つチームには統合作業と評価フレームワークのセットアップが必要です。ゼロから開始するチームには、検索、生成、検証を一括して構築します。当社はすべてのエンゲージメントをクエリごとの明確なコスト予測に基づいてスコープし、検証支出を予測可能にするとともに、最も高価な手法を一律に適用するのではなく、検証の深度を実際のリスクに適合させる支援を行います。
検索によって正しい文書が返されているにもかかわらず、なぜAIの引用は破綻するのですか?
検索と検証は本質的に異なる課題だからです。検索は話題として関連する一節を見つけ出します。一方、引用は特定の一節が、述べられている特定の主張を論理的に含意(裏付け)していることを要求します。2025年の研究によると、RAGが生成した引用の57%が「事後合理化」を示していることが判明しました。モデルがまず回答を決定し、その後検索された文書から表面的に一致するトークンを探して引用を捏造するのです。一節自体は実在し、引用の形式も正しく見えますが、その一節は実際には主張を裏付けていません。引用フォーマットが正しく、情報源が存在し、テキストもその情報源からのものであるため、この破綻は表面化せず見過ごされます。情報源が主張を論理的に裏付けているかを確認する含意検証だけが、この失敗パターンを捕捉できます。
グラウンディング、帰属(アトリビューション)、忠実度(フェイスフルネス)の違いは何ですか?
これらの用語はしばしば混同されますが、測定対象はそれぞれ異なります。グラウンディング(根拠付け)は、モデルの出力がパラメータ知識ではなく提供されたコンテキストに基づいているかを問います。忠実度(フェイスフルネス)は、出力が情報源の内容を歪曲することなく正確に表現しているかを問います。帰属(アトリビューション)は、各主張が引用可能な特定の情報源に遡及できるかを問います。回答はグラウンディングされている(検索された文書に基づいている)ものの不忠実である(それらの文書の内容を誤認して伝えている)場合もあれば、忠実であるものの帰属がない(正確ではあるが、どの情報源がどの主張を裏付けているかを検証する方法がない)場合もあります。検証にはこれら3つすべてが求められます。すなわち、出力は提供された情報源にグラウンディングされ、それらの情報源の内容に忠実であり、かつ個々の言明が独立して検証できるよう主張レベルで帰属付けされている必要があります。
AnthropicのCitations APIとGoogle Vertex AI Groundingの比較はどうなっていますか?
両者は隣接していますが異なる課題を解決します。AnthropicのCitations APIはソース文書を文単位にチャンク分割し、Claudeの出力内の主張に自動で引用を付与します。Endex社は導入後に情報源ハルシネーションが10%から0%に低下したと報告しています。これは明確な一節レベルの帰属を伴う単一文書QAに有効です。Google Vertex AI Groundingは、ファインチューニングされたGeminiモデルを高忠実度モードで使用し、提供されたコンテキストにより密接に従うとともに、文レベルの情報源付与や検索結果とモデル知識のバランスをとる動的検索を提供します。VertexはWebグラウンディングを活用したアプリケーションで強みを発揮します。ただし、いずれも複数ソースの統合検証、時間的(時系列)チェック、数値の正確性検証には対応していません。双方は検証スタックにおける有用なコンポーネントですが、単体で完全な検証システムとなるものではありません。
法務や医療の現場におけるAIにはどのような検証が必要ですか?
法務と医療は、引用に関して最もリスクの高い環境です。スタンフォード大学の研究者によると、リーガルLLMは検証可能な質問に対して58%〜88%の確率でハルシネーションを起こし、裁判所の判示事項の捏造は少なくとも75%の頻度で発生します。医療分野では、調査対象となった臨床医の91.8%が医療ハルシネーションに遭遇したと回答し、84.7%が患者に危害を及ぼす可能性があると認識しています。これらの領域に対して当社は、すべての主張に対する含意検証を伴う原子的事実分解、引用された規制やガイドラインが最新であることを保証する時間的検証、投与量・統計値・法令条文の引用に対する数値検証、ならびに自動化された確信度がドメイン固有の閾値を下回った場合のHuman-in-the-loopエスカレーションを実装します。FDAはAI医療機器における新たなリスクとしてハルシネーションを指摘しており、FINRAの2026年監視レポートではAIエージェントの推論に対する監査証跡が義務付けられています。
本番環境における引用品質はどのように測定しますか?
当社では4つの指標を継続的に追跡します。引用適合率(Citation precision):引用された一節のうち、含意検証を通じて関連する主張を実際に裏付けている割合。引用再現率(Citation recall):引用を持つべき主張のうち、適切に情報源が付与されている割合。含意精度(Entailment accuracy):NLI検証に合格した主張と引用のペアの割合。情報源特異性(Source specificity):引用が単なる文書全体ではなく、正確に裏付けとなる段落を指しているかどうか。アレン人工知能研究所の研究では、帰属トレーニングがない場合、RAGの引用精度は平均65〜70%であることが判明しています。VectaraのHHEMは0〜1のスケールで要約の忠実度を測定しますが、引用精度は評価しません。RAGASはグラウンディングをチェックしますが帰属は評価しません。当社は、これらの指標をお客様のリスク許容度にマッピングし、CI/CDパイプライン内で稼働し、いずれかの指標が定義された閾値を下回った際にアラートを発する統合評価フレームワークを構築します。
原子的事実分解とは何ですか?また、どのような場合に使用すべきですか?
原子的事実分解とは、モデルの回答を検証可能な個々の言明に分解してから、それぞれを引用された情報源と照合する手法です。Google DeepMindのSAFE手法は、このアプローチが人間のアノテーターと72%の割合で一致し、判断が分かれた場合でも自動化システムが76%の確率で正しく、かつ人間のレビューに比べてコストが20分の1(20x低コスト)であることを示しました。重要な洞察は、1つの文に複数の事実が含まれ、その一部は裏付けられており一部は捏造されていることが多いという点です。文レベルのNLIでは、裏付けられた事実が信号を支配するため、部分的に裏付けられた文を含意と判定してしまうことが頻繁にあります。分解を行うことで、他の部分が正確な文の中に紛れ込んだ捏造事実を捕捉できます。1つの誤った言明が重大な影響を及ぼす場面(法的申立書、臨床文書、財務開示、規制当局への提出書類など)で使用すべきです。社内FAQボットのようなリスクの低いアプリケーションであれば、文レベルのNLI検証で通常は十分です。
完全な引用検証が過剰(オーバーキル)となるのはどのような場合ですか?
完全な分解ベースの検証は、2〜5秒のレイテンシと回答あたり$0.01〜0.05を追加します。1日あたり10,000件のクエリを処理する社内ナレッジボットの場合、検証コストだけで1日あたり$100〜500になります。誤った回答が不便であるものの実害がないのであれば、検索品質の向上と基本的なグラウンディング検証(Azure Content SafetyまたはBedrock Contextual Grounding)の組み合わせで、わずかなコストで十分機能する可能性が高いです。完全な検証は、誤った出力が金銭的、法的、臨床的、または規制上の結果をもたらす場合に投資する価値があります。判断基準は次のとおりです。「検出されなかった単一のハルシネーションがユーザーに届いた場合のコストはどれくらいか?」その答えが賠償責任の金額、コンプライアンス罰金、または患者のリスクで測定されるものであれば、検証はそのコストに見合う価値があります。単なるサポートチケットの起票で済むのであれば、より軽量なアプローチで十分です。
確かな信頼のもとに、AIを構築する。
次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。
Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。

