AIアウトリーチのための検証およびガバナンス層
AI SDRはボリュームを最適化し、単一パスのモデルは鮮度切れソース、誤エンティティ、過大主張の記述をそのまま出荷します。Veracity EngineはLLMに下書きを書かせ、その後、純粋なPythonのチェックが未証明の主張をすべて除去し、残ったものを採点し、リスク較正済みポリシーゲートへ回します。エージェントは助言し、コードが決定します。
100%
主張が残ったときの送信完全性
送信メール内のすべての主張がソースに裏付けられている
25/25
ラベル付きゴールデンセットにおける判定精度
決定論的かつ再現可能(25件ベンチマーク)
3
送信前の決定論的チェック
グラウンディング、エンティティ一致、時間的妥当性
これは実行可能なデモです。リトリーバル、CRM、メール送信はシミュレートされており、リードはWerner Enterprisesを除き合成です。Werner Enterprisesの10-K抜粋は実在の公開記録です。
広く報じられたAI SDR炎上の背後にある失敗モード。
AI SDRは、より多く送るために作られています。単一パスのLLMは、見込み客固有の主張のうち測定可能な割合をハルシネーションし、パーソナライゼーションツールは、できた主張を現行でエンティティが正しいソースに照らして再検証することはありません。そのため、鮮度切れソース、誤エンティティ、過大主張の記述がそのまま出荷され、検証は送信後に後付けされるか、そもそも行われません。
業界の文脈は厳しいものです。単一パスのLLMは、見込み客固有の主張の12〜18%をハルシネーションします(AI SDR Industry Report、2026)。エンタープライズAI SDRのチャーンは年あたり50〜70%です(UserGems、2026)。11x.aiは$74Mを調達し、2025年に70〜80%のチャーンで崩壊しました(TechCrunch)。エージェント特化のガバナンスを持つエンタープライズはわずか7%であり(Deloitte、2026)、Gartnerは2027年までにエージェント型AIプロジェクトの40%超が放棄されると予測しています。2025年11月以降、0.3%を超えるスパム率はGmailのSMTPレベルの拒否を引き起こし、ドメイン回復には6〜12週間かかります。
本当のバグは、悪い文法ではありません。文法は完璧であり、だからこそより悪いのです。危険なのは、正しく引用されているが誤解を招く形で使われる主張です。鮮度切れソースから引き抜かれた真の事実、同名の別会社についての真の事実、あるいはソースと矛盾するベンダー主張。私たちはそれを文脈的誤用と呼び、より良いベースモデルでも除去できません。完璧なモデルでも、FINRAやGDPRに対して、どの現行ソースがどの主張を裏付けたかを証明することはできません。
LLMが下書きする。決定論的なコードが出荷内容を決める。これはニューロシンボリックです。ニューラルな執筆、シンボリックな検証。
パイプラインはLead、次にResearch(各事実が日付付きソースに紐づくファクトシート)、次にDraft(ファクトシートのみに制約されたWriter LLM)、次にVerify(決定論的チェック)、次にポリシーゲート、次に署名済み監査レシート、次にシミュレートされたCRMライトバックの順で進みます。検証ステップは、LLMがLLMを判定するものではありません。純粋なPythonなので、同じ入力は毎回同じ判定を返します。
各事実主張は、引用されたソースに照らして検査されます。最初に失敗したチェックが勝ち、優先順位は unsourced、次に contradicted、次に entity mismatch、次に stale です。
主張はソーススニペットから含意されるか。コンテンツトークンのトークン重複は少なくとも0.5でなければならず、会社名トークンは除外されるため、会社名を繰り返すだけでは高得点にはなりません。
ソースはこの正確な見込み客についてのものか、同名の別会社ではないか。語が揃っていても、同名の別企業についてのソースは不合格です。
主張が鮮度の言葉("recently"、"just"、"now"、"this week")を使う場合、ソースは365日以内でなければなりません。事実が真であっても、より古いソースは鮮度切れとマークされます。
さらに2つのガードが並行して動作します。ベンダー矛盾チェックと、0.3の文の忠実性下限です。これにより、ライブLLMが有効な事実idに乗せてハルシネーションした文を出すことを止めます。判定語彙がインターフェースの色を駆動します。supported(緑)は合格、stale(琥珀色)、entity_mismatch(赤)、contradicted(赤)、unsourced(赤)は不合格です。
ゲートはsupportedでない主張をすべて除去し、2つの数値を報告します。Veracity Scoreは、下書き中の事実主張の総数で割ったsupported主張であり、AIが書いた内容のうち実際に真であった割合です。送信完全性は、少なくとも1件の主張が残れば100%です。送信メールにはソース裏付け済みの主張だけが含まれるからです。それが設計上の保証です。
ルーティングはリスクに従います。安全に残るものが何もない、または下書きのカバレッジが0.5を下回る場合、メールは改訂されます。規制対象、Cスイート、または少なくとも$100,000の案件である高価値の場合は、100%クリーンな下書きでも人間レビューへ送られます。それ以外は自動適格です。比較モードであるStandard AI SDRは、リサーチ、下書き、送信を行い、送信前に検証された主張は0件です。アプリはそれを、すでに出てしまったものに対する事後のシャドーチェックとして示します。
デモコーパスからの3件のリード(アンカー日付 2026-06-17)。以下の画像はすべて、実行中のアプリのスクリーンショットです。
Northwind Logisticsのリード(合成のミッドマーケット3PL)では、下書きは同社が「recently expanded into APAC」と主張します。ソースは実在のNorthwind APACニュースであり、グラウンディング重複は100%、エンティティも正しいです。しかしソース日付は2019-03-14で、365日の鮮度ウィンドウに対し2,652日前(約7.3年)なので、時間的妥当性が失敗し、主張は除去されます。Veracity Engineはsupportedの主張を残し(2026-06-09日付の求人で裏付けられた、Salesforce管理者6人の採用推進が先頭)、悪い主張2件を捕捉し、100%ソース裏付けのメールを送信します。
Werner Enterprises, Inc.は実在の上場企業であり、ソースW1とW2はFY2023 Form 10-K(SEC EDGAR、CIK 0000793074、提出日2024-02-26)からの逐語抜粋です。下書きの主張「recently growing your One-Way Truckload fleet to 2,735 trucks」は事実として実在しますが、提出書類は2年超前なので、「recently」という枠組みは鮮度切れとして捕捉されます。これが、SEC提出書類のパーソナライゼーションツールが開けたままにする、まさに時間的誤用のギャップです。(このリードの連絡先と求人は合成です。実在なのはWernerとその10-K抜粋だけです。)
再びNorthwindリードでは、下書きは「$40M Series B」も主張します。引用ソースは実在ですが、「Northwind Inc.」(Austinのサイバーセキュリティスタートアップ)についてのものであり、「Northwind Logistics」ではありません。エンティティ一致チェックが失敗し、出荷前に主張は除去されます。
Atlas Capital Marketsは合成のFINRA規制ブローカー・ディーラーで、チーフ・レベニュー・オフィサーの連絡先と$220,000の案件があります。100%クリーンで完全にソース裏付けの下書きでも、規制対象、Cスイート、かつ$100,000のしきい値を超えるため、ポリシーゲートは人間レビューへ強制します。クリーンな下書きは、送信可能な下書きと同じではありません。
すべてのメールが、ダウンロード可能なJSON監査レシートを生成します。モデルのプロバイダーとバージョン、見込み客とリスク階層、ファクトシート、各主張の判定とそのソーススパンおよび日付、Veracity Score、発火したポリシールール、そして人間の承認者です。25件のラベル付きゴールデンセットでは、決定論的検証器の判定精度は25/25です。難しいまたは悪い主張10件中10件を捕捉し、クリーンな主張15件中15件を保全。その再現性こそが認証可能にするものであり、LLM審判にはできません。私たちは25/25を、このラベル付きベンチマークに帰属させ、オープンワールドの保証としては述べません。
デモが並べて比較する、同じトグル。
| 観点 | Standard AI SDR | Veracity Engine |
|---|---|---|
| 送信前に検証される主張 | 0 | すべての事実主張を、決定論的に |
| 出荷内容を決めるのは誰か | LLMが下書きしたものを送信する | 純粋なPythonのチェックであり、LLMではない |
| 鮮度切れソースの捕捉 | なし | 時間的妥当性、365日ウィンドウ |
| 同名の誤エンティティ | なし | エンティティ一致チェック |
| 監査証跡 | なし | メールごとの署名済みJSONレシート |
| 高リスクの扱い | それでも送信する | 人間レビューへ回す |
いいえ。私たちは市場にもう一つのAI SDRを足しません。Veracity Engineは、下書きの後に位置する検証およびガバナンス層です。決定論的で純粋なPythonの検証器が、AIが書いた各主張を、日付付きでエンティティ一致したソースに照らして検査し、未証明のものを除去し、メールの送信が許可される前に署名済み監査レシートを書き出します。AI SDRはボリュームを最適化します。私たちは、安全に出荷できるものを判断します。
下書き中のすべての事実主張が、3つの決定論的チェックを通ります。グラウンディング(主張はソーススニペットから含意されるか、トークン重複は少なくとも0.5)、エンティティ一致(ソースはこの正確な見込み客についてであり、同名企業ではないか)、時間的妥当性(主張が鮮度の言葉を使う場合、ソースは365日以内でなければならない)。合格した主張だけがsupportedとマークされ残されます。それ以外はすべて除去されます。検証器はコードであり、LLMがLLMを判定するものではないため、同じ入力は常に同じ判定を返します。
それがまさに、私たちが構築した失敗モードであり、デモは文脈的誤用と呼びます。ある実演リードでは、「recently expanded into APAC」という文はグラウンディングされ、正しい会社についてのものですが、唯一のソース日付は2019年で、365日の鮮度ウィンドウに対し2,652日前であり、鮮度切れとして捕捉され除去されます。同じパターンを、FY2023のSEC 10-Kに裏付けられた実在のWerner Enterprisesの主張でも示します。事実としては正確ですが、提出書類は2年超前なので、「recently」という枠組みは時間的妥当性に失敗します。
そここそ、検証およびガバナンス層が最も重要になる場所です。ハルシネーションや誤帰属の主張には規制上の帰結が伴うからです。デモでは、ポリシーゲートは、規制対象、Cスイートの連絡先宛て、または少なくとも$100,000の案件に紐づくメールを、下書きが完全にソース裏付けであっても人間レビューへ回します。ここでのガバナンスは、正しさだけでなくリスクの関数です。
各メールは、ダウンロード可能なJSON監査レシートを生成し、モデルのプロバイダーとバージョン、見込み客とリスク階層、ファクトシート、すべての主張の判定とそのソーススパンおよび日付、Veracity Score、発火した正確なポリシールール、人間の承認者を記録します。どの主張も数秒でソースまで遡れます。完璧なモデルでも、監査人に対してどの現行ソースがどの主張を裏付けたかを証明できません。レシートならできます。
いいえ。それが持続する論点です。より良いベースモデルもなお下書きし、ハルシネーション率ゼロを主張する者は正直ではないので、プロベナンスを証明し、監査証跡を残し、リスクでゲートする必要性は消えません。プロベナンス、監査レシート、ポリシーゲートは持続する性質です。より強いライターが、書いたものを検証し統治する要件を除去するわけではありません。
メカニズムを証明する実行可能なデモであり、デプロイ済みパイプラインではありません。リトリーバルソース(EDGAR、LinkedIn、Greenhouse、ニュース)、CRMの読み書き、メール送信はシミュレートであり、ファクトシートは事前構築です。リードはWerner Enterprisesを除き合成で、その10-K抜粋は実在の公開記録です。決定論的検証器、ポリシーゲート、監査レシートは実在し、示されているとおりに動作します。
このデモの背後にある研究——アーキテクチャ、検証設計、そしてエンタープライズの青写真。
ソリューション全体
AIセールスインテリジェンス & 検証済みアウトリーチのソリューションを見る →検証およびガバナンス層こそが難しい部分です。私たちがそれを構築します。
規制対象の買い手に、ハルシネーションした主張を出すリスクを負わずにAIアウトリーチを届ける方法を探っているなら、その考え方をぜひ聞かせてください。問題は業界全体のものであり、答えもそうなるでしょう。