AIアウトリーチのための検証およびガバナンス層

決定論的な検証器が、AIアウトリーチで送信してよい内容を判断します。

AI SDRはボリュームを最適化し、単一パスのモデルは鮮度切れソース、誤エンティティ、過大主張の記述をそのまま出荷します。Veracity EngineはLLMに下書きを書かせ、その後、純粋なPythonのチェックが未証明の主張をすべて除去し、残ったものを採点し、リスク較正済みポリシーゲートへ回します。エージェントは助言し、コードが決定します。

100%

主張が残ったときの送信完全性

送信メール内のすべての主張がソースに裏付けられている

25/25

ラベル付きゴールデンセットにおける判定精度

決定論的かつ再現可能(25件ベンチマーク)

3

送信前の決定論的チェック

グラウンディング、エンティティ一致、時間的妥当性

これは実行可能なデモです。リトリーバル、CRM、メール送信はシミュレートされており、リードはWerner Enterprisesを除き合成です。Werner Enterprisesの10-K抜粋は実在の公開記録です。

検証なきボリュームは、生み出す以上のパイプラインを破壊する

広く報じられたAI SDR炎上の背後にある失敗モード。

AI SDRは、より多く送るために作られています。単一パスのLLMは、見込み客固有の主張のうち測定可能な割合をハルシネーションし、パーソナライゼーションツールは、できた主張を現行でエンティティが正しいソースに照らして再検証することはありません。そのため、鮮度切れソース、誤エンティティ、過大主張の記述がそのまま出荷され、検証は送信後に後付けされるか、そもそも行われません。

業界の文脈は厳しいものです。単一パスのLLMは、見込み客固有の主張の12〜18%をハルシネーションします(AI SDR Industry Report、2026)。エンタープライズAI SDRのチャーンは年あたり50〜70%です(UserGems、2026)。11x.aiは$74Mを調達し、2025年に70〜80%のチャーンで崩壊しました(TechCrunch)。エージェント特化のガバナンスを持つエンタープライズはわずか7%であり(Deloitte、2026)、Gartnerは2027年までにエージェント型AIプロジェクトの40%超が放棄されると予測しています。2025年11月以降、0.3%を超えるスパム率はGmailのSMTPレベルの拒否を引き起こし、ドメイン回復には6〜12週間かかります。

本当のバグは、悪い文法ではありません。文法は完璧であり、だからこそより悪いのです。危険なのは、正しく引用されているが誤解を招く形で使われる主張です。鮮度切れソースから引き抜かれた真の事実、同名の別会社についての真の事実、あるいはソースと矛盾するベンダー主張。私たちはそれを文脈的誤用と呼び、より良いベースモデルでも除去できません。完璧なモデルでも、FINRAやGDPRに対して、どの現行ソースがどの主張を裏付けたかを証明することはできません。

Veracity Engineの仕組み

LLMが下書きする。決定論的なコードが出荷内容を決める。これはニューロシンボリックです。ニューラルな執筆、シンボリックな検証。

パイプラインはLead、次にResearch(各事実が日付付きソースに紐づくファクトシート)、次にDraft(ファクトシートのみに制約されたWriter LLM)、次にVerify(決定論的チェック)、次にポリシーゲート、次に署名済み監査レシート、次にシミュレートされたCRMライトバックの順で進みます。検証ステップは、LLMがLLMを判定するものではありません。純粋なPythonなので、同じ入力は毎回同じ判定を返します。

3つの決定論的チェック

各事実主張は、引用されたソースに照らして検査されます。最初に失敗したチェックが勝ち、優先順位は unsourced、次に contradicted、次に entity mismatch、次に stale です。

1. グラウンディング

主張はソーススニペットから含意されるか。コンテンツトークンのトークン重複は少なくとも0.5でなければならず、会社名トークンは除外されるため、会社名を繰り返すだけでは高得点にはなりません。

2. エンティティ一致

ソースはこの正確な見込み客についてのものか、同名の別会社ではないか。語が揃っていても、同名の別企業についてのソースは不合格です。

3. 時間的妥当性

主張が鮮度の言葉("recently"、"just"、"now"、"this week")を使う場合、ソースは365日以内でなければなりません。事実が真であっても、より古いソースは鮮度切れとマークされます。

さらに2つのガードが並行して動作します。ベンダー矛盾チェックと、0.3の文の忠実性下限です。これにより、ライブLLMが有効な事実idに乗せてハルシネーションした文を出すことを止めます。判定語彙がインターフェースの色を駆動します。supported(緑)は合格、stale(琥珀色)、entity_mismatch(赤)、contradicted(赤)、unsourced(赤)は不合格です。

ポリシーゲート

ゲートはsupportedでない主張をすべて除去し、2つの数値を報告します。Veracity Scoreは、下書き中の事実主張の総数で割ったsupported主張であり、AIが書いた内容のうち実際に真であった割合です。送信完全性は、少なくとも1件の主張が残れば100%です。送信メールにはソース裏付け済みの主張だけが含まれるからです。それが設計上の保証です。

ルーティングはリスクに従います。安全に残るものが何もない、または下書きのカバレッジが0.5を下回る場合、メールは改訂されます。規制対象、Cスイート、または少なくとも$100,000の案件である高価値の場合は、100%クリーンな下書きでも人間レビューへ送られます。それ以外は自動適格です。比較モードであるStandard AI SDRは、リサーチ、下書き、送信を行い、送信前に検証された主張は0件です。アプリはそれを、すでに出てしまったものに対する事後のシャドーチェックとして示します。

エンドツーエンドで示した落とし穴

デモコーパスからの3件のリード(アンカー日付 2026-06-17)。以下の画像はすべて、実行中のアプリのスクリーンショットです。

鮮度切れソースからの真の事実でも、なお送るべきではない

Northwind Logisticsのリード(合成のミッドマーケット3PL)では、下書きは同社が「recently expanded into APAC」と主張します。ソースは実在のNorthwind APACニュースであり、グラウンディング重複は100%、エンティティも正しいです。しかしソース日付は2019-03-14で、365日の鮮度ウィンドウに対し2,652日前(約7.3年)なので、時間的妥当性が失敗し、主張は除去されます。Veracity Engineはsupportedの主張を残し(2026-06-09日付の求人で裏付けられた、Salesforce管理者6人の採用推進が先頭)、悪い主張2件を捕捉し、100%ソース裏付けのメールを送信します。

Northwindリードに対するVeracity Engineの結果:送信メールの100%がソース裏付け、下書きの60%が検証可能、捕捉・除去された2件の主張とその理由がインラインで表示。
Veracity Engineの結果:送信完全性100%、下書きの検証可能率60%、理由付きで打ち消し線が引かれた捕捉済み主張2件。
グラウンディング100%かつエンティティOKを示すエビデンスパネル。しかし時間チェックは失敗:ソース年齢2,652日が鮮度主張の365日を超えるため、判定はstale。
エビデンスパネル:グラウンディングは合格、エンティティは合格、時間的妥当性は失敗(ソース年齢2,652日が365日ウィンドウを超過)。判定:stale。

実在のSEC提出書類における同じギャップ

Werner Enterprises, Inc.は実在の上場企業であり、ソースW1とW2はFY2023 Form 10-K(SEC EDGAR、CIK 0000793074、提出日2024-02-26)からの逐語抜粋です。下書きの主張「recently growing your One-Way Truckload fleet to 2,735 trucks」は事実として実在しますが、提出書類は2年超前なので、「recently」という枠組みは鮮度切れとして捕捉されます。これが、SEC提出書類のパーソナライゼーションツールが開けたままにする、まさに時間的誤用のギャップです。(このリードの連絡先と求人は合成です。実在なのはWernerとその10-K抜粋だけです。)

FY2023のSEC 10-Kに裏付けられた実在のWerner Enterprisesの主張。提出書類が365日の鮮度ウィンドウに対して2年超前のため、鮮度切れとして捕捉。
実在のWerner 10-Kの主張。事実としては正確だが、鮮度の枠組みで鮮度切れとして捕捉。

同名エンティティの衝突

再びNorthwindリードでは、下書きは「$40M Series B」も主張します。引用ソースは実在ですが、「Northwind Inc.」(Austinのサイバーセキュリティスタートアップ)についてのものであり、「Northwind Logistics」ではありません。エンティティ一致チェックが失敗し、出荷前に主張は除去されます。

エンティティ一致失敗を示すエビデンスパネル:引用された資金調達ソースはNorthwind Inc.(Austinのサイバーセキュリティスタートアップ)についてであり、Northwind Logisticsではない。
エンティティ不一致:資金調達ソースが述べているのはNorthwind Inc.であり、Northwind Logisticsではない。

ガバナンスは正しさだけでなく、リスクの問題である

Atlas Capital Marketsは合成のFINRA規制ブローカー・ディーラーで、チーフ・レベニュー・オフィサーの連絡先と$220,000の案件があります。100%クリーンで完全にソース裏付けの下書きでも、規制対象、Cスイート、かつ$100,000のしきい値を超えるため、ポリシーゲートは人間レビューへ強制します。クリーンな下書きは、送信可能な下書きと同じではありません。

Atlas Capital Marketsは、下書きが完全にソース裏付けであっても、規制対象、Cスイート、かつ$220,000の案件であるため、人間レビューへ回された。
Atlasは100%クリーンな下書きでも人間レビューへ:規制対象、Cスイート、案件が$100,000超。

署名済みレシートと、再現可能なベンチマーク

すべてのメールが、ダウンロード可能なJSON監査レシートを生成します。モデルのプロバイダーとバージョン、見込み客とリスク階層、ファクトシート、各主張の判定とそのソーススパンおよび日付、Veracity Score、発火したポリシールール、そして人間の承認者です。25件のラベル付きゴールデンセットでは、決定論的検証器の判定精度は25/25です。難しいまたは悪い主張10件中10件を捕捉し、クリーンな主張15件中15件を保全。その再現性こそが認証可能にするものであり、LLM審判にはできません。私たちは25/25を、このラベル付きベンチマークに帰属させ、オープンワールドの保証としては述べません。

チェックごとのトレース、モデルバージョン、判定、ソーススパン、日付、発火したポリシールールを備えた、ダウンロード可能なJSON監査レシート。
署名済みJSON監査レシート。チェックごとの完全なトレース付き。
判定精度25件中25件を記録した、25件のラベル付きゴールデンセット。決定論的かつ再現可能。
25件のゴールデンセット:判定精度25/25、毎回同じ結果。

Standard AI SDR対Veracity Engine

デモが並べて比較する、同じトグル。

観点 Standard AI SDR Veracity Engine
送信前に検証される主張 0 すべての事実主張を、決定論的に
出荷内容を決めるのは誰か LLMが下書きしたものを送信する 純粋なPythonのチェックであり、LLMではない
鮮度切れソースの捕捉 なし 時間的妥当性、365日ウィンドウ
同名の誤エンティティ なし エンティティ一致チェック
監査証跡 なし メールごとの署名済みJSONレシート
高リスクの扱い それでも送信する 人間レビューへ回す

このデモが行わないこと

  • ✓ ハルシネーション率がゼロだと主張しません。LLMはなお下書きします。保証は、未証明の主張が送信前に除去されることです。ハルシネーション率ゼロを主張する者は、正直ではありません。
  • ✓ ライブコネクタは使いません。EDGAR、LinkedIn、Greenhouse、ニュースのリトリーバル、CRMの読み書き、メール送信はスタブまたはシミュレートであり、ファクトシートは事前構築です。
  • ✓ NorthwindやAtlasを実在企業として提示しません。それらは合成です。実在の公開記録なのはWerner EnterprisesとそのW1/W2の10-K抜粋だけです。
  • ✓ 12〜18%のハルシネーション範囲を、本製品自身の測定結果として報告しません。その数値は市場の文脈です。デモの見出しはプロベナンスカバレッジと自動処理率です。
  • ✓ 顧客、ケーススタディ、推薦の声、ROI数値は持ちません。まだ存在しません。これはメカニズムを証明するデモであり、デプロイメントではありません。

買い手が実際に尋ねる質問

これは11xのような、また別のAI SDRなのか?

いいえ。私たちは市場にもう一つのAI SDRを足しません。Veracity Engineは、下書きの後に位置する検証およびガバナンス層です。決定論的で純粋なPythonの検証器が、AIが書いた各主張を、日付付きでエンティティ一致したソースに照らして検査し、未証明のものを除去し、メールの送信が許可される前に署名済み監査レシートを書き出します。AI SDRはボリュームを最適化します。私たちは、安全に出荷できるものを判断します。

送信前に、AI生成の営業メールの主張をどう検証するのか?

下書き中のすべての事実主張が、3つの決定論的チェックを通ります。グラウンディング(主張はソーススニペットから含意されるか、トークン重複は少なくとも0.5)、エンティティ一致(ソースはこの正確な見込み客についてであり、同名企業ではないか)、時間的妥当性(主張が鮮度の言葉を使う場合、ソースは365日以内でなければならない)。合格した主張だけがsupportedとマークされ残されます。それ以外はすべて除去されます。検証器はコードであり、LLMがLLMを判定するものではないため、同じ入力は常に同じ判定を返します。

技術的には真だが誤解を招く主張を、どう捕捉するのか?

それがまさに、私たちが構築した失敗モードであり、デモは文脈的誤用と呼びます。ある実演リードでは、「recently expanded into APAC」という文はグラウンディングされ、正しい会社についてのものですが、唯一のソース日付は2019年で、365日の鮮度ウィンドウに対し2,652日前であり、鮮度切れとして捕捉され除去されます。同じパターンを、FY2023のSEC 10-Kに裏付けられた実在のWerner Enterprisesの主張でも示します。事実としては正確ですが、提出書類は2年超前なので、「recently」という枠組みは時間的妥当性に失敗します。

金融サービス / FINRAのような規制業種で、AIアウトリーチは使えるのか?

そここそ、検証およびガバナンス層が最も重要になる場所です。ハルシネーションや誤帰属の主張には規制上の帰結が伴うからです。デモでは、ポリシーゲートは、規制対象、Cスイートの連絡先宛て、または少なくとも$100,000の案件に紐づくメールを、下書きが完全にソース裏付けであっても人間レビューへ回します。ここでのガバナンスは、正しさだけでなくリスクの関数です。

コンプライアンス監査のために、どのソースが主張を裏付けたかをどう証明するのか?

各メールは、ダウンロード可能なJSON監査レシートを生成し、モデルのプロバイダーとバージョン、見込み客とリスク階層、ファクトシート、すべての主張の判定とそのソーススパンおよび日付、Veracity Score、発火した正確なポリシールール、人間の承認者を記録します。どの主張も数秒でソースまで遡れます。完璧なモデルでも、監査人に対してどの現行ソースがどの主張を裏付けたかを証明できません。レシートならできます。

より良い/新しいAIモデルなら、ハルシネーション問題は直るのか?

いいえ。それが持続する論点です。より良いベースモデルもなお下書きし、ハルシネーション率ゼロを主張する者は正直ではないので、プロベナンスを証明し、監査証跡を残し、リスクでゲートする必要性は消えません。プロベナンス、監査レシート、ポリシーゲートは持続する性質です。より強いライターが、書いたものを検証し統治する要件を除去するわけではありません。

これはライブ製品なのか、デモなのか?

メカニズムを証明する実行可能なデモであり、デプロイ済みパイプラインではありません。リトリーバルソース(EDGAR、LinkedIn、Greenhouse、ニュース)、CRMの読み書き、メール送信はシミュレートであり、ファクトシートは事前構築です。リードはWerner Enterprisesを除き合成で、その10-K抜粋は実在の公開記録です。決定論的検証器、ポリシーゲート、監査レシートは実在し、示されているとおりに動作します。

技術研究

このデモの背後にある研究——アーキテクチャ、検証設計、そしてエンタープライズの青写真。

規制対象の買い手にAIアウトリーチを届けるとき?

検証およびガバナンス層こそが難しい部分です。私たちがそれを構築します。

規制対象の買い手に、ハルシネーションした主張を出すリスクを負わずにAIアウトリーチを届ける方法を探っているなら、その考え方をぜひ聞かせてください。問題は業界全体のものであり、答えもそうなるでしょう。

検証アセスメント

  • ✓ AIアウトリーチが未証明の主張を出荷し得る箇所をマップする
  • ✓ データに対するグラウンディング、エンティティ、時間のルールを定義する
  • ✓ リスク階層と人間レビューゲートを設計する
  • ✓ コンプライアンスチームが必要とする監査レシートを仕様化する

層を構築する

  • ✓ 実在ソース上の決定論的検証器
  • ✓ 規制業種に較正したポリシーゲート
  • ✓ 送信ごとの署名済み、ダウンロード可能な監査レシート
  • ✓ モデル交換可能な執筆(Anthropic、OpenAI、Gemini、Ollama)
ソーシャル

他のプラットフォームでも公開