面向 AI 外联的核验与治理层
AI SDR 为数量而优化,而单遍模型会把过时来源、错误实体和过度宣称的陈述原样发出。Veracity Engine 让 LLM 起草,再由纯 Python 检查剔除每一条未经证实的主张,为剩余内容打分,并经由按风险校准的策略闸门路由。智能体建议,代码裁决。
100%
主张存活时的发出完整性
发出邮件中的每一条主张都有来源支撑
25/25
标注金标准集上的裁定准确率
确定性且可复现(25 例基准)
3
发送前的确定性检查
依据、实体匹配、时间有效性
这是一个可运行的演示。检索、CRM 和邮件发送均为模拟,除 Werner Enterprises 外线索均为合成;Werner 的 10-K 摘录是真实公开记录。
那些广为人知的 AI SDR 翻车背后的失败模式。
AI SDR 被造出来就是为了多发。单遍 LLM 会幻觉出可测量比例的潜客专属主张,而个性化工具从不把所得主张对照当前、实体正确的来源重新核验。于是过时来源、错误实体和过度宣称的陈述原样发出,核验被外挂在发送之后,或者根本从不发生。
行业背景很严峻。单遍 LLM 会幻觉出 12 to 18% 的潜客专属主张(AI SDR Industry Report,2026)。企业级 AI SDR 年度流失率为 50 to 70%(UserGems,2026)。11x.ai 融资 $74M,于 2025 年崩塌,流失率达 70 to 80%(TechCrunch)。仅有 7% 的企业具备针对代理式 AI 的专门治理(Deloitte,2026),而 Gartner 预计到 2027 年将有超过 40% 的代理式 AI 项目被放弃。自 2025 年 11 月起,垃圾邮件率超过 0.3% 即会触发 Gmail 在 SMTP 层面拒收,域名恢复需要 6 to 12 周。
真正的缺陷不是语法糟糕。语法完美无瑕,这反而更糟。危险在于一条引用正确却被误导性使用的主张:从过时来源抽出的真实事实、关于同名错误公司的真实事实,或被来源否定的供应商宣称。我们称之为语境误用,更好的基座模型并不能消除它。一个完美的模型仍然无法向 FINRA 或 GDPR 证明,是哪一份当前来源支撑了哪一条主张。
LLM 起草。确定性代码决定发出什么。这是神经符号:神经创作,符号核验。
管道依次运行线索(Lead),然后是调研(Research,一份事实清单,其中每条事实都绑定到有日期的来源),然后是起草(Draft,一个仅受事实清单约束的撰写 LLM),然后是核验(Verify,确定性检查),然后是策略闸门,然后是已签名审计回执,然后是模拟的 CRM 回写。核验步骤不是 LLM 评判 LLM。它是纯 Python,因此同一输入每次运行都得到同一裁定。
每条事实主张都对照其所引来源加以检验。第一个失败的检查胜出,优先级依次为:unsourced,然后是 contradicted,然后是 entity mismatch,然后是 stale。
该主张是否由某段来源片段蕴含?内容 token 的重合度必须至少达到 0.5,且排除公司名称 token,以免一条主张仅靠重复公司名称就得高分。
来源是否关于这一个确切潜客,而非同名的另一家公司?关于同名不同公司的来源会失败,即便用词对得上。
若主张使用了时效性语言("recently"、"just"、"now"、"this week"),来源必须在 365 天以内。更旧的来源被标为过时,即便事实为真。
另有两道护栏并行运行:供应商自相矛盾检查,以及 0.3 的句子忠实度下限,以阻止在线 LLM 把有效的事实 id 骑在一句幻觉句子上。裁定词表驱动界面颜色:supported(绿)通过;stale(琥珀色)、entity_mismatch(红)、contradicted(红)和 unsourced(红)不通过。
闸门剔除每一条未获支持的主张,然后报告两个数字。Veracity Score 是获支持主张数除以草稿中事实主张总数,即 AI 所写内容中实际为真的比例。只要至少有一条主张存活,发出完整性即为 100%,因为发出的邮件此时只包含有来源支撑的主张。这就是设计上的保证。
路由跟随风险。若没有安全内容存活,或草稿覆盖率低于 0.5,邮件会被改写。若属于高价值(受监管,或 C-suite,或至少 $100,000 的交易),即便草稿 100% 干净,也会送交人工审核。其余情况可自动放行。对照模式「标准 AI SDR」会调研、起草并发送,发送前核验的主张数为 0;应用将其显示为对已经发出内容的事后影子检查。
演示语料中的三条线索(锚定日期 2026-06-17)。下方每张图都是运行中应用的截图。
对于 Northwind Logistics 这条线索(一家合成的中端市场 3PL),草稿声称该公司「最近扩展进了亚太」。来源是真实的 Northwind 亚太新闻,依据重合度为 100%,实体正确。但来源日期为 2019-03-14,相对 365 天时效窗口已有 2,652 天(约 7.3 年),因此时间有效性失败,主张被剔除。Veracity Engine 保留获支持的主张(为首的是推动招聘六名 Salesforce 管理员,由日期为 2026-06-09 的招聘启事证明),抓住两条不良主张,并发出一封 100% 有来源支撑的邮件。
Werner Enterprises, Inc. 是一家真实的上市公司,来源 W1 和 W2 是其 FY2023 Form 10-K 的逐字摘录(SEC EDGAR,CIK 0000793074,于 2024-02-26 提交)。草稿主张「最近将 One-Way Truckload 车队扩充到 2,735 辆卡车」在事实上为真,但该备案已超过两年,因此「最近」的表述被抓住为过时。这正是 SEC 备案个性化工具留下的那个时间误用缺口。(本线索中的联系人与招聘启事为合成;仅 Werner 及其 10-K 摘录为真实。)
回到 Northwind 线索,草稿还声称「$40M Series B」。所引来源是真实的,但说的是「Northwind Inc.」,一家奥斯汀网络安全初创公司,而非「Northwind Logistics」。实体匹配检查失败,主张在发出前被剔除。
Atlas Capital Markets 是一家合成的受 FINRA 监管的经纪交易商,联系人是首席营收官,交易额 $220,000。即便一份 100% 干净、完全有来源支撑的草稿,也会被策略闸门强制送交人工审核,因为它受监管、面向 C-suite,且高于 $100,000 阈值。干净的草稿并不等于可发出的草稿。
每封邮件都会生成一份可下载的 JSON 审计回执:模型供应商与版本、潜客与风险层级、事实清单、每条主张的裁定及其来源跨度与日期、Veracity Score、触发的策略规则,以及人工批准人。在一个 25 例的标注金标准集上,确定性核验器的裁定准确率为 25/25:10 条困难或不良主张中的 10 条被抓住,15 条干净主张中的 15 条被保留。正是这种可复现性使其可认证,而 LLM 裁判做不到。我们将 25/25 归因于这一标注基准,绝不当作开放世界保证。
演示用来对照的同一开关,并排比较。
| 维度 | 标准 AI SDR | Veracity Engine |
|---|---|---|
| 发送前已核验的主张 | 0 | 每条事实主张,确定性核验 |
| 谁决定发出什么 | LLM 发出它所起草的内容 | 纯 Python 检查,而非 LLM |
| 过时来源捕获 | 无 | 时间有效性,365 天窗口 |
| 同名错误实体 | 无 | 实体匹配检查 |
| 审计追踪 | 无 | 每封邮件一份已签名 JSON 回执 |
| 高风险处理 | 照样发出 | 路由至人工审核 |
不是。我们并不向市场再添一个 AI SDR。Veracity Engine 是位于草稿之后的核验与治理层:确定性的纯 Python 核验器将 AI 所写的每条主张对照有日期、实体匹配的来源加以检查,剔除任何未经证实的内容,并在允许发送前写出已签名审计回执。AI SDR 为数量而优化;我们决定什么可以安全发出。
草稿中的每条事实主张都会经过三项确定性检查:依据(该主张是否由某段来源片段蕴含,token 重合度至少 0.5)、实体匹配(来源是否关于这一个确切潜客,而非同名公司),以及时间有效性(若主张使用时效性语言,来源必须在 365 天以内)。只有通过的主张被标为 supported 并保留;其余一律剔除。核验器是代码,不是 LLM 评判 LLM,因此同一输入总是得到同一裁定。
那正是我们为之构建的失败模式,演示称之为语境误用。在一条走完的线索中,「最近扩展进了亚太」这句话有依据且关于正确的公司,但唯一来源日期为 2019 年,相对 365 天时效窗口已有 2,652 天,因此被抓住为过时并剔除。我们在一条由 FY2023 SEC 10-K 支撑的真实 Werner Enterprises 主张上展示了同一模式:事实准确,但备案已超过两年,因此「最近」的表述无法通过时间有效性。
这正是核验与治理层最关键的地方,因为一条幻觉或误归属的主张会带来监管后果。在演示中,策略闸门会把任何受监管、发给 C-suite 联系人、或绑定至少 $100,000 交易的邮件路由至人工审核,即便草稿完全有来源支撑。此处的治理是风险的函数,而不只是正确性。
每封邮件都会生成一份可下载的 JSON 审计回执,记录模型供应商与版本、潜客与风险层级、事实清单、每条主张的裁定及其来源跨度与日期、Veracity Score、触发的确切策略规则,以及人工批准人。任何主张都能在数秒内追溯到来源。一个完美的模型仍然无法向审计人员证明是哪一份当前来源支撑了哪一条主张;一份回执可以。
不能,而这正是那个持久成立的要点。更好的基座模型仍然会起草,任何声称零幻觉率的人都没有诚实面对,因此证明出处、保留审计追踪、并按风险设闸的需求不会消失。出处、审计回执和策略闸门是持久性质;更强的写手并不能取消核验并治理其所写内容的要求。
这是一个证明机制的可运行演示,而非已部署的管道。检索来源(EDGAR、LinkedIn、Greenhouse、新闻)、CRM 读写和邮件发送均为模拟,事实清单是预先构建的;除 Werner Enterprises 外线索均为合成,其 10-K 摘录是真实公开记录。确定性核验器、策略闸门和审计回执是真实的,并完全按所示运行。
核验与治理层才是难点。我们来构建它。
如果您的团队正在纠结如何在不冒幻觉主张风险的前提下,把 AI 外联放到受监管买家面前,我们真诚希望听听您的思路。这个问题是全行业的,答案也将如此。