面向 AI 外联的核验与治理层

由确定性核验器决定您的 AI 外联允许发出什么。

AI SDR 为数量而优化,而单遍模型会把过时来源、错误实体和过度宣称的陈述原样发出。Veracity Engine 让 LLM 起草,再由纯 Python 检查剔除每一条未经证实的主张,为剩余内容打分,并经由按风险校准的策略闸门路由。智能体建议,代码裁决。

100%

主张存活时的发出完整性

发出邮件中的每一条主张都有来源支撑

25/25

标注金标准集上的裁定准确率

确定性且可复现(25 例基准)

3

发送前的确定性检查

依据、实体匹配、时间有效性

这是一个可运行的演示。检索、CRM 和邮件发送均为模拟,除 Werner Enterprises 外线索均为合成;Werner 的 10-K 摘录是真实公开记录。

没有核验的数量摧毁的管道,远多于它创造的

那些广为人知的 AI SDR 翻车背后的失败模式。

AI SDR 被造出来就是为了多发。单遍 LLM 会幻觉出可测量比例的潜客专属主张,而个性化工具从不把所得主张对照当前、实体正确的来源重新核验。于是过时来源、错误实体和过度宣称的陈述原样发出,核验被外挂在发送之后,或者根本从不发生。

行业背景很严峻。单遍 LLM 会幻觉出 12 to 18% 的潜客专属主张(AI SDR Industry Report,2026)。企业级 AI SDR 年度流失率为 50 to 70%(UserGems,2026)。11x.ai 融资 $74M,于 2025 年崩塌,流失率达 70 to 80%(TechCrunch)。仅有 7% 的企业具备针对代理式 AI 的专门治理(Deloitte,2026),而 Gartner 预计到 2027 年将有超过 40% 的代理式 AI 项目被放弃。自 2025 年 11 月起,垃圾邮件率超过 0.3% 即会触发 Gmail 在 SMTP 层面拒收,域名恢复需要 6 to 12 周。

真正的缺陷不是语法糟糕。语法完美无瑕,这反而更糟。危险在于一条引用正确却被误导性使用的主张:从过时来源抽出的真实事实、关于同名错误公司的真实事实,或被来源否定的供应商宣称。我们称之为语境误用,更好的基座模型并不能消除它。一个完美的模型仍然无法向 FINRA 或 GDPR 证明,是哪一份当前来源支撑了哪一条主张。

Veracity Engine 如何工作

LLM 起草。确定性代码决定发出什么。这是神经符号:神经创作,符号核验。

管道依次运行线索(Lead),然后是调研(Research,一份事实清单,其中每条事实都绑定到有日期的来源),然后是起草(Draft,一个仅受事实清单约束的撰写 LLM),然后是核验(Verify,确定性检查),然后是策略闸门,然后是已签名审计回执,然后是模拟的 CRM 回写。核验步骤不是 LLM 评判 LLM。它是纯 Python,因此同一输入每次运行都得到同一裁定。

三项确定性检查

每条事实主张都对照其所引来源加以检验。第一个失败的检查胜出,优先级依次为:unsourced,然后是 contradicted,然后是 entity mismatch,然后是 stale。

1. 依据

该主张是否由某段来源片段蕴含?内容 token 的重合度必须至少达到 0.5,且排除公司名称 token,以免一条主张仅靠重复公司名称就得高分。

2. 实体匹配

来源是否关于这一个确切潜客,而非同名的另一家公司?关于同名不同公司的来源会失败,即便用词对得上。

3. 时间有效性

若主张使用了时效性语言("recently"、"just"、"now"、"this week"),来源必须在 365 天以内。更旧的来源被标为过时,即便事实为真。

另有两道护栏并行运行:供应商自相矛盾检查,以及 0.3 的句子忠实度下限,以阻止在线 LLM 把有效的事实 id 骑在一句幻觉句子上。裁定词表驱动界面颜色:supported(绿)通过;stale(琥珀色)、entity_mismatch(红)、contradicted(红)和 unsourced(红)不通过。

策略闸门

闸门剔除每一条未获支持的主张,然后报告两个数字。Veracity Score 是获支持主张数除以草稿中事实主张总数,即 AI 所写内容中实际为真的比例。只要至少有一条主张存活,发出完整性即为 100%,因为发出的邮件此时只包含有来源支撑的主张。这就是设计上的保证。

路由跟随风险。若没有安全内容存活,或草稿覆盖率低于 0.5,邮件会被改写。若属于高价值(受监管,或 C-suite,或至少 $100,000 的交易),即便草稿 100% 干净,也会送交人工审核。其余情况可自动放行。对照模式「标准 AI SDR」会调研、起草并发送,发送前核验的主张数为 0;应用将其显示为对已经发出内容的事后影子检查。

从头到尾走通的那个要害

演示语料中的三条线索(锚定日期 2026-06-17)。下方每张图都是运行中应用的截图。

来自过时来源的真实事实,仍然不该发出

对于 Northwind Logistics 这条线索(一家合成的中端市场 3PL),草稿声称该公司「最近扩展进了亚太」。来源是真实的 Northwind 亚太新闻,依据重合度为 100%,实体正确。但来源日期为 2019-03-14,相对 365 天时效窗口已有 2,652 天(约 7.3 年),因此时间有效性失败,主张被剔除。Veracity Engine 保留获支持的主张(为首的是推动招聘六名 Salesforce 管理员,由日期为 2026-06-09 的招聘启事证明),抓住两条不良主张,并发出一封 100% 有来源支撑的邮件。

Northwind 线索的 Veracity Engine 结果:发出邮件 100% 有来源支撑,草稿 60% 可核验,两条主张被抓住并剔除,原因以内联方式展示。
Veracity Engine 结果:发出完整性 100%,草稿可核验 60%,两条主张被抓住并以删除线标出,附带原因。
证据面板显示依据为 100% 且实体通过,但时间检查失败:来源年龄 2,652 天超过时效主张的 365 天,因此裁定为 stale。
证据面板:依据通过,实体通过,时间有效性失败(来源年龄 2,652 天,超出 365 天窗口)。裁定:stale。

同一缺口落在真实的 SEC 备案上

Werner Enterprises, Inc. 是一家真实的上市公司,来源 W1 和 W2 是其 FY2023 Form 10-K 的逐字摘录(SEC EDGAR,CIK 0000793074,于 2024-02-26 提交)。草稿主张「最近将 One-Way Truckload 车队扩充到 2,735 辆卡车」在事实上为真,但该备案已超过两年,因此「最近」的表述被抓住为过时。这正是 SEC 备案个性化工具留下的那个时间误用缺口。(本线索中的联系人与招聘启事为合成;仅 Werner 及其 10-K 摘录为真实。)

一条由 FY2023 SEC 10-K 支撑的真实 Werner Enterprises 主张,因备案相对 365 天时效窗口已超过两年而被抓住为过时。
一条真实的 Werner 10-K 主张,事实准确,却因时效性表述而被抓住为过时。

一次同名实体碰撞

回到 Northwind 线索,草稿还声称「$40M Series B」。所引来源是真实的,但说的是「Northwind Inc.」,一家奥斯汀网络安全初创公司,而非「Northwind Logistics」。实体匹配检查失败,主张在发出前被剔除。

证据面板显示实体匹配失败:所引融资来源关于 Northwind Inc.,一家奥斯汀网络安全初创公司,而非 Northwind Logistics。
实体不匹配:融资来源描述的是 Northwind Inc.,而非 Northwind Logistics。

治理关乎风险,而不只是正确性

Atlas Capital Markets 是一家合成的受 FINRA 监管的经纪交易商,联系人是首席营收官,交易额 $220,000。即便一份 100% 干净、完全有来源支撑的草稿,也会被策略闸门强制送交人工审核,因为它受监管、面向 C-suite,且高于 $100,000 阈值。干净的草稿并不等于可发出的草稿。

Atlas Capital Markets 被路由至人工审核,因为它受监管、面向 C-suite,且是 $220,000 的交易,即便草稿完全有来源支撑。
Atlas 在 100% 干净的草稿上仍被路由至人工审核:受监管、C-suite、交易高于 $100,000。

一份已签名回执,以及一套可复现基准

每封邮件都会生成一份可下载的 JSON 审计回执:模型供应商与版本、潜客与风险层级、事实清单、每条主张的裁定及其来源跨度与日期、Veracity Score、触发的策略规则,以及人工批准人。在一个 25 例的标注金标准集上,确定性核验器的裁定准确率为 25/25:10 条困难或不良主张中的 10 条被抓住,15 条干净主张中的 15 条被保留。正是这种可复现性使其可认证,而 LLM 裁判做不到。我们将 25/25 归因于这一标注基准,绝不当作开放世界保证。

可下载的 JSON 审计回执,含逐项检查轨迹、模型版本、裁定、来源跨度、日期,以及触发的策略规则。
已签名的 JSON 审计回执,含完整的逐项检查轨迹。
25 例标注金标准集取得 25 中的 25 的裁定准确率,确定性且可复现。
25 例金标准集:裁定准确率 25/25,每次运行结果相同。

标准 AI SDR 对比 Veracity Engine

演示用来对照的同一开关,并排比较。

维度 标准 AI SDR Veracity Engine
发送前已核验的主张 0 每条事实主张,确定性核验
谁决定发出什么 LLM 发出它所起草的内容 纯 Python 检查,而非 LLM
过时来源捕获 时间有效性,365 天窗口
同名错误实体 实体匹配检查
审计追踪 每封邮件一份已签名 JSON 回执
高风险处理 照样发出 路由至人工审核

本演示不会做什么

  • ✓ 它并不声称幻觉率为零。LLM 仍在起草;保证是未经证实的主张在发送前被剔除。任何声称零幻觉率的人都没有诚实面对。
  • ✓ 它不使用真实连接器。EDGAR、LinkedIn、Greenhouse、新闻检索、CRM 读写和邮件发送均为桩或模拟,事实清单是预先构建的。
  • ✓ 它并不把 Northwind 或 Atlas 呈现为真实公司。它们是合成的。仅 Werner Enterprises 及其 W1/W2 10-K 摘录是真实公开记录。
  • ✓ 它并不把 12 to 18% 的幻觉区间报告为本产品自己测得的结果。该数字是市场背景;演示的头条是出处覆盖率与自动处理率。
  • ✓ 它不携带客户、案例研究、推荐语或 ROI 数字。目前尚不存在。这是一个证明机制的演示,而非一次部署。

买家真正会问的问题

这不就是又一个 AI SDR(像 11x 那样)吗?

不是。我们并不向市场再添一个 AI SDR。Veracity Engine 是位于草稿之后的核验与治理层:确定性的纯 Python 核验器将 AI 所写的每条主张对照有日期、实体匹配的来源加以检查,剔除任何未经证实的内容,并在允许发送前写出已签名审计回执。AI SDR 为数量而优化;我们决定什么可以安全发出。

你们如何在 AI 生成的销售邮件主张发出前加以核验?

草稿中的每条事实主张都会经过三项确定性检查:依据(该主张是否由某段来源片段蕴含,token 重合度至少 0.5)、实体匹配(来源是否关于这一个确切潜客,而非同名公司),以及时间有效性(若主张使用时效性语言,来源必须在 365 天以内)。只有通过的主张被标为 supported 并保留;其余一律剔除。核验器是代码,不是 LLM 评判 LLM,因此同一输入总是得到同一裁定。

它如何抓住一条技术上为真却具有误导性的主张?

那正是我们为之构建的失败模式,演示称之为语境误用。在一条走完的线索中,「最近扩展进了亚太」这句话有依据且关于正确的公司,但唯一来源日期为 2019 年,相对 365 天时效窗口已有 2,652 天,因此被抓住为过时并剔除。我们在一条由 FY2023 SEC 10-K 支撑的真实 Werner Enterprises 主张上展示了同一模式:事实准确,但备案已超过两年,因此「最近」的表述无法通过时间有效性。

AI 外联能否用于金融服务 / FINRA 这类受监管行业?

这正是核验与治理层最关键的地方,因为一条幻觉或误归属的主张会带来监管后果。在演示中,策略闸门会把任何受监管、发给 C-suite 联系人、或绑定至少 $100,000 交易的邮件路由至人工审核,即便草稿完全有来源支撑。此处的治理是风险的函数,而不只是正确性。

在合规审计中,你们如何证明是哪份来源支撑了某条主张?

每封邮件都会生成一份可下载的 JSON 审计回执,记录模型供应商与版本、潜客与风险层级、事实清单、每条主张的裁定及其来源跨度与日期、Veracity Score、触发的确切策略规则,以及人工批准人。任何主张都能在数秒内追溯到来源。一个完美的模型仍然无法向审计人员证明是哪一份当前来源支撑了哪一条主张;一份回执可以。

更好/更新的 AI 模型难道不能直接修好幻觉问题吗?

不能,而这正是那个持久成立的要点。更好的基座模型仍然会起草,任何声称零幻觉率的人都没有诚实面对,因此证明出处、保留审计追踪、并按风险设闸的需求不会消失。出处、审计回执和策略闸门是持久性质;更强的写手并不能取消核验并治理其所写内容的要求。

这是上线产品还是演示?

这是一个证明机制的可运行演示,而非已部署的管道。检索来源(EDGAR、LinkedIn、Greenhouse、新闻)、CRM 读写和邮件发送均为模拟,事实清单是预先构建的;除 Werner Enterprises 外线索均为合成,其 10-K 摘录是真实公开记录。确定性核验器、策略闸门和审计回执是真实的,并完全按所示运行。

技术研究

支撑本演示的研究——架构、核验设计,以及企业蓝图。

要把 AI 外联放到受监管买家面前?

核验与治理层才是难点。我们来构建它。

如果您的团队正在纠结如何在不冒幻觉主张风险的前提下,把 AI 外联放到受监管买家面前,我们真诚希望听听您的思路。这个问题是全行业的,答案也将如此。

核验评估

  • ✓ 摸清您的 AI 外联可能在何处发出未经证实的主张
  • ✓ 为您的数据定义依据、实体与时间规则
  • ✓ 设计风险层级与人工审核闸门
  • ✓ 明确合规团队所需的审计回执规格

构建这一层

  • ✓ 覆盖您真实来源的确定性核验器
  • ✓ 按您的受监管垂直领域校准的策略闸门
  • ✓ 每次发送一份已签名、可下载的审计回执
  • ✓ 可更换模型的创作(Anthropic、OpenAI、Gemini、Ollama)
社交媒体

同步发布于