销售仪表盘上的垃圾邮件率曲线越过红色的 0.3% 阈值,发票和密码重置邮件被拒收退回
Artificial IntelligenceSalesStartups

我们的 AI 外联每天发 1,000 封邮件,然后我们的发票再也送不出去了

Ashutosh SinghalAshutosh Singhal2026年4月29日13 min

最先暴露出问题的并不是某项销售指标,而是一张始终没有送达的发票。

一位客户发来邮件,询问为什么还没有收到账单。我们几天前就发出了那张发票——用的正是我们一直用来运行激进 AI 外联活动的同一个域名。发票并没有进入他们的垃圾邮件文件夹。Gmail 直接在门口就把它拒之门外了。等我开始顺着这条线索往下查,我意识到我们的密码重置邮件、成交确认邮件,以及一大批合法的事务性邮件,都在跟着一起被限流。

就是在那一周,我不再相信 AI SDR 的那套说辞了。倒不是不信 AI 销售智能这个理念——我依然认为外联的未来就在这个方向。而是不再相信当时每家工具都在兜售的那个具体承诺:更多邮件、更多个性化、更多商机管道,只要接入一个自主智能体,看着它自动放量就行。我们正是这么做的。而缺乏核验的一味放量,所摧毁的商机管道远多于它曾创造的。

这篇文章讲的是究竟哪里出了问题、为什么问题出在架构层面而非文案层面,以及我们最终转而构建了什么。如果你此刻正在评估 AI SDR 工具,或正从一次在第 90 天前后崩盘的部署中恢复过来,我想你会认得出它的轮廓。

最初的 30 天总是看起来很美

没有人会提醒你这一点:早期的数据是真的很漂亮。而这正是它危险的地方。

AI SDR 工具的初始邮件回复率可以比人类销售代表高出多达 50%,主要是因为它们的发送量是任何人都无法企及的。你上线之后,仪表盘一片亮眼,大约一个月里你会觉得自己捡到了免费的钱。我们就是这样。我还记得把回复率图表拿给团队看,暗暗为别人都还没跟上这一步而有点沾沾自喜。

然后,二阶效应开始层层累积,而它们并不会出现在你正盯着看的那块仪表盘上。

等你察觉时,AI 约到的会议根本转化不了。2026 年的行业数据显示,AI 的“会议到合格商机”转化率约为 15%,而人类 SDR 为 25%。这个差距在下游进一步拉大:人类销售代表所创造的收入要多出 2.6 倍——相比 AI 约到的会议,尽管他们触达的潜在客户更少。AI 只是在日历里塞满了一接触就夭折的对话。

而这还只是那种良性的失败。真正代价高昂的那种,正发生在已发送文件夹里——那里我团队中没有一个人在看。

那封援引了一场从未发生的系统迁移的邮件

一天下午,为了排查某个客户细分群体的低回复率,我真正读了一遍系统实际发出去的内容。不是我们在配置时审核过的样本——而是它上线后好几天的真实产出。

有一封邮件信心满满地祝贺一位潜在客户“近期成功迁移到 Salesforce”。而他们那被我们的数据富化工具抓取过的招聘页面,在三个在招岗位里明确写着用的是 HubSpot。这场迁移完全是 AI 编造出来的。另一封提到某公司“正在向亚太地区扩张”——据我事后还原,其来源是一份 2019 年的新闻稿,而那件事早就已经反转、不再成立了。

语法完美无瑕。而这恰恰让事情更糟。错别字会被人揪出来。而一句语气笃定、文笔漂亮、事实却错误的话,会径直驶进某位副总裁的收件箱,并给你的公司贴上“连查证都懒得做”的标签。

完美的语法就是伪装。正是它让一句虚假的话,能够躲过从草稿到发送之间的每一双人眼。

当我回过头,拿更大范围的基准来审计我们的产出时,结果吻合了:单次生成的语言模型,会把 12% 到 18% 的、针对特定潜在客户的陈述写错。把这个数字放到发送量的背景下细想。每天 1,000 封邮件,就意味着每一天都有 120 到 180 条事实错误的消息落进高管的收件箱——而其中没有一条会触发任何警报,因为每一条读起来都天衣无缝。

我所打造的,是一台极其高效的、用来大规模犯错的机器。

为什么加大个性化力度没能解决问题?

这是我犯的第一个直觉错误,我想坦白承认,因为我曾在内部为它极力辩护:我当时以为,问题在于我们个性化得还不

数据似乎在支持我。通用的、不做个性化的模板,回复率只有 1% 到 3%。而基于信号的个性化活动——也就是引用了某个真实、具体、及时的触发点的外联——回复率能达到 15% 到 25%。这大约是 5 倍的提升,而只有约 5% 的发送方会对每一封消息都做个性化。所以显而易见的做法,就是把个性化再往狠里加:更多信号、更深入的调研、更具体的切入点。

结果它把一切都变得更糟了。

更多的个性化,意味着 AI 要更深地挖进它的信息源,去找出一些具体的话来说——而它挖得越深,就越会凭空编造。个性化和核验并不是一回事,而我此前一直把它们当成同一回事。一个工具,可以极其擅长发现一个购买信号,却完全没有任何机制去核查它就那个信号所写下的句子是否属实。市场上绝大多数产品,恰恰就是这么造出来的。个性化才是它们的产品;而核验,是客户自己的问题。

那是一个转折点,但它并不像是什么突破。它更像是发现地基一开始就浇筑错了。

当 Gmail 不再把邮件投进垃圾箱,会发生什么?

当我还在忙着操心文案时,可送达性的地基正在我们所有人脚下悄然移动。

2025 年 11 月,Gmail 改了规则,而这项改动在没咬到你之前很容易被忽略。它不再把不合规的批量邮件投进垃圾邮件文件夹,而是开始在 SMTP 层面直接拒收——就在握手阶段,早在消息根本还未出现在收件人邮箱里之前。你的邮件不再落进垃圾箱。它们干脆从未抵达。

在这之下,Google 的 RETVec 系统能够在成千上万封消息中识别出 AI 生成的文本模式,即便逐字用词各不相同也照样识别,所以给文案换个说法救不了你。而它的阈值极其严酷:垃圾邮件投诉率一旦超过 0.3%,就会触发域名声誉受损,而恢复需要六到十二周的受限发送期。

有一个细节,正是它把这件事从一个营销问题变成了一个公司层面的问题,而这也正是我多希望有人能在我们上线之前摆到我面前的那一条:

域名声誉的作用范围不局限于你的某场营销活动,而是覆盖你的整个域名。当冷启动外联烧毁了你的声誉,你的发票、密码重置和成交确认邮件,也会跟着一起被烧掉。

这就是那张始终没有送达的发票。我一直盯着我们的 Postmaster Tools 仪表盘,看着垃圾邮件率那条线一点点爬向那条红色的 0.3% 线,仿佛它只是某个营销活动的 KPI。它不是。它关乎这家公司发出的每一封邮件的健康状况。我们越过了那条线,接下来的一段时间里,我们合法的事务性邮件,就和那些被告知“很安全”的外联邮件一起被限流了。

我这个错误的 7400 万美元版本

我之所以愿意把这一切都写下来,是因为我亲眼看着一家资金雄厚得多的公司,在公众面前犯下了一模一样的错误,而这让我看清了:这并不是 Veriprajna 的一次执行失误。它是一整套做法走到尽头时的必然结局。

2025 年 3 月,TechCrunch 报道称,11x.ai——这家由 a16z 和 Benchmark 以 3.5 亿美元估值注资 7400 万美元支持的公司——一直在客户名单上列出它其实并不拥有的客户。ZoomInfo 的标志赫然出现在 11x 的官网上,尽管 ZoomInfo 只做过一个月的试用,而据他们所说,在那段时间里,产品的表现明显更糟——比人类 SDR 还要差。前员工描述说,早期客户群的流失率高达 70% 到 80%,产品会出现幻觉,而对某些客户来说,它甚至根本加载不出来。

那个流失率数字并不是 11x 独有的反常现象。整个 AI SDR 品类的年流失率在 50% 到 70% 之间。人们冲着“放量”的承诺买单,撞上我撞过的那堵墙,然后离开。更大范围的规律也是一样的:2025 年有 42% 的公司放弃了它们大部分的 AI 项目,高于前一年的 17%;而 Gartner 预计,到 2027 年底,超过 40% 的 agentic AI 项目将被砍掉。

7400 万美元的融资,掩盖不了一款会大规模发送错误信息的产品。它买到的,不过是同一个大坑的一个更昂贵的版本。

读到那篇报道的那一刻,我不再试图靠调参把自己从问题里救出来,而是接受了一个事实:我必须从一个不同的前提出发,重新构建。

那份没人细读条款的法律责任

还有第三种失败模式,是我真的完全没有预料到的,而它正是应该让一位总法律顾问立刻警觉起来的那一种。

根据“表见代理”原则,一个代表你公司行事的 AI 智能体,可以用它说的话让你受到约束。一个打出“保证 100% 正常运行时间”或“我们会全额退款、绝不多问”的 AI SDR,很可能正在制造一项可强制执行的义务。在受监管的行业里,这比一笔糟糕的交易还要糟——一个凭空编造“我们已获得 FedRAMP 授权”或杜撰出某项合规认证的 AI,足以引发一场联邦调查。这些并不是律师们为了拖你后腿而抛出的假设;它们是让一个未经核验的文本生成器,以你公司的口吻对陌生人说话,所带来的直接后果。

而几乎没有人在为此做治理。截至 2026 年,只有 7% 的企业建立了针对 agentic 场景的专门治理政策,尽管在欧盟,GDPR 的执法如今已要求对冷启动外联取得明确、有据可查的同意——远远超出了过去那种“正当利益”式的耸肩敷衍。你正在放任一个自主智能体向市场做出各种声明,而从统计意义上说,它背后没有任何政策层。

我们转而构建了什么

两条外联流水线:单次生成的那条发出了一条虚假的 Salesforce 陈述;而经过核验的那条,在事实核查环节就把它拦下了

当我把这三种失败并排摆在一起——凭空捏造的事实、域名声誉崩塌,以及法律风险敞口——它们共有同一个根本原因。它们没有一个是文案问题。它们全都源自同一个架构选择:让单独一个语言模型,在一次生成中既决定什么是真的、又直接点下发送。

于是我们不再把检查环节硬拴在流程的末尾,而是把核验搬进了架构本身。

核心的决定,是把一个事实核查环节,安插在草稿与发送之间——而不是放在它们之后——在这个环节里,邮件中每一条针对特定潜在客户的陈述,都要在消息进入发送队列之前,先与它据称所依据的源数据进行比对核实。如果 AI 写下“近期迁移到 Salesforce”,流水线就会回头去查证据;如果唯一的信号只是一条 HubSpot 的招聘启事,那这条陈述就发不出去。语言模型可以在措辞上尽情发挥创意。但它不被允许成为“某件事是否属实”的最终裁决者。

写下来听起来是理所当然的。但现成的工具并不是这么造的,因为核验才是那个昂贵、不起眼的部分,而一条会调研、会起草、并且还会核查的多智能体流水线,在工程实现上确实要比一条只做调研和起草的流水线难得多。大多数试图自建这套系统的内部团队,正是出于这个原因,退而采用了没有核验层的 retrieval-augmented generation——难的那部分被跳过了,因为就算没有它,演示看起来也一切正常。

要让这套东西真正服务于一家企业,而不只是演示时好看,还有另外几件事必须成立:

它必须覆盖非上市公司。最强的那些面向上市公司的工具,比如 Autobound,是靠 SEC 文件和 10-K 年报来搭建它们的信号库的——这确实很强大,但上限也就卡在大约 4,500 只上市股票代码。而任何人真正的商机管道里,绝大多数都是什么都不申报的非上市公司,所以调研层必须能在没有 EDGAR 数据源可依赖的情况下照样运转。

它必须以治理为先,为每一条陈述、每一次发送都保留一条审计轨迹,好让合规团队能够回答“AI 为什么会那么说”——这不是我们后来在监管压力下才加上去的一项功能,而是整套系统的底层基座。

而且它必须是 CRM 原生的,并从干净的数据出发。我们会在第一周就审计客户的 CRM,因为一条对着重复、陈旧的联系人记录运行的核验流水线——也就是每个 RevOps 团队都熟悉的那些 HubSpot 去重冲突和 Salesforce API 限流——只会更快地把邮件核验着送进错误的收件箱。我们把这整套方法都完整阐述在了我们的AI 销售智能解决方案页面上——如果你想看到的是架构,而不是这个故事的话。

为什么不干脆改回雇用人类 SDR?

AI、人类与人在环路外联的对比:合格商机 15% 对 25%,收入 2.6 倍,投资回报率 317%,回本周期 5.2 个月

人们总是用各种方式问我同一个问题:如果 AI 这么容易出错,为什么不干脆退回去用人类 SDR 呢?

因为纯人力外联的经济账同样算不过来,而假装它算得过来,本身就是一种不诚实。一名全成本核算的人类 SDR,一年要花 75,000 到 125,000 美元。AI 所提供的杠杆效应是真实的——前提是它经过了核验。真正能出成绩的模式,既不是纯 AI,也不是纯人力;而是人在环路的流水线——2026 年的数据认为它能带来 317% 的年回报和 5.2 个月的回本周期。像 Amplemarket 的 Duo 这样的混合工具报告称,每名销售代表的生产力能提升 5 到 6 倍,恰恰是因为由人来处理判断和升级,而经过核验的机器则负责规模化。

把核验内建进来,目的并不是让 AI 安全到可以把人撤掉。而是让 AI 可信到,人的判断力能被成倍放大,而不是被耗费在收拾那些凭空编造出来的烂摊子上。

我收到的另一个问题是关于成本的,这很合理。一条定制的、经过核验的流水线,比按席位收费的 SaaS 订阅在前期投入上要大——那些 SaaS 工具一年从几千美元到三万五千美元不等,而定制开发则是另一个数量级的投资,还有一个 10 到 14 周的周期。但请做一次真正的对比。那款会把自己 15% 的陈述凭空编造出来、还烧毁你域名的廉价工具,其实并不便宜;它是一场为期六到十二周的可送达性中断,是你在每一个被你毒害过的高管收件箱里都要缴的品牌税。昂贵的从来都不是软件。而是善后。

上线之前,我会对自己说的话

如果我能给那个盯着第一个月漂亮回复率图表的自己传回一句话,那不会是“别用 AI 做外联”。这东西我还会再造一次。这句话会是:你正盯着的那块仪表盘,是错的仪表盘。真正重要的数字,不是发出去了多少封邮件,甚至也不是有多少封收到了回复。而是你送进这个世界的那些陈述里,真正属实的占了多大比例——而你根本无从知晓,因为你造的这个系统,从来不做核查。

一个发送速度快过它核验速度的 AI,不是销售加速器。它是一座打开率高得惊人的声誉焚化炉。AI 销售智能这门手艺的全部精髓——那个值得去做的版本——就在于那个所有人都当成别人的问题的核验环节。那正是我们放在正中心的部分,也是我们的发票如今能够送达的原因。你可以看看它是如何环环相扣的,就在那个解决方案页面上

大多数早晨,我依然会盯着 Postmaster 仪表盘上那条垃圾邮件率的线。如今它稳稳地待在 0.3% 阈值之下,平淡,无聊。在我所描述的这一年之后,一条平淡、无聊的线,成了整个公司里最美的图表——因为它意味着,我们昨天发出的每一封邮件,无论是发给潜在客户还是付费客户,都真正抵达了,而且里面的每一条陈述,在离开之前都是真实的。

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。