
我们的 AI 外联每天发 1,000 封邮件,然后我们的发票再也送不出去了
最先暴露出问题的并不是某项销售指标,而是一张始终没有送达的发票。
一位客户发来邮件,询问为什么还没有收到账单。我们几天前就发出了那张发票——用的正是我们一直用来运行激进 AI 外联活动的同一个域名。发票并没有进入他们的垃圾邮件文件夹。Gmail 直接在门口就把它拒之门外了。等我开始顺着这条线索往下查,我意识到我们的密码重置邮件、成交确认邮件,以及一大批合法的事务性邮件,都在跟着一起被限流。
就是在那一周,我不再相信 AI SDR 的那套说辞了。倒不是不信 AI 销售智能这个理念——我依然认为外联的未来就在这个方向。而是不再相信当时每家工具都在兜售的那个具体承诺:更多邮件、更多个性化、更多商机管道,只要接入一个自主智能体,看着它自动放量就行。我们正是这么做的。而缺乏核验的一味放量,所摧毁的商机管道远多于它曾创造的。
这篇文章讲的是究竟哪里出了问题、为什么问题出在架构层面而非文案层面,以及我们最终转而构建了什么。如果你此刻正在评估 AI SDR 工具,或正从一次在第 90 天前后崩盘的部署中恢复过来,我想你会认得出它的轮廓。
最初的 30 天总是看起来很美
没有人会提醒你这一点:早期的数据是真的很漂亮。而这正是它危险的地方。
AI SDR 工具的初始邮件回复率可以比人类销售代表高出多达 50%,主要是因为它们的发送量是任何人都无法企及的。你上线之后,仪表盘一片亮眼,大约一个月里你会觉得自己捡到了免费的钱。我们就是这样。我还记得把回复率图表拿给团队看,暗暗为别人都还没跟上这一步而有点沾沾自喜。
然后,二阶效应开始层层累积,而它们并不会出现在你正盯着看的那块仪表盘上。
等你察觉时,AI 约到的会议根本转化不了。2026 年的行业数据显示,AI 的“会议到合格商机”转化率约为 15%,而人类 SDR 为 25%。这个差距在下游进一步拉大:人类销售代表所创造的收入要多出 2.6 倍——相比 AI 约到的会议,尽管他们触达的潜在客户更少。AI 只是在日历里塞满了一接触就夭折的对话。
而这还只是那种良性的失败。真正代价高昂的那种,正发生在已发送文件夹里——那里我团队中没有一个人在看。
那封援引了一场从未发生的系统迁移的邮件
一天下午,为了排查某个客户细分群体的低回复率,我真正读了一遍系统实际发出去的内容。不是我们在配置时审核过的样本——而是它上线后好几天的真实产出。
有一封邮件信心满满地祝贺一位潜在客户“近期成功迁移到 Salesforce”。而他们那被我们的数据富化工具抓取过的招聘页面,在三个在招岗位里明确写着用的是 HubSpot。这场迁移完全是 AI 编造出来的。另一封提到某公司“正在向亚太地区扩张”——据我事后还原,其来源是一份 2019 年的新闻稿,而那件事早就已经反转、不再成立了。
语法完美无瑕。而这恰恰让事情更糟。错别字会被人揪出来。而一句语气笃定、文笔漂亮、事实却错误的话,会径直驶进某位副总裁的收件箱,并给你的公司贴上“连查证都懒得做”的标签。
完美的语法就是伪装。正是它让一句虚假的话,能够躲过从草稿到发送之间的每一双人眼。
当我回过头,拿更大范围的基准来审计我们的产出时,结果吻合了:单次生成的语言模型,会把 12% 到 18% 的、针对特定潜在客户的陈述写错。把这个数字放到发送量的背景下细想。每天 1,000 封邮件,就意味着每一天都有 120 到 180 条事实错误的消息落进高管的收件箱——而其中没有一条会触发任何警报,因为每一条读起来都天衣无缝。
我所打造的,是一台极其高效的、用来大规模犯错的机器。
为什么加大个性化力度没能解决问题?
这是我犯的第一个直觉错误,我想坦白承认,因为我曾在内部为它极力辩护:我当时以为,问题在于我们个性化得还不够。
数据似乎在支持我。通用的、不做个性化的模板,回复率只有 1% 到 3%。而基于信号的个性化活动——也就是引用了某个真实、具体、及时的触发点的外联——回复率能达到 15% 到 25%。这大约是 5 倍的提升,而只有约 5% 的发送方会对每一封消息都做个性化。所以显而易见的做法,就是把个性化再往狠里加:更多信号、更深入的调研、更具体的切入点。
结果它把一切都变得更糟了。
更多的个性化,意味着 AI 要更深地挖进它的信息源,去找出一些具体的话来说——而它挖得越深,就越会凭空编造。个性化和核验并不是一回事,而我此前一直把它们当成同一回事。一个工具,可以极其擅长发现一个购买信号,却完全没有任何机制去核查它就那个信号所写下的句子是否属实。市场上绝大多数产品,恰恰就是这么造出来的。个性化才是它们的产品;而核验,是客户自己的问题。
那是一个转折点,但它并不像是什么突破。它更像是发现地基一开始就浇筑错了。
当 Gmail 不再把邮件投进垃圾箱,会发生什么?
当我还在忙着操心文案时,可送达性的地基正在我们所有人脚下悄然移动。
2025 年 11 月,Gmail 改了规则,而这项改动在没咬到你之前很容易被忽略。它不再把不合规的批量邮件投进垃圾邮件文件夹,而是开始在 SMTP 层面直接拒收——就在握手阶段,早在消息根本还未出现在收件人邮箱里之前。你的邮件不再落进垃圾箱。它们干脆从未抵达。
在这之下,Google 的 RETVec 系统能够在成千上万封消息中识别出 AI 生成的文本模式,即便逐字用词各不相同也照样识别,所以给文案换个说法救不了你。而它的阈值极其严酷:垃圾邮件投诉率一旦超过 0.3%,就会触发域名声誉受损,而恢复需要六到十二周的受限发送期。
有一个细节,正是它把这件事从一个营销问题变成了一个公司层面的问题,而这也正是我多希望有人能在我们上线之前摆到我面前的那一条:
域名声誉的作用范围不局限于你的某场营销活动,而是覆盖你的整个域名。当冷启动外联烧毁了你的声誉,你的发票、密码重置和成交确认邮件,也会跟着一起被烧掉。
这就是那张始终没有送达的发票。我一直盯着我们的 Postmaster Tools 仪表盘,看着垃圾邮件率那条线一点点爬向那条红色的 0.3% 线,仿佛它只是某个营销活动的 KPI。它不是。它关乎这家公司发出的每一封邮件的健康状况。我们越过了那条线,接下来的一段时间里,我们合法的事务性邮件,就和那些被告知“很安全”的外联邮件一起被限流了。
我这个错误的 7400 万美元版本
我之所以愿意把这一切都写下来,是因为我亲眼看着一家资金雄厚得多的公司,在公众面前犯下了一模一样的错误,而这让我看清了:这并不是 Veriprajna 的一次执行失误。它是一整套做法走到尽头时的必然结局。
2025 年 3 月,TechCrunch 报道称,11x.ai——这家由 a16z 和 Benchmark 以 3.5 亿美元估值注资 7400 万美元支持的公司——一直在客户名单上列出它其实并不拥有的客户。ZoomInfo 的标志赫然出现在 11x 的官网上,尽管 ZoomInfo 只做过一个月的试用,而据他们所说,在那段时间里,产品的表现明显更糟——比人类 SDR 还要差。前员工描述说,早期客户群的流失率高达 70% 到 80%,产品会出现幻觉,而对某些客户来说,它甚至根本加载不出来。
那个流失率数字并不是 11x 独有的反常现象。整个 AI SDR 品类的年流失率在 50% 到 70% 之间。人们冲着“放量”的承诺买单,撞上我撞过的那堵墙,然后离开。更大范围的规律也是一样的:2025 年有 42% 的公司放弃了它们大部分的 AI 项目,高于前一年的 17%;而 Gartner 预计,到 2027 年底,超过 40% 的 agentic AI 项目将被砍掉。
7400 万美元的融资,掩盖不了一款会大规模发送错误信息的产品。它买到的,不过是同一个大坑的一个更昂贵的版本。
读到那篇报道的那一刻,我不再试图靠调参把自己从问题里救出来,而是接受了一个事实:我必须从一个不同的前提出发,重新构建。
那份没人细读条款的法律责任
还有第三种失败模式,是我真的完全没有预料到的,而它正是应该让一位总法律顾问立刻警觉起来的那一种。
根据“表见代理”原则,一个代表你公司行事的 AI 智能体,可以用它说的话让你受到约束。一个打出“保证 100% 正常运行时间”或“我们会全额退款、绝不多问”的 AI SDR,很可能正在制造一项可强制执行的义务。在受监管的行业里,这比一笔糟糕的交易还要糟——一个凭空编造“我们已获得 FedRAMP 授权”或杜撰出某项合规认证的 AI,足以引发一场联邦调查。这些并不是律师们为了拖你后腿而抛出的假设;它们是让一个未经核验的文本生成器,以你公司的口吻对陌生人说话,所带来的直接后果。
而几乎没有人在为此做治理。截至 2026 年,只有 7% 的企业建立了针对 agentic 场景的专门治理政策,尽管在欧盟,GDPR 的执法如今已要求对冷启动外联取得明确、有据可查的同意——远远超出了过去那种“正当利益”式的耸肩敷衍。你正在放任一个自主智能体向市场做出各种声明,而从统计意义上说,它背后没有任何政策层。
我们转而构建了什么

当我把这三种失败并排摆在一起——凭空捏造的事实、域名声誉崩塌,以及法律风险敞口——它们共有同一个根本原因。它们没有一个是文案问题。它们全都源自同一个架构选择:让单独一个语言模型,在一次生成中既决定什么是真的、又直接点下发送。
于是我们不再把检查环节硬拴在流程的末尾,而是把核验搬进了架构本身。
核心的决定,是把一个事实核查环节,安插在草稿与发送之间——而不是放在它们之后——在这个环节里,邮件中每一条针对特定潜在客户的陈述,都要在消息进入发送队列之前,先与它据称所依据的源数据进行比对核实。如果 AI 写下“近期迁移到 Salesforce”,流水线就会回头去查证据;如果唯一的信号只是一条 HubSpot 的招聘启事,那这条陈述就发不出去。语言模型可以在措辞上尽情发挥创意。但它不被允许成为“某件事是否属实”的最终裁决者。
写下来听起来是理所当然的。但现成的工具并不是这么造的,因为核验才是那个昂贵、不起眼的部分,而一条会调研、会起草、并且还会核查的多智能体流水线,在工程实现上确实要比一条只做调研和起草的流水线难得多。大多数试图自建这套系统的内部团队,正是出于这个原因,退而采用了没有核验层的 retrieval-augmented generation——难的那部分被跳过了,因为就算没有它,演示看起来也一切正常。
要让这套东西真正服务于一家企业,而不只是演示时好看,还有另外几件事必须成立:
它必须覆盖非上市公司。最强的那些面向上市公司的工具,比如 Autobound,是靠 SEC 文件和 10-K 年报来搭建它们的信号库的——这确实很强大,但上限也就卡在大约 4,500 只上市股票代码。而任何人真正的商机管道里,绝大多数都是什么都不申报的非上市公司,所以调研层必须能在没有 EDGAR 数据源可依赖的情况下照样运转。
它必须以治理为先,为每一条陈述、每一次发送都保留一条审计轨迹,好让合规团队能够回答“AI 为什么会那么说”——这不是我们后来在监管压力下才加上去的一项功能,而是整套系统的底层基座。
而且它必须是 CRM 原生的,并从干净的数据出发。我们会在第一周就审计客户的 CRM,因为一条对着重复、陈旧的联系人记录运行的核验流水线——也就是每个 RevOps 团队都熟悉的那些 HubSpot 去重冲突和 Salesforce API 限流——只会更快地把邮件核验着送进错误的收件箱。我们把这整套方法都完整阐述在了我们的AI 销售智能解决方案页面上——如果你想看到的是架构,而不是这个故事的话。
为什么不干脆改回雇用人类 SDR?

人们总是用各种方式问我同一个问题:如果 AI 这么容易出错,为什么不干脆退回去用人类 SDR 呢?
因为纯人力外联的经济账同样算不过来,而假装它算得过来,本身就是一种不诚实。一名全成本核算的人类 SDR,一年要花 75,000 到 125,000 美元。AI 所提供的杠杆效应是真实的——前提是它经过了核验。真正能出成绩的模式,既不是纯 AI,也不是纯人力;而是人在环路的流水线——2026 年的数据认为它能带来 317% 的年回报和 5.2 个月的回本周期。像 Amplemarket 的 Duo 这样的混合工具报告称,每名销售代表的生产力能提升 5 到 6 倍,恰恰是因为由人来处理判断和升级,而经过核验的机器则负责规模化。
把核验内建进来,目的并不是让 AI 安全到可以把人撤掉。而是让 AI 可信到,人的判断力能被成倍放大,而不是被耗费在收拾那些凭空编造出来的烂摊子上。
我收到的另一个问题是关于成本的,这很合理。一条定制的、经过核验的流水线,比按席位收费的 SaaS 订阅在前期投入上要大——那些 SaaS 工具一年从几千美元到三万五千美元不等,而定制开发则是另一个数量级的投资,还有一个 10 到 14 周的周期。但请做一次真正的对比。那款会把自己 15% 的陈述凭空编造出来、还烧毁你域名的廉价工具,其实并不便宜;它是一场为期六到十二周的可送达性中断,是你在每一个被你毒害过的高管收件箱里都要缴的品牌税。昂贵的从来都不是软件。而是善后。
上线之前,我会对自己说的话
如果我能给那个盯着第一个月漂亮回复率图表的自己传回一句话,那不会是“别用 AI 做外联”。这东西我还会再造一次。这句话会是:你正盯着的那块仪表盘,是错的仪表盘。真正重要的数字,不是发出去了多少封邮件,甚至也不是有多少封收到了回复。而是你送进这个世界的那些陈述里,真正属实的占了多大比例——而你根本无从知晓,因为你造的这个系统,从来不做核查。
一个发送速度快过它核验速度的 AI,不是销售加速器。它是一座打开率高得惊人的声誉焚化炉。AI 销售智能这门手艺的全部精髓——那个值得去做的版本——就在于那个所有人都当成别人的问题的核验环节。那正是我们放在正中心的部分,也是我们的发票如今能够送达的原因。你可以看看它是如何环环相扣的,就在那个解决方案页面上。
大多数早晨,我依然会盯着 Postmaster 仪表盘上那条垃圾邮件率的线。如今它稳稳地待在 0.3% 阈值之下,平淡,无聊。在我所描述的这一年之后,一条平淡、无聊的线,成了整个公司里最美的图表——因为它意味着,我们昨天发出的每一封邮件,无论是发给潜在客户还是付费客户,都真正抵达了,而且里面的每一条陈述,在离开之前都是真实的。