銷售儀表板上的垃圾郵件率曲線越過紅色的 0.3% 門檻,發票與密碼重設郵件遭到拒收退回
Artificial IntelligenceSalesStartups

我們的 AI 外拓每天寄出 1,000 封郵件,然後我們的發票開始寄不出去了

Ashutosh SinghalAshutosh Singhal2026年4月29日13 min

最初顯示出有問題的跡象,並不是某項銷售指標,而是一張始終沒有送達的發票。

一位客戶寫信來問,為什麼他們還沒收到帳單。我們幾天前就已寄出那張發票——用的是我們一直拿來執行激進 AI 外拓行銷活動的同一個網域。那張發票並沒有進到他們的垃圾郵件匣,而是被 Gmail 直接擋在門外。而當我開始追查這條線索時,我才發現我們的密碼重設郵件、成交確認信,以及一大批合法的交易類郵件,全都跟著一起被限流了。

那一週,我不再相信 AI SDR 那套說詞。不是不相信 AI 銷售情報這個概念——我至今仍認為外拓行銷正朝那個方向走。而是不再相信當時每一款工具都在兜售的那個具體承諾:更多郵件、更多個人化、更多商機管線,只要加上一個自主代理,就能看著它規模化。我們正是這麼做的。而未經查證的量能,所摧毀的商機管線遠多於它曾創造的。

這是一篇文章,談的是什麼壞掉了、為什麼它是在架構層面而非文案層面壞掉的,以及我們最後轉而打造了什麼。如果你此刻正在評估 AI SDR 工具,或正從某次在第 90 天前後崩盤的部署中復原,我想你會認出它的樣貌。

最初 30 天總是看起來很美好

沒有人會警告你這一段:早期的數字是真的好。正是這一點讓它變得危險。

AI SDR 工具的初期郵件回覆率,可以比真人業務高出多達 50%,主要是因為它們發送的量能是任何人都無法匹敵的。你上線後,儀表板亮了起來,大約有一個月的時間,你會覺得自己撿到了免費的錢。我們就是這樣。我記得把回覆率圖表拿給團隊看時,還有點自鳴得意,覺得其他人都太晚才發現這一招。

接著,二階效應開始複合累積,而它們並不會出現在你正盯著看的那個儀表板上。

等你注意到時,AI 預約下來的會議根本無法轉化。2026 年的產業數據顯示,AI 的「會議轉合格商機」比率約為 15%,而真人 SDR 則是 25%。這道落差在下游還會進一步擴大:真人業務創造出2.6 倍的營收,比 AI 預約的會議還多,儘管接觸的潛在客戶更少。AI 把行事曆塞滿了那些一接觸就夭折的對話。

而那還算是良性的失敗。真正昂貴的那一種,正發生在寄件備份匣裡,而我團隊裡沒有人在盯著那裡。

那封引用了一場從未發生過的遷移的郵件

某天下午,我在排查某個名單區隔的低回覆率問題時,真正去讀了系統實際寄出的內容。不是我們在設定階段核准過的樣本——而是實際發出的內容,好幾天份的。

有一封郵件信心滿滿地恭喜一位潛在客戶「近期遷移到 Salesforce」。而他們那個被我們的資料增益程式抓取過的徵才頁面,卻在三則開放職缺中明確列出了 HubSpot。那場遷移是 AI 自己編出來的。另一封則提到某公司「拓展至亞太地區」——就我所能重建的來看,這個說法來源於一則 2019 年、且早已被推翻的新聞稿。

文法完美無瑕。正是這一點讓情況更糟。錯字會被抓出來。但一個語氣篤定、文筆流暢、事實卻錯誤的句子,會直接駛進某位副總裁的收件匣,並替你的公司貼上「連查證都懶得做」的標籤。

完美的文法就是那層偽裝。正是它讓一個錯誤的句子,得以在草稿與寄出之間躲過每一雙人眼。

當我回過頭,拿我們的輸出對照更廣泛的基準來稽核時,數字對得上:單次生成(single-pass)的語言模型,會把 12% 到 18% 的潛在客戶專屬論述寫錯。把這個數字放在量能的脈絡下細想。以每天 1,000 封郵件計算,那就是每一天都有 120 到 180 則事實錯誤的訊息落進高階主管的收件匣——而其中沒有任何一則觸發警報,因為每一則讀起來都完美無瑕。

我打造出來的東西,是一部極其高效、能大規模犯錯的機器。

為什麼加強個人化沒能解決問題?

這是我第一個錯誤的直覺,而我想誠實面對它,因為我當時在內部激烈地為它辯護:我以為問題在於我們的個人化還不

數據似乎站在我這一邊。通用、未經個人化的範本回覆率是 1-3%。而以訊號為基礎的個人化行銷活動——也就是會引用某個真實、具體、及時觸發點的外拓——回覆率則是 15-25%。這大約是 5 倍的提升,而且只有約 5% 的寄件者會為每一則訊息做個人化。所以顯而易見的做法,就是把個人化再往上催:更多訊號、更深入的研究、更具體的切入點。

結果它讓一切都更糟了。

更多的個人化,意味著 AI 得更深入地挖掘它的資料來源,以找出某些具體的話來說——而它挖得越深,就編造得越多。個人化與查證並不是同一回事,而我一直把它們當成同一回事在處理。一款工具可以極其擅長找出某個購買訊號,卻完全沒有任何機制去查核它針對那個訊號所寫出的句子究竟是不是真的。市場上絕大多數產品,就是完全照這個方式打造的。個人化是產品;查證則是客戶自己的問題。

那是個轉捩點,但它感覺起來不像是一項突破。它感覺起來,像是發現地基一開始就灌錯了。

當 Gmail 不再把郵件送進垃圾匣時,會發生什麼事?

當我還忙著擔心文案時,可送達性的地基,正在我們所有人腳下移動。

2025 年 11 月,Gmail 改變了規則,而這項改變在咬到你之前都很容易被忽略。它不再把不合規的大量郵件導向垃圾郵件匣,而是開始在 SMTP 層級就直接拒收——在交握(handshake)的當下,早在訊息根本還沒進到收件者的信箱之前。你的郵件不再落入垃圾匣。它們根本從未送達。

在這之下,Google 的 RETVec 系統能跨越數千則訊息偵測出 AI 生成的文字模式,即使個別的用字選擇有所不同也一樣,所以把文案改頭換面並救不了你。而那道門檻極為殘酷:垃圾郵件投訴率一旦高於 0.3%,就會觸發網域信譽受損,而復原需要六到十二週的受限發送。

以下這個細節,把它從一個行銷問題變成了一個公司問題,而這也是我多希望在我們上線之前,有人能擺在我面前的:

網域信譽的範圍並不局限於你的某個行銷活動,而是涵蓋你整個網域。當那些冷外拓燒毀了你的信譽時,你的發票、密碼重設信與成交確認信,也會跟著一起燒掉。

那正是那張始終沒有送達的發票。我一直盯著我們的 Postmaster Tools 儀表板,看著垃圾郵件率那條線緩緩爬向那條紅色的 0.3% 界線,彷彿它是某個行銷活動的 KPI。它不是。它代表的是這家公司所寄出的每一封郵件的健康狀況。我們越過了那條線,而在接下來那段期間,我們合法的交易類郵件,就跟那些我們被告知很安全的外拓郵件一起,一併遭到了限流。

我這個錯誤的 7,400 萬美元版本

我之所以願意把這一切都寫下來,是因為我親眼看著一家資金雄厚得多的公司,公開犯下了一模一樣的錯誤,而這件事讓我看清:這並不是 Veriprajna 的執行失誤,而是整套做法的最終結局。

2025 年 3 月,TechCrunch 報導,11x.ai——這家在 3.5 億美元估值下、由 a16z 與 Benchmark 挹注 7,400 萬美元的公司——一直在列出它其實根本沒有的客戶。ZoomInfo 的商標就掛在 11x 的網站上,儘管 ZoomInfo 只進行過為期一個月的試用,而據他們所說,在那段期間,該產品的表現明顯更差,比真人 SDR 還要糟。前員工描述,在早期的客戶群中,客戶流失率高達 70% 到 80%,產品會出現幻覺,而對某些客戶來說,甚至根本無法載入。

那個流失率數字並不是 11x 的特例。整個 AI SDR 類別的年度流失率就落在 50% 到 70% 之間。人們買下那個量能承諾,撞上我撞過的那面牆,然後離開。更大範圍的模式也一樣:2025 年有 42% 的公司放棄了他們大部分的 AI 計畫,高於前一年的 17%,而 Gartner 預期,到 2027 年底,將有超過 40% 的 agentic AI 專案遭到廢棄。

7,400 萬美元的資金,無法掩蓋一款會大規模發送錯誤資訊的產品。它只不過是買下了同一個坑洞、更昂貴的版本罷了。

讀到那篇報導的那一刻,我不再試圖靠微調來擺脫這個問題,並接受了一個事實:我必須從一個不同的前提重新打造。

那項沒有人會細讀合約小字的法律責任

還有第三種失敗模式,是我真的完全沒料到的,而它正是那種應該讓法務長為之一驚、正襟危坐的。

依據「表見代理」(apparent authority)原則,一個代表你公司行事的 AI 代理,可以讓你受它所說的話約束。一個打出「保證 100% 正常運作時間」或「我們會全額退款,絕不囉嗦」的 AI SDR,可能正在創造一項具強制執行力的義務。在受監管的產業裡,這比一筆糟糕的交易還要糟——一個憑空捏造「我們已通過 FedRAMP 授權」或杜撰出一張合規認證的 AI,可能會觸發聯邦層級的調查。這些並不是律師為了拖慢你腳步而提出的假設情境;它們是讓一個未經查證的文字產生器,以你公司的口吻對陌生人說話,所帶來的直接後果。

而幾乎沒有人針對這一點在做治理。截至 2026 年,只有 7% 的企業建立了專門針對 agentic AI 的治理政策,儘管在歐盟,GDPR 的執法如今已要求對冷外拓取得明確、有文件記錄的同意——遠遠超出過去那種「正當利益」的敷衍聳肩。你正在讓一個自主代理對整個市場做出各種聲明陳述,而從統計上看,它背後根本沒有任何政策層。

我們轉而打造了什麼

兩條外拓流水線:單次生成的那條寄出了一則不實的 Salesforce 論述;而經過查證的那條,則在事實查核的步驟就把它攔了下來

當我把這三種失敗並排放在一起——捏造的事實、網域崩潰,以及法律風險敞口——它們共享同一個根本原因。它們沒有一個是文案問題。它們全都源自同一個架構選擇:讓單一一個語言模型,在同一趟流程中,既決定什麼是真的,又直接按下寄出。

於是我們不再把查核硬拴在流程的末端,而是把查證移進了架構本身。

核心的決定,是把一道事實查核的步驟,放在之間草稿與寄出這兩者,而不是放在寄出之後——在這個階段,郵件裡每一則潛在客戶專屬的論述,都會在訊息被排入寄送佇列之前,先對照它宣稱來源的原始資料加以驗證。如果 AI 寫下「近期的 Salesforce 遷移」,這條流水線就會回頭去查證據;如果唯一的訊號只是一則 HubSpot 的徵才貼文,那則論述就不會被寄出。語言模型被允許在措辭上發揮創意,但不被允許成為「某件事究竟是不是真的」的最終裁決者。

寫下來聽起來理所當然。但市面上現成的工具並不是這樣打造的,因為查證是那個昂貴、不光鮮的部分,而一條會研究、會撰稿、會查核的多代理流水線,其工程難度,確實比一條只會研究和撰稿的流水線高得多。大多數試圖自建這套系統的內部團隊,正是基於這個原因,預設就採用了沒有查證層的 retrieval-augmented generation——那個困難的部分被跳過了,因為就算少了它,展示(demo)看起來也沒問題。

還有幾件事必須成立,這套系統才能真正服務一家企業,而不只是展示時很好看:

它必須涵蓋私人公司。最強的那些上市公司工具,例如 Autobound,是拿 SEC 申報文件與 10-K 年報來建立它們的訊號資料庫——這確實很強大,但上限大約就在 4,500 檔上市公司股票代號封頂了。任何人真正的商機管線裡,絕大多數其實都是什麼都不申報的私人公司,所以研究層必須在沒有 EDGAR 資料源可倚靠的情況下也能運作。

它必須以治理為先,為每一則論述、每一次寄送都留下稽核軌跡,好讓合規團隊能夠回答「AI 為什麼會那樣說」——而這不是我們後來在監管壓力下才加上的功能,而是作為底層基礎。

而且它必須原生整合 CRM,並從乾淨的資料出發。我們會在第一週就稽核客戶的 CRM,因為一條指向重複、過時聯絡人紀錄的查證流水線——也就是每個 RevOps 團隊都熟知的那種 HubSpot 去重碰撞與 Salesforce API 限流——只會更快地一路查證進錯誤的收件匣。這整套做法,都詳列在我們的AI 銷售情報解決方案頁面上,如果你想看的是架構本身而不是故事的話。

那為什麼不乾脆改聘真人 SDR 就好?

AI、真人與人機協作(human-in-the-loop)外拓的對比:合格商機 15% 對 25%,營收 2.6 倍,投資報酬率 317%,回本期 5.2 個月

人們總是用不同版本問我同一個問題:如果 AI 這麼容易出錯,那為什麼不乾脆退回去用真人 SDR 就好?

因為純靠真人的外拓,其經濟帳同樣算不過來,而假裝它算得過來,本身就是另一種不誠實。一位完全計入成本的真人 SDR,一年要花 $75,000 到 $125,000。AI 所提供的槓桿是真實的——前提是它經過查證。真正能拿出成效的模式,既不是純 AI,也不是純真人;而是人機協作的流水線,2026 年的數據認定它能帶來 317% 的年度回報,以及 5.2 個月的回本期。像 Amplemarket 的 Duo 這類混合式工具回報指出,每位業務的生產力提升了 5 到 6 倍,正是因為由真人負責判斷與升級處理,而經過查證的機器負責規模。

把查證內建進去的重點,並不是要讓 AI 安全到可以把人拿掉。而是要讓 AI 值得信賴到,人的判斷力得以被加倍放大,而不是被耗費在收拾那些憑空捏造的爛攤子上。

我收到的另一個問題是關於成本的,這問得很公道。一條客製化的、經過查證的流水線,其前期投入比按人頭計費的 SaaS 訂閱要大——那些 SaaS 工具一年從幾千美元到三萬五千美元不等,而客製化的建置則是另一個量級的投資,需要 10 到 14 週的時程。但請做一次真正的比較。那款便宜、卻會把 15% 的論述都寫成幻覺、還燒掉你網域的工具,其實一點都不便宜;它是一次六到十二週的可送達性中斷,以及一筆你在每一個被你毒害過的高階主管收件匣裡都得繳的品牌稅。昂貴的從來都不是那套軟體,而是善後的清理。

我會在我們上線之前對自己說的話

如果我能傳一則訊息,回給那個盯著第一個月漂亮回覆率圖表的我,那不會是「別用 AI 做外拓」。我還是會再打造一次。那則訊息會是:你正盯著看的那個儀表板,是錯的儀表板。真正重要的數字,不是有多少封郵件寄出去了,甚至也不是有多少封收到了回覆。而是你送進這個世界的那些論述裡,究竟有多大比例是真的——而你根本無從得知,因為你打造了一套從不查核的系統。

一個發送速度快過它查證速度的 AI,並不是銷售加速器。它是一座信譽焚化爐,只是附帶了一個非常亮眼的開信率。AI 銷售情報這整門手藝——它值得打造的那個版本——全都在那道每個人都當成別人家問題的查證步驟裡。那正是我們放在核心的部分,也是我們的發票如今能夠送達的原因。你可以看到這一切是如何組合在一起的,詳見我們的解決方案頁面

大多數的早晨,我仍會盯著 Postmaster 儀表板上那條垃圾郵件率的線。它如今穩穩地待在 0.3% 那道門檻底下,平坦又無聊。在我所描述的這一年之後,一條平坦、無聊的線,是這家公司裡最美的一張圖表——因為它意味著,我們昨天寄出的每一封郵件,無論是寄給潛在客戶或付費客戶,都真的送達了,而且郵件裡的每一則論述,在它離開之前,都是真的。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。