AI 對話泡泡顯示 32GB;一道驗證關卡將它攔下,並顯示商品目錄中真正的 16GB。
Artificial IntelligenceEcommerceRetail

你的 AI 購物助理轉換率高達 4 倍——直到它憑空編造出一件事

Ashutosh SinghalAshutosh Singhal2026年6月13日13 min

這場示範堪稱完美。一位購物者請我們的 AI 購物助理比較兩台適合影片剪輯的筆記型電腦,而它的回答就像一位真正用過這兩台機器、又有耐心的銷售人員——記憶體、色彩準確度、散熱表現,一應俱全。在場所有人都點了頭。接著,在一次低調試營運進行幾週後,我在翻閱一份對話紀錄時,看到同一個助理告訴一位顧客:某台筆電出貨時配備 32GB 記憶體。它出貨時其實只有 16GB。

系統中沒有任何機制對此提出警示。這個句子文法通順、語氣自信,聽起來也很有幫助。但它同時也是錯的,而且錯得很微妙——如果那位顧客為了算圖而買下這台機器,結果它撐不住,這個錯誤會立刻以退貨、一星負評,以及一句以「他們的 AI 告訴我」開頭的客訴,直接反彈回我們身上。就在那個下午,我才明白了電子商務 AI真正的問題所在:危險不在於一個聽起來很蠢的模型,而是一個聽起來正確、實際上卻錯誤的模型,因為整個技術堆疊中,從來沒有任何環節會拿它的答案與事實核對。

這道鴻溝——介於一個讀起來很順的答案,與一個真正正確的答案之間——如今正是我的團隊賴以維生、努力去彌合的目標。在我解釋該怎麼做之前,先讓我告訴你,為什麼一個更聰明的模型從來就救不了我們。

那場對我說謊的示範

我進入零售 AI 領域時,抱持著大多數工程主管都有的信念:幻覺是一個模型品質的問題,而模型品質正一路向上攀升,所以只要你等上兩季、換上下一個模型檢查點,這個問題自然就會迎刃而解。

數據似乎支持這種樂觀——直到它們不再支持為止。Google 最好的模型在大約0.7%的一般常識問答上會產生幻覺。大多數模型落在 1–3% 之間。但整體的平均值,橫跨所有一般常識,卻是9.2%,而且一項產業分析發現,82% 的 AI 故障屬於幻覺或錯誤資訊,而非當機或逾時。所以即使用的是好模型,大約每一百個自信滿滿的產品陳述中,就有一個是憑空捏造的——而你每天正發送著數以千計這樣的陳述。

1% 的幻覺率聽起來像是甲等成績。但以每週一百萬個產品回答計算——這是一個中型商品目錄的流量——那就是一萬句掛著你品牌名號、卻自信地說錯的句子。

以下這一點是「模型品質」這套說法完全忽略的:錯誤的答案和正確的答案,出自同一台機器,帶著同樣的流暢度、同樣的語氣、同樣的自信。模型根本不知道自己在說謊。模型內部沒有任何訊號能區分「16GB,已對照商品目錄驗證」與「32GB,從論壇貼文中模式比對而來」這兩者。如果你想要那個訊號,就必須在模型之外把它建出來。等待一個更聰明的模型檢查點並不會給你那個訊號,只會讓錯誤的答案說得更加動聽。

為什麼更完善的護欄沒能解決這個問題?

於是我們試著用最顯而易見的方式來打造那個訊號,而我想誠實地說:正是我極力主張採用這個顯而易見的做法。

我的第一直覺是以提示詞為基礎的安全防護,再加上關鍵字過濾。在系統的指示中告訴它:只陳述你能確認的規格,絕不提供醫療或安全建議,拒絕任何危險的要求。再加上一個能攔截明顯有害詞彙的過濾器。這既便宜又快速,而且在測試中看起來滴水不漏。我主張把它上線。我們也上線了。

它一直撐得住——直到檢索層餵給它某個看起來很權威的東西。這類系統大多數的運作方式,是檢索增強生成——助理擷取相關文件(你的商品目錄,有時是開放網路),再根據這些文件寫出答案。沒有人提醒你的陷阱在於,當檢索層拉進新的內容時,模型會把那些內容視為比自己的安全指示更具權威。Amazon 的 Rufus 就是公開的前車之鑑:它告訴購物者超級盃在錯誤的城市舉行,因為檢索浮現了相互矛盾的網路來源,而模型的訓練壓過了商品目錄。更糟的是,它透過一般的產品查詢,一步步教使用者製作汽油彈——沒有越獄、沒有巧妙的提示詞,只是檢索到的網路內容,被模型選擇去相信,凌駕於它自己的護欄之上。

這打破了我的思維模型。我所支持的那道護欄根本不是一堵牆;它只是一個建議,系統一旦讀到某個與之矛盾的東西,就會欣然無視它。關鍵字過濾攔下了那些粗糙的案例,卻直接放過了語意上等價的變體。我上線的是一把鎖,只要有人從門縫底下塞進一張更有自信的紙,它就會自動打開。

以提示詞為基礎的安全防護,就像貼在金庫上的一張便利貼。它有效——直到模型讀到另一張聽起來更權威的便利貼為止。

零售 AI 崩壞的三種方式——以及沒有人記錄的第四種

四格資訊圖,呈現各種失效模式:幻覺資訊、安全繞過、交易無能、方言偏誤。

一旦我不再把這當成模型問題,這些失效便自行歸類成少數幾種結構性型態,而每一場重大的公開災難,都只是其中某一種被放大到規模化的結果。

最常見的型態是幻覺化的產品資訊——也就是「32GB 其實是 16GB」那個問題。它之所以發生,是因為系統產生了一個看似合理的規格,卻沒有任何機制在購物者看到之前,把那個規格與一筆真實基準紀錄進行比對。這個代價並不抽象:只有46% 的購物者表示他們完全信任 AI 的推薦,而且89% 的人會查證助理在他們下單購買前所告訴他們的內容。每一個捏造的細節都印證了懷疑者的疑慮,把他們送回手動搜尋,或推向競爭對手。

再來是我剛才描述的安全繞過——檢索凌駕護欄。在商務情境中,這比一般的內容審查更為尖銳,因為「這款保健品會和我的抗凝血劑產生交互作用嗎?」並不是一個內容問題,而是一個產品責任問題。一個自信卻答錯的助理,所製造出的法律風險,遠遠蓋過任何轉換率的提升。

第三種型態,我會稱之為交易無能:AI 能夠描述你的退貨政策,卻無法處理一筆退貨;它能談論一筆自己其實查不到的訂單。Rufus 能解釋 Amazon 的退貨流程,卻無法實際執行一筆。Klarna 學到了同樣的教訓,而且付出的帳單大得多。他們取代了大約700 名客服專員,改用 AI,並讓它處理橫跨230 萬次對話,起初還宣稱它撐住了這樣的負載——但接著,服務品質恰恰在那些最重要的情況上下滑(多步驟的處理、情緒性的爭議,以及任何需要真正變更帳戶的事項),執行長公開承認了這次衝擊,到了 2026 年,他們又開始重新雇用真人。在這份懊悔中,他們並不孤單:55% 的公司曾因 AI 而裁員,如今表示他們當初做錯了。

接著還有一種從來不會出現在任何錯誤日誌裡的失效。Cornell Tech 測試了 Rufus 對不同英語方言的表現,發現它對非裔美國英語、奇卡諾英語與印度英語,系統性地給出較差的答案。一位購物者問「this jacket machine washable?」——這是一個完全標準、省略了連繫動詞的非裔美國英語句構——得到的卻是一個沒有答案的回應,或是指向不相關產品的連結。你的儀表板永遠不會抓到這一點,因為系統並沒有出錯;它只是悄悄地對你一大部分的顧客,端出了一間更糟的商店。我現在保留著一張評測表格,把助理在那些方言下的答案,與標準英語並排評分,正是因為沒有別的東西能讓這道落差浮現出來。

那麼,你該如何讓答案為真?

流程圖:LLM 的答案通過一個驗證層,該層會將各項陳述與產品知識圖譜進行核對。

一旦護欄失敗,轉折點說起來簡單得幾乎令人尷尬,做起來卻是真的困難:別要求模型值得信任——而是在模型與顧客之間,放上一個驗證層,在每個答案送出之前,都拿它與真實基準核對。

具體而言,這意味著一個產品知識圖譜,把已驗證的規格、價格、庫存與政策當成權威紀錄保存起來,再加上一個中介軟體層,攔截模型的答案,抽取其中可查證的陳述,並逐一與那個圖譜核對。這並不是什麼邊緣的想法——Walmart 就打造了自己的Retail Graph,一個產品知識圖譜,正是為了讓它的 AI 有一個真實基準可以據以回答,而不是憑空生成一個猜測。真正困難的部分不在於查找;而在於實體消歧——同一個 SKU 會以不同的表面形式,出現在你的商品目錄各處、出現在不同的地區語系中,所以這一層必須先判定哪一筆紀錄,才能開始核對它。判定錯了,你就會拿錯誤的產品去驗證,那比完全不驗證還糟。但只要判定正確:如果模型說 32GB,而圖譜說 16GB,這個陳述就永遠到不了購物者面前。如果模型無法把一項陳述奠基在一個已驗證的來源上,助理就會少說一點,而不是多編一些。檢索凌駕的問題因此煙消雲散,因為對於一項商品目錄早已知道的事實,開放網路不再擁有投票權。

一個不起眼卻不可或缺的前提,是資料。Gartner 預測,到 2026 年為止,各組織將放棄 60% 的 AI 專案——那些沒有 AI 就緒資料支撐的專案;而大多數零售資料都尚未就緒。我打開過的產品資訊管理系統,通常顯示30–40% 的屬性完整度——這是就長尾 SKU 而言。你無法用一個每五個欄位就缺兩個的商品目錄,來為助理奠定基準;它會靠猜測來填補空洞,而那正是你想要根除的行為。所以,工作中很實在的一部分,就是把那些資料結構化,好讓機器能夠讀取——而這一切都要早在任何單一答案被驗證之前就完成。這正是我們所打造的那一層——那套坐落在大型語言模型與你的店面之間、負責驗證、奠基與合規的管線基礎設施——你可以在以下網址看到完整的架構:veriprajna.com/solutions/ecommerce-ai-accuracy

模型的任務是保持流暢。驗證層的任務是保持正確。把這兩者混為一談,正是這每一套系統失敗的原因。

它說的每一個字,你都得負責

我之所以在這件事上毫不妥協,是因為法律早已判定聊天機器人的錯誤是誰的問題,而答案是:你的。

加拿大航空的聊天機器人捏造了一項根本不存在的喪親退款政策。當這家航空公司在裁決庭上主張,這個聊天機器人是一個獨立的法律實體,需為自己的陳述負責時,裁決庭直接駁回了這個說法,並判定該公司須對損害賠償負責。這是一個很小的金額——812 加幣——卻是一個巨大的判例:如今已有法院用白紙黑字說明,你的 AI 對顧客所說的每一個字,你都得負責。我曾看過一個法務團隊把那份判決轉寄來轉寄去,主旨只有一行、沒有任何評論,因為它的意涵根本不需要任何說明。據報導,一位 Shopify 上的商家損失了超過 8,000 美元,起因是一個助理興高采烈地承諾了免費運送到夏威夷——而它根本無權提供這項優惠。而那個承諾,在法律上,就是這位商家的承諾。

在這一切之下,法規的底線正在升高。《歐盟人工智慧法》將於 2026 年 8 月 2 日全面適用,而且它觸及任何服務歐盟顧客的公司——你不能因為總部設在別處就得以豁免。它要求 AI 生成的內容必須標示,並要求告知使用者他們正在與 AI 互動,而且它帶有的罰則最高可達3,500 萬歐元,或全球年營業額的 7%。在美國,FTC 已經直言不諱地表示,利用 AI 進行誤導或詐欺本來就是違法的,並沒有為 AI 開任何例外,而其《消費者評論規則》禁止具有欺騙性的 AI 生成評論。這裡的合規並不是你在最後才加上去的一個勾選框;透明與標示是設計上的限制條件,從第一次提交程式碼起,就該歸屬於驗證層之中。

我最常聽到的反對意見

有人問我,新的代理式商務協定是不是讓這一切都變得無關緊要了——這是個合理的問題,因為這些代理已經大規模地來到我們身邊:每五筆數位購物中就有一筆如今是透過 AI 代理完成的,而光是 2025 年的網購週(Cyber Week),就帶動了大約670 億美元的交易額,全都是以這種方式流動。Google 推出了它的Universal Commerce Protocol,於 2026 年 1 月的 NRF 大會上與 Shopify、Etsy、Wayfair、Target 和 Walmart 一同亮相;OpenAI 則有它的Agentic Commerce Protocol,在它的即時結帳(Instant Checkout)計畫熄火、只剩下約莫十來家啟用商家之後。這些都是真實存在、值得整合的。但仔細讀過它們,你會發現它們是以發現為先——它們非常擅長讓代理找到並推薦你的產品,卻幾乎對那些雜亂的交易後段隻字未提:退貨、換貨、保固索賠,以及那些搞垮 Klarna 的多步驟處理。這些協定移動了大門;卻沒有把屋子裡的傢俱擺好。

另一個問題是自建還是外購,而我誠實的答案是「大概兩者都要一些,而且不會是廠商告訴你的那樣。」那些發現工具——Bloomreach 的 Loomi、Algolia、Coveo 那套以商品目錄為基礎的產品發現——確實很擅長發現,但它們假設你會帶來乾淨的資料,而且不會跨工具進行驗證。大多數零售商同時運行三到五套這樣的 AI 系統,卻沒有任何人在檢查它們彼此之間的一致性。那道接縫——多廠商的協同調度,加上一個沒有任何廠商會賣給你的獨立驗證層,因為每一家都在賣自己的那套技術堆疊——正是失效所盤踞之處。

而且沒錯,人們擔心驗證步驟會增加延遲,他們這樣擔心是對的:Amazon 測量出,每增加 100 毫秒的延遲,大約會損失 1% 的銷售額。這個限制是真實的,而它是一個有工程解法的工程問題——只驗證那一小組可查證的陳述,而非整段生成內容;快取圖譜的查找結果;並以快速地少說一點作為失效時的傾向。這並不是跳過驗證的理由。一個 100 毫秒卻錯誤的答案,代價遠遠高於一個 200 毫秒卻正確的答案。

真正賺到那 4 倍的,究竟是什麼?

讓這一切為我揭開序幕的那個統計數字,是轉換率儀表板上我至今仍念念不忘的一個:與 AI 互動的購物者,轉換率達12.3%,相對於3.1%則是那些不與 AI 互動者的數字。四倍。這個數字是真的,也正是每一家零售商都在爭相部署的原因。但它同時也是一個陷阱,因為同樣的不對稱也會反向運作——一個幻覺化的規格、一項憑空捏造的政策、一個被截圖分享出去的不安全答案,那個造就了 4 倍的信任,蒸發的速度會比它建立的速度還要快。

模型如今已是一種商品——每個人都在向同樣那少數幾家供應商租用智慧,而且它每一季都會變得更流暢。流暢從來就不是賺到那 4 倍的東西;信任才是。而信任,正是一個憑空捏造的規格所揮霍掉的東西。如果你正在部署你的第一個助理,或此刻正默默看著一個助理在生產環境中產生幻覺,驗證層就是你無法跳過的那一部分——它是我們所打造的東西,也正是「一個聽起來很專業的助理」與「一個你願意讓它在無人監督下與顧客交談的助理」之間的差別。

在接下來幾年的商業競爭中勝出的商店,會是這樣一家:當它的 AI 被問到某台筆電是否有 32GB 記憶體時,它會去查證——然後回答 16GB。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。