問題所在
Wendy's 得來速的顧客為了點一個漢堡,必須重複點餐三次甚至更多次。該連鎖店由 Google Cloud 支援的 FreshAI 語音系統預計在 2025 年底前擴展至 500 到 600 家門市,儘管使用者直指該系統「緩慢」、「惱人」且經常出錯。顧客表示必須大喊「轉接專員」(AGENT)才能找到真人服務。該機器人會在話講到一半時打斷顧客、在有人詢問茶飲時推薦 Frosty 口味,連「不要酸黃瓜」這種基本要求都難以處理。
但最嚴重的失敗影響了一群您可能不會立即想到的群體:口吃者。全球有超過 8,000 萬人受口吃困擾。對他們而言,該系統被形容為「完全無法使用」。當一個人在說話中途出現無聲阻滯時,AI 會認為他們已經說完了並直接打斷;當有人重複發音——例如「培、培、培根吉士堡」(b-b-b-baconator)時,系統無法將其對應到正確的菜單項目。研究顯示,部分語音識別模型傳回的結果混亂至極,甚至得出負的語義分數。這意味著 AI 不只是聽錯了顧客的話,而是徹底失去了理解能力。
Wendy's 宣稱無需人工協助的訂單成功率達 86%。這聽起來很高,但若考慮到在速度與準確度決定顧客忠誠度的餐飲業中,剩下的 14% 代表著極為巨大的失敗率。如果您的企業部署了一套每七位顧客就有一位失敗的系統,您會認為它已經準備好進行全國推廣了嗎?
為什麼這對您的企業至關重要
這不僅僅是一家速食店的故事,而是預示了任何面向消費者的企業在技術尚未成熟前擴展 AI 所面臨的後果。財務、法律與聲譽風險真實存在,而且正在迅速加劇。
以下是數據顯示的事實:
- 72% 的標普 500 指數(S&P 500)企業目前已在公開揭露中將 AI 故障列為重大風險,遠高於 2023 年的 12%。您的董事會正密切關注。
- 53% 的消費者擔心個人資料遭到 AI 客服濫用。信任崩塌對品牌的打擊,會遠在反映於季度財報之前就已顯現。
- 為數百家門市重新改造不合規的 AI 系統,其成本可能比一開始就正確建構高出五倍。這就是計劃性資本支出與緊急補救預算之間的差距。
監管壓力也正步步進逼。《美國身心障礙者法》(ADA)早已禁止在公共場所進行歧視。如 CAN-ASC-6.2:2025 等新標準——這是首個專門針對 AI 系統的無障礙標準——現已要求身心障礙人士參與 AI 的設計、測試與治理。《歐洲無障礙法案》(European Accessibility Act)已於 2025 年 6 月開始強制執行,並伴隨高額罰款。
如果您的 AI 因顧客說話緩慢或重複而對其造成不利,您將面臨 無障礙與偏見風險 ,而這正是監管機構鎖定的重點目標。您的法務與風險團隊面臨一個簡單的問題:您能否證明無論顧客的說話方式如何,您的 AI 都能一視同仁地對待每位顧客?
底層架構的真實情況
核心問題不在於 AI 的「大腦」,而是在於 AI 的「耳朵」。多數得來速 AI 系統採用業界所謂的「API 包裝器」(API wrapper)架構。這就好比將一個普通麥克風綁在數英里外隔音室裡的頂尖天才身上——天才雖然聰明,但能聽到的只有混雜著引擎噪音與風聲的零碎話語。
第一個故障點在於語音活動偵測(VAD)——即判斷您何時開始說話、何時結束說話的系統。基礎 VAD 系統依賴音量閾值運作,原本是為配備良好麥克風的安靜室內所設計。但在得來速環境中,柴油引擎聲、一陣強風或關車門聲都可能造成誤判。
當您為了看一眼菜單看板而停頓半秒時,系統會將該沉默解讀為「說話完畢」。它擷取您未講完的句子並傳送至雲端處理,結果傳回一片混亂。機器人給出答非所問的回答,您只能重複說明,而同樣的狀況再次上演。三次嘗試之後,您已經忍不住大喊要找真人。
第二個故障點是延遲。每句說出的話都必須從得來速麥克風透過公共網際網路傳輸至資料中心,然後再傳送回來。光是這趟往返在 AI 甚至尚未開始處理之前就已消耗 100 到 500 毫秒。自然語音互動的黃金標準是總延遲低於 300 毫秒。一旦超過 700 到 900 毫秒,對話就會出現斷層;若達到 2 秒,感覺就像一通互相搶話的糟糕電話通話。
這些絕非表層小問題,而是 架構上的致命缺陷 ,再多的提示工程(Prompt Engineering)也無法修復。
行得通與行不通的方案
三種在現實世界中以失敗告終的常見做法:
- 「直接調高麥克風靈敏度。」 這在捕捉更多聲音的同時也收進了更多噪音。您的 AI 現在會將每一次引擎運轉聲都當作語音,問題只會更嚴重,而不會改善。
- 「用更多數據微調雲端模型。」 通用大型語言模型不需要寫詩——它只需要知道「Dave's Single」是漢堡而不是專輯名稱。通用模型在處理特定任務時,速度與準確度都遠不及專門建構的模型。
- 「增加更長的停頓逾時時間。」 為所有人設定等待 2 秒的靜態逾時,意味著說話快速的顧客必須對著毫無反應的對講喇叭乾等。一刀切的設定會為大多數人帶來新的摩擦,卻對少數群體幾乎毫無幫助。
真正有效的是在各個階段解決問題的三層架構:
1. 源頭智慧訊號處理。 神經網路 VAD 模型不再使用單純的音量閾值,而是為輸入的聲音賦予機率評分。它們能分辨人類聲音與暫態引擎噪音,並利用頻譜閘控(spectral gating)這種噪聲過濾技術,在音訊離開裝置前消除約 75% 的背景噪音。系統亦會在 250 毫秒時開始處理音訊,但會等待至 600 毫秒以確認結束點,在防止過早打斷的同時,將感知延遲縮短 350 到 600 毫秒。
2. 邊緣硬體在地處理。 與其將每個字傳送到遙遠的資料中心,不如直接在餐廳內的專用晶片上處理。這將延遲從 100–500 毫秒驟降至 5–10 毫秒。即便在網路斷線時系統也能正常運作,顧客的語音數據保留在本地,這對 數據主權與隱私保護至關重要。同時您能以固定的硬體成本取代難以預測的雲端 API 費用——通常可降低 30% 到 40% 的營運支出。
3. 上下文感知話輪轉換與向上提報。 如果顧客說「我想要一個 Baconator 還有……」,系統會識別出連詞「還有」代表發言尚未結束,即使中間停頓了一秒鐘也是如此;如果顧客說「就這樣」,系統會在 200 毫秒內做出回應。針對口吃人士,系統經過包含阻滯、延長與重複等語音特徵的訓練,不會將字詞中途的停頓誤認為句子結束。
此處的合規優勢對您的審計團隊至關重要。系統的每項決策——為何等待、為何轉接真人、為何以特定方式解讀訂單——皆具備可追溯性。您可以向監管機構清楚展示 AI 如何處理特定的互動。部署前測試納入多元說話族群;即時防護機制(Guardrails)捕捉違規語言或脫稿行為;互動後監控標記失敗模式以持續改進;自動提報機制則在顧客感到挫折前,將高阻力問題轉交真人處理。
您的 語音 AI 系統 應當產生明確的審計軌跡,而非留下一團謎團。
關鍵要點
- Wendy's 得來速 AI 處理簡單訂單需嘗試三次或以上,對全球 8,000 萬口吃者而言被形容為「完全無法使用」。
- 72% 的標普 500 企業已將 AI 列為重大風險(2023 年僅為 12%),使 AI 部署失敗成為董事會層級的重大議題。
- 雲端語音 AI 光是網路延遲就增加 100–500 毫秒;邊緣處理將其降至 5–10 毫秒,並降低 30–40% 的營運成本。
- 最新無障礙標準(CAN-ASC-6.2:2025 及《歐洲無障礙法案》)要求 AI 系統必須支援身心障礙人士,違者面臨高額罰款。
- 跨數百家門市重新改造不合規的 AI 系統,成本最高可達一開始就採用包容性設計的五倍。
總結
在語音 AI 能夠處理真實環境噪音、多元語音模式及無障礙要求之前進行規模化擴展,會帶來法律、財務與聲譽風險,且隨著每家新門市的開設而不斷疊加。打造能理解每位顧客(而非僅限容易辨識者)的技術早已存在。請詢問您的 AI 供應商:能否出具按言語不流暢、口音與背景噪音等級細分的系統準確度報告——並能否為每次提報提供完整的決策軌跡?