董事會會議室螢幕上一面全綠的 AI 治理儀表板,旁邊擺著一份列印出的 AI 答案,其中一行被標示為錯誤。
Artificial IntelligenceFintechEnterprise Technology

綠色儀表板騙了你:企業級 AI 驗證真正該測試的是什麼

Ashutosh SinghalAshutosh Singhal2026年6月10日14 min

我職業生涯有很長一段時間,在會議室裡扮演的正是那個負責說「不,那個模型還沒通過驗證」的人。在銀行業,這項職能有個枯燥的名稱——SR 11-7 之下的獨立模型驗證,也就是聯準會與 OCC 自 2011 年以來規範模型風險的指引。這份工作正如它聽起來那樣「光鮮」。你去讀那份沒人會讀的限制附錄。你去問廠商,模型在示範中不會出現的那些情況下會如何表現。而每隔一段時間,你就會坐在審計委員會面前,對著一面完全、令人安心地全綠的儀表板——每個方框都打了勾、每條政策都對應到位、每項合規狀態都顯示正常——心裡卻懷著一種下沉的感覺,明白那片綠色幾乎沒告訴你這東西到底能不能真正運作。

這道落差正是這整篇文章要談的,也是我們之所以打造Veriprajna 企業級 AI 驗證實務所圍繞的那個不合時宜的核心理念:你必須測試答案,而不是流程。一面治理儀表板證明的是某個程序被遵循了。它並不能證明你的 AI 針對這位投保人、這筆貸款、這條法條給出了正確答案。這兩者在董事會裡不斷被混為一談,而這種混淆代價高昂。

讓我告訴你有多昂貴。

Klarna 省下 40%——然後虧損 9,900 萬美元

2024 年,Klarna 向全世界宣布,其 AI 助理已取代 700 名客服人員。該助理處理了橫跨 35 種語言、約三分之二的對話。每筆交易成本從 $0.32 降到 $0.19——大約 40%——各家頭條不寫自明。這就是未來:更精簡、更快速、更便宜。

到了 2025 年年中,他們正把軟體工程師和行銷人員重新調派去支援客服中心。CSAT 分數下滑了 22%。在棘手的問題上——爭議款項、有異議的退款、帳戶關閉——客戶陷入了媒體所稱的「卡夫卡式迴圈」。Klarna 的 2025 年第一季以 9,900 萬美元的淨虧損作收,高於前一年的 4,700 萬美元,儘管營收成長了 15%。執行長坦承,大規模自動化「導致了服務品質下降」。

有一點我花了好一陣子才真正領會,而它與多數人得出的教訓恰恰相反。Klarna 的 AI 是有效的。它確實在密碼重設和訂單狀態查詢上省下了錢。問題不在於 AI 很糟。問題在於,沒有人驗證它能否處理那承載了大部分財務與商譽份量的 20% 互動——那些爭議、那些邊緣案例、那些會演變成客戶流失與投訴的事情。毒性過濾器會讓那些破裂的對話全數通過。AI 在失敗的同時,仍彬彬有禮。

AI 沒有說出任何冒犯的話。它只是無法處理一筆涉及取消航班與爭議款項的多幣別退款——而那正是至關重要的 20%。

Klarna 並非特例。它只是某件事情的可見版本——這件事正悄悄發生在我所接觸的每一家企業。大約 70% 到 85% 的企業 AI 專案根本從未上線——這個數字是 RAND、Gartner、BCG 和 McKinsey 各自獨立得出、卻都很接近的。MIT 的 NANDA 研究在 2025 年發現,95% 的 AI 試點沒有帶來任何可衡量的損益影響。McKinsey 報告指出,42% 的公司在 2025 年放棄了大部分 AI 計畫,高於前一年的 17%。這些試點示範得漂亮無比。一接觸到示範從未展示過的案例,它們就死去。

我們一開始打造了錯誤的東西

我想誠實說明,我們是如何走到測試答案、而非測試流程這一步的,因為我們不是靠聰明才智走到那裡。我們是靠推出了一個行不通的東西,並眼看著它在客戶面前失敗,才走到那裡。

如今回頭看,我們的 AI 驗證層第一版,恰恰就是市場早已在賣的那種東西。我們搭建了一套像樣的護欄框架——內容審查、PII 偵測、越獄檢查——外掛上漂移與公平性監控,並把整套東西呈現為一個乾淨的合規視圖。輸入經過掃描。輸出經過掃描,以檢查毒性與外洩的個人資料。一面變綠的儀表板。我為它感到驕傲。它看起來就像治理。

我們把它放到一個受監管的金融工作流程試點中,而在最初幾週內,AI 就給出了一個自信、格式良好、不含任何毒性、也沒有外洩任何 PII 的答案——但它就是在一條領域規則上錯了。我們的系統讓它通過了。我們建立的每一項檢查都是綠的。錯誤出在答案的實質內容上,出在我們的護欄全都沒有在看的地方,因為它們沒有一個對這個領域了解到足以知道答案是錯的。

那個月,我不再相信我們一頭栽進去的那個產品類別。我在模型驗證領域待了多年,早在銀行業的脈絡裡就懂得這個道理,卻仍舊打造了一個犯下同樣錯誤的工具——那正是我整個職業生涯都在抓的錯誤。資安不等於正確。安全不等於正確。一面綠色的儀表板不等於正確。

一個能安全抵禦提示注入的 AI,仍然可能算錯準備金、引用一條已廢止的法條,或核准一筆違反公平放貸規則的貸款。安全與正確是不同的問題,而幾乎沒有人在測試後者。

你聽過的那些工具,為什麼止步於它們止步之處?

五種 AI 工具類別,每一種各涵蓋一件事,下方有一條寬闊的琥珀色橫條,顯示沒有任何一種能回答答案是否正確。

如今存在著一個真實、資金充裕的 AI 工具市場,以大約 45% 的年複合成長率擴張,我不想對它不公平。這些產品大多把它們真正的工作做得很好。問題在於,它們真正的工作,並不是多數買家以為自己買的那份工作。

治理平台——Credo AI、IBM 的 watsonx.governance、ModelOp——把你的 AI 計畫對應到監理框架,並追蹤合規狀態。Credo AI 在 Fast Company 的 2026 年榜單上,於應用 AI 類別排名第 6,與 Google、Nvidia 和 Anthropic 並列;這是紮實的工作。但政策合規並不等於輸出正確。一面綠色的政策儀表板,意味著文書作業井然有序,而不代表 AI 針對你的特定使用情境給出了正確答案。

監控工具——Arthur、Galileo、Arize——即時盯著模型層級的指標:漂移、公平性、延遲、token 分佈。很有用。但它們監控的是模型的整體行為,而不是在特定投保人的承保條款下,某一筆保險計算是否正確。資安工具則深入一層——Cisco 在 2024 年 10 月斥資約 4 億美元收購 Robust Intelligence,並將其併入 Cisco AI Defense,把偵測結果對應到 OWASP 與 MITRE ATLAS。這是必要的。但它談的仍然是模型能否被攻擊,而不是它是否正確。

接著是護欄框架,像 NVIDIA 的 NeMo Guardrails 之類,它們擅長內容審查、PII 與主題過濾——而 NVIDIA 自己也謹慎地表示這無法攔下一切,因為自我檢查機制仰賴的正是它們所要防護的那些模型。還有四大會計師事務所,會用 6 到 18 個月、介於 50 萬到 500 萬美元的價碼賣你一套治理策略,最後交給你一份 PowerPoint 和一張廠商候選名單——那是一套框架,而不是一個會在某個星期二告訴你「你的 AI 錯了」的運行中系統。

這其中的每一個,都有一欄是它的用處戛然而止之處。把它們全部疊在一起,你涵蓋了政策、資安、漂移與內容安全。你仍然沒有回答那個真正決定部署存亡的問題:針對這個案例,答案正確嗎?

69% 的問題

如果你想要那個讓這件事對我變得具體的數字,那就是它了。在法律盡職調查任務上,獨立測試把 AI 的錯誤率定在 69% 到 88% 之間——遠高於廠商基準測試所暗示的水準。好好體會一下。不是 6.9%。是六十九到八十八。

而這些並不是護欄能抓到的錯誤,因為它們既不冒犯、也不涉及資安漏洞。它們錯得只有懂這個領域的人才看得出來。到 2025 年底,法律文件中有據可查的 AI 幻覺事件已超過 729 起——高於前一年的 280 起。法院開始對當事人開罰。在其中一起案件,Doiban v. OLCC中,制裁金額算下來是 15 條捏造引註每條 $500,外加 $1,000 補償對造律師花在追查那些根本不存在的幽靈案例上的時間。美國最大的律師事務所之一,在六個月內就記錄到三起各自獨立的幻覺事件。

這些是專業人士,會覆核自己的工作,身處一個出錯就有後果的領域——而 AI 仍然捏造出足夠以假亂真、能混進法院文件的判例法。那就是這種失敗的質地。它流暢、看似合理,卻是假的,而它恰恰盤踞在通用型監控無從評估的領域知識之中。

當廠商不肯打開黑盒子時,你要驗證什麼?

圖示:一個封閉的 LLM,其內部無法被看見,改為在輸出層對照已知正確的案例進行驗證,並在每次更新時重新測試。

在受監管的產業裡,這不再是一個有趣的工程問題,而成了一個法律問題。如果一個模型影響核保、準備金提列或資本,美國銀行業的 SR 11-7——以及針對歐洲保險業者的 Solvency II 第二支柱——就要求它必須經過獨立驗證、留下文件記錄,並持續受到監控。這項義務如今也適用於大型語言模型;監理機關並不在乎你的模型碰巧是個 LLM。

而這就是我一再遇到的困局。SR 11-7 的驗證傳統上仰賴對模型的理解——它的假設、它的內部結構、它的邊界。但 LLM 供應商不會告訴你模型是如何運作的。我的封存郵件裡就有這句話,以各種措辭出現:我們無法揭露模型的內部結構。你在法律上被要求去驗證一個廠商拒絕打開的東西。

跳出這個困局的唯一辦法,就是別再試圖檢視權重,而開始為輸出對照領域的基準事實來評分。你建立起一批你已知正確答案的案例——例如當一張保單的次限額與一項承保除外條款交互作用時,長尾責任準備金該如何提列、一條已廢止的法條意味著什麼、一項公平放貸規則如何適用——然後你測試 AI 是否答對,大規模地、持續地,在每一次模型更新或重新調校時測試。你驗證你看得見的行為,因為那反正就是監理機關與客戶所經歷到的行為。那正是我們如今所打造之物的核心,也是唯一一種無論廠商是否曾打開黑盒子都行得通的方法。

當你無法看進模型內部時,輸出層就是唯一還誠實的驗證之處——而恰巧的是,它也是你的客戶與你的監理機關唯一真正接觸得到的那一層。

為什麼「乾脆買個平台」不再是答案

在企業打造 AI 的方式上,正發生著一場悄無聲息的反叛,而它與驗證直接相關。Retool 的 2026 年自建對外購報告發現,35% 的團隊已經以自建方案取代了至少一項 SaaS 工具,而 78% 預期會自建更多。貼合特定商業邏輯的客製化方案,一直展現出比通用型套殼高 3 到 5 倍的回報——部分原因在於,大約 65% 的軟體成本,都在部署之後才產生——落在整合、維護,以及套殼沒能完全做到的那些事情之中。

但有一個「乾脆自己做」那派人跳過的陷阱。要把客製化驗證做好,需要多數公司並不具備的 ML 基礎架構團隊。所以真正的局面並不是套殼對客製之爭。它有三個選項:一個不懂你領域的通用套殼、一個你人力不足以支撐的自建專案,或者由做過這類驗證工作的人為你的特定垂直領域打造的領域專家系統。第三個選項,正是我們決定安身其中的那道缺口。不是一個你去授權的儀表板。不是一個你去配置人力的平台。而是一個圍繞你領域真實實況打造的驗證層。

「我們已經買的治理工具,難道不涵蓋這一塊嗎?」

人們不斷用各種版本問我這個問題,通常帶著一絲希望,因為他們已經把預算花掉了。誠實的答案是:你的治理工具涵蓋的是治理——而治理確實有其必要。留著它。它只是不驗證正確性,而它本來也就不是為此打造的。

他們問的第二件事,是關於那些他們無法看見的 AI——影子 AI。這件事讓風險長徹夜難眠,而數字顯示他們確實該如此:78% 的員工使用雇主並未提供的 AI 工具,其中 77% 曾把敏感或專有資訊餵進那些工具。Samsung 和 Amazon 都發現自家的專有程式碼躺在公開的 AI 服務裡。影子 AI 資料外洩事件平均損失達 463 萬美元。Gartner 自己的說法才是令人不安的那個——絕大多數未經授權的 AI 活動來自內部政策違規、過度分享與誤用,而非外部攻擊者。你的治理平台無法治理它看不見的東西,而驗證必須從發現到底有什麼正在運行開始。

第三個問題,是來得最快的那一個。Gartner 預測,到 2026 年底,40% 的企業應用程式將嵌入自主 AI 代理——這些代理不只是回答,它們會行動:修改資料庫、執行交易、發送客戶溝通訊息。只有大約三分之一的組織表示,對這其中任何一項具備成熟的治理。當一個代理能夠採取不可逆的行動時,驗證的問題就從「它有沒有說對」轉變為「它有沒有對」,而一個你無法收回的錯誤行動,是與一句錯誤的話截然不同類別的風險。為聊天機器人打造的監控,從來就不是為它而設計的。

沒人想放進董事會簡報的那張罰則表

我會用那個往往能終結辯論的數字作結,因為它讓驗證的代價,以錯誤率所做不到的方式,變得讓 CFO 一看就懂。

自 2026 年 8 月 2 日起,歐盟《AI 法案》大部分剩餘的義務將正式生效——針對高風險系統的規則、第 50 條下的透明度要求。違反禁止性行為的罰則高達 3,500 萬歐元或全球營業額的 7%;高風險違規則高達 1,500 萬歐元或 3%。芬蘭在 2026 年 1 月成為第一個具備完整可運作執法權力的成員國。這不再是一份關於未來的備忘錄。它是一個標注了日期的預算項目。

把跳過驗證的其餘帳單加總起來:每起影子 AI 外洩事件 463 萬美元、重大 AI 停機期間每小時逾 100 萬美元、服務品質悄然崩塌時的 9,900 萬美元、每起幻覺事件六位數的制裁金,以及一筆以全球營收百分點計的歐盟罰款。相較於這一切,好好驗證你的 AI 的成本——測試答案、對照你的領域、持續進行——只是一個捨入誤差。然而多數企業仍把驗證當成一個勾一次就了事的核取方塊,而不是一項持續執行的紀律。

綠色的儀表板告訴他們一切都好。麻煩在於,這個儀表板評的是錯的東西。它檢查的是他們有沒有遵循流程——那是一件容易稽核、也安全好扛的事,這正是為什麼在它早已不再具有任何意義之後,它仍能在董事會簡報裡存活下來。它從來沒有問過一次答案是否正確——而答案正確與否,才是客戶、監理機關與損益表上那一欄唯一在乎的事。如果你想看看我們是如何改為測試那件事的,我們把這套做法寫在了這裡

我至今仍把 SR 11-7 的四支柱檢查表放在看得見的地方,而第四根支柱是監控——唯有當你監控的是對的東西時,它才有意義。一面評你流程的儀表板會綠油油地待在那裡,而你的 AI 卻悄悄搞砸那筆多幣別退款、那筆有爭議的準備金、那條已廢止的法條。Klarna 的儀表板當初也是綠的,一路綠到它虧損 9,900 萬美元的那一季。真正保護你的驗證,就是我整個職業生涯一直在做的那份不光鮮的工作:蒐集那些你已經知道正確答案的案例,然後檢查——一次又一次,在模型每一次改變時——機器是否仍然答對它們。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。