問題所在
UnitedHealth Group 的 AI 演算法拒絕了老年病人的照護——而且它有 90% 的時候是錯的。當真正有人類審查者複核時,每十件拒保案就有九件被翻轉。但 UnitedHealth 心裡清楚一件殘酷的事實:只有 0.2% 的病人擁有反擊的資源。
這場危機核心的演算法名為 nH Predict。UnitedHealth 旗下的 Optum 部門於 2020 年以超過 10 億美元收購了它。它原本應該預測 Medicare 病人需要多久的後續照護,例如在專業護理機構的住院天數。結果它卻變成一部無視病人是否真的需要協助的成本削減機器。
想想 Carol Clemens 的遭遇。她熬過了高鐵血紅蛋白血症——一種危及生命的血液疾病——之後,需要密集的專業護理照護。臨床證據支持她持續接受復健的需要。但 nH Predict 的預測還是終止了她的承保。她的家人自掏腰包支付了超過 16,768 美元,只為避免她被過早出院。訴訟指控 UnitedHealth「押注」在像 Clemens 這樣的病人病得太重、太老或太窮而無力上訴這件事上。
2025 年 2 月,一位聯邦法官裁定該集體訴訟可以繼續進行。躲在黑箱 AI 決策背後的時代正在結束。如果您的組織使用 AI 做出影響他人生命或生計的決策,這個案子就是對您發出的警告。
這為何與您的企業息息相關
這不只是一個醫療故事,更是一個公司治理故事,而財務風險敞口大得驚人。
UnitedHealth Group 每年創造約 3,000 億美元的營收。該公司如今面臨一場可能重塑所有受監管企業部署 AI 方式的聯邦集體訴訟。以下數字告訴您自身的風險何在:
**拒保率飆升超過 100%。**AI 部署之後,後續照護拒保率從約 10% 跳升至 22.7%。專業護理機構拒保率增加了 800%。您的董事會應該追問:您的 AI 系統是否正在產生監管機關能夠標記的統計異常結果?
S&P 500 成分股中已有 72% 的公司在年度 SEC 申報文件中揭露重大 AI 風險。信譽受損是最常被引用的顧慮。一次爆紅傳播的 AI 失誤就可能引發訴訟,其成本是這套 AI 原本預期節省金額的好幾倍。
**EU AI Act(歐盟 AI 法案)的罰款最高可達全球營業額的 7%。**醫療 AI 系統依該法被歸類為「高風險」,必須接受強制性符合性評估、透明度揭露與人類監督。如果您在歐洲做生意,不合規就是董事會層級的財務威脅。
FDA 2025 年 1 月的指導草案現在為用於醫療與法規決策的 AI 模型確立了一套強制性的七步驟可信度框架。監管機關不再只是建議最佳實務——他們正在制定規則。
對您損益表而言的底線:妥善治理 AI 的成本,僅是為集體訴訟辯護、繳納監管罰款或在公開失敗後重建品牌所需成本的一小部分。
底層究竟發生了什麼事
以下用淺顯的語言解釋 nH Predict 為何失效。
這套演算法的運作方式是交叉比對一個包含 600 萬份病人紀錄的資料庫。它尋找模式:診斷相似的病人,歷史上通常住院 X 天。然後它為每位新病人產出一個「目標」出院日期。
把它想成一台只知道平均路況模式的 GPS。它告訴您車程需要 30 分鐘,卻看不見前方的事故、道路封閉,也看不見您的車輪胎沒氣了。它只是一味堅稱您早就該抵達了。
nH Predict 有著同樣的盲點。它依賴的是相關性——通常會發生什麼——而非因果性——究竟是什麼在驅動每一位病人的病情。它無法考量病人家中是否有照顧者、是否面臨財務不穩定,或有特定的臨床併發症。這些因素依 Medicare 規則決定了醫療必要性,但這個模型完全忽略了它們。
這種失效模式有個名字:它就是「通常會發生什麼」與「為什麼這位病人需要更多時間」之間的差別。相關性驅動的模型——只能辨識模式而不理解成因——會告訴您某種診斷的病人通常在 14 天後離院。因果模型則會追問哪些因素導致病人需要更多時間,以及過早取消承保會造成什麼後果。
問題之所以惡化,是因為 UnitedHealth 把一套有缺陷的預測工具變成了強制指令。內部經理要求個案管理師將病人住院天數控制在演算法預測值的 3% 以內,接著又把目標收窄到只剩 1%。為配合病人實際需求而偏離目標的臨床人員,面臨的是懲戒處分或解僱。「人在迴路中」的保障被簡化成了橡皮圖章。
什麼有效(什麼無效)
我們先從無效的做法談起,因為您的組織可能已經正在採行其中一項。
**在既有 AI 上再疊加一層聊天機器人。**這就是所謂的「套殼」做法——在 GPT 之類的第三方 AI 引擎外面罩上一層自訂介面。這類套殼毫無專有邏輯可言,會原封繼承其基礎模型的每一種偏見,並產出您無法稽核的黑箱輸出。在受監管產業中,它們是不折不扣的負債。
**假設人工審查能解決一切。**嚴格來說,UnitedHealth 確實有人類在審查 AI 決策。但如果您因員工推翻演算法而懲罰他們,您那所謂的「人在迴路中」就是虛構的。流程設計比政策措辭更重要。
**把 AI 治理當成一個 IT 專案。**如果您的 AI 治理完全落在 IT 部門手裡,就會遺漏法律、臨床與財務等真正構成法律責任的面向。2025 年 2 月的裁決之所以成功,是因為法官認定 UnitedHealth 違反了由「臨床服務人員」和「醫師」做出承保決定的合約承諾——而不是由演算法來決定。
以下是真正有效的做法,分三個步驟:
**輸入:以因果建模取代相關性。**您的 AI 系統應該建立在 因果與反事實建模 之上——這種方法要求您描繪自身領域中真實存在的因果關係,而不只是歷史模式。就醫療而言,這意味著為「病人為何需要照護」建模,而不只是相似病人住了多久。
**處理:具備信心評分的可解釋 AI。**AI 做出的每一項決策,都應附帶一段以平實語言寫成的說明,講清是哪些因素驅動了該決策。SHAP 和 LIME 這類工具——用以顯示哪些資料點影響了特定輸出的方法——讓稽核人員能看出拒保究竟是由臨床證據驅動,還是由郵遞區號之類的代理變數驅動。當 AI 遇到訓練資料之外的案例時,信心評分應標記出那份不確定性,並將該案例轉交給人類審查者。
**輸出:具備終止開關控制的完整稽核軌跡。**每一項 AI 輸出都必須被記錄、標記時間戳且可追溯。您的 AI 治理與合規計畫 應包含一個集中式的 AI 登錄簿,登載您技術堆疊中的每一個模型;包含支援回滾選項的模型變更管理;以及明確授權一個跨功能委員會,在某個模型效能退化時將其停用。
這份稽核軌跡正是說服您合規團隊採用這套做法的關鍵。當監管機關或原告律師問起「給我看這項決策是如何做成的」,您要嘛拿得出一份書面的邏輯軌跡,要嘛就得吃官司。FDA 的七步驟可信度框架現在明確要求一份「可信度報告」,記載驗證策略、指標以及任何偏差。如果您的 AI 生產不出那份報告,它在走進法庭之前就已經通不過法規檢驗。
正在打造 醫療與生命科學 AI 解決方案 的組織,需要的系統要能解釋自身的推理、標記自身的不確定性,並讓人類真正掌握控制權。法院在 UnitedHealth 案中傳達的訊息再明白不過:如果您的 AI 系統從根本上就是壞的,法院不會要求受害者去陪演一場被操縱的上訴程序的鬧劇。
關鍵要點
- UnitedHealth 的 AI 以 90% 的錯誤率拒絕老年病人的照護,但只有 0.2% 的病人能夠上訴——形成一種有利可圖的失敗。
- 一位聯邦法官允許集體訴訟繼續進行,裁定以 AI 演算法取代人類臨床判斷,可能違背對保戶的合約承諾。
- EU AI Act(歐盟 AI 法案)對不合規的醫療 AI 部署最高可處以全球營業額 7% 的罰款,而 FDA 現在要求 AI 模型遵循七步驟可信度框架。
- 基於相關性、只預測「通常會發生什麼」的 AI,在受監管的情境中必然失靈——您需要的是能解釋決策「為什麼」的因果模型。
- 在高風險領域中,每一項 AI 輸出都需要完整的稽核軌跡、信心評分與終止開關——否則您建造的是負債,而不是效率。
總結
UnitedHealth 案證明了:一套能獲利的 AI 系統,同時也可能是錯得離譜的系統——而法院會就這道落差追究您組織的責任。只要您在任何影響人們健康、財務或法律權利的決策上部署 AI,您的系統就必須能解釋自身的推理,並標記自身的不確定性。請問您的 AI 供應商:當你們的模型拒絕一筆理賠或做出一項高風險建議時,它能向監管機關出示它權衡過的確切因素、該筆特定決策的信心水準,以及證明人類確實握有推翻權限的稽核軌跡嗎?