一頁承諾由醫師做決定的保險合約,旁邊是一個被人類橡皮圖章式核准的 AI 理賠畫面。
Artificial IntelligenceHealthcareCompliance

90% 的 AI 保險拒付在申訴後被推翻。法院剛把這稱為違約。

Ashutosh SinghalAshutosh Singhal2026年6月4日13 min

一個家庭自掏腰包支付了 $16,768,只為讓母親能繼續躺在病床上。

她患有高鐵血紅蛋白血症——一種讓身體缺氧的血液疾病。決定她保險給付的演算法並不知道這一點,或者說,它知道卻不在乎。它被訓練成根據她的診斷分組來預測住院天數,而該分組的平均病患已經可以出院了。於是系統依照群體時間表把她標記為應該出院,儘管她實際的血氧狀況訴說著截然不同的故事。她的家人湊出了這筆錢。大多數家庭做不到——而且大多數家庭甚至從未嘗試:在 UnitedHealth 的訴訟中,只有約 0.2% 的 Medicare 受益人真正對他們的拒付提出過申訴。

該案例正位於 Lokken v. UnitedHealth 一案的核心——這是一起針對 nH Predict 的集體訴訟,nH Predict 是一款用於在 Medicare Advantage 使用率管理中預測康復時間表的 AI 工具。而應該讓每一位健康計畫高階主管都不寒而慄的數字是:大約有 該訴訟中由 AI 生成的拒付有 90% 在申訴後被推翻——而這還只是在那一小撮願意提出異議的會員之中。我第一次讀到時,直覺和多數工程師一樣——90% 的推翻率是個模型準確度問題,用更好的訓練資料和更嚴格的閾值就能修正。我錯了,而法院告訴了我原因。一位聯邦法官把這 90% 不是當作技術缺陷,而是當作違約的證據。正是這一個重新定義,才是 Medicare Advantage AI 治理 真正必須回答的問題,也是我最終圍繞它創辦一家公司的原因。

90% 的申訴推翻率不是一個調校參數。它是一種坦白:這套系統從一開始就根本不是在判定醫療必要性。

這場官司關乎的是你合約裡的一句話,而不是你模型中的一個缺陷

讓我羞愧地花了很久才明白的是:這些案件中的法律風險並不存在於模型權重裡。它存在於你的 Evidence of Coverage(保險給付憑證)之中。

你的 EOC——每位會員都會簽署的合約——承諾保險給付決定是由臨床服務人員與醫師做出的。這就是約定。當我開始把各計畫的 EOC 條文調出來,並把它擺在他們實際的自動裁定佇列旁邊時,那道落差幾乎總是白紙黑字地擺在那裡。合約說由醫師決定。工作流程卻顯示:一套演算法在為請求評分,而人類只是對它回傳的任何結果點擊核准。對方律師不需要一位資料科學家來找出那道落差。他們需要的是一名律師助理和一支螢光筆。

2026 年 3 月,在 Lokken(2026 WL 658883)一案中作出的證據開示命令讓這一點變得具體。法院准許原告取得 AI 開發文件、訓練資料規格與驗證報告。我留著那份命令的列印本,上面圈了一條條款,因為它改變了我和每一個計畫談話的方式:你的 AI 文件現在是可被開示的。如果你的模型無法產出結構化的決策日誌、受版本控制的訓練資料,以及有文件記載的驗證結果,你就無法重建你為何拒付某項理賠——而你無法為你無法重建的東西辯護。

「人在迴路中」變成虛構的那一刻

有一陣子我以為那些被告的計畫是魯莽的異類,跑著完全自動化的拒付。現實更令人不安,而每當有醫務長告訴我他們很安全、因為有臨床醫師簽核時,這正是我如今會率先端出的細節。

崩壞發生在一個房間外沒人看得見的單一營運決策上。nH Predict 的管理者把相對於模型預測的可接受偏差範圍,從 3% 收緊到 1%。在紙面上這是一項調校變更。實際上它把一款決策支援工具轉變成了一個自動化的守門員,因為任何偏離演算法數字超過一絲一毫的臨床醫師,如今都算違規。有些推翻系統的人面臨了紀律處分。

那正是「人在迴路中」不再是一道防護、而淪為表演的那一刻。一位若不同意模型就會丟掉工作的醫師,並不是在行使臨床判斷——她只是在橡皮圖章式地蓋章放行。而每一筆流經這種做做樣子審查的拒付,都承擔著與自動化拒付完全相同的合約與法規責任,因為在功能上它就是自動化拒付。

那道偏差區間就埋藏在某個委員會的會議記錄裡。官司的勝負在那裡決定,而不是在模型架構裡。

我數不清有多少場治理對話直接跳過了這一點。各計畫會稽核他們的模型。他們卻幾乎從不稽核環繞在模型周圍的工作流程政策——那個閾值、那些推翻規則、那套紀律結構。正是那項政策,決定了你的臨床醫師究竟是一位決策者,還是一面其實什麼都擋不住的責任擋箭牌。

我們為何一開始做錯了東西

我的團隊起步時,我們做了那件顯而易見的事。我們建了監控。

在白板上這說得通。市場上滿是 AI 可觀測性產品——Fiddler 提供 SHAP 和 LIME 的可解釋性,並附帶漂移與偏誤偵測;IBM 的 Watsonx.governance 有用於公平性的 OpenScale;Credo AI 和 Holistic AI 則販售政策套件與能自動蒐集證據的合規儀表板。整個品類的邏輯是:你有模型在生產環境中運行,你外掛一層來監看它們,於是你就有了治理。所以我們建了一層,用來監看某個試點計畫的使用率管理 AI,並產出漂亮的公平性指標。

接著,那個計畫的一位醫務主任——一位在自己的 UM 委員會裡坐了多年的人——看著我們的儀表板,問出了那個把我們打回原點的問題。「這告訴我模型的行為前後一致。它並沒有告訴我這個模型究竟該不該做這個決定。nH Predict 當年也很一致。」

她說得對,而且刺痛人。我們打造了一件非常精密的儀器,去量測一件從根本上就有缺陷的東西。nH Predict 之所以失敗,不是因為它沒被監控。它失敗,是因為它把診斷分組的平均值看得比個別臨床指標——血氧、照護者可及性、共病交互作用——更重,而在這個領域裡,個體差異 就是 醫療必要性的定義。更緊密地監控那個模型,只會產出一份整潔的記錄,記載一套系統可靠地做著錯誤的事。那 90% 的推翻率原本會被記錄得無比漂亮。

那次失敗,換來了我們接下來所建構的一切。可觀測性告訴你模型是否穩定。它不會告訴你這個決定是否站得住腳、經得起辯護。這是兩個不同的問題,而對我在意的那位買家而言,整個治理平台品類都在解決第一個問題,卻把它叫做第二個。

Medicare Advantage AI 治理實際上必須做到什麼?

一個附帶公平性儀表板、被封閉監控的模型,對比一份開放、可供證據開示的逐項決策記錄。

於是我們撕掉了監控的前提,從法庭上唯一重要的問題重新出發:你能為這一個特定的人所受的這一筆特定拒付辯護嗎?

這個重新定義徹底改變了建構方式。你不再是在為一個模型加裝儀表——你是在工程化一個決策,好讓多年以後、在一紙證據開示命令之下,它能自我重建。對一個 Medicare Advantage 計畫而言,這意味著三件事必須同時成立,而讓它們成立,正是 Veriprajna 在 veriprajna.com/solutions/medicare-advantage-ai-governance 所從事的工作。

首先,每一個決策都必須帶著自己的解釋——不是一個全域的公平性分數,而是一份逐項決策的記錄,說明模型權衡了哪些臨床因素、又忽略了哪些,並且用臨床醫師與法官都讀得懂的語言寫成。這是每個人都低估的部分,也是我不得不帶來壞消息的地方。多數計畫所仰賴的老舊理賠平台——Facets、QNXT——從來就不是為了輸出逐項決策的特徵歸因記錄而設計的。它們儲存結果,而非推理過程。所以在 Medicare Advantage 的技術堆疊上實現真正的可解釋性,並不是從貨架上挑一個更好的模型那麼簡單。它是中介軟體:一層捕捉模型輸入、權重與臨床推翻路徑,並把它們寫入一份為經得起證據開示而打造的日誌的中間層。那是不光鮮的整合工作,而它佔了這份工作的絕大部分。

更困難的要求是:合規架構必須對應到同時到來的各項法規——這把我帶到了一個陷阱,一個我親眼看著一個老練的計畫直直走進去的陷阱。

那個看似乾淨、實則不然的指標

Medicare Advantage AI 所面臨的 2026-2027 年 CMS、RADV、FHIR 與 EU AI Act 各項期限的時間軸。

CMS-0057-F,也就是那項事前授權最終規則,在 2026 年 1 月開始發威——加急請求須在 72 小時內處理完畢,標準請求則為七天,除詐欺外不得重新開啟已核准的住院收治。接著在 2026 年 3 月 31 日,第一個公開申報期限到來:各計畫必須在合約層級申報八項事前授權指標,包括拒付率、處理時間,以及申訴推翻率。

真正要緊的細節,是那種你只有讀過 Federal Register 的勘誤、而不只是頭條時,才會注意到的那種東西。2025 年 6 月,CMS 暫停了計畫層級的細項拆分,以及對 UM 委員會的健康公平專業要求。仍然公開的,是 彙總的、合約層級的 指標。所以一個計畫可以公布一個相當體面的合約層級申訴推翻率,看起來一乾二淨——然而它那些個別的決策日誌,也就是一紙 Lokken式證據開示命令會直接伸手探入的那些日誌,訴說的卻是一個截然不同的故事。

那些公開指標是你選擇要展示的部分。那些決策日誌則是法院會拿走的部分。治理必須贏在後者,而不是前者。

我曾與一些高階主管面對面而坐,他們指著自己 3 月 31 日的申報,把它當作自己已有保障的證明。那份申報是必要的。但它不是一道辯護。原告律師群並不是在讀你那彙總的儀表板;他們是在傳喚某一位會員遭拒付背後的那份記錄。

接著是 2027 年 1 月 1 日,屆時 HL7 FHIR 事前授權 API——CRD、DTR 與 PAS——將成為強制項目,為每一筆 PA 決策建立一條完整的電子交易軌跡。那條軌跡要麼是你最好的證據,要麼是你最糟的證據,完全取決於在決策做出的當下,是否把推理過程一併捕捉了下來。你事後無法回填它。我此刻手上就有一張針對某個 QNXT 執行個體開立的整合工單,它本質上就是在賭一個計畫最終會落入那兩種未來中的哪一種。

沒有任何單一平台為之打造的那張拼布

而且它必須撐過一張沒有任何現成產品能涵蓋的法規地圖。當我第一次把一個跨州客戶的各項義務攤在同一張試算表上時,各欄位彼此不再一致——而這是刻意設計出來的。這些要求本就是故意不一致的。

《德州負責任 AI 治理法》(Texas Responsible AI Governance Act)於 2026 年 1 月生效,賦予了廣泛的民事調查傳喚權力——而德州早已亮出底牌:早在 2024 年 9 月,它就針對誇大準確度的宣稱,和解了第一起醫療生成式 AI 調查案,對象是 Pieces Technologies。賓州則走上了另一條路,立法要求在任何 AI 驅動的拒付之前,須經人類醫療提供者審查,強制揭露 AI 確有被使用,並須提交年度合規聲明。一個跨州的 Medicare Advantage 組織如今面對的是一張拼布,其中每一州都要求不同的透明度、稽核與揭露控制。而對任何有全球營運的計畫來說,EU AI Act 依據附件三將醫療 AI 歸類為高風險,須於 2027 年 8 月前完全合規,罰款最高可達全球年度營業額的 6%。

這正是那些大型顧問公司會掉進去的接縫。Deloitte 和 Accenture 會部署一個打包好的平台——一個 Credo AI 或一個 IBM Watsonx——然後把它稱作治理。但一個打包平台並不了解你特定的 Facets 組態,它也無法把德州的調查傳喚、賓州的拒付前審查要求,與歐盟的風險管理檔案要求彼此調和。理賠系統供應商的處境還更糟:維護 Facets 和 QNXT 的,正是同一批公司,而它們也在為這些系統販售 AI 附加元件,所以它們其實沒什麼誘因去在自家平台上把治理缺口攤開來看。在那整片版圖上,沒有人在打造買家真正需要的那一樣東西——把技術控制逐一決策地對應到同時適用於他們的每一項法規。

計畫為什麼不能直接買一套可解釋性軟體就好?

人們問我一個合理的問題:如果可解釋性與偏誤監控都已經存在,一個計畫為什麼不能直接買 Fiddler、或架起一套因果 AI,然後就大功告成?

有兩個原因。那些監控供應商在他們所做的事情上確實很在行——但他們的整套前提是:在生產環境中運行的那個模型,就是值得治理的對象。當模型的 決策架構 本身就是那個缺陷時——就像 nH Predict 的情況一樣——更仔細地監看它,只會給你一份解析度更高的傷害記錄而已。因果 AI——causaLens 是這裡最可信的名字——是學術上正確的答案,它建模因果而非相關,但它在商業上尚不成熟,且主要瞄準金融服務業;針對保險給付決策、專屬於醫療領域的因果模型,目前大體上仍處於研究階段。而像 Cohere Health 這類事前授權自動化供應商,優化的根本是錯的那個變數。Cohere 會把你的 PA 行政成本削減 47%。那是一個真實的數字,也是一個真實的好處。但速度不等於可辯護性。一筆你在法庭上依然無法重建的、更快的拒付,只是一條通往那個確切責任的更快捷徑——那個責任正是 Lokken 一案所定義的。

另一個原因是規模,而這是我無法勸退一個計畫的部分。Gartner 預期到 2028 年,將有 80% 的門診理賠透過 AI 驅動的即時裁定來處理。然而根據 Censinet 的統計,如今只有 12% 的美國醫院擁有正式的 AI 治理框架。自動化保險給付決策的數量即將倍增,其速度遠遠超過任何人在建構防護它們所需基礎設施的速度。而 CMS 並沒有客氣地等著——它的 2020 支付年度 RADV 稽核已於 2026 年 2 月展開,運用 AI 驅動的異常偵測來標記缺乏佐證的診斷。監管機構正一邊用 AI 稽核你的 AI,一邊要求你自己去治理它。

率先行動的計畫會把這件事變成一種優勢

我想以我真正相信的東西作結,而不是一則警告。

我談過的每一個計畫都把治理當成一種成本——一種部署 AI 的稅、一道踩在人人都想要的代理式自動化上的煞車。我理解這種框架。這門行政經濟學從兩邊看都很殘酷:醫療提供者每年花 197 億美元去對抗拒付,而各計畫在每一筆有爭議的理賠上也各自背負著成本。誘惑在於:更用力地自動化,並且只在規則要求的最低限度內去治理。

但那筆帳是倒著算的。那些在申訴後被推翻的拒付,從來就不是省下來的成本——它們是計畫當成營收記入帳的責任,而且將在法庭上連本帶利地償還。一個計畫若能為任何一筆拒付,產出一份乾淨的記錄,載明權衡了哪些臨床因素、由一位真正擁有不同意自由的臨床醫師簽署,並對應到每一項適用的法規,那它就不只是避開了官司。它還能更快、更有信心地拒付,因為每一個決策都是為了經得起如今已成例行公事的審視而打造的。我們打造了 那套 Medicare Advantage AI 治理架構,正是為了那樣的計畫。

那位高鐵血紅蛋白血症病患的家人,並不是因為演算法犯了錯而輸的。他們是暫時輸了,因為那套系統無法解釋自己,而迴路中沒有任何一個人是自由到能推翻它的。把系統打造成能夠解釋自己,並且讓迴路中的人有自由去推翻它,那麼你就不再是在指望那紙證據開示命令永遠不會到來。你已經為它做好了準備。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。