問題所在
黑人產婦在懷孕和分娩期間的死亡率是白人產婦的 3.5 倍。旨在拯救她們的 AI 系統卻正在讓這場危機愈演愈烈。加州各醫院的自動化預警系統漏診了黑人患者 40% 的嚴重且危及生命的併發症。作為應用最廣泛的敗血症預測模型之一,安裝在數百家醫院的 Epic 敗血症模型(Epic's Sepsis Model)在獨立測試中漏診了 67% 的實際敗血症病例。該模型觸發了如此多的虛警,以至於其 88% 的警報都是錯誤的。
這絕非理論上的擔憂。這些失敗此時此刻正發生於您的醫院中,或由貴組織承保、資助或合作的醫院中。其根本原因遠比糟糕的軟體更為深刻。向 AI 提供數據的物理設備——例如脈搏血氧儀——在其物理原理中就植入了種族偏見。而構建在這些數據之上的 AI 模型繼承了每一個缺陷,將其放大,並披上一層演算法權威的外衣。
如果貴組織正在部署、採購或依賴臨床 AI,您必須了解這些失敗是如何級聯擴散的——以及在它們演變為您的法律責任之前,需要採取何種措施來予以解決。
為什麼這對貴企業至關重要
帶有偏見的臨床 AI 所帶來的財務與法律風險是觸目驚心的。麥肯錫(McKinsey)估計,僅解決黑人孕產婦健康差距一項,每年就能節省 3.85 億美元的可預防醫療成本,並透過恢復健康壽命年為美國 GDP 增加 244 億美元。這意味著現有系統在提供更差醫療照護的同時,正在耗費巨額資金。
以下是應當引起您領導團隊高度關注的問題:
- 監管風險正在加劇。 歐洲 GDPR 已經要求自動化系統提供透明的推理鏈條。美國醫療監管機構也在朝著同一方向邁進。如果您的 AI 無法解釋為何標記某位患者卻忽略另一位患者,您就將面臨合規風險。
- 死亡率差距成為訴訟目標。 一旦發生嚴重併發症,黑人女性的死亡機率是白人女性的 1.79 倍。當 AI 系統未能向臨床醫生發出警報,且由此造成的傷害不成比例地落在某一特定種族群體身上時,起訴的法律依據便不言自明。
- 警報疲勞正在摧毀您的投資。 Epic 敗血症模型 88% 的誤報率意味著臨床醫生不再信任該系統。您付費購買的工具,第一線醫護人員卻學會了將其忽略。這是對您的投資報酬率(ROI)以及患者安全指標的直接打擊。
- 董事會層級的聲譽風險。 三分之一的黑人女性表示在產科護理期間曾遭遇不當對待。如果您的 AI 正在加劇這種模式而非糾正它,造成的聲譽損害可能是嚴重且持久的。
您的財務長(CFO)需要明白:在此事上犯錯的代價,是以生命、訴訟和信任喪失來衡量的。
底層究竟發生了什麼
問題的出現甚至早於任何 AI 模型的運行。它始於夾在患者手指上的感測器。
脈搏血氧儀的工作原理是透過皮膚照射光線並測量血液中的含氧量。然而,黑色素——賦予皮膚顏色的色素——同樣會吸收這種光線。由於這些設備主要是在淺膚色人群身上進行校準的,來自深色皮膚的額外吸收就會被誤讀。當患者實際上處於危險之中時,設備卻報告血氧水平正常。
不妨將其想像成一個僅用體重在 120 到 160 磅之間的人群校準的浴室體重計。如果您以 200 磅的體重站上去,它可能顯示 170 磅。這個數字看起來很正常,但卻錯得極其危險。
黑人患者遭遇這種被稱為隱匿性低氧血症(occult hypoxemia)的隱藏血氧危機的機率,接近白人患者的三倍。在膚色最深的新生兒和兒童中,常見脈搏血氧儀在 7% 的病例中漏診了危險的低血氧,而在膚色最淺的人群中漏診率為零。
現在再將 AI 疊加在上面。如果您的分診演算法在血氧降至 92% 以下時觸發高優先級警報,它就會系統性地漏掉那些真實血氧為 88%、但設備讀數顯示為 93% 的黑人患者。AI 繼承了感測器的盲區。隨後它又增添了自身的問題:基於帶有偏見的臨床病歷訓練出來的模型,會學會將「敗血症」與白人患者的數據模式聯繫起來。如果在歷史上臨床醫生對黑人患者開具血液培養醫囑的速度更慢,AI 也會學會這一盲區。這就形成了一個致命的良惡性反饋回路——輸入偏見數據,輸出偏見決策。
哪些方法有效(哪些無效)
在探討有效方案之前,先來看看哪些方法行不通:
- 通用 AI 聊天機器人和 LLM 外殼。 這些只是覆蓋在 GPT 或 Gemini 等通用大型語言模型之上的單薄軟體層。它們處理的是詞語機率,而非臨床邏輯。研究發現,當臨床情況較為複雜時,LLM 在腎臟疾病患者用藥劑量調整方面的準確率僅有 16.7%。它們根本不是為了生死攸關的決策而構建的。
- 缺乏亞組數據的供應商準確率宣稱。 如果一家供應商告訴您其模型「準確率達到 95%」,但對白人患者的靈敏度為 80%,對黑人患者的靈敏度僅為 40%,那麼這一宣稱就毫無意義。您需要按種族、年齡和性別細分的效能表現指標——而不是單個平均數字。
- 一次性模型驗證。 在一家醫院驗證過之模型在另一家醫院往往會失效。Epic 敗血症模型在內部宣稱其 AUC(預測準確率的標準衡量指標)為 0.76 至 0.83。密西根大學醫學院(Michigan Medicine)的外部獨立測試卻發現,該指標暴跌至 0.63。您的患者群體與供應商的訓練群體並不相同。
真正有效的是一種在各個階段逐層解決問題的分層方法:
修復輸入端。 切勿將任何單一感測器視為絕對事實。將血氧測量讀數與心率變異性、呼吸頻率和實驗室化驗值相結合。當這些訊號發生衝突時——例如心率上升、乳酸升高但血氧讀數保持穩定——系統會標記出差異並提示進行金標準動脈血氣體分析(ABG)。這能捕捉到帶有偏見的感測器所遺漏的病例。
修復訓練過程。 使用經過臨床專家審核的標籤來訓練模型,而不是使用帶有歷史偏見的計費代碼或文檔簡化記錄。在訓練期間應用公平性約束——即強制模型在跨種族和人口統計群體中表現同樣良好的數學規則,即便這意味著略微降低整體平均評分。
修復部署環節。 在貴機構上線運行之前,先進行本地驗證稽核。使用名為人口穩定性指數(Population Stability Index,PSI)的指標,衡量您的患者群體與模型訓練數據的差異程度。然後進行重新校準。並持續重複這項稽核,因為您的患者構成和臨床方案會隨時間而變化。
此處的合規優勢至關重要。從感測器校正到公平性約束再到本地稽核,每一步都會產生記錄在案的稽核軌跡。當監管機構或原告詢問您的系統為何做出某一特定決策時,您可以準確展示哪些數據點觸發了警報、應用了哪些公平性檢查,以及該模型是如何針對您特定的患者群體完成驗證的。正是這項稽核軌跡,將可辯護的 AI 與危險的 AI 區分開來。
您的法律總顧問和風險管理長應當向您評估的每家 AI 供應商索取此類文檔。如果供應商無法提供按亞組細分的效能指標、校準曲線以及經過同行評審的獨立外部驗證證據,那就是您應當果斷放棄合作的訊號。
關鍵要點
- 脈搏血氧儀高估了深膚色患者的血氧水平,構建在這些數據之上的 AI 系統繼承並放大了這種偏見。
- Epic 敗血症模型在獨立外部測試中漏診了 67% 的實際敗血症病例,並產生了 88% 的誤報率。
- 黑人產婦死亡率比白人產婦高出 3.5 倍,且自動化預警系統漏診了黑人患者 40% 的嚴重病例。
- 通用 LLM 外殼在複雜用藥劑量決策上的準確率僅為 16.7%——它們不適合用於臨床決策。
- 縮小黑人孕產婦健康差距每年可節省 3.85 億美元的可預防成本,並為美國 GDP 增加 244 億美元。
總結
將所有患者的表現取平均值的臨床 AI,會掩蓋那些最需要幫助的患者身上發生的致命失誤。貴組織需要能夠在本地驗證、按人口統計亞組報告效能並產生完整稽核軌跡的 AI 系統。請向您的 AI 供應商發問:您能否向我展示按種族細分的模型靈敏度和假陽性率,並出具證明該表現的同行評審獨立外部驗證研究?