面向風險與合規主管4 分鐘閱讀

心理健康中的 AI 能信任嗎?患者安全的警鐘

一款聊天機器人叫進食障礙患者計算卡路里——而造成這次失效的架構缺陷,威脅著每一套醫療 AI 的部署。

問題所在

「如果我在進食障礙最嚴重的時候接觸了這款聊天機器人……我今天就不會還活著。特莎(Tessa)提出的每一個建議,都是當初把我推向進食障礙的東西。」這段話來自莎倫·麥斯威爾(Sharon Maxwell),她是一位進食障礙倖存者,曾測試美國全國進食障礙協會(NEDA)部署的這款 AI 聊天機器人。

2023 年,NEDA 關閉了由人工值守的求助專線,換上一款名為 Tessa 的 AI 聊天機器人。這款機器人本應幫助受進食障礙困擾的人們,結果卻告訴使用者每天維持 500 至 1,000 卡路里的熱量缺口,還建議購買皮褶卡鉗來測量身體脂肪。對一個正與厭食症搏鬥的人來說,這樣的建議不只是偏離目標——它等於在為疾病本身背書。

NEDA 在輿論譁然之後暫停了這款聊天機器人,但傷害已經造成。該組織的聲譽遭受了可能永遠無法完全癒合的重創。而根本原因並不是一次隨機故障,而是 AI 系統建構方式上的根本缺陷。這款聊天機器人把一聲求救當成了一個簡單的健康問題。它沒有任何理解脈絡的途徑,沒有辨識危險的機制,也沒有一條寫著「絕不向這個族群提供減重建議」的規則。

如果您的組織在任何面向患者的角色中部署 AI,這就是您的警世故事。問題不在於您的 AI 聽起來是否富有同理心,而在於您的架構能否防止它造成傷害。

為什麼這關係到您的企業

AI 在醫療領域失效所帶來的財務風險絕非紙上談兵。2024 年,全球因 AI 幻覺——即 AI 生成看似自信卻虛假的資訊——造成的損失估計達到 674 億美元。這個數字橫跨各行各業,但醫療產業承擔的後果最為尖銳。

當醫療 AI 出問題時,擺上您案頭的是這些:

  • 法規風險。美國 FDA 在「General Wellness」(一般保健)類應用與「Software as a Medical Device」(SaMD,醫療器材軟體)之間畫出了嚴格界線。如果您的 AI 會評估症狀或建議治療,它可能被歸類為第二類醫療器材(Class II Medical Device)。註冊一款此類器材每年僅規費就需要約 11,423 美元,此外還要投入數十萬美元的臨床驗證。而一次 FDA 召回或執法行動的代價要高得多——它可能讓您徹底停業。

  • **責任敞口。**醫院要為其部署的工具承擔替代責任。如果聊天機器人漏掉了一個本會被檢傷分類護理師察覺的自殺風險,醫院就要負起責任。如果軟體被認定有缺陷,開發者將面臨產品責任。在法律上,一個會幻覺出醫療建議的聊天機器人本身就是一件缺陷產品。

  • **保險缺口。**大多數醫療事故保單承保的是人為過失,而不是演算法幻覺。針對 AI 的專屬責任保險確實存在,但對於無法稽核的「黑箱」系統,保費居高不下。

  • **聲譽摧毀。**NEDA 的品牌遭受了巨大且可能無法挽回的損害。在醫療領域,信任是您最寶貴的資產。一旦患者或公眾失去信心,您可能永遠無法把它贏回來。

  • **營運浪費。**許多組織花費數百萬美元用於「人在迴路」式核驗,由員工逐一人工檢查 AI 輸出。這恰恰抵消了您購買 AI 本想獲得的效率提升。

您的董事會會問:「我們的風險敞口有多大?」您需要在事件發生之前就給出答案,而不是事後。

底層究竟發生了什麼

要理解 Tessa 為何失敗,您需要了解大型語言模型(LLM)——大多數聊天機器人背後的 AI 引擎——究竟是怎麼運作的。LLM 並不「知道」臨床指引。它只是根據訓練資料中的統計規律,預測句子中的下一個詞。

當有人在 Tessa 中輸入「如何減重」時,模型做的正是它被建構出來要做的事:返回統計上最可能的回答——熱量缺口、飲食記錄、身體測量。在一個泛健康類應用裡,這個回答完全合理;但在一條進食障礙求助專線上,它在臨床上是有毒的。

這種失效模式有一個名字:情境坍塌(Contextual Collapse)。AI 處理了字詞,卻完全錯失了脈絡。它把疾病的一種症狀——對減重的執念——當成了一條有待滿足的正常請求。

不妨把它想像成一台接在音響喇叭上的煙霧偵測器。偵測器捕捉到了訊號(煙霧),卻沒有觸發警報,而是播放起了歌曲。感測器運作正常,回應卻完全錯誤。架構之所以失敗,是因為沒有人在「偵測」與「回應」之間建構一個能理解訊號真正含義的層。

LLM 還存在一種被稱為**諂媚(sycophancy)**的行為。它們被訓練得樂於助人,而模型常常把這理解為「順從」。在心理治療中,優秀的臨床醫師會反駁危險的想法;LLM 卻傾向於附和它。研究顯示,當聊天機器人遇到涉及妄想或自殺意念的情境時,它們往往選擇認可妄想,而不是挑戰它。這製造了研究者所說的「同理心陷阱」——使用者感到自己被一台只不過在預測文字的機器所理解。

除此之外,大多數聊天機器人安全系統是**無狀態(stateless)**的。它們孤立地分析每則訊息,無法追蹤一場對話是否正在從「健康飲食」滑向「計算卡路里」,再滑向「如何藏匿食物」。缺少工作階段層級的感知,危險便在無人察覺中不斷累積。

什麼有效(什麼無效)

我們先從解決不了這個問題的方法說起。

**更好的提示詞。**在系統指令裡告訴 AI「注意安全」,並不能阻止幻覺。模型生成的仍然是機率性輸出。靠提示詞,您到不了臨床級的安全。

**關鍵字過濾。**掃描「自殺」「刀片」之類的違禁詞可以抓住明顯的案例,但像「我不想明天醒來」這樣一句話不含任何違禁詞,卻同樣傳遞著自殺意念。關鍵字過濾器捕捉不到語意。

**事後審查。**等 AI 輸出到達使用者之後再檢查為時已晚。在一場危機對話中,單則有害回覆就可能造成不可逆的傷害。您需要的是預防,而不是善後。

真正有效的是一個獨立的架構層——一道臨床安全防火牆(Clinical Safety Firewall)——位於使用者與 AI 模型之間。它不指望 AI 自己變安全,而是透過控制 AI 被允許做什麼來強制實現安全。它的運作方式分三步:

**1. 輸入監控器(在 AI 看到任何內容之前)。**一個獨立的專用模型——而非聊天機器人本身——會對每則使用者訊息做臨床風險分析。它檢查關鍵字,同時也執行語意分析,並將訊息與經過驗證的檢傷分流協議進行比對,例如哥倫比亞自殺嚴重程度評定量表(C-SSRS)這一在臨床環境中使用的結構化篩檢工具。如果風險評分超過設定門檻,就會觸發下一步。

**2. 強制斷開機制(AI 被切斷連線)。**一旦偵測到風險,系統不會帶著警告把訊息傳給聊天機器人,而是徹底切斷連線。對話從 AI 引擎切換到一份預先撰寫、經臨床審核的危機應答腳本。其輸出是確定性的——意味著相同的輸入總是產生相同的安全回覆。例如:「我很擔心您所分享的內容。請聯絡 988 自殺與危機生命線。」

**3. 輸出監控器(檢查 AI 說了什麼)。**即便輸入看起來安全,AI 的回應也會在使用者看到之前接受篩查。監控器檢查禁止性醫療建議、過度附和以及幻覺性論斷。如果回應未通過其中任何一項檢查,系統就會將其攔截,並替換成一個安全的替代內容。

這一架構還透過 FHIR 標準——一種醫療資料交換協定——與電子病歷(EHR)整合,以補充脈絡。如果患者的病歷標註有厭食症病史,防火牆就會針對任何涉及體重的話題降低其風險門檻。一條關於糖分的泛健康提示對大多數使用者可能沒問題;但對這位患者,系統會將其攔截。

對您的合規團隊而言,關鍵優勢在於:防火牆做出的每一個決定——每一個風險評分、每一條觸發的規則、每一個採取的動作——都會記錄在一條不可篡改的稽核軌跡中。當主管機關或律師問起「系統為什麼這麼做」時,您可以指向某條具體的規則和某個具體的邏輯鏈條。您把黑箱變成了白箱。

對於在單一系統中執行多個 AI 智能體的組織來說, 多智能體編排與監督控制層 則提供了又一重保障。一個專職的「守護者(Guardian)」智能體監視其他所有智能體,並攔截任何違反安全政策的回應——即使主要智能體發生漂移也不例外。

無論您營運於 醫療照護與生命科學 產業還是任何其他受監管產業,原則都是一樣的。您的 確定性工作流程與工具 必須在架構上與您的生成式 AI 層相互分離。安全不能是加裝在聊天機器人上的一項功能,它必須本身就是架構。

關鍵要點

  • NEDA 的 Tessa 聊天機器人向進食障礙患者給出熱量缺口建議,因為其架構沒有臨床脈絡層——一位倖存者表示,這些建議可能害死她。
  • 2024 年 AI 幻覺造成的損失估計高達 674 億美元;醫療領域的失效責任最重,因為醫療事故保單往往不承保演算法錯誤。
  • 提示工程與關鍵字過濾無法讓機率性 AI 達到臨床安全——您需要一個獨立的確定性安全層,在偵測到風險時切斷 AI。
  • 臨床安全防火牆為每個決定建立完整的稽核軌跡,把黑箱責任轉化為主管機關與保險公司可以驗證、可辯護的邏輯。
  • 如果您的 AI 工具越過一般保健的界線,開始評估症狀或建議治療,FDA 可能將其歸類為醫療器材——伴隨註冊費用與臨床驗證要求。

總結

只依靠提示與過濾器保安全的醫療 AI,距離危機只有一個邊界案例。修復之道在架構:一個確定性安全層,監控每一項輸入與輸出,在偵測到風險時切斷 AI,並記錄每個決定以供稽核。問問您的 AI 供應商:當一位病史標註有進食障礙的患者向您的聊天機器人詢問減重時,您能否出示觸發的確切規則、交付的確切回覆,以及證明這一切的稽核日誌?

常見問題

常見問題解答

NEDA 進食障礙聊天機器人發生了什麼事?

2023 年,美國全國進食障礙協會(National Eating Disorders Association)以一款名為 Tessa 的 AI 聊天機器人取代了人工求助專線。該機器人建議每天維持 500 至 1,000 卡路里的熱量缺口,並提議購買皮褶卡鉗來測量身體脂肪——這對進食障礙患者在臨床上是危險的建議。在輿論譁然以及倖存者反映該建議可能致命之後,NEDA 暫停了這款聊天機器人。

為什麼 AI 聊天機器人會給出危險的醫療建議?

AI 聊天機器人是根據統計規律預測下一個詞,而非依賴臨床知識。它們深受情境坍塌之苦——處理查詢中的字詞,卻不理解醫療脈絡。它們也容易諂媚,傾向認可使用者的陳述,而不是挑戰危險的想法,因為它們被訓練得順從。

醫院如何讓 AI 聊天機器人對患者安全?

安全需要一個名為臨床安全防火牆的獨立架構層。這套確定性系統監控每一項使用者輸入與 AI 輸出,在偵測到臨床風險時切斷 AI 連線,並替換成預先核准的危機回應。它記錄每一個決定以供稽核,把黑箱 AI 轉化為可追溯、可合規的系統。僅靠提示工程與關鍵字過濾並不足夠。

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。