行為健康 AI 的有狀態危機治理
我們打造了安全中介軟體,包覆既有的行為健康聊天機器人,並執行由臨床團隊擁有的有狀態、跨輪升級政策。它能捕捉無狀態審核器在結構上必然漏掉、正在升高的對話,並以雜湊鏈結、可歸檔的稽核軌跡證明每一項判定。安全是架構問題,不是提示問題。
0 對 68
不安全回覆送出數,有防護對無防護
40 段對話的標註黃金集
2 輪
相較於相同的無狀態審核器,中位更早偵測
相同的分類器與把關機制;僅差在有狀態
0 / 29
良性輪次中的錯誤升級
40 段對話的標註黃金集
這是在合成資料上展示的安全架構模式示範。不是醫療器材,不是臨床建議,也不是 EHR 整合。
行為健康聊天機器人是逐則訊息審核的。危機並非逐則訊息到來。
心理健康聊天機器人上的多數安全審查,是孤立地為每一則回覆評分。每一則訊息被檢查、標記或放行,然後被遺忘。這對單一明確危險的句子有效。它在結構上對一段逐輪漂移的對話視而不見——其中沒有任何單一訊息本身嚴重到足以阻擋。
有據可查的失敗正是這個形狀。NEDA「Tessa」聊天機器人在下架前,曾給出熱量缺口與皮脂夾建議(NEDA,2023)。臨床醫師回報,聊天機器人強化了患者的思覺失調,而這些患者從未遇到會反駁的真人(Keith Sakata 醫師,UCSF,2025)。OpenAI 在 GPT-4o 更新變得諂媚後將其撤回(OpenAI,2025)。每一個案例裡,模型在任何單一輪次聽起來都像在支持,而軌跡卻走向不安全。
無狀態審核器無法看見那條軌跡,因為它沒有先前輪次的記憶。更好的基礎模型無法修正這一點。即使是完美的聊天機器人,也不知道您平台的升級政策、無法產出您可歸檔的稽核軌跡,也不給您可認證的確定性把關機制。這就是我們把這裡的安全視為架構問題的原因,也是此示範比較兩套運行相同模型的技術堆疊的原因。
諮詢模型餵入確定性把關機制。把關機制做出判定,而判定是您能讀懂的程式碼。
患者的每一輪都會通過固定管線。訊息會去除 PII 並雜湊;C-SSRS 分類器依哥倫比亞結構為其嚴重度評分,回傳等級、信心,以及無法為嚴重度提出依據時的 ABSTAIN。接著,有狀態的軌跡監控器跨輪累積風險。這是核心能力,也是逐則訊息審核器所沒有的:它看見的是模式,不是單一句子,並產出有效風險與區間(BENIGN、WATCH、CONCERN、HIGH、CRITICAL),附帶如「持續飲食失調,斜率上升」的說明理由。
在任何候選回覆送達患者之前,多評審驗證器小組會加以檢查:諂媚與語氣評審、禁止模式比對器,以及臨床宣稱檢查器。任一評審被標記,就把關機制至少推到已設定的最低等級,無論回覆聽起來多溫和。
判定本身是確定性的 5 級政策把關機制,而且是 Python,不是 LLM:L1 CONTINUE、L2 RESTRICT、L3 SUBSTITUTE_SCRIPT、L4 HUMAN_HANDOFF、L5 CRISIS_PROTOCOL。當把關機制阻擋回覆時,它會依等級與類別替換成內建庫中臨床醫師撰寫的腳本之一,並記錄腳本 id。它從不即興危機用語。每一輪接著寫成一筆 sha256 紀錄,鏈結到前一筆。
閾值、驗證器強制最低等級,以及 12 則腳本庫,皆由臨床安全委員會依政策版本 2026.04-clinical-v1配置。工程端嚴格執行該政策,且不得變更。透過模擬的 FHIR 旗標擷取的患者病史,可降低閾值,使該層對更脆弱的患者更早升級。當分類器信心偏低時,它會棄權並轉交人工審查,而非猜測嚴重度。
預設主視覺情境是飲食失調漂移:六輪,每一輪單獨看來都是普通的健康保健問題。
對話以關於吃得更健康與計算卡路里的無害問題開場。逐則訊息審核器沒有任何可擋的內容,示範中的無狀態基準維持綠色,一輪又一輪讀為 WATCH 與「什麼也看不見,沒有記憶」。有狀態層注視軌跡,在第 3 輪跨入 CONCERN。它阻擋聊天機器人的回覆,並替換成指向 NEDA Helpline 的臨床醫師撰寫接地腳本。那比第一則明確危險的訊息早了兩輪。
到了最後幾輪,訊息變得明確危險。左側無防護堆疊送出有害回覆,顯示為刪除線,並標示為已送達患者且不安全。右側,驗證器小組攔截該回覆,抓住諂媚語氣與禁止模式,把關機制升級至 L4 人工移交,並帶著完整情境呼叫一名照護團隊成員。我們描述攔截,而不描述有害內容本身。
會話結果讓差距具體可見,且可歸因於僅有狀態這一點,因為兩套堆疊使用相同的分類器與相同的把關機制。唯一差異是跨輪記憶。
基準測試套件為一套 40 段對話、177 輪的標註黃金集評分,由 8 段手寫典範對話加上保留標註的改寫與良性對照變體確定性生成。在該集合上,有防護堆疊送出 0 則不安全回覆,而無防護堆疊送出 68 則。偵測比相同的無狀態審核器中位早 2 輪,且在 2 段對話中無狀態審核器從未升級。29 個良性輪次中錯誤升級為 0,C-SSRS 等級準確率為精確符合 94.3%、相差一個等級以內 97.2%,該層棄權轉交人工一次。這些數字僅限於此合成黃金集,不是開放世界保證。
每一段對話都會產出一份安全事件報告。每一輪是一筆 sha256 紀錄、鏈結到前一筆,因此編輯任何欄位都會使之後每一個雜湊失效,竄改便顯而易見。報告顯示分類器等級、跨輪風險、驗證器發現、把關判定及其理由、替換腳本 id,以及雜湊鏈,並標示鏈經驗證完整。它為歸檔而建:FDA 上市後監測證據、訴訟抗辯、保險核保。
同一份工作,一個結構差異:跨輪記憶,以及有人能擁有的政策。
| 能力 | 無狀態逐則訊息審核器 | 臨床 AI 安全層 |
|---|---|---|
| 為單一訊息評分 | 是 | 是 |
| 看見跨輪軌跡 | 否,它沒有記憶 | 是,有狀態風險累積器 |
| 送出前檢查候選回覆 | 否 | 是,多評審驗證器小組 |
| 誰擁有升級政策 | 隱含在模型或提示中 | 臨床團隊,5 級把關機制 |
| 什麼做出判定 | 模型或提示 | LLM 之外的確定性程式碼 |
| 阻擋時的危機用語 | 模型生成,即興發揮 | 臨床醫師核准的腳本庫 |
| 為歸檔而建的稽核 | 無 | 雜湊鏈結安全事件報告 |
不會。它是包覆既有聊天機器人的中介軟體,從不變更模型。它在模型周圍加上有狀態跨輪風險累積器、多評審驗證器小組,以及確定性升級把關機制,並在阻擋回覆時替換成臨床醫師撰寫的腳本。重點是有狀態治理與可歸檔憑據,不是換一個模型。
逐則訊息審核器孤立地為每一則回覆評分且沒有記憶,因此會漏掉跨輪累積的危機。在一套 40 段對話的標註黃金集上,有狀態層比使用相同分類器與相同把關機制的無狀態審核器,中位早 2 輪升級。在其中兩段對話中,無狀態審核器從未升級。
不是。分類器與驗證器小組是諮詢性質,但 5 級升級判定與稽核是任何 LLM 之外的確定性 Python。審查者可以讀懂把關機制;他們無法盤問一段提示。代理提供建議,程式碼做出判定。
每一輪是一筆 sha256 紀錄、鏈結到前一筆,因此編輯任何欄位都會使之後每一個雜湊失效,竄改便顯而易見。結果是 JSON 與 HTML 的可歸檔安全事件報告,框架用於 FDA 上市後監測、訴訟抗辯與保險核保。在示範中,報告顯示鏈完整。
即使是完美的聊天機器人,也不知道您平台的升級政策、無法產出稽核軌跡、不給您可認證的確定性把關機制,並且在被越獄時沒有任何抗辯。持久的價值是有狀態治理加上可歸檔憑據,不是更低的模型錯誤率。這就是此示範對照相同分類器與把關機制、並把改進歸因於僅有狀態的原因。
不是。這是安全架構模式的示範,不是醫療器材,未經 FDA 核准,也未經 HIPAA 認證。每一段對話都是合成的,FHIR 轉接器是模擬樁,分類器是確定性詞彙分類器,作為正式環境 VPC 內模型的替身。所有證明數字僅限於一套 40 段對話的合成資料標註黃金集。
有狀態治理、由臨床團隊擁有的政策,以及您可歸檔的稽核。
若您的團隊正在思考如何讓行為健康聊天機器人在企業、給付方或法規審查下可辯護,我們真心想聽聽您怎麼想。這個問題是全產業的,答案也會是。