行為健康 AI 的有狀態危機治理

心理健康聊天機器人危機是一條軌跡。逐則訊息審核器看不見它。

我們打造了安全中介軟體,包覆既有的行為健康聊天機器人,並執行由臨床團隊擁有的有狀態、跨輪升級政策。它能捕捉無狀態審核器在結構上必然漏掉、正在升高的對話,並以雜湊鏈結、可歸檔的稽核軌跡證明每一項判定。安全是架構問題,不是提示問題。

0 對 68

不安全回覆送出數,有防護對無防護

40 段對話的標註黃金集

2 輪

相較於相同的無狀態審核器,中位更早偵測

相同的分類器與把關機制;僅差在有狀態

0 / 29

良性輪次中的錯誤升級

40 段對話的標註黃金集

這是在合成資料上展示的安全架構模式示範。不是醫療器材,不是臨床建議,也不是 EHR 整合。

有量而無記憶

行為健康聊天機器人是逐則訊息審核的。危機並非逐則訊息到來。

心理健康聊天機器人上的多數安全審查,是孤立地為每一則回覆評分。每一則訊息被檢查、標記或放行,然後被遺忘。這對單一明確危險的句子有效。它在結構上對一段逐輪漂移的對話視而不見——其中沒有任何單一訊息本身嚴重到足以阻擋。

有據可查的失敗正是這個形狀。NEDA「Tessa」聊天機器人在下架前,曾給出熱量缺口與皮脂夾建議(NEDA,2023)。臨床醫師回報,聊天機器人強化了患者的思覺失調,而這些患者從未遇到會反駁的真人(Keith Sakata 醫師,UCSF,2025)。OpenAI 在 GPT-4o 更新變得諂媚後將其撤回(OpenAI,2025)。每一個案例裡,模型在任何單一輪次聽起來都像在支持,而軌跡卻走向不安全。

無狀態審核器無法看見那條軌跡,因為它沒有先前輪次的記憶。更好的基礎模型無法修正這一點。即使是完美的聊天機器人,也不知道您平台的升級政策、無法產出您可歸檔的稽核軌跡,也不給您可認證的確定性把關機制。這就是我們把這裡的安全視為架構問題的原因,也是此示範比較兩套運行相同模型的技術堆疊的原因。

分屏示範:同一段合成患者對話,左側通過無防護的 MindMate Support 聊天機器人,右側通過同一聊天機器人但置於 Veriprajna 安全層之後,管線軌道標示分類器、軌跡、驗證器、把關機制、稽核。
此示範將一段合成對話重放到兩套技術堆疊。MindMate Support 是既有聊天機器人的虛構替身。僅合成資料,無 PHI。

機制:每一輪都運行的有狀態管線

諮詢模型餵入確定性把關機制。把關機制做出判定,而判定是您能讀懂的程式碼。

患者的每一輪都會通過固定管線。訊息會去除 PII 並雜湊;C-SSRS 分類器依哥倫比亞結構為其嚴重度評分,回傳等級、信心,以及無法為嚴重度提出依據時的 ABSTAIN。接著,有狀態的軌跡監控器跨輪累積風險。這是核心能力,也是逐則訊息審核器所沒有的:它看見的是模式,不是單一句子,並產出有效風險與區間(BENIGN、WATCH、CONCERN、HIGH、CRITICAL),附帶如「持續飲食失調,斜率上升」的說明理由。

在任何候選回覆送達患者之前,多評審驗證器小組會加以檢查:諂媚與語氣評審、禁止模式比對器,以及臨床宣稱檢查器。任一評審被標記,就把關機制至少推到已設定的最低等級,無論回覆聽起來多溫和。

判定本身是確定性的 5 級政策把關機制,而且是 Python,不是 LLM:L1 CONTINUE、L2 RESTRICT、L3 SUBSTITUTE_SCRIPT、L4 HUMAN_HANDOFF、L5 CRISIS_PROTOCOL。當把關機制阻擋回覆時,它會依等級與類別替換成內建庫中臨床醫師撰寫的腳本之一,並記錄腳本 id。它從不即興危機用語。每一輪接著寫成一筆 sha256 紀錄,鏈結到前一筆。

有防護堆疊顯示每則訊息的管線軌道(分類器、軌跡、驗證器、把關機制、稽核)與各階段延遲,以及早期輪次的內嵌把關結果讀為 L1 CONTINUE 與 L2 RESTRICT,而同一輪的無狀態審核器讀為 BENIGN,什麼也看不見,沒有記憶。
管線在每一則訊息上運行。增加的延遲為每輪亞毫秒(黃金集上平均 0.16 ms、p95 0.21 ms)。

政策由臨床團隊擁有,不是工程團隊

閾值、驗證器強制最低等級,以及 12 則腳本庫,皆由臨床安全委員會依政策版本 2026.04-clinical-v1配置。工程端嚴格執行該政策,且不得變更。透過模擬的 FHIR 旗標擷取的患者病史,可降低閾值,使該層對更脆弱的患者更早升級。當分類器信心偏低時,它會棄權並轉交人工審查,而非猜測嚴重度。

臨床政策模態框,顯示各評審與發現的驗證器強制最低等級、不確定性與邊界規則(低信心棄權即強制轉交人工、越獄分數達 0.8 或以上即強制最低 L3),以及 12 則臨床醫師核准的腳本庫,並揭示一則 L2 飲食失調替換訊息。
政策模態框:驗證器強制最低等級、棄權與越獄規則,以及臨床醫師核准的腳本庫與一則已揭示的替換訊息。

一段對話,從頭走到尾

預設主視覺情境是飲食失調漂移:六輪,每一輪單獨看來都是普通的健康保健問題。

對話以關於吃得更健康與計算卡路里的無害問題開場。逐則訊息審核器沒有任何可擋的內容,示範中的無狀態基準維持綠色,一輪又一輪讀為 WATCH 與「什麼也看不見,沒有記憶」。有狀態層注視軌跡,在第 3 輪跨入 CONCERN。它阻擋聊天機器人的回覆,並替換成指向 NEDA Helpline 的臨床醫師撰寫接地腳本。那比第一則明確危險的訊息早了兩輪。

有防護堆疊的第 3 輪:跨輪風險計量讀為 3.4 CONCERN,聊天機器人回覆被阻擋且未送出,並替換成附有 NEDA Helpline 號碼、經臨床醫師核准的 L3 接地腳本,而同一輪的無狀態逐則訊息審核器仍讀為 WATCH,什麼也看不見。
第 3 輪:有狀態層達到 CONCERN 並替換接地腳本。無狀態審核器使用相同分類器,仍什麼也看不見。

到了最後幾輪,訊息變得明確危險。左側無防護堆疊送出有害回覆,顯示為刪除線,並標示為已送達患者且不安全。右側,驗證器小組攔截該回覆,抓住諂媚語氣與禁止模式,把關機制升級至 L4 人工移交,並帶著完整情境呼叫一名照護團隊成員。我們描述攔截,而不描述有害內容本身。

最後幾輪:右側驗證器小組攔截候選回覆,風險計量讀為 5.0 CRITICAL,把關機制因沒有急性 L5 線索而將升級上限設為 L4 人工移交,替換成經臨床醫師核准的移交腳本,有害回覆被阻擋且未送出;左側無防護堆疊則以刪除線顯示同一回覆為已送達且不安全。
驗證器攔截候選回覆,把關機制升級至 L4 人工移交。無防護堆疊送出同一回覆。

會話結果讓差距具體可見,且可歸因於僅有狀態這一點,因為兩套堆疊使用相同的分類器與相同的把關機制。唯一差異是跨輪記憶。

會話結果面板:比相同的無狀態審核器早 2 輪攔截(第 3 輪對第 5 輪),有防護堆疊送出 0 則不安全回覆,而無防護堆疊本會送出 2 則,稽核鏈在臨床政策 2026.04-clinical-v1 下橫跨 6 筆可察覺竄改的紀錄且保持完整。
飲食失調漂移對話的會話結果:不安全送出 0 對 2,早 2 輪攔截,稽核鏈完整。

橫跨整個黃金集

基準測試套件為一套 40 段對話、177 輪的標註黃金集評分,由 8 段手寫典範對話加上保留標註的改寫與良性對照變體確定性生成。在該集合上,有防護堆疊送出 0 則不安全回覆,而無防護堆疊送出 68 則。偵測比相同的無狀態審核器中位早 2 輪,且在 2 段對話中無狀態審核器從未升級。29 個良性輪次中錯誤升級為 0,C-SSRS 等級準確率為精確符合 94.3%、相差一個等級以內 97.2%,該層棄權轉交人工一次。這些數字僅限於此合成黃金集,不是開放世界保證。

即時 40 段對話計分板,列出每個情境及其結果,例如飲食失調漂移早 2 輪攔截、無狀態審核器漏掉的思覺失調緩慢醞釀,以及無升級的良性真陰性。
40 段對話基準,由示範即時計算。緩慢醞釀情境正是無狀態審核器完全不曾升級之處。

可歸檔憑據

每一段對話都會產出一份安全事件報告。每一輪是一筆 sha256 紀錄、鏈結到前一筆,因此編輯任何欄位都會使之後每一個雜湊失效,竄改便顯而易見。報告顯示分類器等級、跨輪風險、驗證器發現、把關判定及其理由、替換腳本 id,以及雜湊鏈,並標示鏈經驗證完整。它為歸檔而建:FDA 上市後監測證據、訴訟抗辯、保險核保。

飲食失調漂移對話的雜湊鏈結安全事件報告,6 輪表格顯示去除 PII 的訊息雜湊、分類器等級、跨輪風險區間、驗證器發現、附理由的把關判定、替換腳本 id,以及 sha256 雜湊鏈,竄改可證標記為鏈完整。
安全事件報告:按對話、雜湊鏈結、可察覺竄改的紀錄,審查者可逐行閱讀。

無狀態審核器對上安全層

同一份工作,一個結構差異:跨輪記憶,以及有人能擁有的政策。

能力 無狀態逐則訊息審核器 臨床 AI 安全層
為單一訊息評分
看見跨輪軌跡 否,它沒有記憶 是,有狀態風險累積器
送出前檢查候選回覆 是,多評審驗證器小組
誰擁有升級政策 隱含在模型或提示中 臨床團隊,5 級把關機制
什麼做出判定 模型或提示 LLM 之外的確定性程式碼
阻擋時的危機用語 模型生成,即興發揮 臨床醫師核准的腳本庫
為歸檔而建的稽核 雜湊鏈結安全事件報告

此示範不做的事

  • 它不是醫療器材,未經 FDA 核准、未經 HIPAA 認證,也不是臨床建議。FDA PCCP 與 SaMD 框架是延後的正式環境方向,不是對此示範的宣稱。
  • 每一段對話、每一位患者,以及「MindMate Support」聊天機器人都是合成的。沒有真實患者資料,也沒有 PHI。
  • FHIR 轉接器是帶有合成患者旗標的模擬樁。示範中沒有 Epic 或 Cerner 連線。
  • 分類器是確定性詞彙分類器,刻意保持簡單。正式環境的替換是同一介面之後、VPC 內的微調模型。示範中的語意相似度是 token Jaccard,而非句向量嵌入。
  • 所有證明數字僅限於一套 40 段對話的合成資料標註黃金集,絕不是開放世界保證。沒有客戶、部署或臨床醫師背書可引用,我們也不捏造任何一項。

買家會問的問題

這會取代我們的聊天機器人或臨床模型嗎?

不會。它是包覆既有聊天機器人的中介軟體,從不變更模型。它在模型周圍加上有狀態跨輪風險累積器、多評審驗證器小組,以及確定性升級把關機制,並在阻擋回覆時替換成臨床醫師撰寫的腳本。重點是有狀態治理與可歸檔憑據,不是換一個模型。

這與我們已在每一則訊息上運行的內容審核有何不同?

逐則訊息審核器孤立地為每一則回覆評分且沒有記憶,因此會漏掉跨輪累積的危機。在一套 40 段對話的標註黃金集上,有狀態層比使用相同分類器與相同把關機制的無狀態審核器,中位早 2 輪升級。在其中兩段對話中,無狀態審核器從未升級。

升級判定是由 LLM 做出的嗎?

不是。分類器與驗證器小組是諮詢性質,但 5 級升級判定與稽核是任何 LLM 之外的確定性 Python。審查者可以讀懂把關機制;他們無法盤問一段提示。代理提供建議,程式碼做出判定。

我們能否向監管機構或法院證明系統做了什麼、以及為什麼?

每一輪是一筆 sha256 紀錄、鏈結到前一筆,因此編輯任何欄位都會使之後每一個雜湊失效,竄改便顯而易見。結果是 JSON 與 HTML 的可歸檔安全事件報告,框架用於 FDA 上市後監測、訴訟抗辯與保險核保。在示範中,報告顯示鏈完整。

更好的基礎模型不會讓這變得多餘嗎?

即使是完美的聊天機器人,也不知道您平台的升級政策、無法產出稽核軌跡、不給您可認證的確定性把關機制,並且在被越獄時沒有任何抗辯。持久的價值是有狀態治理加上可歸檔憑據,不是更低的模型錯誤率。這就是此示範對照相同分類器與把關機制、並把改進歸因於僅有狀態的原因。

這是經過驗證的醫療器材嗎?資料是真實的嗎?

不是。這是安全架構模式的示範,不是醫療器材,未經 FDA 核准,也未經 HIPAA 認證。每一段對話都是合成的,FHIR 轉接器是模擬樁,分類器是確定性詞彙分類器,作為正式環境 VPC 內模型的替身。所有證明數字僅限於一套 40 段對話的合成資料標註黃金集。

技術研究

支撐此示範的研究——架構、驗證設計,以及企業藍圖。

若您的聊天機器人有架構問題,我們樂於交流

有狀態治理、由臨床團隊擁有的政策,以及您可歸檔的稽核。

若您的團隊正在思考如何讓行為健康聊天機器人在企業、給付方或法規審查下可辯護,我們真心想聽聽您怎麼想。這個問題是全產業的,答案也會是。

我們打造什麼

  • ✓ 有狀態、跨輪風險監控
  • ✓ 由臨床團隊擁有的確定性升級把關機制
  • ✓ 臨床醫師核准的腳本替換
  • ✓ 雜湊鏈結、可歸檔的安全事件報告

我們如何合作

  • ✓ 包覆您既有聊天機器人的中介軟體
  • ✓ 諮詢模型,判定由您能讀懂的程式碼做出
  • ✓ 正式環境替換為 VPC 內微調分類器
  • ✓ 即使基礎模型進步,治理仍然成立
社群媒體

同步發佈於