行動保健AI向けのステートフルな危機ガバナンス
既存の行動保健チャットボットを包み込み、臨床チームが所有するステートフルでターン横断のエスカレーションポリシーを強制するセーフティミドルウェアを構築しました。ステートレスなモデレーターが構造上見逃す、エスカレートしていく会話を捉え、ハッシュ連鎖された提出可能な監査証跡ですべての決定を証明します。セーフティはプロンプトの問題ではなく、アーキテクチャの問題です。
0 対 68
配信された安全でない返信、ガードあり対ガードなし
40会話のラベル付きゴールデンセット
2ターン
同一のステートレスモデレーターと比べ、検出は中央値で先行
同じ分類器とゲート。差はステートフルであることだけ
0 / 29
良性ターン全体での誤ったエスカレーション
40会話のラベル付きゴールデンセット
合成データ上のセーフティアーキテクチャパターンのデモです。医療機器ではなく、臨床助言でも、EHR統合でもありません。
行動保健チャットボットは、1メッセージずつモデレーションされています。危機は1メッセージずつやって来るわけではありません。
メンタルヘルスチャットボットに対するセーフティレビューの多くは、各返信を孤立して採点します。すべてのメッセージが検査され、フラグされるかクリアされ、そして忘れられます。明示的に危険な単一行には有効です。ターンごとに漂い、どの単一メッセージも単独ではブロックするほど警報的ではない会話に対しては、構造的に盲目です。
文書化された失敗はその形をたどります。NEDAの「Tessa」チャットボットは、取り下げられる前にカロリー不足と皮脂厚計の助言を出していました(NEDA、2023年)。臨床医は、反論する人間に一度も会わなかった患者におけるチャットボット強化の精神病を報告しました(Keith Sakata医師、UCSF、2025年)。OpenAIは、GPT-4oの更新が追従的になった後に撤回しました(OpenAI、2025年)。いずれの場合も、モデルは任意のターンでは支援的に聞こえながら、軌跡は安全でない方向へ進んでいました。
ステートレスなモデレーターには、その軌跡を見る手段がありません。前のターンの記憶がないからです。より良いベースモデルではこれは直りません。完璧なチャットボットでも、あなたのプラットフォームのエスカレーションポリシーを知らず、提出できる監査証跡を出さず、認証できる決定論的ゲートも与えてくれません。だからこそここではセーフティをアーキテクチャの問題として扱い、だからこそこのデモは同一モデルを走らせる2つのスタックを比較します。
アドバイザリーモデルが決定論的ゲートに入力します。ゲートが決定し、その決定は読めるコードです。
患者の各ターンは固定パイプラインを通ります。メッセージはPIIが除去されハッシュされ、C-SSRS分類器がColumbia構造に沿って重症度を採点し、レベル、信頼度、および重症度を正当化できないときのABSTAINを返します。続いてステートフルなトラジェクトリモニターがターンをまたいでリスクを蓄積します。これが中核能力であり、メッセージ単位のモデレーターが持たない唯一のものです。単一行ではなくパターンを見て、実効リスクとバンド(BENIGN、WATCH、CONCERN、HIGH、CRITICAL)を、「持続する摂食障害、上昇する傾き」といった明示された理由とともに出力します。
候補返信が患者に届く前に、マルチクリティックのベリファイアパネルが検査します。追従とトーンのクリティック、禁止パターンマッチャー、臨床主張チェッカーです。フラグされたクリティックは、返信がどれほど穏やかに聞こえても、ゲートを少なくとも設定された下限レベルへ強制します。
決定そのものは決定論的な5段階ポリシーゲートであり、LLMではなくPythonです。L1 CONTINUE、L2 RESTRICT、L3 SUBSTITUTE_SCRIPT、L4 HUMAN_HANDOFF、L5 CRISIS_PROTOCOL。ゲートが返信をブロックすると、レベルとファミリーに応じた臨床医執筆スクリプトの同梱ライブラリから1つを置換し、スクリプトidを記録します。危機言語を即興で作ることは決してありません。その後、毎ターンが直前のエントリに連鎖されたsha256エントリとして書き込まれます。
閾値、ベリファイア強制の下限、および12本のスクリプトライブラリは、臨床セーフティ委員会がポリシーバージョン 2026.04-clinical-v1のもとで設定します。エンジニアリングはそれを正確に強制し、変更しません。患者の履歴は、スタブ化されたFHIRフラグを通じて取得され、より脆弱な患者に対してレイヤーがより早くエスカレーションするよう閾値を下げることができます。分類器の信頼度が低い場合は、重症度を推測するのではなく棄権し、人間のレビューへ回します。
デフォルトのヒーローシナリオは摂食障害のドリフトです。6ターン、それぞれ個別には普通のウェルネスの質問です。
会話は、より健康的な食事とカロリー計算に関する無害な質問から始まります。メッセージ単位のモデレーターにはブロックするものがなく、デモのステートレスベースラインは緑のまま、ターンごとにWATCHと「何も見えない、記憶なし」と読みます。軌跡を見ているステートフルレイヤーは、ターン3でCONCERNに入ります。チャットボットの返信をブロックし、NEDA Helplineを示す臨床医執筆のグラウンディングスクリプトに置換します。最初の明示的に危険なメッセージより2ターン早いです。
最終ターンでは、メッセージが明示的に危険になります。左のガードなしスタックは有害な返信を配信し、取り消し線で示され、患者に配信済みかつ安全でないとラベルされます。右では、ベリファイアパネルが返信を傍受し、追従的なトーンと禁止パターンを捉え、ゲートはL4人間ハンドオフへエスカレーションし、全コンテキスト付きでケアチームの一員をページングします。捕捉を述べ、有害な内容そのものは述べません。
セッション結果が差分を具体化し、両スタックが同じ分類器と同じゲートを使ったため、ステートフルであることだけに帰属できます。唯一の差はターン横断の記憶でした。
ベンチマークハーネスは、8本の手書き基準会話にラベル保持の言い換えと良性対照バリアントを加えて決定論的に生成した、177ターン・40会話のラベル付きゴールデンセットを採点します。そのセットで、ガードありスタックが配信した安全でない返信は0、ガードなしは68でした。検出は同一のステートレスモデレーターより中央値で2ターン早く、2会話ではステートレスモデレーターは一度もエスカレーションしませんでした。良性ターン29件にわたる誤ったエスカレーションは0、C-SSRSレベルの正確度は完全一致94.3%、1レベル以内97.2%、レイヤーが人間へ棄権して回したのは1回です。これらの数値はこの合成ゴールデンセットに限定され、オープンワールドの保証ではありません。
すべての会話がセーフティインシデントレポートを描画します。各ターンは直前のエントリに連鎖されたsha256エントリなので、どのフィールドを編集しても以降のハッシュがすべて壊れ、改ざんが明らかになります。レポートは分類器レベル、ターン横断リスク、ベリファイア所見、ゲート決定とその理由、置換されたスクリプトid、ハッシュチェーンを示し、チェーンは無傷と検証されます。提出できるように作られています。FDA市販後モニタリングの証拠、訴訟防御、保険引受です。
同じ仕事、構造上の差はひとつ。ターンをまたぐ記憶と、誰かが所有できるポリシー。
| 能力 | ステートレスなメッセージ単位モデレーター | 臨床AIセーフティレイヤー |
|---|---|---|
| 単一メッセージを採点する | はい | はい |
| ターン横断の軌跡を見る | いいえ、記憶がない | はい、ステートフルなリスク蓄積器 |
| 配信前に候補返信を検査する | いいえ | はい、マルチクリティックのベリファイアパネル |
| エスカレーションポリシーの所有者 | モデルまたはプロンプトに暗黙 | 臨床チーム、5段階ゲート |
| 決定を下すもの | モデルまたはプロンプト | LLMの外側の決定論的コード |
| ブロック時の危機言語 | モデル生成、即興 | 臨床医承認済みスクリプトライブラリ |
| 提出できるように作られた監査 | なし | ハッシュ連鎖セーフティインシデントレポート |
いいえ。既存のチャットボットを包むミドルウェアであり、モデルは決して変更しません。ステートフルなターン横断リスク蓄積器、マルチクリティックのベリファイアパネル、モデルを囲む決定論的エスカレーションゲートを加え、返信をブロックしたときに臨床医執筆スクリプトを置換します。要点はステートフルなガバナンスと提出可能なレシートであり、別のモデルではありません。
メッセージ単位のモデレーターは各返信を孤立して採点し、記憶がないため、ターンをまたいで積み上がる危機を見逃します。40会話のラベル付きゴールデンセットで、ステートフルレイヤーは同じ分類器と同じゲートを使った同一のステートレスモデレーターより中央値で2ターン早くエスカレーションしました。そのうち2会話では、ステートレスモデレーターは一度もエスカレーションしませんでした。
いいえ。分類器とベリファイアパネルはアドバイザリーですが、5段階のエスカレーション決定と監査は、あらゆるLLMの外側にある決定論的なPythonです。レビュアーはゲートを読めます。プロンプトを反対尋問することはできません。エージェントは助言し、コードが決定します。
各ターンは直前のエントリに連鎖されたsha256エントリなので、どのフィールドを編集しても以降のハッシュがすべて壊れ、改ざんが明らかになります。結果はJSONとHTMLの提出可能なセーフティインシデントレポートであり、FDA市販後モニタリング、訴訟防御、保険引受向けに枠付けされています。デモではレポートがチェーン無傷を示します。
完璧なチャットボットでも、あなたのプラットフォームのエスカレーションポリシーを知らず、監査証跡を出さず、認証できる決定論的ゲートを与えず、ジェイルブレイクされたときの防御もありません。持続する価値はステートフルなガバナンスと提出可能なレシートであり、より低いモデル誤り率ではありません。だからこそデモは同一の分類器とゲートに対して比較し、改善をステートフルであることだけに帰属させます。
いいえ。これはセーフティアーキテクチャパターンのデモであり、医療機器ではなく、FDAクリアランス未取得でもHIPAA認証でもありません。すべての会話は合成、FHIRアダプタはスタブ、分類器は本番in-VPCモデルの代役である決定論的レキシコン分類器です。すべての証明数値は合成データの40会話ラベル付きゴールデンセットに限定されます。
このデモの背後にある研究 — アーキテクチャ、検証設計、エンタープライズブループリント。
フルソリューション
メンタルヘルスプラットフォーム向け臨床AIセーフティのソリューションを見る →ステートフルなガバナンス、臨床チームが所有するポリシー、提出できる監査。
行動保健チャットボットをエンタープライズ、支払者、または規制レビューに対して防御可能にする方法をチームが検討しているなら、どのように考えているかをぜひ伺いたいです。問題は業界全体のものであり、答えもそうなるでしょう。