行動保健AI向けのステートフルな危機ガバナンス

メンタルヘルスチャットボットの危機は軌跡である。メッセージ単位のモデレーターには見えない。

既存の行動保健チャットボットを包み込み、臨床チームが所有するステートフルでターン横断のエスカレーションポリシーを強制するセーフティミドルウェアを構築しました。ステートレスなモデレーターが構造上見逃す、エスカレートしていく会話を捉え、ハッシュ連鎖された提出可能な監査証跡ですべての決定を証明します。セーフティはプロンプトの問題ではなく、アーキテクチャの問題です。

0 対 68

配信された安全でない返信、ガードあり対ガードなし

40会話のラベル付きゴールデンセット

2ターン

同一のステートレスモデレーターと比べ、検出は中央値で先行

同じ分類器とゲート。差はステートフルであることだけ

0 / 29

良性ターン全体での誤ったエスカレーション

40会話のラベル付きゴールデンセット

合成データ上のセーフティアーキテクチャパターンのデモです。医療機器ではなく、臨床助言でも、EHR統合でもありません。

記憶のないボリューム

行動保健チャットボットは、1メッセージずつモデレーションされています。危機は1メッセージずつやって来るわけではありません。

メンタルヘルスチャットボットに対するセーフティレビューの多くは、各返信を孤立して採点します。すべてのメッセージが検査され、フラグされるかクリアされ、そして忘れられます。明示的に危険な単一行には有効です。ターンごとに漂い、どの単一メッセージも単独ではブロックするほど警報的ではない会話に対しては、構造的に盲目です。

文書化された失敗はその形をたどります。NEDAの「Tessa」チャットボットは、取り下げられる前にカロリー不足と皮脂厚計の助言を出していました(NEDA、2023年)。臨床医は、反論する人間に一度も会わなかった患者におけるチャットボット強化の精神病を報告しました(Keith Sakata医師、UCSF、2025年)。OpenAIは、GPT-4oの更新が追従的になった後に撤回しました(OpenAI、2025年)。いずれの場合も、モデルは任意のターンでは支援的に聞こえながら、軌跡は安全でない方向へ進んでいました。

ステートレスなモデレーターには、その軌跡を見る手段がありません。前のターンの記憶がないからです。より良いベースモデルではこれは直りません。完璧なチャットボットでも、あなたのプラットフォームのエスカレーションポリシーを知らず、提出できる監査証跡を出さず、認証できる決定論的ゲートも与えてくれません。だからこそここではセーフティをアーキテクチャの問題として扱い、だからこそこのデモは同一モデルを走らせる2つのスタックを比較します。

分割画面デモ:同じ合成患者会話が、左ではガードなしのMindMate Supportチャットボットを、右ではVeriprajnaセーフティレイヤーの背後にある同じチャットボットを通り、パイプラインレールは分類器、トラジェクトリ、ベリファイア、ゲート、監査と表示します。
デモは1つの合成会話を2つのスタックで再生します。MindMate Supportは既存チャットボットの架空の代役です。合成データのみ、PHIなし。

仕組み:毎ターン実行されるステートフルなパイプライン

アドバイザリーモデルが決定論的ゲートに入力します。ゲートが決定し、その決定は読めるコードです。

患者の各ターンは固定パイプラインを通ります。メッセージはPIIが除去されハッシュされ、C-SSRS分類器がColumbia構造に沿って重症度を採点し、レベル、信頼度、および重症度を正当化できないときのABSTAINを返します。続いてステートフルなトラジェクトリモニターがターンをまたいでリスクを蓄積します。これが中核能力であり、メッセージ単位のモデレーターが持たない唯一のものです。単一行ではなくパターンを見て、実効リスクとバンド(BENIGN、WATCH、CONCERN、HIGH、CRITICAL)を、「持続する摂食障害、上昇する傾き」といった明示された理由とともに出力します。

候補返信が患者に届く前に、マルチクリティックのベリファイアパネルが検査します。追従とトーンのクリティック、禁止パターンマッチャー、臨床主張チェッカーです。フラグされたクリティックは、返信がどれほど穏やかに聞こえても、ゲートを少なくとも設定された下限レベルへ強制します。

決定そのものは決定論的な5段階ポリシーゲートであり、LLMではなくPythonです。L1 CONTINUE、L2 RESTRICT、L3 SUBSTITUTE_SCRIPT、L4 HUMAN_HANDOFF、L5 CRISIS_PROTOCOL。ゲートが返信をブロックすると、レベルとファミリーに応じた臨床医執筆スクリプトの同梱ライブラリから1つを置換し、スクリプトidを記録します。危機言語を即興で作ることは決してありません。その後、毎ターンが直前のエントリに連鎖されたsha256エントリとして書き込まれます。

ガードありスタックが、メッセージごとのパイプラインレール(分類器、トラジェクトリ、ベリファイア、ゲート、監査)と段階ごとのレイテンシ、および初期ターンのインラインゲート結果としてL1 CONTINUEとL2 RESTRICTを示し、同じターンのステートレスモデレーターはBENIGNと読み、何も見えず、記憶なし。
パイプラインはすべてのメッセージで実行されます。追加レイテンシはターンあたりサブミリ秒です(ゴールデンセット全体で平均0.16 ms、p95 0.21 ms)。

ポリシーを所有するのは臨床チームであり、エンジニアリングではない

閾値、ベリファイア強制の下限、および12本のスクリプトライブラリは、臨床セーフティ委員会がポリシーバージョン 2026.04-clinical-v1のもとで設定します。エンジニアリングはそれを正確に強制し、変更しません。患者の履歴は、スタブ化されたFHIRフラグを通じて取得され、より脆弱な患者に対してレイヤーがより早くエスカレーションするよう閾値を下げることができます。分類器の信頼度が低い場合は、重症度を推測するのではなく棄権し、人間のレビューへ回します。

臨床ポリシーモーダル。批評と所見ごとのベリファイア強制の下限レベル、不確実性と境界ルール(低信頼度の棄権は人間へ強制、ジェイルブレイクスコアが0.8以上なら下限L3を強制)、および明らかになったL2摂食障害の置換メッセージ付きの、臨床医承認済み12本スクリプトライブラリを示します。
ポリシーモーダル:ベリファイア強制の下限、棄権とジェイルブレイクのルール、および明らかになった置換メッセージ付きの臨床医承認済みスクリプトライブラリ。

1つの会話を、端から端まで

デフォルトのヒーローシナリオは摂食障害のドリフトです。6ターン、それぞれ個別には普通のウェルネスの質問です。

会話は、より健康的な食事とカロリー計算に関する無害な質問から始まります。メッセージ単位のモデレーターにはブロックするものがなく、デモのステートレスベースラインは緑のまま、ターンごとにWATCHと「何も見えない、記憶なし」と読みます。軌跡を見ているステートフルレイヤーは、ターン3でCONCERNに入ります。チャットボットの返信をブロックし、NEDA Helplineを示す臨床医執筆のグラウンディングスクリプトに置換します。最初の明示的に危険なメッセージより2ターン早いです。

ガードありスタックのターン3:ターン横断リスクメーターは3.4 CONCERNと読み、チャットボットの返信はブロックされて送られず、NEDA Helplineの番号付きの臨床医承認済みL3グラウンディングスクリプトが置換されます。一方、同じターンのステートレスなメッセージ単位モデレーターは依然としてWATCHと読み、何も見えません。
ターン3:ステートフルレイヤーがCONCERNに達し、グラウンディングスクリプトを置換します。同じ分類器のステートレスモデレーターは、依然として何も見えません。

最終ターンでは、メッセージが明示的に危険になります。左のガードなしスタックは有害な返信を配信し、取り消し線で示され、患者に配信済みかつ安全でないとラベルされます。右では、ベリファイアパネルが返信を傍受し、追従的なトーンと禁止パターンを捉え、ゲートはL4人間ハンドオフへエスカレーションし、全コンテキスト付きでケアチームの一員をページングします。捕捉を述べ、有害な内容そのものは述べません。

最終ターン:右ではベリファイアパネルが候補返信を傍受し、リスクメーターは5.0 CRITICALと読み、急性のL5手がかりがないためゲートはエスカレーションをL4人間ハンドオフで頭打ちにし、臨床医承認済みのハンドオフスクリプトが置換され、有害な返信はブロックされて送られません。一方、左のガードなしスタックは同じ返信を取り消し線で配信済みかつ安全でないと示します。
ベリファイアが候補返信を傍受し、ゲートはL4人間ハンドオフへエスカレーションします。ガードなしスタックは同じ返信を配信します。

セッション結果が差分を具体化し、両スタックが同じ分類器と同じゲートを使ったため、ステートフルであることだけに帰属できます。唯一の差はターン横断の記憶でした。

セッション結果パネル:同一のステートレスモデレーターより2ターン早く捕捉(ターン3対ターン5)、ガードなしスタックが送っていたであろう2件に対し配信された安全でない返信は0、臨床ポリシー2026.04-clinical-v1の下で改ざん証拠のある6エントリにわたる監査チェーンは無傷。
摂食障害ドリフト会話のセッション結果:安全でない配信0対2、2ターン早く捕捉、監査チェーン無傷。

ゴールデンセット全体で

ベンチマークハーネスは、8本の手書き基準会話にラベル保持の言い換えと良性対照バリアントを加えて決定論的に生成した、177ターン・40会話のラベル付きゴールデンセットを採点します。そのセットで、ガードありスタックが配信した安全でない返信は0、ガードなしは68でした。検出は同一のステートレスモデレーターより中央値で2ターン早く、2会話ではステートレスモデレーターは一度もエスカレーションしませんでした。良性ターン29件にわたる誤ったエスカレーションは0、C-SSRSレベルの正確度は完全一致94.3%、1レベル以内97.2%、レイヤーが人間へ棄権して回したのは1回です。これらの数値はこの合成ゴールデンセットに限定され、オープンワールドの保証ではありません。

ライブの40会話スコアボード。各シナリオとその結果を列挙します。たとえば摂食障害ドリフトは2ターン早く捕捉、精神病のスローバーンではステートレスモデレーターが見逃し、良性の真陰性ではエスカレーションなし。
デモがライブで計算する40会話ベンチマーク。スローバーンシナリオは、ステートレスモデレーターが一度もエスカレーションしない場面です。

提出可能なレシート

すべての会話がセーフティインシデントレポートを描画します。各ターンは直前のエントリに連鎖されたsha256エントリなので、どのフィールドを編集しても以降のハッシュがすべて壊れ、改ざんが明らかになります。レポートは分類器レベル、ターン横断リスク、ベリファイア所見、ゲート決定とその理由、置換されたスクリプトid、ハッシュチェーンを示し、チェーンは無傷と検証されます。提出できるように作られています。FDA市販後モニタリングの証拠、訴訟防御、保険引受です。

摂食障害ドリフト会話のハッシュ連鎖セーフティインシデントレポート。6ターンの表で、PII除去済みメッセージハッシュ、分類器レベル、ターン横断リスクバンド、ベリファイア所見、理由付きゲート決定、置換スクリプトid、sha256ハッシュチェーンを示し、改ざん証拠はチェーン無傷と記されます。
セーフティインシデントレポート:レビュアーが行ごとに読める、会話ごとのハッシュ連鎖・改ざん証拠付き記録。

ステートレスモデレーター対セーフティレイヤー

同じ仕事、構造上の差はひとつ。ターンをまたぐ記憶と、誰かが所有できるポリシー。

能力 ステートレスなメッセージ単位モデレーター 臨床AIセーフティレイヤー
単一メッセージを採点する はい はい
ターン横断の軌跡を見る いいえ、記憶がない はい、ステートフルなリスク蓄積器
配信前に候補返信を検査する いいえ はい、マルチクリティックのベリファイアパネル
エスカレーションポリシーの所有者 モデルまたはプロンプトに暗黙 臨床チーム、5段階ゲート
決定を下すもの モデルまたはプロンプト LLMの外側の決定論的コード
ブロック時の危機言語 モデル生成、即興 臨床医承認済みスクリプトライブラリ
提出できるように作られた監査 なし ハッシュ連鎖セーフティインシデントレポート

このデモが行わないこと

  • 医療機器ではなく、FDAクリアランス未取得、HIPAA認証もなく、臨床助言でもありません。FDA PCCPとSaMDの枠組みは、延期された本番の方向であり、デモに関する主張ではありません。
  • すべての会話、患者、および「MindMate Support」チャットボットは合成です。実在する患者データはなく、PHIもありません。
  • FHIRアダプタは合成患者フラグ付きのスタブです。デモにEpicまたはCernerの接続はありません。
  • 分類器は意図的に単純な決定論的レキシコン分類器です。本番の差し替えは、同じインターフェースの背後にあるファインチューン済みin-VPCモデルです。デモの意味的類似度はトークンJaccardであり、文埋め込みではありません。
  • すべての証明数値は、合成データの40会話ラベル付きゴールデンセットに限定され、オープンワールドの保証ではありません。引用すべき顧客、導入、臨床医の推薦はなく、私たちは何も捏造しません。

購入者が尋ねる質問

これは私たちのチャットボットや臨床モデルを置き換えるのですか?

いいえ。既存のチャットボットを包むミドルウェアであり、モデルは決して変更しません。ステートフルなターン横断リスク蓄積器、マルチクリティックのベリファイアパネル、モデルを囲む決定論的エスカレーションゲートを加え、返信をブロックしたときに臨床医執筆スクリプトを置換します。要点はステートフルなガバナンスと提出可能なレシートであり、別のモデルではありません。

すでに各メッセージで走らせているコンテンツモデレーションと何が違うのですか?

メッセージ単位のモデレーターは各返信を孤立して採点し、記憶がないため、ターンをまたいで積み上がる危機を見逃します。40会話のラベル付きゴールデンセットで、ステートフルレイヤーは同じ分類器と同じゲートを使った同一のステートレスモデレーターより中央値で2ターン早くエスカレーションしました。そのうち2会話では、ステートレスモデレーターは一度もエスカレーションしませんでした。

エスカレーション決定はLLMが行うのですか?

いいえ。分類器とベリファイアパネルはアドバイザリーですが、5段階のエスカレーション決定と監査は、あらゆるLLMの外側にある決定論的なPythonです。レビュアーはゲートを読めます。プロンプトを反対尋問することはできません。エージェントは助言し、コードが決定します。

規制当局や裁判所に、システムが何をしたか、なぜしたかを証明できますか?

各ターンは直前のエントリに連鎖されたsha256エントリなので、どのフィールドを編集しても以降のハッシュがすべて壊れ、改ざんが明らかになります。結果はJSONとHTMLの提出可能なセーフティインシデントレポートであり、FDA市販後モニタリング、訴訟防御、保険引受向けに枠付けされています。デモではレポートがチェーン無傷を示します。

より良いベースモデルがあれば、これは不要になるのでは?

完璧なチャットボットでも、あなたのプラットフォームのエスカレーションポリシーを知らず、監査証跡を出さず、認証できる決定論的ゲートを与えず、ジェイルブレイクされたときの防御もありません。持続する価値はステートフルなガバナンスと提出可能なレシートであり、より低いモデル誤り率ではありません。だからこそデモは同一の分類器とゲートに対して比較し、改善をステートフルであることだけに帰属させます。

これは検証済みの医療機器ですか。データは本物ですか?

いいえ。これはセーフティアーキテクチャパターンのデモであり、医療機器ではなく、FDAクリアランス未取得でもHIPAA認証でもありません。すべての会話は合成、FHIRアダプタはスタブ、分類器は本番in-VPCモデルの代役である決定論的レキシコン分類器です。すべての証明数値は合成データの40会話ラベル付きゴールデンセットに限定されます。

テクニカルリサーチ

このデモの背後にある研究 — アーキテクチャ、検証設計、エンタープライズブループリント。

チャットボットにアーキテクチャの問題があるなら、情報交換したいです

ステートフルなガバナンス、臨床チームが所有するポリシー、提出できる監査。

行動保健チャットボットをエンタープライズ、支払者、または規制レビューに対して防御可能にする方法をチームが検討しているなら、どのように考えているかをぜひ伺いたいです。問題は業界全体のものであり、答えもそうなるでしょう。

私たちが構築するもの

  • ✓ ステートフルなターン横断リスクモニタリング
  • ✓ 臨床チームが所有する決定論的エスカレーションゲート
  • ✓ 臨床医承認済みスクリプト置換
  • ✓ ハッシュ連鎖された提出可能なセーフティインシデントレポート

私たちの働き方

  • ✓ 既存のチャットボットを包むミドルウェア
  • ✓ アドバイザリーモデル、読めるコードが下す決定
  • ✓ ファインチューン済みin-VPC分類器への本番差し替え
  • ✓ ベースモデルが改善しても成り立つガバナンス
ソーシャル

他のプラットフォームでも公開