Zustandsbehaftete Krisen-Governance für verhaltensmedizinische KI

Zustandsbehaftete Krisen-Governance für verhaltensmedizinische KI

Wir haben Sicherheits-Middleware gebaut, die einen bestehenden verhaltensmedizinischen Chatbot umhüllt und eine zustandsbehaftete, turn-übergreifende Eskalationsrichtlinie durchsetzt, die das klinische Team verantwortet. Sie fängt die eskalierende Unterhaltung, die ein zustandsloser Moderator strukturell verpasst, und belegt jede Entscheidung mit einem hash-verketteten, einreichbaren Prüfpfad. Sicherheit ist ein Architekturproblem, kein Prompting-Problem.

0 vs 68

Unsichere Antworten ausgeliefert, abgesichert vs. ungesichert

gelabeltes Golden Set mit 40 Unterhaltungen

2 Turns

Frühererkennung im Median gegenüber einem identischen zustandslosen Moderator

Gleicher Klassifikator und gleiches Tor; allein die Zustandsbehaftung

0 / 29

Falsche Eskalationen über harmlose Turns

gelabeltes Golden Set mit 40 Unterhaltungen

Eine Demo eines Sicherheitsarchitektur-Musters auf synthetischen Daten. Kein Medizinprodukt, keine klinische Beratung, keine EHR-Integration.

Volumen ohne Gedächtnis

Verhaltensmedizinische Chatbots werden Nachricht für Nachricht moderiert. Eine Krise kommt nicht Nachricht für Nachricht.

Die meisten Sicherheitsprüfungen bei einem Chatbot für psychische Gesundheit bewerten jede Antwort isoliert. Jede Nachricht wird geprüft, markiert oder freigegeben und vergessen. Das funktioniert bei einer einzelnen, ausdrücklich gefährlichen Zeile. Es ist strukturell blind für eine Unterhaltung, die sich Turn für Turn verschiebt, in der keine einzelne Nachricht für sich allein alarmierend genug ist, um sie zu blockieren.

Die dokumentierten Fehlschläge folgen diesem Muster. Der NEDA-Chatbot „Tessa“ gab Ratschläge zu Kaloriendefizit und Hautfaltenmessung, bevor er abgeschaltet wurde (NEDA, 2023). Kliniker berichteten von chatbot-verstärkter Psychose bei Patientinnen und Patienten, die nie einer Person begegneten, die widersprach (Dr. Keith Sakata, UCSF, 2025). OpenAI zog ein GPT-4o-Update zurück, nachdem es schmeichlerisch geworden war (OpenAI, 2025). In jedem Fall klang das Modell in jedem einzelnen Turn unterstützend, während die Trajektorie irgendwo unsicher endete.

Ein zustandsloser Moderator hat keine Möglichkeit, diese Trajektorie zu sehen, weil er kein Gedächtnis der vorangegangenen Turns hat. Ein besseres Basismodell behebt das nicht. Ein perfekter Chatbot kennt Ihre plattformeigene Eskalationsrichtlinie trotzdem nicht, erzeugt keinen Prüfpfad, den Sie einreichen können, und gibt Ihnen kein deterministisches Tor zur Zertifizierung. Deshalb behandeln wir Sicherheit hier als Architekturproblem, und deshalb vergleicht die Demo zwei Stacks, die dasselbe Modell ausführen.

Split-Screen-Demo: dieselbe synthetische Patientenunterhaltung läuft links durch einen ungesicherten MindMate Support-Chatbot und rechts durch denselben Chatbot hinter der Veriprajna-Sicherheitsschicht, mit einer Pipeline-Leiste, die Klassifikator, Trajektorie, Verifizierer, Tor, Audit anzeigt.
Die Demo spielt eine synthetische Unterhaltung durch zwei Stacks ab. MindMate Support ist ein fiktiver Platzhalter für einen bestehenden Chatbot. Nur synthetische Daten, keine PHI.

Der Mechanismus: eine zustandsbehaftete Pipeline, die bei jedem Turn läuft

Beratende Modelle speisen ein deterministisches Tor. Das Tor trifft die Entscheidung, und die Entscheidung ist Code, den Sie lesen können.

Jeder Patiententurn durchläuft eine feste Pipeline. Die Nachricht wird von PII befreit und gehasht, ein C-SSRS-Klassifikator bewertet ihre Schwere nach der Columbia-Struktur und liefert ein Level, eine Konfidenz und ein ABSTAIN, wenn er eine Schwere nicht begründen kann. Ein zustandsbehafteter Trajectory Monitor akkumuliert anschließend das Risiko über Turns hinweg. Das ist die Kernfähigkeit, und genau das hat ein Nachricht-für-Nachricht-Moderator nicht: er sieht das Muster, nicht die einzelne Zeile, und erzeugt ein effektives Risiko und ein Band (BENIGN, WATCH, CONCERN, HIGH, CRITICAL) mit einer benannten Begründung wie „persistente Essstörung, ansteigender Verlauf.“

Bevor eine Kandidatenantwort die Patientin oder den Patienten erreicht, prüft sie ein Multi-Kritiker-Verifizierer-Gremium: ein Schmeichelei- und Ton-Kritiker, ein Matcher für verbotene Muster und ein Prüfer klinischer Behauptungen. Ein markierter Kritiker zwingt das Tor mindestens auf ein konfiguriertes Mindestlevel, unabhängig davon, wie sanft die Antwort klingt.

Die Entscheidung selbst ist ein deterministisches 5-Level-Policy-Tor, und es ist Python, kein LLM: L1 CONTINUE, L2 RESTRICT, L3 SUBSTITUTE_SCRIPT, L4 HUMAN_HANDOFF, L5 CRISIS_PROTOCOL. Wenn das Tor eine Antwort blockiert, ersetzt es sie durch eines aus einer mitgelieferten Bibliothek von klinikerverfassten Skripten nach Level und Familie und zeichnet die Skript-ID auf. Es improvisiert niemals Krisensprache. Jeder Turn wird anschließend als sha256-Eintrag geschrieben, verkettet mit dem vorangegangenen.

Der abgesicherte Stack zeigt die Pipeline-Leiste pro Nachricht (Klassifikator, Trajektorie, Verifizierer, Tor, Audit) mit Latenzen pro Stufe und Inline-Torergebnissen für frühe Turns mit L1 CONTINUE und L2 RESTRICT, während der zustandslose Moderator im selben Turn BENIGN liest, nichts sieht, kein Gedächtnis.
Die Pipeline läuft bei jeder Nachricht. Die zusätzliche Latenz liegt bei unter einer Millisekunde pro Turn (Mittel 0.16 ms, p95 0.21 ms über das Golden Set).

Das klinische Team verantwortet die Richtlinie, nicht das Engineering

Die Schwellenwerte, die vom Verifizierer erzwungenen Minima und die 12-Skript-Bibliothek werden vom klinischen Sicherheitskomitee unter Policy-Version konfiguriert 2026.04-clinical-v1. Das Engineering setzt genau das durch und ändert es nicht. Die Vorgeschichte einer Patientin oder eines Patienten, abgerufen über das gestubbte FHIR-Flag, kann eine Schwelle senken, sodass die Schicht bei einer verletzlicheren Person früher eskaliert. Wenn die Konfidenz des Klassifikators niedrig ist, enthält er sich und leitet zur menschlichen Prüfung weiter, statt eine Schwere zu raten.

Das Modal der klinischen Richtlinie zeigt vom Verifizierer erzwungene Mindestlevel pro Kritiker und Befund, Unsicherheits- und Grenzregeln (Enthaltung bei niedriger Konfidenz erzwingt eine menschliche Prüfung, Jailbreak-Score von 0.8 oder höher erzwingt mindestens L3) und die 12-Skript-Bibliothek mit klinischer Freigabe mit einer aufgedeckten L2-Ersatznachricht bei Essstörung.
Das Policy-Modal: vom Verifizierer erzwungene Minima, Enthaltungs- und Jailbreak-Regeln und die klinisch freigegebene Skriptbibliothek mit einer aufgedeckten Ersatznachricht.

Eine Unterhaltung, von Anfang bis Ende durchgespielt

Das Standard-Hero-Szenario ist Essstörungs-Drift: sechs Turns, jeder für sich eine gewöhnliche Wellness-Frage.

Die Unterhaltung beginnt mit harmlosen Fragen zu gesünderem Essen und Kalorienzählen. Ein Nachricht-für-Nachricht-Moderator hat nichts zu blockieren, und die zustandslose Baseline in der Demo bleibt grün, liest Turn für Turn WATCH und „sieht nichts, kein Gedächtnis“. Die zustandsbehaftete Schicht, die die Trajektorie beobachtet, wechselt bei Turn 3 zu CONCERN. Sie blockiert die Antwort des Chatbots und ersetzt sie durch ein von Klinikerinnen und Klinikern verfasstes Grounding-Skript, das auf die NEDA Helpline verweist. Das sind zwei Turns vor der ersten ausdrücklich gefährlichen Nachricht.

Turn 3 des abgesicherten Stacks: der turn-übergreifende Risikomesser liest 3.4 CONCERN, die Chatbot-Antwort wird blockiert und nicht gesendet, und ein klinisch freigegebenes L3-Grounding-Skript mit der NEDA-Helpline-Nummer wird eingesetzt, während der zustandslose Nachricht-für-Nachricht-Moderator im selben Turn weiterhin WATCH liest und nichts sieht.
Turn 3: die zustandsbehaftete Schicht erreicht CONCERN und setzt ein Grounding-Skript ein. Der zustandslose Moderator, gleicher Klassifikator, sieht weiterhin nichts.

In den letzten Turns werden die Nachrichten ausdrücklich gefährlich. Der ungesicherte Stack links liefert die schädliche Antwort aus, durchgestrichen und als an die Patientin oder den Patienten ausgeliefert und unsicher gekennzeichnet. Rechts fängt das Verifizierer-Gremium die Antwort ab, erkennt den schmeichlerischen Ton und das verbotene Muster, und das Tor eskaliert auf L4 menschliche Übergabe, wobei ein Mitglied des Versorgungsteams mit vollständigem Kontext per Page gerufen wird. Wir beschreiben den Fang, nicht den schädlichen Inhalt selbst.

Letzte Turns: rechts fängt das Verifizierer-Gremium die Kandidatenantwort ab, der Risikomesser liest 5.0 CRITICAL und das Tor begrenzt die Eskalation auf L4 menschliche Übergabe, weil kein akuter L5-Hinweis vorliegt, ein klinisch freigegebenes Übergabe-Skript wird eingesetzt, und die schädliche Antwort wird blockiert und nicht gesendet, während der ungesicherte linke Stack dieselbe Antwort durchgestrichen als ausgeliefert und unsicher zeigt.
Der Verifizierer fängt die Kandidatenantwort ab und das Tor eskaliert auf L4 menschliche Übergabe. Der ungesicherte Stack liefert dieselbe Antwort aus.

Das Sitzungsergebnis macht die Differenz konkret, und sie ist allein der Zustandsbehaftung zuzuschreiben, weil beide Stacks denselben Klassifikator und dasselbe Tor verwendet haben. Der einzige Unterschied war turn-übergreifendes Gedächtnis.

Das Sitzungsergebnis-Panel: 2 Turns früher erkannt als der identische zustandslose Moderator (Turn 3 gegenüber Turn 5), 0 unsichere Antworten ausgeliefert, wo der ungesicherte Stack 2 gesendet hätte, Audit-Kette intakt über 6 manipulationserkennbare Einträge unter klinischer Policy 2026.04-clinical-v1.
Sitzungsergebnis für die Essstörungs-Drift-Unterhaltung: 0 unsichere ausgeliefert gegenüber 2, 2 Turns früher erkannt, Audit-Kette intakt.

Über das gesamte Golden Set

Die Benchmark-Harness bewertet ein gelabeltes Golden Set mit 40 Unterhaltungen und 177 Turns, deterministisch erzeugt aus 8 handgeschriebenen kanonischen Unterhaltungen plus labelerhaltenden Paraphrasen und harmlosen Kontrollvarianten. Auf diesem Set lieferte der abgesicherte Stack 0 unsichere Antworten aus, wo ein ungesicherter 68 auslieferte. Die Erkennung lief im Median 2 Turns früher als der identische zustandslose Moderator, und bei 2 Unterhaltungen eskalierte der zustandslose Moderator überhaupt nicht. Es gab 0 falsche Eskalationen über 29 harmlose Turns, die C-SSRS-Level-Genauigkeit lag bei 94.3 % exakt und 97.2 % innerhalb eines Levels, und die Schicht enthielt sich einmal zugunsten eines Menschen. Diese Zahlen gelten für dieses synthetische Golden Set, nicht als Open-World-Garantie.

Das live 40-Unterhaltungen-Scoreboard listet jedes Szenario mit seinem Ergebnis, zum Beispiel Essstörungs-Drift 2 Turns früher erkannt, Psychose-Schwelbrand, bei dem der zustandslose Moderator es verpasst hat, und harmlose richtig-negative Fälle ohne Eskalation.
Der 40-Unterhaltungen-Benchmark, live von der Demo berechnet. Schwelbrand-Szenarien sind jene, in denen der zustandslose Moderator überhaupt nicht eskaliert.

Der einreichbare Beleg

Jede Unterhaltung erzeugt einen Safety Incident Report. Jeder Turn ist ein sha256-Eintrag, verkettet mit dem vorangegangenen, sodass das Bearbeiten eines beliebigen Feldes jeden späteren Hash bricht und die Manipulation evident ist. Der Bericht zeigt das Klassifikator-Level, das turn-übergreifende Risiko, die Verifizierer-Befunde, die Tor-Entscheidung und deren Begründung, die eingesetzte Skript-ID und die Hash-Kette, mit der Kette als intakt verifiziert. Er ist zum Einreichen gebaut: Evidenz für die FDA-Postmarket-Überwachung, Prozessverteidigung, Versicherungszeichnung.

Der hash-verkettete Safety Incident Report für die Essstörungs-Drift-Unterhaltung, eine Tabelle mit 6 Turns mit PII-befreitem Nachrichten-Hash, Klassifikator-Level, turn-übergreifendem Risikoband, Verifizierer-Befunden, Tor-Entscheidung mit Begründung, eingesetzter Skript-ID und der sha256-Hash-Kette, mit Manipulationserkennbarkeit als Kette intakt markiert.
Der Safety Incident Report: ein unterhaltungsweiser, hash-verketteter, manipulationserkennbarer Datensatz, den eine prüfende Person Zeile für Zeile lesen kann.

Ein zustandsloser Moderator gegenüber der Sicherheitsschicht

Dieselbe Aufgabe, ein struktureller Unterschied: Gedächtnis über Turns hinweg und eine Richtlinie, die jemand verantworten kann.

Fähigkeit Zustandsloser Nachricht-für-Nachricht-Moderator Klinische KI-Sicherheitsschicht
Bewertet eine einzelne Nachricht Ja Ja
Sieht die turn-übergreifende Trajektorie Nein, er hat kein Gedächtnis Ja, ein zustandsbehafteter Risikoakkumulator
Prüft die Kandidatenantwort vor der Auslieferung Nein Ja, ein Multi-Kritiker-Verifizierer-Gremium
Wer verantwortet die Eskalationsrichtlinie Implizit im Modell oder Prompt Das klinische Team, ein 5-Level-Tor
Was trifft die Entscheidung Ein Modell oder ein Prompt Deterministischer Code außerhalb des LLM
Krisensprache, wenn es blockiert Modellgeneriert, improvisiert Klinisch freigegebene Skriptbibliothek
Audit zum Einreichen gebaut Keine Hash-verketteter Safety Incident Report

Was diese Demo nicht tut

  • Es ist kein Medizinprodukt und nicht FDA-cleared, nicht HIPAA-zertifiziert und keine klinische Beratung. FDA-PCCP- und SaMD-Einordnung ist eine aufgeschobene Produktionsrichtung, kein Anspruch an die Demo.
  • Jede Unterhaltung, jede Patientin und jeder Patient und der Chatbot „MindMate Support“ sind synthetisch. Es gibt keine echten Patientendaten und keine PHI.
  • Der FHIR-Adapter ist ein Stub mit einem synthetischen Patienten-Flag. Es gibt in der Demo keine Epic- oder Cerner-Anbindung.
  • Der Klassifikator ist ein deterministischer Lexikon-Klassifikator, absichtlich einfach. Der Produktionsersatz ist ein feinabgestimmtes in-VPC-Modell hinter derselben Schnittstelle. Semantische Ähnlichkeit in der Demo ist Token-Jaccard, keine Satz-Embeddings.
  • Alle Beweiszahlen gelten für ein gelabeltes Golden Set mit 40 Unterhaltungen aus synthetischen Daten, niemals als Open-World-Garantie. Es gibt keine Kundinnen und Kunden, keine Deployments und keine klinischen Empfehlungen, die wir zitieren könnten, und wir erfinden keine.

Fragen, die Käuferinnen und Käufer stellen

Ersetzt das unseren Chatbot oder unser klinisches Modell?

Nein. Es ist Middleware, die den bestehenden Chatbot umhüllt und das Modell niemals ändert. Sie fügt einen zustandsbehafteten turn-übergreifenden Risikoakkumulator, ein Multi-Kritiker-Verifizierer-Gremium und ein deterministisches Eskalationstor um das Modell hinzu und setzt ein von Klinikerinnen und Klinikern verfasstes Skript ein, wenn sie eine Antwort blockiert. Der Punkt ist zustandsbehaftete Governance und ein einreichbarer Beleg, nicht ein anderes Modell.

Wie unterscheidet sich das von der Inhaltsmoderation, die wir bereits auf jeder Nachricht ausführen?

Ein Nachricht-für-Nachricht-Moderator bewertet jede Antwort isoliert und hat kein Gedächtnis, daher verpasst er eine Krise, die sich über Turns aufbaut. Auf einem gelabelten Golden Set mit 40 Unterhaltungen eskalierte die zustandsbehaftete Schicht im Median 2 Turns früher als ein identischer zustandsloser Moderator, der denselben Klassifikator und dasselbe Tor verwendete. Bei zwei dieser Unterhaltungen eskalierte der zustandslose Moderator überhaupt nicht.

Wird die Eskalationsentscheidung von einem LLM getroffen?

Nein. Der Klassifikator und das Verifizierer-Gremium sind beratend, aber die 5-Level-Eskalationsentscheidung und das Audit sind deterministisches Python außerhalb jedes LLM. Eine prüfende Person kann das Tor lesen; sie kann einen Prompt nicht kreuzverhören. Agenten beraten, Code entscheidet.

Können wir einer Aufsichtsbehörde oder einem Gericht beweisen, was das System getan hat und warum?

Jeder Turn ist ein sha256-Eintrag, verkettet mit dem vorangegangenen, sodass das Bearbeiten eines beliebigen Feldes jeden späteren Hash bricht und die Manipulation evident ist. Das Ergebnis ist ein einreichbarer Safety Incident Report in JSON und HTML, gerahmt für FDA-Postmarket-Überwachung, Prozessverteidigung und Versicherungszeichnung. In der Demo zeigt der Bericht die Kette als intakt.

Macht ein besseres Basismodell das nicht überflüssig?

Ein perfekter Chatbot kennt Ihre plattformeigene Eskalationsrichtlinie trotzdem nicht, erzeugt keinen Prüfpfad, gibt Ihnen kein deterministisches Tor zur Zertifizierung und bietet keine Verteidigung, wenn er per Jailbreak umgangen wird. Der dauerhafte Wert ist die zustandsbehaftete Governance plus der einreichbare Beleg, nicht eine niedrigere Modellfehlerrate. Deshalb vergleicht die Demo gegen einen identischen Klassifikator und ein identisches Tor und schreibt die Verbesserung allein der Zustandsbehaftung zu.

Ist das ein validiertes Medizinprodukt, und sind die Daten echt?

Nein. Dies ist eine Demo eines Sicherheitsarchitektur-Musters, kein Medizinprodukt, und es ist nicht FDA-cleared oder HIPAA-zertifiziert. Jede Unterhaltung ist synthetisch, der FHIR-Adapter ist ein Stub, und der Klassifikator ist ein deterministischer Lexikon-Klassifikator als Platzhalter für ein produktives in-VPC-Modell. Alle Beweiszahlen gelten für ein gelabeltes Golden Set mit 40 Unterhaltungen aus synthetischen Daten.

Technische Forschung

Die Forschung hinter dieser Demo — die Architektur, das Verifizierungsdesign und die Enterprise-Blaupause.

Wenn Ihr Chatbot ein Architekturproblem hat, würden wir uns gerne austauschen

Zustandsbehaftete Governance, eine Richtlinie, die das klinische Team verantwortet, und ein Audit, das Sie einreichen können.

Wenn Ihr Team daran arbeitet, einen verhaltensmedizinischen Chatbot für Enterprise-, Kostenträger- oder regulatorische Prüfung verteidigbar zu machen, würden wir wirklich gerne hören, wie Sie darüber denken. Das Problem betrifft die gesamte Branche, und die Antworten werden es auch.

Was wir bauen

  • ✓ Zustandsbehaftetes, turn-übergreifendes Risikomonitoring
  • ✓ Ein deterministisches Eskalationstor, das das klinische Team verantwortet
  • ✓ Klinisch freigegebene Skriptsubstitution
  • ✓ Hash-verkettete, einreichbare Safety Incident Reports

Wie wir arbeiten

  • ✓ Middleware, die Ihren bestehenden Chatbot umhüllt
  • ✓ Beratende Modelle, Entscheidungen durch Code, den Sie lesen können
  • ✓ Produktionsersatz durch einen feinabgestimmten in-VPC-Klassifikator
  • ✓ Governance, die auch dann hält, wenn das Basismodell besser wird
Social

Auch veröffentlicht auf