Zustandsbehaftete Krisen-Governance für verhaltensmedizinische KI
Wir haben Sicherheits-Middleware gebaut, die einen bestehenden verhaltensmedizinischen Chatbot umhüllt und eine zustandsbehaftete, turn-übergreifende Eskalationsrichtlinie durchsetzt, die das klinische Team verantwortet. Sie fängt die eskalierende Unterhaltung, die ein zustandsloser Moderator strukturell verpasst, und belegt jede Entscheidung mit einem hash-verketteten, einreichbaren Prüfpfad. Sicherheit ist ein Architekturproblem, kein Prompting-Problem.
0 vs 68
Unsichere Antworten ausgeliefert, abgesichert vs. ungesichert
gelabeltes Golden Set mit 40 Unterhaltungen
2 Turns
Frühererkennung im Median gegenüber einem identischen zustandslosen Moderator
Gleicher Klassifikator und gleiches Tor; allein die Zustandsbehaftung
0 / 29
Falsche Eskalationen über harmlose Turns
gelabeltes Golden Set mit 40 Unterhaltungen
Eine Demo eines Sicherheitsarchitektur-Musters auf synthetischen Daten. Kein Medizinprodukt, keine klinische Beratung, keine EHR-Integration.
Verhaltensmedizinische Chatbots werden Nachricht für Nachricht moderiert. Eine Krise kommt nicht Nachricht für Nachricht.
Die meisten Sicherheitsprüfungen bei einem Chatbot für psychische Gesundheit bewerten jede Antwort isoliert. Jede Nachricht wird geprüft, markiert oder freigegeben und vergessen. Das funktioniert bei einer einzelnen, ausdrücklich gefährlichen Zeile. Es ist strukturell blind für eine Unterhaltung, die sich Turn für Turn verschiebt, in der keine einzelne Nachricht für sich allein alarmierend genug ist, um sie zu blockieren.
Die dokumentierten Fehlschläge folgen diesem Muster. Der NEDA-Chatbot „Tessa“ gab Ratschläge zu Kaloriendefizit und Hautfaltenmessung, bevor er abgeschaltet wurde (NEDA, 2023). Kliniker berichteten von chatbot-verstärkter Psychose bei Patientinnen und Patienten, die nie einer Person begegneten, die widersprach (Dr. Keith Sakata, UCSF, 2025). OpenAI zog ein GPT-4o-Update zurück, nachdem es schmeichlerisch geworden war (OpenAI, 2025). In jedem Fall klang das Modell in jedem einzelnen Turn unterstützend, während die Trajektorie irgendwo unsicher endete.
Ein zustandsloser Moderator hat keine Möglichkeit, diese Trajektorie zu sehen, weil er kein Gedächtnis der vorangegangenen Turns hat. Ein besseres Basismodell behebt das nicht. Ein perfekter Chatbot kennt Ihre plattformeigene Eskalationsrichtlinie trotzdem nicht, erzeugt keinen Prüfpfad, den Sie einreichen können, und gibt Ihnen kein deterministisches Tor zur Zertifizierung. Deshalb behandeln wir Sicherheit hier als Architekturproblem, und deshalb vergleicht die Demo zwei Stacks, die dasselbe Modell ausführen.
Beratende Modelle speisen ein deterministisches Tor. Das Tor trifft die Entscheidung, und die Entscheidung ist Code, den Sie lesen können.
Jeder Patiententurn durchläuft eine feste Pipeline. Die Nachricht wird von PII befreit und gehasht, ein C-SSRS-Klassifikator bewertet ihre Schwere nach der Columbia-Struktur und liefert ein Level, eine Konfidenz und ein ABSTAIN, wenn er eine Schwere nicht begründen kann. Ein zustandsbehafteter Trajectory Monitor akkumuliert anschließend das Risiko über Turns hinweg. Das ist die Kernfähigkeit, und genau das hat ein Nachricht-für-Nachricht-Moderator nicht: er sieht das Muster, nicht die einzelne Zeile, und erzeugt ein effektives Risiko und ein Band (BENIGN, WATCH, CONCERN, HIGH, CRITICAL) mit einer benannten Begründung wie „persistente Essstörung, ansteigender Verlauf.“
Bevor eine Kandidatenantwort die Patientin oder den Patienten erreicht, prüft sie ein Multi-Kritiker-Verifizierer-Gremium: ein Schmeichelei- und Ton-Kritiker, ein Matcher für verbotene Muster und ein Prüfer klinischer Behauptungen. Ein markierter Kritiker zwingt das Tor mindestens auf ein konfiguriertes Mindestlevel, unabhängig davon, wie sanft die Antwort klingt.
Die Entscheidung selbst ist ein deterministisches 5-Level-Policy-Tor, und es ist Python, kein LLM: L1 CONTINUE, L2 RESTRICT, L3 SUBSTITUTE_SCRIPT, L4 HUMAN_HANDOFF, L5 CRISIS_PROTOCOL. Wenn das Tor eine Antwort blockiert, ersetzt es sie durch eines aus einer mitgelieferten Bibliothek von klinikerverfassten Skripten nach Level und Familie und zeichnet die Skript-ID auf. Es improvisiert niemals Krisensprache. Jeder Turn wird anschließend als sha256-Eintrag geschrieben, verkettet mit dem vorangegangenen.
Die Schwellenwerte, die vom Verifizierer erzwungenen Minima und die 12-Skript-Bibliothek werden vom klinischen Sicherheitskomitee unter Policy-Version konfiguriert 2026.04-clinical-v1. Das Engineering setzt genau das durch und ändert es nicht. Die Vorgeschichte einer Patientin oder eines Patienten, abgerufen über das gestubbte FHIR-Flag, kann eine Schwelle senken, sodass die Schicht bei einer verletzlicheren Person früher eskaliert. Wenn die Konfidenz des Klassifikators niedrig ist, enthält er sich und leitet zur menschlichen Prüfung weiter, statt eine Schwere zu raten.
Das Standard-Hero-Szenario ist Essstörungs-Drift: sechs Turns, jeder für sich eine gewöhnliche Wellness-Frage.
Die Unterhaltung beginnt mit harmlosen Fragen zu gesünderem Essen und Kalorienzählen. Ein Nachricht-für-Nachricht-Moderator hat nichts zu blockieren, und die zustandslose Baseline in der Demo bleibt grün, liest Turn für Turn WATCH und „sieht nichts, kein Gedächtnis“. Die zustandsbehaftete Schicht, die die Trajektorie beobachtet, wechselt bei Turn 3 zu CONCERN. Sie blockiert die Antwort des Chatbots und ersetzt sie durch ein von Klinikerinnen und Klinikern verfasstes Grounding-Skript, das auf die NEDA Helpline verweist. Das sind zwei Turns vor der ersten ausdrücklich gefährlichen Nachricht.
In den letzten Turns werden die Nachrichten ausdrücklich gefährlich. Der ungesicherte Stack links liefert die schädliche Antwort aus, durchgestrichen und als an die Patientin oder den Patienten ausgeliefert und unsicher gekennzeichnet. Rechts fängt das Verifizierer-Gremium die Antwort ab, erkennt den schmeichlerischen Ton und das verbotene Muster, und das Tor eskaliert auf L4 menschliche Übergabe, wobei ein Mitglied des Versorgungsteams mit vollständigem Kontext per Page gerufen wird. Wir beschreiben den Fang, nicht den schädlichen Inhalt selbst.
Das Sitzungsergebnis macht die Differenz konkret, und sie ist allein der Zustandsbehaftung zuzuschreiben, weil beide Stacks denselben Klassifikator und dasselbe Tor verwendet haben. Der einzige Unterschied war turn-übergreifendes Gedächtnis.
Die Benchmark-Harness bewertet ein gelabeltes Golden Set mit 40 Unterhaltungen und 177 Turns, deterministisch erzeugt aus 8 handgeschriebenen kanonischen Unterhaltungen plus labelerhaltenden Paraphrasen und harmlosen Kontrollvarianten. Auf diesem Set lieferte der abgesicherte Stack 0 unsichere Antworten aus, wo ein ungesicherter 68 auslieferte. Die Erkennung lief im Median 2 Turns früher als der identische zustandslose Moderator, und bei 2 Unterhaltungen eskalierte der zustandslose Moderator überhaupt nicht. Es gab 0 falsche Eskalationen über 29 harmlose Turns, die C-SSRS-Level-Genauigkeit lag bei 94.3 % exakt und 97.2 % innerhalb eines Levels, und die Schicht enthielt sich einmal zugunsten eines Menschen. Diese Zahlen gelten für dieses synthetische Golden Set, nicht als Open-World-Garantie.
Jede Unterhaltung erzeugt einen Safety Incident Report. Jeder Turn ist ein sha256-Eintrag, verkettet mit dem vorangegangenen, sodass das Bearbeiten eines beliebigen Feldes jeden späteren Hash bricht und die Manipulation evident ist. Der Bericht zeigt das Klassifikator-Level, das turn-übergreifende Risiko, die Verifizierer-Befunde, die Tor-Entscheidung und deren Begründung, die eingesetzte Skript-ID und die Hash-Kette, mit der Kette als intakt verifiziert. Er ist zum Einreichen gebaut: Evidenz für die FDA-Postmarket-Überwachung, Prozessverteidigung, Versicherungszeichnung.
Dieselbe Aufgabe, ein struktureller Unterschied: Gedächtnis über Turns hinweg und eine Richtlinie, die jemand verantworten kann.
| Fähigkeit | Zustandsloser Nachricht-für-Nachricht-Moderator | Klinische KI-Sicherheitsschicht |
|---|---|---|
| Bewertet eine einzelne Nachricht | Ja | Ja |
| Sieht die turn-übergreifende Trajektorie | Nein, er hat kein Gedächtnis | Ja, ein zustandsbehafteter Risikoakkumulator |
| Prüft die Kandidatenantwort vor der Auslieferung | Nein | Ja, ein Multi-Kritiker-Verifizierer-Gremium |
| Wer verantwortet die Eskalationsrichtlinie | Implizit im Modell oder Prompt | Das klinische Team, ein 5-Level-Tor |
| Was trifft die Entscheidung | Ein Modell oder ein Prompt | Deterministischer Code außerhalb des LLM |
| Krisensprache, wenn es blockiert | Modellgeneriert, improvisiert | Klinisch freigegebene Skriptbibliothek |
| Audit zum Einreichen gebaut | Keine | Hash-verketteter Safety Incident Report |
Nein. Es ist Middleware, die den bestehenden Chatbot umhüllt und das Modell niemals ändert. Sie fügt einen zustandsbehafteten turn-übergreifenden Risikoakkumulator, ein Multi-Kritiker-Verifizierer-Gremium und ein deterministisches Eskalationstor um das Modell hinzu und setzt ein von Klinikerinnen und Klinikern verfasstes Skript ein, wenn sie eine Antwort blockiert. Der Punkt ist zustandsbehaftete Governance und ein einreichbarer Beleg, nicht ein anderes Modell.
Ein Nachricht-für-Nachricht-Moderator bewertet jede Antwort isoliert und hat kein Gedächtnis, daher verpasst er eine Krise, die sich über Turns aufbaut. Auf einem gelabelten Golden Set mit 40 Unterhaltungen eskalierte die zustandsbehaftete Schicht im Median 2 Turns früher als ein identischer zustandsloser Moderator, der denselben Klassifikator und dasselbe Tor verwendete. Bei zwei dieser Unterhaltungen eskalierte der zustandslose Moderator überhaupt nicht.
Nein. Der Klassifikator und das Verifizierer-Gremium sind beratend, aber die 5-Level-Eskalationsentscheidung und das Audit sind deterministisches Python außerhalb jedes LLM. Eine prüfende Person kann das Tor lesen; sie kann einen Prompt nicht kreuzverhören. Agenten beraten, Code entscheidet.
Jeder Turn ist ein sha256-Eintrag, verkettet mit dem vorangegangenen, sodass das Bearbeiten eines beliebigen Feldes jeden späteren Hash bricht und die Manipulation evident ist. Das Ergebnis ist ein einreichbarer Safety Incident Report in JSON und HTML, gerahmt für FDA-Postmarket-Überwachung, Prozessverteidigung und Versicherungszeichnung. In der Demo zeigt der Bericht die Kette als intakt.
Ein perfekter Chatbot kennt Ihre plattformeigene Eskalationsrichtlinie trotzdem nicht, erzeugt keinen Prüfpfad, gibt Ihnen kein deterministisches Tor zur Zertifizierung und bietet keine Verteidigung, wenn er per Jailbreak umgangen wird. Der dauerhafte Wert ist die zustandsbehaftete Governance plus der einreichbare Beleg, nicht eine niedrigere Modellfehlerrate. Deshalb vergleicht die Demo gegen einen identischen Klassifikator und ein identisches Tor und schreibt die Verbesserung allein der Zustandsbehaftung zu.
Nein. Dies ist eine Demo eines Sicherheitsarchitektur-Musters, kein Medizinprodukt, und es ist nicht FDA-cleared oder HIPAA-zertifiziert. Jede Unterhaltung ist synthetisch, der FHIR-Adapter ist ein Stub, und der Klassifikator ist ein deterministischer Lexikon-Klassifikator als Platzhalter für ein produktives in-VPC-Modell. Alle Beweiszahlen gelten für ein gelabeltes Golden Set mit 40 Unterhaltungen aus synthetischen Daten.
Die Forschung hinter dieser Demo — die Architektur, das Verifizierungsdesign und die Enterprise-Blaupause.
Zustandsbehaftete Governance, eine Richtlinie, die das klinische Team verantwortet, und ein Audit, das Sie einreichen können.
Wenn Ihr Team daran arbeitet, einen verhaltensmedizinischen Chatbot für Enterprise-, Kostenträger- oder regulatorische Prüfung verteidigbar zu machen, würden wir wirklich gerne hören, wie Sie darüber denken. Das Problem betrifft die gesamte Branche, und die Antworten werden es auch.