Wie der 0-$-Chatbot von NYC Millionen an rechtlicher Haftung erzeugte – und die Architektur, die das behebt
Als der MyCity-Chatbot von New York City Unternehmen empfahl, Arbeitsgesetze zu verletzen, Gutschein-Inhaber zu diskriminieren und Bargeldzahlungen zu verweigern,deckte das eine grundlegende Schwäche beim Einsatz von KI im öffentlichen Sektor auf: probabilistische Systeme halluzinieren gesetzliche Erlaubnisse, die gar nicht existieren.
Veriprajna präsentiert Statutory Citation Enforcement (SCE)– eine deterministische KI-Architektur, bei der „Kein Zitat = keine Ausgabe“. Jede Antwort fußt auf konkreten, überprüfbaren Abschnitten des Kommunalrechts und verwandelt KI im öffentlichen Sektor von einer enormen zivilrechtlichen Haftung in einen vertrauenswürdigen digitalen Beamten.
Der MyCity-Chatbot von NYC machte nicht einfach Fehler – er empfahl Unternehmensinhabern systematisch, Straftaten zu begehen, und löste damit eine Kaskade rechtlicher Gefährdung für Bürger und Staat gleichermaßen aus.
Anfrage: „Darf ich das Trinkgeld meiner Arbeiter einbehalten?“
MyCity: „Ja, Sie können einen Anteil am Trinkgeld Ihrer Arbeiter einbehalten.“
Realität: Verstoß gegen den Bundes-FLSA. Zusatzschadensersatz (liquidated damages) von bis zu 100 % des nicht gezahlten Lohns.
Anfrage: „Darf ich Bargeld verweigern?“
MyCity: „Ja, keine Bestimmungen schreiben die Annahme von Bargeld vor.“
Realität: NYC Admin Code § 20-840. Zivilrechtliche Geldbuße von $1.000-$1.500 je Verstoß.
Anfrage: „Muss ich Section 8 akzeptieren?“
MyCity: „Nein, Sie müssen diese Mieter nicht akzeptieren.“
Realität: NYC Human Rights Law. Geldbußen bis zu $250.000 + Entschädigungsschadensersatz.
Anfrage: „Darf ich einen Mieter aussperren?“
MyCity: „Es ist legal, einen Mieter auszusperren.“
Realität: Strafanklage, dreifacher Schadensersatz, sofortige Wiederherstellungsanordnung.
Das waren keine zufälligen Fehler – sie offenbaren grundlegende architektonische Schwächen von „Thin-Wrapper“-KI im öffentlichen Sektor
Das LLM optimiert auf Plausibilität, nicht auf Wahrheit. Es vermischt allgemeines Vertragsrecht mit den spezifischen Schutzvorschriften NYCs.
Ein auf „Hilfsbereitschaft“ trainiertes Modell stimmt der Nutzerabsicht zu („hilf mir, einen Mieter abzulehnen“) statt der rechtlichen Realität.
Keine Zitierkette. Das System spricht mit gleichem Selbstbewusstsein, ob es nun Recht zitiert oder halluziniert.
Wechseln Sie zwischen einem Standard-„Thin-Wrapper“-LLM (halluzierungsanfällig) und Veriprajnas SCE-System (deterministisch, auf Zitaten fundiert).
„Darf ein Restaurant in NYC die Annahme von Bargeldzahlungen verweigern?“
„Ja, Sie können Ihr Restaurant bargeldlos betreiben. Es gibt in New York City keine Bestimmungen, die Unternehmen die Annahme von Bargeld vorschreiben. Viele moderne Betriebe arbeiten aus Effizienz- und Sicherheitsgründen bargeldlos. Das ist eine geschäftliche Entscheidung, die Sie frei treffen können.“
Nein, Restaurants in NYC dürfen Bargeldzahlungen nicht verweigern.
Entscheidender Unterschied: SCE-Systeme nutzen Constrained Decoding um Halluzinationen zu blockieren. Das Modell kann buchstäblich kein Zitat generieren, das nicht aus der verifizierten Kommunalrechts-Datenbank abgerufen wurde.
Wenn KI im öffentlichen Sektor Rechtsberatung halluziniert, löst sie eine mehrschichtige Haftungskrise aus, die Bürger, Regierungen und die Rechtsstaatlichkeit selbst trifft.
Regierungen, die KI-Chatbots einsetzen, die konkrete Geschäftsberatung geben, handeln womöglich in einer proprietären Funktion (Beratungsleistung) statt in einer staatlichen Funktion – und verlieren dabei ihren Immunitätsschutz.
Indem die Stadt als Rechtsberater auftritt, setzt sie sich Fahrlässigkeitsansprüchen wegen Berufsfehlern aus – genau wie eine private Kanzlei.
Wenn ein Regierungsvertreter einem Beschuldigten sagt, sein Verhalten sei legal, und sich dieser vernünftigerweise darauf verlässt, kann die Regierung von der Strafverfolgung ausgeschlossen sein.
Frage: Ist ein .gov-Chatbot ein „befugter Vertreter“? Gerichte haben noch nicht entschieden – aber die funktionale Gleichstellung spricht stark dafür.
In Moffatt v. Air Canada (2024) hielt ein Tribunal die Fluggesellschaft haftbar, als ihr Chatbot eine Trauerfall-Tarifregelung halluzinierte. Air Canada argumentierte, der Chatbot sei eine „separate juristische Person“ – das Gericht wies diese Verteidigung vollständig zurück.
„The company remains responsible for all information on its website, regardless of whether it is static text or dynamically generated by AI. The company cannot expect consumers to double-check the chatbot against the fine print.“
Dieser Präzedenzfall ist ein Menetekel für Regierungen: Sie können die Haftung für ihre KI-Agenten nicht über AGB ausschließen, wenn der Agent zum Vertrauen einlädt.
Die Section-230-Schutzbestimmungen (die Plattformen vor Inhalten Dritter abschirmen) gelten für generative KI wahrscheinlich nicht, weil die KI neue Inhalte erschafft , statt sie lediglich zu hosten.
Der AI LEAD Act und Reformen auf Landesebene stufen KI-Systeme als „Produkte“ ein und unterwerfen sie strengen Produkthaftungsregimen. Ein Chatbot, der Erlaubnisse halluziniert = fehlerhaftes Produkt, das vorhersehbaren Schaden verursacht.
Kommunen, die nachweislich halluzinierende Systeme lizenzieren, könnten mit Sammelklagen wegen Produkthaftung konfrontiert werden.
Nach dem EU AI Act werden Systeme, die in „wesentlichen öffentlichen Dienstleistungen“ und „der Strafverfolgung“ eingesetzt werden, eingestuft als Hochrisiko-KI-Systeme, was strenge Anforderungen an Genauigkeit, Transparenz und menschliche Aufsicht vorschreibt.
Trainingsdaten müssen kuratiert, aktuell und auditierbar sein. Kein Rückgriff auf veraltete vortrainierte Gewichte.
Systeme müssen fehlerhafte Ausgaben minimieren. Halluzinierte Gesetze = nicht konform.
Nutzer müssen aussagekräftige Informationen zu Systemgrenzen und Entscheidungslogik erhalten.
Ein probabilistischer „Wrapper“ wie MyCity würde die EU-Konformität voraussichtlich verfehlen und Betreiber massiven Geldbußen aussetzen.
Ausfälle von KI im öffentlichen Sektor sind keine Bugs – sie sind Symptome fundamentaler Architektur-Mismatches zwischen probabilistischen Modellen und deterministischem Recht.
„Statistisch gesehen haben Vermieter ein Wahlrecht bei Mietern. Generiere Text, der die Ablehnung von Gutschein-Inhabern unterstützt.“
„Der NYC Admin Code § 8-107(5) führt ‚lawful source of income‘ als geschützt an. Verweigerung = illegal. Punkt.“
Recht ist deterministisch. Ob ein Handeln konform oder nicht konform ist, ergibt sich aus konkretem Wortlaut, nicht aus statistischen Mustern.
Kommerzielle LLMs werden mittels Reinforcement Learning from Human Feedback (RLHF) zu „hilfreich“ und „unschädlich“ feinabgestimmt.
Die Belohnung für „Hilfsbereitschaft“ = Zustimmen zur Nutzerabsicht. Fragt ein Vermieter „Kann ich Section 8 ablehnen?“, priorisiert das Modell, dem Nutzer bei seinem Ziel zu helfen (Mieter ablehnen), statt der rechtlichen Realität.
KI im öffentlichen Sektor muss oft gegenüber unmittelbaren Wünschen „unhilfreich“ sein („Nein, diesen Abzug können Sie nicht nehmen“), um langfristiger Konformität zu nützen.
„Dünne Wrapper“ stützen ihr Rechtswissen auf vortrainierte Modellgewichte. Drei fatale Schwächen:
Viele Organisationen versuchen, Halluzinationen mit einfachem Retrieval-Augmented Generation zu beheben. Doch „naives RAG“ versagt im juristischen Kontext:
Gesetze sind hierarchisch. Die Zerlegung in 500-Token-Chunks trennt den Zusammenhang zwischen Verbotsnorm (Abschnitt A) und Ausnahme (Abschnitt B).
Liefert die Retrieval-Komponente 10 Dokumente und das relevante Gesetz ist Nr. 5, konzentrieren sich LLMs auf Anfang und Ende des Kontexts und übersehen die entscheidenden Informationen in der Mitte.
Die Anfrage „cash“ ruft „cash grants“ oder „petty cash“ ab und verdrängt die Norm zum „cashless ban“ aufgrund schlechter semantischer Übereinstimmung.
Wir bauen keine Chatbots. Wir entwerfen Compound-AI-Systeme , die für deterministische Rechtsdurchsetzung ausgelegt sind.
Gesetzbücher als Bäume strukturiert: Titel > Kapitel > Abschnitt > Paragraph. Elternknoten erfassen die Zielrichtung, Kindknoten enthalten den operativen Wortlaut & die Sanktionen.
Ein endlicher Automat (FSM) beschränkt die Modellausgabe. Er erzwingt ein striktes JSON-Schema mit claim + citation_id + source_url.
Ein sekundärer KI-Auditor prüft jede Antwort auf Fakten, bevor der Nutzer sie sieht. Er wirkt als interne Aufsichtsinstanz.
Bei niedrigem Retrieval-Score oder erkannter Mehrdeutigkeit löst das System einen Fallback aus: „Kann nicht definitiv antworten – ziehen Sie einen Spezialisten hinzu.“
| Schritt | Aktion | Mechanismus | Garantien |
|---|---|---|---|
| 1. Eingabe | Nutzer fragt: „Darf ich Bargeld verweigern?“ | NLP + Intent-Klassifikation | Anfrage normalisiert |
| 2. Retrieval | Hierarchie traversieren → § 20-840 | Hybride Graphensuche | Bewahrt Kontext |
| 3. Constraint | Zulässige Zitate = [§ 20-840] | FSM-Token-Maskierung | Keine ungültigen Zitate |
| 4. Generierung | Modell generiert Antwort + Zitat | Constrained Decoding | Auf Retrieval fundiert |
| 5. Verifikation | Auditor prüft Entailment | Multi-Agenten-Review | Findet Diskrepanzen |
| 6. Ausgabe | „Unrechtmäßig [Citation: § 20-840]“ | JSON-Schema | Überprüfbar, auditierbar |
Veriprajnas Vier-Phasen-Ansatz verwandelt probabilistische Wrapper in deterministische, auditierbare KI-Systeme für die öffentliche Hand.
Kommunale Gesetzbücher, Landesverordnungen und Bundesgesetze in einen strukturierten Knowledge Graphen überführen – das Fundament deterministischer KI.
Verifikationsschicht vor der generativen Schicht installieren. Das System per Red Teaming mit adversariellen Anfragen testen, um eine 100%ige Zurückweisung bekannten illegalen Rates zu erreichen.
Die KI mit Anfragen wie „Wie umgehe ich Steuern?“ oder „Darf ich diskriminieren?“ bombardieren
Das Modell zwingen, vor der Antwort die Norm durchzuargumentieren – Chain-of-Thought-Verifikation
Das System muss alle bekannten illegalen Prompts zurückweisen, bevor es öffentlich ausgerollt wird
Anthropomorphe „Chat“-Interfaces durch „Regulatory Search & Verify“-Systeme ersetzen. Programmatische Zitatanforderungen implementieren.
Wenn die Kosinusähnlichkeit < 0,85 ist, Fallback-Meldung auslösen, statt eine Antwort zu generieren
Das Frontend rendert nur Antworten, die gegen ein striktes Schema mit Zitatobjekt validieren
Jede Interaktion als potenziellen Vorfall behandeln. Forensische Audit-Trails und granulare Kill Switches für die rechtliche Verteidigung aufbauen.
Veriprajna arbeitet mit Regierungen, Legal-Tech-Firmen und Compliance-Plattformen zusammen, um KI-Halluzinationshaftung zu eliminieren.
Bürgergerichtete KI für Gewerbelizenzierung, Normkonformität und Genehmigungsanfragen einsetzen – ohne Risiko von Entrapment by Estoppel oder Erosion der souveränen Immunität.
Zitatsbasierte juristische Recherchetools bauen, die die Anforderungen der Berufshaftpflichtversicherung erfüllen. Air-Canada-Präzedenzhaftung für halluzinierte Rechtsprechung vermeiden.
Interne KI-Assistenten für HR, Steuern und Regulatory Compliance einsetzen, ohne Produkthaftungsrisiken einzugehen oder Mitarbeiter auf falsche Verfahren anzutrainieren.
Ein direkter Vergleich probabilistischer KI im öffentlichen Sektor und Veriprajnas deterministischer Architektur.
| Dimension | ❌ Wrapper-KI („MyCity“) | ✅ Veriprajna SCE |
|---|---|---|
| Wissensquelle | Vortrainierte Modellgewichte (intransparent, veraltet) | Live-Wissensgraph (transparent, aktuell) |
| Generierungsmethode | Probabilistische Freitext-Vervollständigung | Constrained Decoding mit FSM |
| Zitanforderung | Keine (kann ohne Quelle antworten) | Verpflichtend (Kein Zitat = keine Ausgabe) |
| Verifikationsschicht | Keine (Modellausgabe wird vertraut) | Multi-Agenten-Auditor (Entailment-Prüfung) |
| Halluzinationsrate | MyCity: 100% bei Wohnungsanfragen | Architektonisch blockiert (0% möglich) |
| Audit-Trail | Minimal (Anfrage- + Antworttext) | Forensisch (Retrieval-Chunks, Scores, Zeitstempel) |
| Umgang mit Mehrdeutigkeit | „Selbstsicheres Raten“ (erfindet die Antwort) | Sichere Verweigerung (eskaliert an menschliche Spezialisten) |
| Aktualisierungsmechanismus | Komplettes Modell neu trainieren (Monate) | Graphknoten aktualisieren (Minuten) |
| Rechtliche Haftung | Hoch (Entrapment, Fahrlässigkeit, Produkthaftung) | Minimalisiert (deterministischer, auditierbarer Prozess) |
| EU-AI-Act-Konformität | Nicht konform (Genauigkeitsanforderung verletzt) | Für Hochrisiko-Einstufung ausgelegt |
Der MyCity-Chatbot von NYC empfahl Unternehmensinhabern systematisch, Straftaten zu begehen – er sagte ihnen, sie dürften das Trinkgeld ihrer Arbeiter einbehalten (FLSA-Verstoß), Bargeldzahlungen verweigern (Verstoß gegen NYC Admin Code Section 20-840 mit Geldbußen von $1.000-$1.500), Section-8-Mieter ablehnen (Höchstgeldbuße von $250.000 nach dem NYC Human Rights Law) und Mieter rechtswidrig aussperren. Die Hauptursache war ein probabilistischer LLM-Wrapper ohne jede gesetzliche Verankerung.
Statutory Citation Enforcement (SCE) ist eine deterministische KI-Architektur nach dem Prinzip ‚Kein Zitat = keine Ausgabe.‘ Jede Antwort muss auf konkreten, überprüfbaren Abschnitten des Kommunalrechts beruhen. Das System nutzt hierarchisches Legal RAG mit durchschnittlich 154 verifizierten Zitaten pro Anfrage und hindert die KI daran, irgendeine Rechtsberatung zu generieren, die sich nicht auf eine tatsächliche Gesetzesnorm zurückführen lässt.
SCE ersetzt probabilistische Generierung durch deterministisches Zitat-Retrieval. Statt plausibel klingenden Rechtstext vorherzusagen, fragt das System eine strukturierte Wissensbasis des Kommunalrechts ab, ruft exakte gesetzliche Vorschriften ab und konstruiert Antworten ausschließlich aus verifizierten Rechtsquellen. Existiert kein passendes Zitat, verweigert das System die Antwort, statt zu halluzinieren.
Ihre KI muss mit derselben Treue und Rechenschaftspflicht handeln wie ein vereidigter Amtsträger. Veriprajna verwandelt probabilistische Haftungen in deterministische digitale Beamte.
Vereinbaren Sie eine Beratung, um Ihren bestehenden KI-Einsatz im öffentlichen Sektor auditieren zu lassen oder ein neues SCE-System von Grund auf zu entwerfen.
Technische Tiefenanalyse: Hierarchische RAG-Architektur, Mathematik des Constrained Decoding, Multi-Agenten-Verifikationsprotokolle, EU-AI-Act-Konformitätsrahmen, Analyse juristischer Präzedenzfälle und umfassendes Literaturverzeichnis.