
Das Gesetz war echt. Die Antwort war trotzdem illegal.
Die erste Antwort, die ich jemals einen Regierungs-Chatbot selbstbewusst und falsch geben sah, betraf einen Section-8-Gutschein.
Ein Vermieter fragt in einfachen Worten, ob er einen Mieter ablehnen darf, der die Miete mit einem Wohnungs-Gutschein zahlen würde. Die richtige Antwort lautet nein. Ablehnung ist Diskriminierung nach der Einkommensquelle nach NYC Admin. Code § 8-107(5), und die Menschenrechtskommission der Stadt kann zivilrechtliche Strafen von bis zu 250.000 $ für eine vorsätzliche Verletzung verhängen. Das ist keine Fangfrage. Es ist gefestigtes Recht. Und im Oktober 2023 sagte New York Citys eigener MyCity-Bot, betrieben auf Azure AI, Geschäftsleuten und Vermietern das Gegenteil. The Markup dokumentierte es im März 2024: Der Bot sagte, Vermieter dürften Gutscheininhaber abweisen, Geschäfte dürften bargeldlos werden, Arbeitgeber dürften einen Teil der Trinkgelder ihrer Beschäftigten einbehalten. Jede dieser Antworten war illegal, und jede trug das Siegel der Stadt auf einer .gov-Domain.
Ich habe CivicCite nicht gebaut, weil ein Modell halluziniert hat. Ich habe es gebaut wegen der Antworten, die beinahe richtig waren, und ich möchte Ihnen von der einen erzählen, die verändert hat, wie ich über das ganze Problem denke. Wenn Sie die Sache selbst sehen wollen, lebt sie hier: veriprajna.com/de/demos/behorden-ki-die-das-gesetz-zitiert-oder-schweigt. Der Korpus ist ein synthetischer, aber treuer Demo-Graph, keine Rechtsberatung. Aber der Mechanismus ist real, und der Mechanismus ist der Teil, über den es sich zu streiten lohnt.
Der Moment, der bei mir hängen blieb, war nicht, dass der Bot ein Gesetz erfand. Es war, wie ich zusah, wie meine eigene Pipeline die richtige Vorschrift holte und trotzdem die falsche Antwort entwarf.
Die Woche, in der ich Abruf zu einem Problem hinzufügte, an das Abruf nicht heranreicht
Ich begann so, wie fast jeder in GovTech beginnt: überzeugt, dass die Lösung für einen lügenden Chatbot besserer Abruf sei. Gib dem Modell den tatsächlichen kommunalen Code. Verankere jede Antwort in einer echten Vorschrift. Retrieval-Augmented Generation, die Standardantwort auf die Standardangst, dass das Modell Dinge erfindet. Es ist eine saubere Geschichte, sie demonstriert sich wunderbar, und ich glaubte länger daran, als ich sollte.
Dann las ich die Stanford-Zahlen und sie ruinierten die Geschichte. Magesh und Kollegen maßen in einer 2025 in JELS veröffentlichten Studie die beiden zweckgebauten juristischen Recherchewerkzeuge, die genau das tun. Lexis+ AI halluzinierte bei 17 % der Anfragen. Westlaws AI-Assisted Research halluzinierte bei 33 %. Das sind keine Spielzeug-Chatbots. Das sind Systeme, die zuerst die Vorschrift abrufen und dann generieren, gebaut von Unternehmen, deren ganzes Geschäft darin besteht, beim Recht recht zu haben. Etwa jede dritte Antwort des zweiten Werkzeugs war trotzdem falsch. Der Abruf verbesserte den Entwurf. Er machte die Antwort nicht sicher zur Freigabe.
Ich will ehrlich sagen, wie sich das anfühlte, denn ich hatte gerade eine Woche damit verbracht, dieselbe Architektur zu bauen und mich clever dabei zu fühlen. Meine Pipeline zerlegte die Bürgerfrage in atomare rechtliche Teilfragen, rief Kandidatenvorschriften aus einem kommunalen-Code-Graphen ab und zwang das Modell, nur aus dem Abgerufenen zu entwerfen. Bei der Section-8-Frage machte es bis zum letzten Schritt alles richtig. Es fand § 8-107(5). Die richtige Vorschrift. Es zog den exakten Text über rechtmäßige Einkommensquellen. Und dann entwarf es einen Satz, der im Kern lautete: ja, Sie dürfen den Gutschein ablehnen.
Das richtige Gesetz. Die falsche Antwort. Übereinander in demselben Entwurf.
Der Abruf reicht dem Modell die richtige Vorschrift. Er tut nichts, um das Modell davon abzuhalten, diese Vorschrift rückwärts zu lesen.
Das war die Woche, in der das Problem für mich die Form wechselte. Ich hatte Halluzination als den Feind behandelt, und Halluzination ist real, aber es ist das Versagen, das man sich vorstellen kann zu erwischen. Das Versagen, das tatsächlich die MyCity-Antworten auslieferte, ist subtiler und schlimmer: die richtige Vorschrift zitiert, die falsche Schlussfolgerung behauptet. Nirgendwo in dem Satz eine Erfindung. Nichts, was ein „hast du das erfunden“-Filter fangen könnte, weil nichts erfunden wurde. Nur eine selbstbewusste Fehllektüre eines Gesetzes, das genau dort lag. Dieser Fehlermodus ist für den Abruf unsichtbar, weil der Abruf nur prüft, dass die Vorschrift vorhanden ist, nie dass der Satz sie richtig herum gelesen hat.
Was ist schlimmer, ein erfundenes Gesetz oder ein echtes, falsch gelesen?
Ich kam immer wieder auf diese Frage zurück, und meine Antwort wurde immer bestimmter. Das erfundene Gesetz ist das sicherere Versagen.
Denken Sie daran, was ein Bürger mit jedem tut. Eine offensichtlich erfundene Vorschrift liest sich seltsam, zitiert einen Codeabschnitt, der sich nicht auflöst, fühlt sich falsch an. Eine echte Vorschrift, rückwärts gelesen, liest sich perfekt. Sie hat ein echtes Zitat. Der Abschnitt existiert. Ein Vermieter liest „ja, Sie dürfen den Gutschein ablehnen“, sieht eine echte Code-Nummer angehängt und handelt danach. Nun gibt es eine illegale Ablehnung, einen Mieter mit einem Diskriminierungsanspruch und eine Papierspur zurück zu einer Regierungsantwort. Die Korrektheit des Zitats ist genau das, was die falsche Schlussfolgerung gefährlich macht. Es ist die Beglaubigung, mit der der schlechte Rat daherkommt.
Also war die Prüfung, die mir am meisten am Herzen lag, nie „ist dieses Zitat echt“. Es war „stützt dieses Zitat diesen Satz tatsächlich“. In der Pipeline ist diese Prüfung Entailment: Gegeben die entworfene Behauptung und der exakte Text der zitierten Vorschrift – impliziert der Text die Behauptung, widerspricht er ihr, oder keines von beiden. Beim Section-8-Entwurf wird das „ja“ des Modells als durch § 8-107(5) widersprochen gefangen, weil die Vorschrift klar das Gegenteil sagt. Der Entwurf stirbt dort. Was überlebt und was die Schranke schließlich freigibt, ist die korrigierte Behauptung: Ein Vermieter darf nicht ablehnen, und hier ist die Vorschrift, die das sagt.

Worauf ich bestand, und der Grund, warum dieser Bildschirm existiert, ist, dass Entailment keine Blackbox ist, der man glauben muss. Man kann die Verify-Stufe öffnen und ihren Roh-Input und -Output lesen: die entworfene Behauptung, den gesetzlichen Text, gegen den sie geprüft wurde, das Label und die Begründung in den eigenen Worten der Vorschrift. Ein Urteil, das man nicht inspizieren kann, ist keine Verifizierung. Es ist eine zweite Meinung mit besserer Produktionsqualität. Ich hatte bereits auf die teure Weise gelernt, dass man, wenn man ein Modell über ein anderes schiedsrichterlich entscheiden lässt, nur zwei Modelle erhält, die übereinstimmen – und das ist eine schwächere Sache, als es aussieht.
Der Schritt, der schließlich funktionierte, war, aufzuhören zu versuchen, das Modell vertrauenswürdig zu machen
Ich erinnere mich an die genaue Umformulierung, weil sie sich anfühlte wie Aufgeben und sich als das ganze Design herausstellte. Ich hörte auf zu versuchen, das Modell vertrauenswürdig zu machen, und begann, seine Vertrauenswürdigkeit irrelevant zu machen.
Die Verschiebung lautet so. Das Sprachmodell in CivicCite ist ein Berater. Es zerlegt die Frage, es entwirft eine Kandidatenantwort, es bietet eine Entailment-Meinung. Es darf nie etwas freigeben. Außerhalb des Agenten-Frameworks, in schlichtem deterministischem Python, sitzt etwas, das ich die Gesetzliche Entscheidungsschranke nenne, und sie gibt eine Teilantwort nur frei, wenn vier Bedingungen gleichzeitig gelten: das Zitat existiert, die Vorschrift ist in Kraft, der zitierte Text impliziert die Behauptung, und nichts widerspricht ihr. Fehlt eine, wird die Antwort nicht ausgeliefert. Zwei dieser Prüfungen sind reine Arithmetik und Logik. In Kraft ist ein Datumsvergleich: Die Vorschrift hat kein Aufhebungsdatum und ihr Inkrafttretungsdatum liegt am oder vor dem Stichtag. Konflikt ist ein Graph-Lesen. Es gibt keinen Prompt, keine Temperatur, kein Überreden.

Ich sage jetzt ständig zwei Sätze. Einer ist die Agenten beraten, die Schranke entscheidet. Der andere ist, dass ein LLM sich nicht selbst an der Schranke vorbeistimmen kann, egal wie selbstbewusst sein Entwurf ist. Das zählt mehr, als es klingt, denn das verführerische Versagen in diesem ganzen Feld ist, das Modell seine eigene Arbeit benoten zu lassen und die Note „Verifizierung“ zu nennen. Ein Modell, das die Antwort entwirft, kann nicht das sein, was zertifiziert, dass die Antwort sicher ist. Die Schranke ist absichtlich dümmer als das Modell und absichtlich außerhalb davon, und das ist der ganze Punkt. Die Intelligenz schlägt vor. Der Code verfügt.
Das Modell ist ein guter Schreiber und ein schlechter Richter. Also lasse ich es schreiben, und ich lasse es nie richten.
Die Demo ist ehrlich über ihre Grenzen, und ich werde es auch sein. Der Korpus ist ein synthetischer, aber treuer Graph kommunalen Rechts, paraphrasiert aus echten Vorschriften, keine amtliche Quelle. Die 311-Eskalationsweiterleitung wird berechnet und gezeigt, aber der Konnektor zu einem echten Fallsystem ist nur als Stub vorhanden. Das eingeschränkte Entwerfen nutzt einen Allowlist-Validator und ein erneutes Nachfragen statt produktionsreifer Token-Level-Dekodierung. Was real ist, ist die Entscheidungslogik, und die Entscheidungslogik ist das Produkt.
Warum ich der Stille mehr vertraue als einer guten Antwort
Ich hatte nicht erwartet, stolz darauf zu sein, dass die Demo eine Antwort verweigert, und jetzt ist es meine Lieblingssache, die sie tut. Das klarste Beispiel ist ein Foodtruck.
Ein Anbieter fragt, ob er seinen Wagen unter der allgemeinen Anbieter-Parkregel den ganzen Tag an einem Parkscheinautomaten-Platz stehen lassen darf. Der schlichte Assistent antwortet fröhlich und falsch und zitiert eine Regel, als wäre sie live. CivicCite entwirft auch einen Kandidaten, und der Kandidat zitiert eine Parkvorschrift, die aufgehoben wurde. Dann läuft die Aktualitätsprüfung. Die Vorschrift hat ein Aufhebungsdatum. In Kraft scheitert. Und statt auf irgendeine benachbarte Regel zurückzufallen und zu bluffen, hält die Schranke die Antwort zurück, markiert die Frage als außerhalb der verifizierten Abdeckung und leitet sie mit den Teilergebnissen an eine aktive Abteilung weiter.

Eine falsche Antwort auf einer Regierungsdomain ist keine Peinlichkeit. Sie ist eine Haftung mit dem Namen der Stadt darauf.
Sehen Sie, was dieser Bildschirm sich weigert zu tun. Er synthetisiert keine plausible Antwort aus einem toten Gesetz. Er sagt in klarer Sprache, dass die einzige Vorschrift dazu aufgehoben wurde und derzeit nichts in Kraft die Frage regelt, und er übergibt den Bürger, statt zu raten. Ehrliche Enthaltung schlägt eine selbstbewusste falsche Antwort, besonders in der Regierung. Und in der Regierung geht es bei den Einsätzen nicht um den Ruf. Regierungsrechtliche Beratung sitzt in der proprietary-function-Zone, was bedeutet, dass es keinen Schild der souveränen Immunität gibt, hinter dem man sich verstecken kann, wenn die Antwort sich als falsch herausstellt.
Das ist keine hypothetische Sorge mehr, was ein Teil davon ist, warum ich die Sache jetzt statt später gebaut habe. Es gab 78 chatbotbezogene Gesetzentwürfe in 27 Bundesstaaten im Jahr 2026. New Yorks S7263 gelangte am 26. Februar 2026 auf die Tagesordnung des Senats. Die Hochrisiko-Pflichten aus Anhang III der EU-KI-Verordnung werden am 2. August 2026 durchsetzbar, mit Strafen von bis zu 15 Mio. € oder 3 % des weltweiten Umsatzes. Die regulatorische Frage verschiebt sich von „ist Ihre KI hilfreich“ zu „können Sie beweisen, dass Ihre KI das sagen durfte“. Stille können Sie verteidigen. Eine selbstbewusste falsche Antwort nicht.
Die Zahl, auf die ein Regulierer tatsächlich handeln kann
Früher dachte ich, die Schlagzeilenmetrik für ein solches System sei eine Halluzinationsrate, und jetzt denke ich, dass dieser Instinkt genau umgekehrt ist. Ein Prozentsatz ist das Falsche, was man einem Regulierer in die Hand gibt.
Stellen Sie sich vor, Sie sind die Rechtsabteilung der Stadt, das Amt, dem die Haftung gehört, wenn eine Antwort schiefgeht. „Unser Chatbot halluziniert nur 4 % der Zeit“ ist nicht beruhigend. Es ist ein Eingeständnis, dass vier von hundert Bürgern eine Antwort mit der Autorität der Stadt dahinter bekommen und nichts hinter der Antwort steht. Die Zahl, die etwas bedeutet, geht nicht darum, wie oft das Modell falschliegt. Sie geht darum, ob jemals etwas Unverifiziertes aus der Tür gelassen wurde. Also ist die Metrik, um die ich den Benchmark gebaut habe, diese: auf einem festen, gelabelten 12-Anfragen-Goldstandard-Set, durch die echte Pipeline gelaufen, die Anzahl der Antworten, die ohne verifizierte, in Kraft befindliche gesetzliche Grundlage freigegeben wurden. Das Ziel ist null von zwölf.
Eine Halluzinationsrate sagt einem Regulierer, wie oft Sie versagt haben. Sie kann ihnen nicht sagen, dass Sie es erwischt haben.

Ich will präzise sein über das, was diese Zahl ist und nicht ist, denn sie zu überziehen würde die ganze Prämisse verraten. Es ist ein Ergebnis auf einem festen gelabelten Set, keine Open-World-Garantie und nicht „null Halluzination“, eine Phrase, die meiner Meinung nach kein ehrlicher Mensch verkaufen sollte. Das Modell entwirft immer noch unvollkommene Behauptungen. Der Punkt ist, dass die unverifizierten zurückgehalten werden, nicht dass sie nie entworfen werden. Neben dieser Zahl sitzen zwei weitere: 100 % Audit-Record-Abdeckung, bedeutet ein einreichbarer Record pro Anfrage, ob sie ausgeliefert oder verweigert wird, und Disposition-Übereinstimmung mit der gelabelten Ground Truth. Die Plain-RAG-Baseline, die MyCity-Architektur ohne Schranke, hätte die dokumentierten illegalen Antworten auf demselben Set ausgeliefert. Dieser Vergleich ist Kontext, nicht die Schlagzeile.
Der Record ist der Teil, den ich am härtesten verteidigen würde.

Jede Anfrage, freigegeben oder verweigert, erzeugt einen Gesetzlichen Entscheidungsnachweis: die Disposition, das Zitat, alle vier Prüfungsergebnisse, die Entscheidung, als strukturierte Daten, die man einreichen und erneut ausführen kann. Er nennt NIST-AI-RMF-Logging und FedRAMP- und StateRAMP-Continuous-Monitoring als die Standards, auf die er hingebaut ist. Ich bin vorsichtig mit diesem Satz. „Hingebaut“ ist eine Richtung, keine Zertifizierung, und ich werde nicht behaupten, CivicCite sei gegen irgendeinen davon zertifiziert. Aber ein Auditor will kein Versprechen, dass das Modell klug ist. Ein Auditor will einen Record, pro Interaktion, der genau zeigt, warum eine Antwort existieren durfte, in einer Form, die dem Versuch standhält, sie zu zerbrechen. Reproduzierbarkeit ist das, was eine Entscheidung zu Beweismaterial macht, und Beweismaterial ist das, worauf ein Regulierer handeln kann.
Und wenn Sie lieber zuschauen, als mich beschreiben zu hören, hier ist die ganze Demo von Ende zu Ende.
Die Frage, mit der ich zurückbleibe
Ich kehre immer wieder zu etwas zurück, das mich an meiner eigenen Reaktion überraschte. Das erste Mal, als ich zusah, wie CivicCite eine Frage verweigerte und an eine Abteilung weiterleitete, las ein Teil von mir es als Versagen des Systems.
Es versagte nicht. Es tat das eine, was die selbstbewussten Bots nicht können: die Grenze dessen kennen, was es beweisen kann, und dort stoppen. Ich hatte so lange für eine gute Antwort optimiert, dass ich stillschweigend angenommen hatte, eine gute Antwort sei das Ziel. Das ist sie nicht. In der Regierung ist das Ziel eine verteidigungsfähige Antwort, und der Abstand zwischen diesen beiden Worten ist der ganze Grund, warum dieses Produkt existiert. Eine verteidigungsfähige Antwort sieht manchmal wie ein freigegebenes Zitat aus. Ebenso oft sieht sie aus wie eine weitergeleitete Frage und ein abgelegter Record.
Also ist die Frage, die ich jedem hinterlassen würde, der KI für eine Regierung baut oder sie kauft, nicht „wie genau ist Ihr Modell“. Bessere Modelle werden immer besser darin, flüssige, im Kontext falsche Antworten zu schreiben, weil Flüssigkeit nie das fehlende Stück war. Die Frage, die ich stelle, bevor irgendetwas die Schranke verlässt, ist enger und härter. Können Sie jetzt beweisen, dass genau diese Antwort auf eine Vorschrift zurückgeht, die existiert und derzeit in Kraft ist, und würde dieser Beweis ein Gericht überstehen, das wollte, dass er scheitert? Wenn die Antwort nein ist, spielt es keine Rolle, wie gut das Modell ist. Das System sollte schweigen. Sie können zusehen, wie es entscheidet, so oder so, hier: veriprajna.com/de/demos/behorden-ki-die-das-gesetz-zitiert-oder-schweigt.
Vertrauen gehört nicht in ein Modell, dem man glauben muss. Es gehört in Code, den man auditieren kann.


