Die Governance-Schicht oberhalb des Behörden-Chatbots
Eine falsche Antwort auf der .gov-Domain einer Stadt trägt das Siegel der Stadt. CivicCite gibt eine Bürgerantwort nur frei, wenn sie eine Vorschrift trägt, die existiert, in Kraft ist, vom zitierten Text impliziert wird und konfliktfrei ist. Andernfalls enthält sie sich, eskaliert an die zuständige Stelle und legt einen Nachweis ab. Die Agenten beraten; das Tor entscheidet.
0 / 12
Antworten, die ohne geprüfte, in Kraft befindliche gesetzliche Grundlage freigegeben wurden
Zielwert auf dem festen 12-Anfragen-Golden-Set
100%
Abdeckung durch gesetzliche Entscheidungsnachweise
Ein einreichbarer Nachweis pro Anfrage, Freigabe oder Ablehnung
4
Torbedingungen, alle für die Freigabe erforderlich
Existiert, in Kraft, impliziert, konfliktfrei
Dies ist eine lauffähige Demo auf einem synthetischen, aber getreuen Korpus von 12 kommunalen Vorschriften. Die Übernahme des kommunalen Rechts und der 311-Eskalationskonnektor sind simuliert; das deterministische Tor und der Nachweis laufen genau wie gezeigt. Keine Rechtsberatung.
Der Fehlermodus, den CivicCite schließen soll.
Behörden-Chatbots geben Bürgern selbstsichere rechtliche Antworten, die falsch sind, und jede falsche Antwort trägt das Siegel der Stadt. Der MyCity-Bot von NYC, gestartet im Oktober 2023, wurde von The Markup (März 2024) dokumentiert: Vermietern sagte er, sie dürften Gutscheine nach Section 8 ablehnen, Unternehmen, sie dürften bargeldlos arbeiten, Arbeitgebern, sie dürften Trinkgelder der Beschäftigten einbehalten. Jede dieser Antworten war rechtswidrig.
Retrieval hinzuzufügen behebt das nicht. Forscher von Stanford und JELS (Magesh et al., 2025) maßen bei Lexis+ AI 17 Prozent und bei Westlaw AI-Assisted Research 33 Prozent Halluzination. Der Abruf holt die Vorschrift; die Generierung liest sie trotzdem falsch oder übergeht sie. Der gefährliche Fall ist kein erfundenes Zitat. Es ist die richtige Vorschrift, zitiert mit der falschen Schlussfolgerung, oder eine aufgehobene Bestimmung, zitiert, als wäre sie noch in Kraft.
Die Exposition ist real und wächst. Es gibt 78 Chatbot-Gesetzesvorhaben in 27 Bundesstaaten im Jahr 2026, New Yorks S7263 erreichte am 26. Februar 2026 den Senatsplenarsaal, und die Hochrisiko-Pflichten nach Anhang III des EU AI Act werden am 2. August 2026 durchsetzbar, mit Bußgeldern bis zu 15 Millionen Euro oder 3 Prozent des Umsatzes. Rechtliche Beratung durch die öffentliche Hand liegt in der Zone der proprietary function, daher gibt es keinen Schutz durch Sovereign Immunity. Die dauerhafte Anforderung ist kein besseres Modell. Es ist der Nachweis gegenüber einer Aufsichtsbehörde, dass jede freigegebene Antwort auf geltendes Recht zurückgeht.
LLM-Agenten beraten. Deterministischer Code außerhalb des Agenten-Frameworks entscheidet, was freigegeben wird. Ein LLM kann sich nicht selbst am Tor vorbei stimmen.
Jede Bürgeranfrage läuft von links nach rechts: Decompose, dann Retrieve, dann Draft, dann Verify, dann das Tor, dann der Nachweis. Decompose (LLM, beratend) teilt die Anfrage in atomare rechtliche Teilfragen. Retrieve (deterministisch, kein LLM) durchläuft einen kuratierten Wissensgraphen des kommunalen Rechts mit lexikalischer Suche und hierarchischer Traversierung von Querverweisen, und jeder Kandidat trägt seine Zitat-ID, den Text, das Inkrafttretensdatum, das Aufhebungsdatum, die Sanktion und die Behörde. Draft (LLM, eingeschränkt) schlägt eine Behauptung plus ein Zitat vor, das nur aus der abgerufenen Menge stammt, durchgesetzt durch einen Allowlist-Validator und eine erneute Nachfrage.
Verify führt drei Prüfungen pro entworfener Behauptung aus, und das Tor kombiniert sie mit einer Bedingung „Zitat existiert“. Es gibt eine Teilantwort nur frei, wenn alle vier gelten.
Die zitierte Zitat-ID löst sich zu einer echten Bestimmung im Graphen des kommunalen Rechts auf. Eine entworfene Antwort kann keine Abschnittsnummer erfinden, die nicht in der abgerufenen Menge liegt.
Deterministisch: die Bestimmung hat kein Aufhebungsdatum und ein Inkrafttretensdatum am oder vor dem Stichtag. Eine aufgehobene oder noch nicht wirksame Bestimmung kann niemals eine freigegebene Antwort tragen.
Beratende LLM-Prüfung: stützt der zitierte Text die Behauptung tatsächlich und liefert impliziert, widersprochen oder neutral? Das fängt die richtige Vorschrift, zitiert mit der falschen Schlussfolgerung.
Deterministisch: es liest conflicts-with-Kanten im Graphen, unabhängig vom Implikationsurteil, sodass zwei einander widersprechende Bestimmungen nicht stillschweigend eine freigegebene Antwort erzeugen.
Das Gesetzliche Entscheidungstor ist deterministisches Python, das außerhalb des Agenten-Frameworks liegt. Es gibt eine Teilantwort nur frei, wenn das Zitat existiert und die Bestimmung in Kraft ist und der zitierte Text impliziert und kein Konflikt vorliegt. Andernfalls hält es die Teilantwort zurück, markiert sie als außerhalb der geprüften Abdeckung und leitet sie an die zuständige Stelle. Pro Anfrage aggregiert es zu einer von drei Dispositionen: RELEASED, PARTIAL oder REFUSED and ESCALATED.
Für jede Anfrage, Freigabe oder Ablehnung, erzeugt ein deterministischer Schreiber einen Gesetzlichen Entscheidungsnachweis: die Teilfragen, die vier Prüfungen und ihre Urteile, das Zitat, die Disposition und das Eskalationsziel, wenn etwas zurückgehalten wurde. Das ist das Artefakt, auf das eine Rechtsabteilung und eine Aufsichtsbehörde handeln können, und deshalb ist die dauerhafte Metrik beweisbare Nicht-Freigabe, nicht eine Halluzinationsrate.
Aktualität Stand 2026-06-17. Jedes Bild unten ist ein Screenshot der laufenden App.
Ein Vermieter fragt, ob er einen Mieter ablehnen darf, der die Miete mit einem Gutschein nach Section 8 zahlen würde. Der Standard-Assistent liefert das selbstsichere, rechtswidrige „Ja.“ CivicCite entwirft ebenfalls ein „Ja“, aber die Implikationsprüfung liest es als widersprochen durch NYC Admin. Code section 8-107(5), das Diskriminierung nach Einkommensquelle für unzulässig erklärt (NYC Commission on Human Rights, zivilrechtliche Bußgelder bis zu 250.000 Dollar bei vorsätzlichen Verstößen). Das Tor blockiert den Entwurf und gibt stattdessen das korrekte, zitiergestützte „Nein“ frei, markiert als geprüft, impliziert und in Kraft. Das linke Panel ist ein reiner Retrieval-Chatbot ohne Prüfungstor; das rechte Panel ist CivicCite mit der vollen Pipeline.
Jede Stufe ist anklickbar für ihre rohen Ein- und Ausgaben. Die Verify-Stufe zeigt die entworfene Behauptung und ihre Zitat-ID als Eingang und das Implikationsurteil als Ausgang: impliziert, mit der Begründung, die die genaue Vorschriftensprache zitiert über die Ablehnung der Vermietung wegen einer rechtmäßigen Einkommensquelle, zu der Wohngutscheine nach Section 8 gehören. Das ist die Prüfung, die die richtige Vorschrift mit der richtigen Schlussfolgerung von der richtigen Vorschrift mit der falschen trennt.
Ein Food-Truck-Betreiber fragt nach ganztägigem Parken an einem gebührenpflichtigen Stellplatz unter der allgemeinen General-Vendor-Parkregel. Die einzige Bestimmung, die das regeln würde, ist aufgehoben, und keine derzeit in Kraft befindliche Bestimmung regelt die Frage. Die Aktualitätsprüfung schlägt fehl, daher synthetisiert CivicCite keine Antwort. Es hält zurück, leitet die Frage an die allgemeine Aufnahme von NYC 311 mit den Teilergebnissen weiter und gibt die Disposition REFUSED and ESCALATED zurück. Ehrliche Enthaltung schlägt eine selbstsichere falsche Antwort.
Jede Anfrage, Freigabe oder Ablehnung, erzeugt einen Gesetzlichen Entscheidungsnachweis. Er erfasst die Teilfrage, ihren Bereich, die entworfene Behauptung und das Zitat, die vier Prüfungen mit ihren booleschen Urteilen, die Entscheidung, das Implikationslabel und jeden Rückhaltegrund oder jedes Eskalationsziel. Er nennt auch die Standards, denen er zugeordnet ist, NIST AI RMF Governance und Measurement-Logging sowie FedRAMP- und StateRAMP-Continuous-Monitoring, als Ausrichtungsrichtung, nicht als Zertifizierung.
Der Korpus umfasst 12 Bestimmungen in 7 Titeln, Aktualität Stand 2026-06-17. In-Kraft-Knoten sind grün, der eine bewusst aufgehobene Knoten ist rot und gestrichelt, und Querverweis-Kanten sind dargestellt, damit die Retrieval-Traversierung sichtbar ist. Über das feste 12-Anfragen-Golden-Set (die vier dokumentierten MyCity-Fehler, ein bereichsübergreifender Food-Truck-Fall, eine Falle nur-aufgehoben und eine Falle ohne Abdeckung) meldet die App 0 von 12 Antworten, die ohne geprüfte, in Kraft befindliche gesetzliche Grundlage freigegeben wurden, 100 Prozent Abdeckung durch Audit-Nachweise und 100 Prozent Übereinstimmung der Disposition mit der gelabelten Ground Truth. Wir ordnen diese Zahlen diesem gelabelten Golden Set zu, niemals als Open-World-Garantie.
Derselbe geteilte Bildschirm, gegen den die Demo vergleicht, nebeneinander.
| Dimension | Standard-Chatbot (die MyCity-Architektur) | CivicCite Gesetzliches Entscheidungstor |
|---|---|---|
| Wer entscheidet, was freigegeben wird | Das LLM liefert, was es entworfen hat | Deterministisches Python-Tor außerhalb der Agenten |
| Richtige Vorschrift, falsche Schlussfolgerung | Wird unverändert ausgeliefert | Erfasst durch die Implikationsprüfung |
| Aufgehobene Bestimmung zitiert | Wird unverändert ausgeliefert | Erfasst durch die Aktualitätsprüfung |
| Keine Vorschrift deckt die Frage | Synthetisiert trotzdem eine Antwort | Enthält sich und eskaliert an die zuständige Stelle |
| Audit-Trail | Keine | Ein Gesetzlicher Entscheidungsnachweis pro Anfrage |
| Beweisbare Nicht-Freigabe | Nicht gemessen | 0 von 12 auf dem gelabelten Golden Set |
Nein. CivicCite ist kein Chatbot und keine Suchmaschine für kommunales Recht. Es ist eine Governance-Schicht, die oberhalb der Chatbot-Plattform sitzt, das Stück, das Cloud-KI-Dienste und GovTech-Anbieter nicht haben. Ein deterministisches Python-Tor außerhalb des Agenten-Frameworks gibt eine Bürgerantwort nur frei, wenn ihr Zitat existiert, in Kraft ist, vom zitierten Text impliziert wird und konfliktfrei ist. Der Chatbot in der Demo ist eine synthetische Requisite; das Tor ist das Produkt.
Das LLM berät nur. Es zerlegt die Frage und entwirft eine Behauptung mit einem Zitat, das nur aus der abgerufenen Menge stammt. Dann prüft deterministischer Code, dass die zitierte Vorschrift existiert, zum Stichtag in Kraft ist, vom zitierten Text impliziert wird und keinen Konflikt trägt, und das Tor gibt nur frei, wenn alle vier gelten. Bei der echten MyCity-Anfrage zu Gutscheinen nach Section 8 wird das entworfene „Ja“ von der Implikationsprüfung als widersprochen durch NYC Admin. Code section 8-107(5) erfasst, und das Tor gibt stattdessen das korrekte, zitiergestützte „Nein“ frei.
Retrieval verbessert den Entwurf, kann aber nicht beweisen, dass die Antwort zur Freigabe sicher ist. Forscher von Stanford und JELS (Magesh et al., 2025) maßen, dass retrieval-gestützte juristische KI weiterhin halluziniert, mit 17 Prozent bei Lexis+ AI und 33 Prozent bei Westlaw AI-Assisted Research. Selbst mit einem perfekten Modell muss eine Behörde einer Aufsichtsbehörde nachweisen, dass jede freigegebene Antwort auf geltendes Recht zurückgeht. Dieser Nachweis ist eine Eigenschaft eines deterministischen Tors und eines einreichbaren Nachweises, nicht eines stärkeren Autors.
Jede Anfrage erzeugt einen Gesetzlichen Entscheidungsnachweis, Freigabe oder Ablehnung, daher ist die Prüfungsabdeckung auf dem Golden Set 100 Prozent. Jeder Nachweis erfasst die Teilfragen, die vier Prüfungen mit ihren Urteilen, das Zitat, die Disposition und wohin ein unbeantworteter Teil eskaliert wurde. Die Schlagzeile, auf die eine Aufsichtsbehörde handeln kann, ist kein Halluzinationsprozentsatz. Es ist, dass Antworten ohne geprüfte, in Kraft befindliche gesetzliche Grundlage als null nachweisbar sind, gestützt durch einen Nachweis für jede Interaktion.
Es ist nicht zertifiziert, und wir behaupten das nicht. Der regulatorische Rahmen ist Ausrichtung und Richtung, keine Zertifizierung. Der Gesetzliche Entscheidungsnachweis ist so entworfen, dass er NIST-AI-RMF-Dokumentation sowie FedRAMP- und StateRAMP-Continuous-Monitoring-Logging zugeordnet werden kann, sodass das Artefakt, das ein Compliance-Team braucht, standardmäßig entsteht. Die FedRAMP- oder StateRAMP-Autorisierungsgrenze wird von der Hosting-Umgebung geerbt und liegt außerhalb des Umfangs einer lokalen Demo.
Es ist eine lauffähige Demo, die den Mechanismus belegt, kein Deployment, und es ist keine Rechtsberatung. Der Korpus ist ein synthetischer, aber getreuer Demo-Graph von 12 Bestimmungen: der operative Text ist paraphrasiert aus realen referenzierten Bestimmungen des NYC Administrative Code, NY Labor Law und NYC Health Code, mit realistischen Bezeichnungen, Behörden, Sanktionen und Daten. Die Übernahme des kommunalen Rechts und der 311-Eskalationskonnektor sind simuliert; die deterministischen Prüfungen, das Tor und der Nachweis laufen genau wie gezeigt.
Die Forschung hinter dieser Demo — die Architektur, das Prüfdesign und der Enterprise-Blueprint.
Vollständige Lösung
Die Lösung Government AI That Cites the Law erkunden →Der Nachweis, dass jede Antwort auf geltendes Recht zurückgeht, ist der harte Teil. Wir bauen ihn.
Wenn Ihre Behörde abwägt, wie Bürger KI-Antworten erhalten können, ohne eine falsche unter dem Namen der Stadt auszuliefern, hören wir gerne, wie Sie und Ihre Rechtsabteilung darüber denken. Das Problem greift über Bundesstaaten hinweg um sich, und die Antworten werden das ebenfalls tun.