Die Governance-Schicht oberhalb des Behörden-Chatbots

Behörden-KI, die das Gesetz zitiert — oder schweigt.

Eine falsche Antwort auf der .gov-Domain einer Stadt trägt das Siegel der Stadt. CivicCite gibt eine Bürgerantwort nur frei, wenn sie eine Vorschrift trägt, die existiert, in Kraft ist, vom zitierten Text impliziert wird und konfliktfrei ist. Andernfalls enthält sie sich, eskaliert an die zuständige Stelle und legt einen Nachweis ab. Die Agenten beraten; das Tor entscheidet.

0 / 12

Antworten, die ohne geprüfte, in Kraft befindliche gesetzliche Grundlage freigegeben wurden

Zielwert auf dem festen 12-Anfragen-Golden-Set

100%

Abdeckung durch gesetzliche Entscheidungsnachweise

Ein einreichbarer Nachweis pro Anfrage, Freigabe oder Ablehnung

4

Torbedingungen, alle für die Freigabe erforderlich

Existiert, in Kraft, impliziert, konfliktfrei

Dies ist eine lauffähige Demo auf einem synthetischen, aber getreuen Korpus von 12 kommunalen Vorschriften. Die Übernahme des kommunalen Rechts und der 311-Eskalationskonnektor sind simuliert; das deterministische Tor und der Nachweis laufen genau wie gezeigt. Keine Rechtsberatung.

Eine selbstsichere falsche Antwort auf einer Stadt-Domain ist eine Haftung, kein Feature

Der Fehlermodus, den CivicCite schließen soll.

Behörden-Chatbots geben Bürgern selbstsichere rechtliche Antworten, die falsch sind, und jede falsche Antwort trägt das Siegel der Stadt. Der MyCity-Bot von NYC, gestartet im Oktober 2023, wurde von The Markup (März 2024) dokumentiert: Vermietern sagte er, sie dürften Gutscheine nach Section 8 ablehnen, Unternehmen, sie dürften bargeldlos arbeiten, Arbeitgebern, sie dürften Trinkgelder der Beschäftigten einbehalten. Jede dieser Antworten war rechtswidrig.

Retrieval hinzuzufügen behebt das nicht. Forscher von Stanford und JELS (Magesh et al., 2025) maßen bei Lexis+ AI 17 Prozent und bei Westlaw AI-Assisted Research 33 Prozent Halluzination. Der Abruf holt die Vorschrift; die Generierung liest sie trotzdem falsch oder übergeht sie. Der gefährliche Fall ist kein erfundenes Zitat. Es ist die richtige Vorschrift, zitiert mit der falschen Schlussfolgerung, oder eine aufgehobene Bestimmung, zitiert, als wäre sie noch in Kraft.

Die Exposition ist real und wächst. Es gibt 78 Chatbot-Gesetzesvorhaben in 27 Bundesstaaten im Jahr 2026, New Yorks S7263 erreichte am 26. Februar 2026 den Senatsplenarsaal, und die Hochrisiko-Pflichten nach Anhang III des EU AI Act werden am 2. August 2026 durchsetzbar, mit Bußgeldern bis zu 15 Millionen Euro oder 3 Prozent des Umsatzes. Rechtliche Beratung durch die öffentliche Hand liegt in der Zone der proprietary function, daher gibt es keinen Schutz durch Sovereign Immunity. Die dauerhafte Anforderung ist kein besseres Modell. Es ist der Nachweis gegenüber einer Aufsichtsbehörde, dass jede freigegebene Antwort auf geltendes Recht zurückgeht.

So funktioniert das Gesetzliche Entscheidungstor

LLM-Agenten beraten. Deterministischer Code außerhalb des Agenten-Frameworks entscheidet, was freigegeben wird. Ein LLM kann sich nicht selbst am Tor vorbei stimmen.

Jede Bürgeranfrage läuft von links nach rechts: Decompose, dann Retrieve, dann Draft, dann Verify, dann das Tor, dann der Nachweis. Decompose (LLM, beratend) teilt die Anfrage in atomare rechtliche Teilfragen. Retrieve (deterministisch, kein LLM) durchläuft einen kuratierten Wissensgraphen des kommunalen Rechts mit lexikalischer Suche und hierarchischer Traversierung von Querverweisen, und jeder Kandidat trägt seine Zitat-ID, den Text, das Inkrafttretensdatum, das Aufhebungsdatum, die Sanktion und die Behörde. Draft (LLM, eingeschränkt) schlägt eine Behauptung plus ein Zitat vor, das nur aus der abgerufenen Menge stammt, durchgesetzt durch einen Allowlist-Validator und eine erneute Nachfrage.

Die vier Prüfungen, die das Tor verlangt

Verify führt drei Prüfungen pro entworfener Behauptung aus, und das Tor kombiniert sie mit einer Bedingung „Zitat existiert“. Es gibt eine Teilantwort nur frei, wenn alle vier gelten.

1. Zitat existiert

Die zitierte Zitat-ID löst sich zu einer echten Bestimmung im Graphen des kommunalen Rechts auf. Eine entworfene Antwort kann keine Abschnittsnummer erfinden, die nicht in der abgerufenen Menge liegt.

2. In Kraft (Aktualität)

Deterministisch: die Bestimmung hat kein Aufhebungsdatum und ein Inkrafttretensdatum am oder vor dem Stichtag. Eine aufgehobene oder noch nicht wirksame Bestimmung kann niemals eine freigegebene Antwort tragen.

3. Impliziert

Beratende LLM-Prüfung: stützt der zitierte Text die Behauptung tatsächlich und liefert impliziert, widersprochen oder neutral? Das fängt die richtige Vorschrift, zitiert mit der falschen Schlussfolgerung.

4. Konfliktfrei

Deterministisch: es liest conflicts-with-Kanten im Graphen, unabhängig vom Implikationsurteil, sodass zwei einander widersprechende Bestimmungen nicht stillschweigend eine freigegebene Antwort erzeugen.

Das Tor und der Nachweis

Das Gesetzliche Entscheidungstor ist deterministisches Python, das außerhalb des Agenten-Frameworks liegt. Es gibt eine Teilantwort nur frei, wenn das Zitat existiert und die Bestimmung in Kraft ist und der zitierte Text impliziert und kein Konflikt vorliegt. Andernfalls hält es die Teilantwort zurück, markiert sie als außerhalb der geprüften Abdeckung und leitet sie an die zuständige Stelle. Pro Anfrage aggregiert es zu einer von drei Dispositionen: RELEASED, PARTIAL oder REFUSED and ESCALATED.

Für jede Anfrage, Freigabe oder Ablehnung, erzeugt ein deterministischer Schreiber einen Gesetzlichen Entscheidungsnachweis: die Teilfragen, die vier Prüfungen und ihre Urteile, das Zitat, die Disposition und das Eskalationsziel, wenn etwas zurückgehalten wurde. Das ist das Artefakt, auf das eine Rechtsabteilung und eine Aufsichtsbehörde handeln können, und deshalb ist die dauerhafte Metrik beweisbare Nicht-Freigabe, nicht eine Halluzinationsrate.

Der Fang, von Anfang bis Ende durchgespielt

Aktualität Stand 2026-06-17. Jedes Bild unten ist ein Screenshot der laufenden App.

Die echte MyCity-Anfrage zu Section 8, erfasst durch Implikation

Ein Vermieter fragt, ob er einen Mieter ablehnen darf, der die Miete mit einem Gutschein nach Section 8 zahlen würde. Der Standard-Assistent liefert das selbstsichere, rechtswidrige „Ja.“ CivicCite entwirft ebenfalls ein „Ja“, aber die Implikationsprüfung liest es als widersprochen durch NYC Admin. Code section 8-107(5), das Diskriminierung nach Einkommensquelle für unzulässig erklärt (NYC Commission on Human Rights, zivilrechtliche Bußgelder bis zu 250.000 Dollar bei vorsätzlichen Verstößen). Das Tor blockiert den Entwurf und gibt stattdessen das korrekte, zitiergestützte „Nein“ frei, markiert als geprüft, impliziert und in Kraft. Das linke Panel ist ein reiner Retrieval-Chatbot ohne Prüfungstor; das rechte Panel ist CivicCite mit der vollen Pipeline.

Geteilter Bildschirm: ein Standard-Retrieval-Chatbot liefert links eine ungeprüfte Antwort auf die Anfrage zu Gutscheinen nach Section 8, während CivicCite rechts die Pipeline Decompose, Retrieve, Draft, Verify, Gate durchläuft und die Antwort nur gegen NYC Admin. Code section 8-107(5) freigibt, markiert als geprüft und in Kraft.
Links: Standard-Assistent, keine gesetzliche Grundlage, unverändert ausgeliefert. Rechts: CivicCite-Tor RELEASED, gestützt auf ein geprüftes, in Kraft befindliches Zitat.

Innerhalb der Verify-Stufe, am zitierten Text

Jede Stufe ist anklickbar für ihre rohen Ein- und Ausgaben. Die Verify-Stufe zeigt die entworfene Behauptung und ihre Zitat-ID als Eingang und das Implikationsurteil als Ausgang: impliziert, mit der Begründung, die die genaue Vorschriftensprache zitiert über die Ablehnung der Vermietung wegen einer rechtmäßigen Einkommensquelle, zu der Wohngutscheine nach Section 8 gehören. Das ist die Prüfung, die die richtige Vorschrift mit der richtigen Schlussfolgerung von der richtigen Vorschrift mit der falschen trennt.

Das Detailpanel der Verify-Stufe zeigt die entworfene Behauptung und ihre Zitat-ID als Eingabe und die Implikationsausgabe mit der Kennzeichnung impliziert sowie einer Begründung, die die zitierte Bestimmung zu rechtmäßiger Einkommensquelle und Wohngutscheinen nach Section 8 wörtlich anführt.
Die Verify-Stufe: entworfene Behauptung plus zitierter Gesetzestext hinein, ein Urteil impliziert mit stützender Begründung hinaus.

Eine aufgehobene Bestimmung, erfasst durch Aktualität und eskaliert

Ein Food-Truck-Betreiber fragt nach ganztägigem Parken an einem gebührenpflichtigen Stellplatz unter der allgemeinen General-Vendor-Parkregel. Die einzige Bestimmung, die das regeln würde, ist aufgehoben, und keine derzeit in Kraft befindliche Bestimmung regelt die Frage. Die Aktualitätsprüfung schlägt fehl, daher synthetisiert CivicCite keine Antwort. Es hält zurück, leitet die Frage an die allgemeine Aufnahme von NYC 311 mit den Teilergebnissen weiter und gibt die Disposition REFUSED and ESCALATED zurück. Ehrliche Enthaltung schlägt eine selbstsichere falsche Antwort.

CivicCite hält eine Food-Truck-Parkantwort zurück, weil die einzige einschlägige Bestimmung aufgehoben ist und keine in Kraft befindliche Vorschrift sie regelt; die Prüfungen zeigen cite-exists, in-force und entailed als fehlgeschlagen, während no-conflict besteht; weitergeleitet an die allgemeine Aufnahme von NYC 311.
Zurückgehalten: keine in Kraft befindliche Vorschrift regelt die Frage, daher Eskalation an NYC 311 mit den Teilergebnissen, nicht geblufft.

Ein einreichbarer Nachweis für jede Interaktion

Jede Anfrage, Freigabe oder Ablehnung, erzeugt einen Gesetzlichen Entscheidungsnachweis. Er erfasst die Teilfrage, ihren Bereich, die entworfene Behauptung und das Zitat, die vier Prüfungen mit ihren booleschen Urteilen, die Entscheidung, das Implikationslabel und jeden Rückhaltegrund oder jedes Eskalationsziel. Er nennt auch die Standards, denen er zugeordnet ist, NIST AI RMF Governance und Measurement-Logging sowie FedRAMP- und StateRAMP-Continuous-Monitoring, als Ausrichtungsrichtung, nicht als Zertifizierung.

Die Schublade des Gesetzlichen Entscheidungsnachweises zeigt JSON mit der Anfrage, der Disposition RELEASED, den zugeordneten Standards, der Teilantwort mit Bereich, Behauptung, Zitat und den vier Prüfungen citation-exists, in-force, entailed und no-conflict, alle true.
Der Gesetzliche Entscheidungsnachweis: Disposition, die vier Prüfungen, das Zitat und die zugeordneten Standards, einer pro Anfrage.

Der Graph des kommunalen Rechts und das Golden-Set-Benchmark

Der Korpus umfasst 12 Bestimmungen in 7 Titeln, Aktualität Stand 2026-06-17. In-Kraft-Knoten sind grün, der eine bewusst aufgehobene Knoten ist rot und gestrichelt, und Querverweis-Kanten sind dargestellt, damit die Retrieval-Traversierung sichtbar ist. Über das feste 12-Anfragen-Golden-Set (die vier dokumentierten MyCity-Fehler, ein bereichsübergreifender Food-Truck-Fall, eine Falle nur-aufgehoben und eine Falle ohne Abdeckung) meldet die App 0 von 12 Antworten, die ohne geprüfte, in Kraft befindliche gesetzliche Grundlage freigegeben wurden, 100 Prozent Abdeckung durch Audit-Nachweise und 100 Prozent Übereinstimmung der Disposition mit der gelabelten Ground Truth. Wir ordnen diese Zahlen diesem gelabelten Golden Set zu, niemals als Open-World-Garantie.

Der Graph des kommunalen Rechts mit 12 Bestimmungen in 7 Titeln, In-Kraft-Knoten grün und ein aufgehobener Knoten rot und gestrichelt, verbunden durch belongs-to-title- und blau gestrichelte Querverweis-Kanten, Aktualität Stand 2026-06-17.
Der Graph des kommunalen Rechts: In-Kraft-Knoten grün, der aufgehobene Knoten rot und gestrichelt, Querverweise gestrichelt.
Die Golden-Set-Benchmark-Kacheln: 0 von 12 Antworten, die ohne geprüfte, in Kraft befindliche gesetzliche Grundlage freigegeben wurden, bei einem Zielwert von 0, 100 Prozent Abdeckung durch Audit-Nachweise und 100 Prozent Übereinstimmung der Disposition mit der gelabelten Ground Truth.
Das Golden Set: 0 von 12 ohne geprüfte Grundlage freigegeben, 100 Prozent Nachweisabdeckung, 100 Prozent Dispositionsübereinstimmung.

Ein Standard-Behörden-Chatbot versus CivicCite

Derselbe geteilte Bildschirm, gegen den die Demo vergleicht, nebeneinander.

Dimension Standard-Chatbot (die MyCity-Architektur) CivicCite Gesetzliches Entscheidungstor
Wer entscheidet, was freigegeben wird Das LLM liefert, was es entworfen hat Deterministisches Python-Tor außerhalb der Agenten
Richtige Vorschrift, falsche Schlussfolgerung Wird unverändert ausgeliefert Erfasst durch die Implikationsprüfung
Aufgehobene Bestimmung zitiert Wird unverändert ausgeliefert Erfasst durch die Aktualitätsprüfung
Keine Vorschrift deckt die Frage Synthetisiert trotzdem eine Antwort Enthält sich und eskaliert an die zuständige Stelle
Audit-Trail Keine Ein Gesetzlicher Entscheidungsnachweis pro Anfrage
Beweisbare Nicht-Freigabe Nicht gemessen 0 von 12 auf dem gelabelten Golden Set

Was diese Demo nicht tut

  • ✓ Sie behauptet nicht null Halluzination und keine universelle Genauigkeitsgarantie. Das gemessene Ergebnis ist 0 von 12 Antworten, die ohne geprüfte, in Kraft befindliche gesetzliche Grundlage freigegeben wurden, auf einem festen, gelabelten Golden Set, kein Open-World-Versprechen.
  • ✓ Sie nutzt keine Live-Konnektoren. Die Übernahme des kommunalen Rechts wird als ein normalisierter Graph ausgeliefert, nicht als PDF-, HTML- oder CMS-Normalisierer, und die 311- und CRM-Eskalation wird berechnet und gezeigt, aber der Salesforce-Gov-Cloud- oder ServiceNow-Konnektor ist eine Schnittstelle, keine Live-Integration.
  • ✓ Sie stellt den Korpus nicht als rechtliche Quellengrundlage dar. Es ist ein synthetischer, aber getreuer Demo-Graph von 12 Bestimmungen, paraphrasiert aus realen referenzierten Bestimmungen des NYC Administrative Code, NY Labor Law und NYC Health Code. Dies ist keine Rechtsberatung.
  • ✓ Sie behauptet nicht, FedRAMP-, StateRAMP- oder NIST-zertifiziert zu sein. Die regulatorische Zuordnung ist eine Ausrichtungsrichtung, keine Zertifizierung, und die Autorisierungsgrenze wird von der Hosting-Umgebung geerbt.
  • ✓ Sie führt keine Kunden, Deployments, Testimonials oder ROI an. Hartwell 311 und der eingebettete Standard-Assistent in der Oberfläche sind synthetische Demo-Requisiten. Dies ist eine Demo, die den Mechanismus belegt.

Fragen, die Käufer tatsächlich stellen

Ist das nur ein weiterer Behörden-Chatbot wie MyCity von NYC?

Nein. CivicCite ist kein Chatbot und keine Suchmaschine für kommunales Recht. Es ist eine Governance-Schicht, die oberhalb der Chatbot-Plattform sitzt, das Stück, das Cloud-KI-Dienste und GovTech-Anbieter nicht haben. Ein deterministisches Python-Tor außerhalb des Agenten-Frameworks gibt eine Bürgerantwort nur frei, wenn ihr Zitat existiert, in Kraft ist, vom zitierten Text impliziert wird und konfliktfrei ist. Der Chatbot in der Demo ist eine synthetische Requisite; das Tor ist das Produkt.

Wie verhindert man, dass eine Behörden-KI Bürgern rechtswidrige Auskunft gibt?

Das LLM berät nur. Es zerlegt die Frage und entwirft eine Behauptung mit einem Zitat, das nur aus der abgerufenen Menge stammt. Dann prüft deterministischer Code, dass die zitierte Vorschrift existiert, zum Stichtag in Kraft ist, vom zitierten Text impliziert wird und keinen Konflikt trägt, und das Tor gibt nur frei, wenn alle vier gelten. Bei der echten MyCity-Anfrage zu Gutscheinen nach Section 8 wird das entworfene „Ja“ von der Implikationsprüfung als widersprochen durch NYC Admin. Code section 8-107(5) erfasst, und das Tor gibt stattdessen das korrekte, zitiergestützte „Nein“ frei.

Behebt nicht einfach ein besseres Modell oder mehr Retrieval das Halluzinationsproblem?

Retrieval verbessert den Entwurf, kann aber nicht beweisen, dass die Antwort zur Freigabe sicher ist. Forscher von Stanford und JELS (Magesh et al., 2025) maßen, dass retrieval-gestützte juristische KI weiterhin halluziniert, mit 17 Prozent bei Lexis+ AI und 33 Prozent bei Westlaw AI-Assisted Research. Selbst mit einem perfekten Modell muss eine Behörde einer Aufsichtsbehörde nachweisen, dass jede freigegebene Antwort auf geltendes Recht zurückgeht. Dieser Nachweis ist eine Eigenschaft eines deterministischen Tors und eines einreichbaren Nachweises, nicht eines stärkeren Autors.

Können wir einer Aufsichtsbehörde oder einem Prüfer nachweisen, dass jede Antwort auf geltendes Recht zurückging?

Jede Anfrage erzeugt einen Gesetzlichen Entscheidungsnachweis, Freigabe oder Ablehnung, daher ist die Prüfungsabdeckung auf dem Golden Set 100 Prozent. Jeder Nachweis erfasst die Teilfragen, die vier Prüfungen mit ihren Urteilen, das Zitat, die Disposition und wohin ein unbeantworteter Teil eskaliert wurde. Die Schlagzeile, auf die eine Aufsichtsbehörde handeln kann, ist kein Halluzinationsprozentsatz. Es ist, dass Antworten ohne geprüfte, in Kraft befindliche gesetzliche Grundlage als null nachweisbar sind, gestützt durch einen Nachweis für jede Interaktion.

Ist das FedRAMP- oder StateRAMP-zertifiziert, und wie ordnet es sich NIST AI RMF zu?

Es ist nicht zertifiziert, und wir behaupten das nicht. Der regulatorische Rahmen ist Ausrichtung und Richtung, keine Zertifizierung. Der Gesetzliche Entscheidungsnachweis ist so entworfen, dass er NIST-AI-RMF-Dokumentation sowie FedRAMP- und StateRAMP-Continuous-Monitoring-Logging zugeordnet werden kann, sodass das Artefakt, das ein Compliance-Team braucht, standardmäßig entsteht. Die FedRAMP- oder StateRAMP-Autorisierungsgrenze wird von der Hosting-Umgebung geerbt und liegt außerhalb des Umfangs einer lokalen Demo.

Ist das ein Live-Produkt oder eine Demo, und ist das kommunale Recht echtes Recht?

Es ist eine lauffähige Demo, die den Mechanismus belegt, kein Deployment, und es ist keine Rechtsberatung. Der Korpus ist ein synthetischer, aber getreuer Demo-Graph von 12 Bestimmungen: der operative Text ist paraphrasiert aus realen referenzierten Bestimmungen des NYC Administrative Code, NY Labor Law und NYC Health Code, mit realistischen Bezeichnungen, Behörden, Sanktionen und Daten. Die Übernahme des kommunalen Rechts und der 311-Eskalationskonnektor sind simuliert; die deterministischen Prüfungen, das Tor und der Nachweis laufen genau wie gezeigt.

Technische Forschung

Die Forschung hinter dieser Demo — die Architektur, das Prüfdesign und der Enterprise-Blueprint.

KI vor Bürgern auf einer .gov-Domain einsetzen?

Der Nachweis, dass jede Antwort auf geltendes Recht zurückgeht, ist der harte Teil. Wir bauen ihn.

Wenn Ihre Behörde abwägt, wie Bürger KI-Antworten erhalten können, ohne eine falsche unter dem Namen der Stadt auszuliefern, hören wir gerne, wie Sie und Ihre Rechtsabteilung darüber denken. Das Problem greift über Bundesstaaten hinweg um sich, und die Antworten werden das ebenfalls tun.

Governance-Bewertung

  • ✓ Kartieren, wo Ihre bürgernahe KI eine ungeprüfte Antwort freigeben kann
  • ✓ Die Prüfungen Zitat-existiert, Aktualität, Implikation und Konflikt für Ihr Recht definieren
  • ✓ Die Pfade für Enthaltung und Eskalation zu den zuständigen Stellen entwerfen
  • ✓ Den Gesetzlichen Entscheidungsnachweis spezifizieren, den Ihre Rechtsabteilung braucht

Das Tor bauen

  • ✓ Ein deterministisches Entscheidungstor über Ihrem geltenden kommunalen Recht
  • ✓ Ein Wissensgraph des kommunalen Rechts mit Aktualität und Querverweisen
  • ✓ Einreichbare Nachweise, zugeordnet zu NIST AI RMF und Continuous-Monitoring-Logging
  • ✓ Ein anbieteraustauschbares LLM in einer rein beratenden Rolle
Social

Auch veröffentlicht auf