La couche de gouvernance au-dessus du chatbot gouvernemental
Une mauvaise réponse sur le domaine .gov d'une ville porte l'imprimatur de la ville. CivicCite ne publie une réponse au citoyen que lorsqu'elle porte une disposition qui existe, est en vigueur, est entraînée par le texte cité, et est sans conflit. Sinon il s'abstient, escalade vers le bon service, et consigne un dossier. Les agents conseillent ; la porte décide.
0 / 12
Réponses publiées sans base statutaire vérifiée et en vigueur
Objectif sur le jeu doré fixe de 12 requêtes
100%
Couverture du Dossier de décision statutaire
Un dossier archivable par requête, publier ou refuser
4
Conditions de la porte, toutes requises pour publier
Existe, en vigueur, entraîné, sans conflit
Ceci est une démonstration exécutable sur un corpus synthétique mais fidèle de 12 dispositions du code municipal. L'ingestion du code municipal et le connecteur d'escalade 311 sont simulés ; la porte déterministe et le dossier s'exécutent exactement comme montré. Ceci n'est pas un avis juridique.
Le mode de défaillance que CivicCite est conçu pour fermer.
Les chatbots gouvernementaux donnent aux citoyens des réponses juridiques confiantes qui sont fausses, et chaque mauvaise réponse porte l'imprimatur de la ville. Le bot MyCity de NYC, lancé en octobre 2023, a été documenté par The Markup (mars 2024) disant aux propriétaires qu'ils pouvaient refuser les bons Section 8, aux commerces qu'ils pouvaient refuser les espèces, et aux employeurs qu'ils pouvaient empocher les pourboires des employés. Chacune de ces réponses était illégale.
Ajouter de la récupération ne le corrige pas. Des chercheurs de Stanford et de JELS (Magesh et al., 2025) ont mesuré Lexis+ AI à 17 pour cent et Westlaw AI-Assisted Research à 33 pour cent d'hallucination. La récupération extrait la disposition ; la génération la lit encore de travers ou s'en affranchit. Le cas dangereux n'est pas une citation inventée. C'est la bonne disposition citée avec la mauvaise conclusion énoncée, ou une disposition abrogée citée comme si elle était encore en vigueur.
L'exposition est réelle et croissante. Il y a 78 projets de loi sur les chatbots dans 27 États en 2026, le S7263 de New York a atteint le plancher du Sénat le 26 février 2026, et les obligations à haut risque de l'annexe III de l'EU AI Act deviennent exécutoires le 2 août 2026, avec des sanctions allant jusqu'à 15 millions d'euros ou 3 pour cent du chiffre d'affaires. Le conseil juridique gouvernemental se situe dans la zone de fonction propriétaire, donc il n'y a pas de bouclier d'immunité souveraine. L'exigence durable n'est pas un meilleur modèle. C'est la preuve, pour un régulateur, que chaque réponse publiée remonte à une loi en vigueur.
Les agents LLM conseillent. Un code déterministe en dehors du cadre agentique décide de ce qui est publié. Un LLM ne peut pas se voter lui-même au-delà de la porte.
Chaque requête citoyenne s'exécute de gauche à droite : Decompose, puis Retrieve, puis Draft, puis Verify, puis la porte, puis le dossier. Decompose (LLM, consultatif) découpe la requête en sous-questions juridiques atomiques. Retrieve (déterministe, sans LLM) parcourt un graphe de connaissances de code municipal constitué avec une recherche lexicale et une traversée hiérarchique des renvois, et chaque candidat porte son identifiant de citation, son texte, sa date d'entrée en vigueur, sa date d'abrogation, sa sanction et son agence. Draft (LLM, contraint) propose une affirmation plus une citation tirée uniquement de l'ensemble récupéré, appliquée par un validateur en liste blanche et une seule re-demande.
Verify exécute trois contrôles par affirmation rédigée, et la porte les combine avec une condition de citation existante. Elle ne publie une sous-réponse que lorsque les quatre tiennent.
L'identifiant de citation cité se résout en une disposition réelle dans le graphe du code municipal. Une réponse rédigée ne peut pas inventer un numéro d'article qui n'est pas dans l'ensemble récupéré.
Déterministe : la disposition n'a pas de date d'abrogation et une date d'entrée en vigueur antérieure ou égale à la date de référence. Une disposition abrogée ou pas encore en vigueur ne peut jamais étayer une réponse publiée.
Contrôle LLM consultatif : le texte cité soutient-il réellement l'affirmation, en renvoyant entraîné, contredit ou neutre ? Cela attrape la bonne disposition citée avec la mauvaise conclusion énoncée.
Déterministe : il lit les arêtes conflicts-with dans le graphe, indépendamment du verdict d'implication, de sorte que deux dispositions qui se contredisent ne produisent pas silencieusement une réponse publiée.
La Porte de décision statutaire est du Python déterministe qui vit en dehors du cadre agentique. Elle ne publie une sous-réponse que si la citation existe et que la disposition est en vigueur et que le texte cité implique l'affirmation et qu'il n'y a pas de conflit. Sinon elle retient la sous-réponse, la marque hors couverture vérifiée, et l'achemine vers le bon service. Par requête, elle agrège en l'une de trois issues : RELEASED, PARTIAL, ou REFUSED and ESCALATED.
Pour chaque requête, publier ou refuser, un rédacteur déterministe émet un Dossier de décision statutaire : les sous-questions, les quatre contrôles et leurs verdicts, la citation, l'issue, et la cible d'escalade lorsque quelque chose a été retenu. C'est l'artefact sur lequel un Law Department et un régulateur peuvent agir, et c'est pourquoi la métrique durable est la non-publication prouvable, pas un taux d'hallucination.
Actualité à la date de référence 2026-06-17. Chaque image ci-dessous est une capture d'écran de l'application en cours d'exécution.
Un propriétaire demande s'il peut refuser un locataire qui paierait le loyer avec un bon Section 8. L'assistant standard publie le « oui » confiant et illégal. CivicCite rédige aussi un « oui », mais le contrôle d'implication le lit comme contredit par NYC Admin. Code section 8-107(5), qui rend illégale la discrimination fondée sur la source de revenus (NYC Commission on Human Rights, amendes civiles jusqu'à 250 000 dollars pour les violations volontaires). La porte bloque le brouillon et publie à la place le « Non » correct, étayé par une citation, marqué vérifié, entraîné et en vigueur. Le panneau de gauche est un chatbot de récupération simple sans porte de vérification ; le panneau de droite est CivicCite exécutant le pipeline complet.
Toute étape est cliquable pour son entrée et sa sortie brutes. L'étape Verify montre l'affirmation rédigée et son identifiant de citation en entrée, et le verdict d'implication en sortie : entraîné, avec le motif citant le langage exact de la disposition sur le refus de louer en raison d'une source de revenus licite qui inclut les bons de logement Section 8. C'est le contrôle qui sépare la bonne disposition citée avec la bonne conclusion de la bonne disposition citée avec la mauvaise.
Un exploitant de food-truck demande s'il peut rester garé toute la journée à une place avec parcmètre au titre de la règle générale de stationnement des vendeurs. La seule disposition qui traiterait de cela a été abrogée, et aucune disposition actuellement en vigueur ne régit la question. Le contrôle de vigueur échoue, donc CivicCite ne synthétise pas de réponse. Il retient, achemine la question vers l'accueil général NYC 311 avec les conclusions partielles jointes, et renvoie l'issue REFUSED and ESCALATED. L'abstention honnête bat une mauvaise réponse confiante.
Chaque requête, publier ou refuser, produit un Dossier de décision statutaire. Il capture la sous-question, son domaine, l'affirmation rédigée et la citation, les quatre contrôles avec leurs verdicts booléens, la décision, le libellé d'implication, et tout motif de retenue ou cible d'escalade. Il nomme aussi les normes vers lesquelles il s'aligne, le logging de gouvernance et de mesure NIST AI RMF et le continuous monitoring FedRAMP et StateRAMP, comme une direction d'alignement plutôt qu'une certification.
Le corpus compte 12 dispositions réparties en 7 titres, actualité à la date de référence 2026-06-17. Les nœuds en vigueur sont verts, le nœud délibérément abrogé est rouge et en pointillés, et les arêtes de renvoi sont affichées pour que la traversée de récupération soit visible. Exécuté sur le jeu doré fixe de 12 requêtes (les quatre échecs MyCity documentés, un cas food-truck multi-domaines, un piège abrogé uniquement, et un piège hors couverture), l'application rapporte 0 réponse sur 12 publiée sans base statutaire vérifiée et en vigueur, 100 pour cent de couverture des dossiers d'audit, et 100 pour cent d'accord d'issue avec la vérité terrain étiquetée. Nous attribuons ces chiffres à ce jeu doré étiqueté, jamais comme une garantie sur le monde ouvert.
Le même écran scindé contre lequel la démonstration se compare, côte à côte.
| Dimension | Chatbot standard (l'architecture MyCity) | Porte de décision statutaire CivicCite |
|---|---|---|
| Qui décide de ce qui est publié | Le LLM publie ce qu'il a rédigé | Porte Python déterministe en dehors des agents |
| Bonne disposition, mauvaise conclusion | Publiée intacte | Attrapée par le contrôle d'implication |
| Disposition abrogée citée | Publiée intacte | Attrapée par le contrôle de vigueur |
| Aucune disposition ne couvre la question | Synthétise une réponse quand même | S'abstient et escalade vers le service |
| Piste d'audit | Aucune | Un Dossier de décision statutaire par requête |
| Non-publication prouvable | Non mesurée | 0 sur 12 sur le jeu doré étiqueté |
Non. CivicCite n'est pas un chatbot et n'est pas un moteur de recherche de code municipal. C'est une couche de gouvernance qui se situe au-dessus de la plateforme de chatbot, la pièce que les services d'IA cloud et les éditeurs GovTech n'ont pas. Une porte Python déterministe en dehors du cadre agentique ne publie une réponse au citoyen que lorsque sa citation existe, est en vigueur, est entraînée par le texte cité, et est sans conflit. Le chatbot dans la démonstration est un accessoire synthétique ; la porte est le produit.
Le LLM ne fait que conseiller. Il décompose la question et rédige une affirmation avec une citation tirée uniquement de l'ensemble récupéré. Puis un code déterministe vérifie que la disposition citée existe, est en vigueur à la date d'effet, est entraînée par le texte cité, et ne porte aucun conflit, et la porte ne publie que si les quatre tiennent. Sur la vraie requête MyCity du bon Section 8, le « oui » rédigé est attrapé par le contrôle d'implication comme contredit par NYC Admin. Code section 8-107(5), et la porte publie à la place le « Non » correct étayé par une citation.
La récupération améliore le brouillon, mais elle ne peut pas prouver que la réponse est sûre à publier. Des chercheurs de Stanford et de JELS (Magesh et al., 2025) ont mesuré que l'IA juridique augmentée par récupération hallucinait encore, à 17 pour cent pour Lexis+ AI et 33 pour cent pour Westlaw AI-Assisted Research. Même avec un modèle parfait, un gouvernement doit prouver à un régulateur que chaque réponse publiée remonte à une loi en vigueur. Cette preuve est une propriété d'une porte déterministe et d'un dossier archivable, pas d'un rédacteur plus fort.
Chaque requête produit un Dossier de décision statutaire, publier ou refuser, donc la couverture d'audit sur le jeu doré est de 100 pour cent. Chaque dossier capture les sous-questions, les quatre contrôles avec leurs verdicts, la citation, l'issue, et où une partie sans réponse a été escaladée. Le chiffre phare sur lequel un régulateur peut agir n'est pas un pourcentage d'hallucination. C'est que les réponses publiées sans base statutaire vérifiée et en vigueur peuvent être montrées à zéro, étayées par un dossier pour chaque interaction.
Ce n'est pas certifié, et nous ne le prétendons pas. Le cadrage réglementaire est l'alignement et la direction, pas la certification. Le Dossier de décision statutaire est conçu pour s'aligner sur la documentation NIST AI RMF et sur le logging de continuous monitoring FedRAMP et StateRAMP, de sorte que l'artefact dont une équipe de conformité a besoin est produit par défaut. Le périmètre d'autorisation FedRAMP ou StateRAMP est hérité de l'environnement d'hébergement et est hors périmètre pour une démonstration locale.
C'est une démonstration exécutable qui prouve le mécanisme, pas un déploiement, et ce n'est pas un avis juridique. Le corpus est un graphe de démonstration synthétique mais fidèle de 12 dispositions : le texte opératoire est paraphrasé à partir de dispositions réelles référencées du NYC Administrative Code, du NY Labor Law et du NYC Health Code, avec des libellés, agences, sanctions et dates réalistes. L'ingestion du code municipal et le connecteur d'escalade 311 sont simulés ; les contrôles déterministes, la porte et le dossier s'exécutent exactement comme montré.
La recherche derrière cette démonstration — l'architecture, la conception de la vérification, et le schéma directeur d'entreprise.
Solution complète
Explorer la solution IA gouvernementale qui cite la loi →La preuve que chaque réponse remonte à une loi en vigueur, c'est le plus dur. Nous la construisons.
Si votre agence évalue comment donner aux citoyens des réponses d'IA sans en publier une fausse sous le nom de la ville, nous aimerions sincèrement entendre comment vous et votre Law Department y réfléchissez. Le problème se répand d'un État à l'autre, et les réponses aussi.