Il livello di governance sopra il chatbot governativo
Una risposta sbagliata sul dominio .gov di una città porta l'imprimatur della città. CivicCite rilascia una risposta al cittadino solo quando porta una norma statutaria che esiste, è in vigore, è implicata dal testo citato ed è priva di conflitti. Altrimenti si astiene, scala al dipartimento giusto e archivia un record. Gli agenti consigliano; il gate decide.
0 / 12
Risposte rilasciate senza una base statutaria verificata e in vigore
Obiettivo sul set aureo fisso di 12 query
100%
Copertura del Record di decisione statutaria
Un record archiviabile per query, si rilasci o si rifiuti
4
Condizioni del gate, tutte richieste per il rilascio
Esiste, in vigore, implicato, privo di conflitti
Questa è una demo eseguibile su un corpus sintetico ma fedele di 12 disposizioni del codice municipale. L'ingestione del codice municipale e il connettore di escalation 311 sono simulati; il gate deterministico e il record funzionano esattamente come mostrato. Non costituisce consulenza legale.
La modalità di fallimento che CivicCite è costruito per chiudere.
I chatbot governativi danno ai cittadini risposte giuridiche sicure di sé che sono sbagliate, e ogni risposta sbagliata porta l'imprimatur della città. Il bot MyCity di NYC, lanciato nell'ottobre 2023, è stato documentato da The Markup (marzo 2024) mentre diceva ai proprietari che potevano rifiutare i voucher Section 8, alle imprese che potevano diventare cashless, e ai datori di lavoro che potevano trattenere le mance dei lavoratori. Ognuna di quelle risposte era illegale.
Aggiungere il retrieval non lo risolve. I ricercatori di Stanford e JELS (Magesh et al., 2025) hanno misurato Lexis+ AI al 17 percento e Westlaw AI-Assisted Research al 33 percento di allucinazione. Il retrieval recupera la norma statutaria; la generazione la legge ancora male o la sovrascrive. Il caso pericoloso non è una citazione inventata. È la norma statutaria giusta citata con la conclusione sbagliata, o una disposizione abrogata citata come se fosse ancora in vigore.
L'esposizione è reale e in crescita. Nel 2026 ci sono 78 disegni di legge sui chatbot in 27 Stati, lo S7263 di New York è arrivato in aula al Senato il 26 febbraio 2026, e gli obblighi ad alto rischio dell'Allegato III dell'EU AI Act diventano esecutivi il 2 agosto 2026 con sanzioni fino a 15 milioni di euro o il 3 percento del fatturato. La consulenza legale governativa rientra nella zona di funzione proprietaria, quindi non c'è uno scudo di immunità sovrana. Il requisito duraturo non è un modello migliore. È la prova, per un regolatore, che ogni risposta rilasciata risale a diritto vigente.
Gli agenti LLM consigliano. Il codice deterministico esterno al framework degli agenti decide cosa viene rilasciato. Un LLM non può votarsi da solo oltre il gate.
Ogni query del cittadino procede da sinistra a destra: Decompose, poi Retrieve, poi Draft, poi Verify, poi il gate, poi il record. Decompose (LLM, consultivo) suddivide la query in sotto-domande giuridiche atomiche. Retrieve (deterministico, nessun LLM) percorre un grafo della conoscenza del codice municipale curato con ricerca lessicale e attraversamento gerarchico dei rinvii, e ogni candidato porta il proprio citation id, testo, data di efficacia, data di abrogazione, sanzione e agenzia. Draft (LLM, vincolato) propone un'asserzione più una citazione tratta solo dall'insieme recuperato, applicata da un validatore di allowlist e da un re-ask.
Verify esegue tre controlli per ogni asserzione redatta, e il gate li combina con una condizione di esistenza della citazione. Rilascia una sotto-risposta solo quando tutte e quattro valgono.
Il citation id citato si risolve in una disposizione reale nel grafo del codice municipale. Una risposta redatta non può inventare un numero di sezione che non è nell'insieme recuperato.
Deterministico: la disposizione non ha data di abrogazione e ha una data di efficacia pari o precedente alla data as-of. Una disposizione abrogata o non ancora efficace non può mai sostenere una risposta rilasciata.
Controllo LLM consultivo: il testo citato sostiene davvero l'asserzione, restituendo implicato, contraddetto o neutrale? Questo cattura la norma statutaria giusta citata con la conclusione sbagliata.
Deterministico: legge gli archi conflicts-with nel grafo, indipendentemente dal verdetto di implicazione, così due disposizioni che si contraddicono non producono silenziosamente una risposta rilasciata.
Il Gate di decisione statutaria è Python deterministico che vive fuori dal framework degli agenti. Rilascia una sotto-risposta solo se la citazione esiste e la disposizione è in vigore e il testo citato è implicato e non c'è conflitto. Altrimenti trattiene la sotto-risposta, la marca fuori dalla copertura verificata e la instrada al dipartimento corretto. Per query aggrega a uno di tre esiti: RELEASED, PARTIAL, o REFUSED and ESCALATED.
Per ogni query, si rilasci o si rifiuti, un writer deterministico emette un Record di decisione statutaria: le sotto-domande, i quattro controlli e i loro verdetti, la citazione, l'esito, e il bersaglio di escalation quando qualcosa è stato trattenuto. Quello è l'artefatto su cui un Dipartimento legale e un regolatore possono agire, ed è perché la metrica duratura è il non-rilascio dimostrabile, non un tasso di allucinazione.
Vigenza al 2026-06-17. Ogni immagine sotto è uno screenshot dell'app in esecuzione.
Un proprietario chiede se può rifiutare un inquilino che pagherebbe l'affitto con un voucher Section 8. L'assistente standard spedisce il «sì» sicuro di sé e illegale. CivicCite redige anch'esso un «sì», ma il controllo di implicazione lo legge come contraddetto dalla NYC Admin. Code section 8-107(5), che rende illecita la discriminazione per fonte di reddito (NYC Commission on Human Rights, sanzioni civili fino a 250.000 dollari per violazioni dolose). Il gate blocca la bozza e rilascia invece il «No» corretto, sostenuto da citazione, marcato verificato, implicato e in vigore. Il pannello sinistro è un chatbot di retrieval semplice senza gate di verifica; il pannello destro è CivicCite che esegue la pipeline completa.
Qualsiasi stadio è cliccabile per il suo input e output grezzi. Lo stadio Verify mostra l'asserzione redatta e il suo citation id in ingresso, e il verdetto di implicazione in uscita: implicato, con la ragione che cita il linguaggio esatto della disposizione sul rifiuto di affittare a causa di una fonte di reddito lecita che include i voucher abitativi Section 8. Questo è il controllo che separa la norma statutaria giusta citata con la conclusione giusta dalla norma statutaria giusta citata con quella sbagliata.
Un gestore di food truck chiede del parcheggio tutto il giorno in uno stallo a parcometro secondo la regola generale di parcheggio dei venditori. L'unica disposizione che lo disciplinarebbe è stata abrogata, e nessuna disposizione attualmente in vigore regola la questione. Il controllo di vigenza fallisce, quindi CivicCite non sintetizza una risposta. Trattiene, instrada la domanda all'intake generale di NYC 311 con i risultati parziali allegati, e restituisce l'esito REFUSED and ESCALATED. Un'astensione onesta batte una risposta sbagliata sicura di sé.
Ogni query, si rilasci o si rifiuti, produce un Record di decisione statutaria. Cattura la sotto-domanda, il suo dominio, l'asserzione redatta e la citazione, i quattro controlli con i loro verdetti booleani, la decisione, l'etichetta di implicazione, e qualsiasi ragione di trattenuta o bersaglio di escalation. Nomina anche gli standard a cui si mappa, la governance e il logging di misurazione NIST AI RMF e il monitoraggio continuo FedRAMP e StateRAMP, come direzione di allineamento piuttosto che come certificazione.
Il corpus è di 12 disposizioni su 7 titoli, vigenza al 2026-06-17. I nodi in vigore sono verdi, l'unico nodo deliberatamente abrogato è rosso e tratteggiato, e gli archi di rinvio sono mostrati così l'attraversamento del retrieval è visibile. Eseguita sul set aureo fisso di 12 query (i quattro fallimenti MyCity documentati, un caso food-truck multi-dominio, una trappola solo-abrogata e una trappola senza copertura), l'app riporta 0 su 12 risposte rilasciate senza una base statutaria verificata e in vigore, copertura del record di audit al 100 percento, e accordo di esito al 100 percento con la verità di riferimento etichettata. Attribuiamo queste cifre a questo set aureo etichettato, mai come garanzia in open-world.
Lo stesso schermo diviso usato come confronto nella demo, affiancati.
| Dimensione | Chatbot standard (l'architettura MyCity) | CivicCite Gate di decisione statutaria |
|---|---|---|
| Chi decide cosa viene rilasciato | L'LLM spedisce ciò che ha redatto | Gate Python deterministico fuori dagli agenti |
| Norma statutaria giusta, conclusione sbagliata | La rilascia intatta | Catturata dal controllo di implicazione |
| Disposizione abrogata citata | La rilascia intatta | Catturata dal controllo di vigenza |
| Nessuna norma statutaria copre la questione | Sintetizza comunque una risposta | Si astiene e scala al dipartimento |
| Traccia di audit | Nessuna | Un Record di decisione statutaria per query |
| Non-rilascio dimostrabile | Non misurato | 0 su 12 sul set aureo etichettato |
No. CivicCite non è un chatbot e non è un motore di ricerca del codice municipale. È un livello di governance che sta sopra la piattaforma chatbot, il pezzo che i servizi AI cloud e i vendor GovTech non hanno. Un gate Python deterministico fuori dal framework degli agenti rilascia una risposta al cittadino solo quando la sua citazione esiste, è in vigore, è implicata dal testo citato ed è priva di conflitti. Il chatbot nella demo è un prop sintetico; il gate è il prodotto.
L'LLM si limita a consigliare. Scompone la domanda e redige un'asserzione con una citazione tratta solo dall'insieme recuperato. Poi il codice deterministico verifica che la norma statutaria citata esista, sia in vigore alla data di efficacia, sia implicata dal testo citato e non porti conflitti, e il gate rilascia solo se tutte e quattro valgono. Sulla vera query MyCity dei voucher Section 8, il «sì» redatto è catturato dal controllo di implicazione come contraddetto dalla NYC Admin. Code section 8-107(5), e il gate rilascia invece il «No» corretto sostenuto da citazione.
Il retrieval migliora la bozza, ma non può provare che la risposta sia sicura da rilasciare. I ricercatori di Stanford e JELS (Magesh et al., 2025) hanno misurato l'AI legale basata su retrieval ancora in allucinazione, al 17 percento per Lexis+ AI e al 33 percento per Westlaw AI-Assisted Research. Anche con un modello perfetto, un governo deve provare a un regolatore che ogni risposta rilasciata risale a diritto vigente. Quella prova è una proprietà di un gate deterministico e di un record archiviabile, non di uno scrittore più forte.
Ogni query produce un Record di decisione statutaria, si rilasci o si rifiuti, quindi la copertura di audit sul set aureo è del 100 percento. Ogni record cattura le sotto-domande, i quattro controlli con i loro verdetti, la citazione, l'esito, e dove una parte senza risposta è stata scalata. Il titolo su cui un regolatore può agire non è una percentuale di allucinazione. È che le risposte rilasciate senza una base statutaria verificata e in vigore possono essere mostrate pari a zero, sostenute da un record per ogni interazione.
Non è certificata, e non pretendiamo di esserlo. L'inquadramento normativo è allineamento e direzione, non certificazione. Il Record di decisione statutaria è progettato per mappare sulla documentazione NIST AI RMF e sul logging di monitoraggio continuo FedRAMP e StateRAMP, così l'artefatto di cui un team di compliance ha bisogno è prodotto di default. Il perimetro di autorizzazione FedRAMP o StateRAMP è ereditato dall'ambiente di hosting ed è fuori ambito per una demo locale.
È una demo eseguibile che prova il meccanismo, non un deployment, e non è consulenza legale. Il corpus è un grafo demo sintetico ma fedele di 12 disposizioni: il testo operativo è parafrasato da disposizioni reali di riferimento del NYC Administrative Code, del NY Labor Law e del NYC Health Code, con etichette, agenzie, sanzioni e date realistiche. L'ingestione del codice municipale e il connettore di escalation 311 sono simulati; i controlli deterministici, il gate e il record funzionano esattamente come mostrato.
La ricerca dietro questa demo — l'architettura, il disegno di verifica e il blueprint enterprise.
Soluzione completa
Esplora la soluzione AI governativa che cita la legge →La prova che ogni risposta risale a diritto vigente è la parte difficile. Noi la costruiamo.
Se la vostra agenzia sta valutando come dare ai cittadini risposte AI senza spedirne una sbagliata sotto il nome della città, ci farebbe davvero piacere sentire come voi e il vostro Dipartimento legale ci state pensando. Il problema si sta diffondendo tra gli Stati, e lo faranno anche le risposte.