政府聊天機器人上方的治理層
城市 .gov 網域上的錯誤答案,帶有該市的官方背書。CivicCite 僅在市民答案附有一條確實存在、現行有效、由所引條文蘊涵、且無衝突的成文法時,才予以放行。否則它棄權、升級轉介至正確部門,並歸檔一份紀錄。代理提供建議;把關機制做決定。
0 / 12
沒有已核實、現行有效成文法依據卻放行的答案
固定 12 題黃金集上的目標
100%
成文法裁決紀錄涵蓋率
每一查詢一份可歸檔紀錄,放行或拒絕
4
把關條件,全部必須滿足才可放行
存在、現行有效、蘊涵、無衝突
這是一套可執行的示範,語料為 12 條合成但忠實的市政法典條文。市政法典匯入與 311 升級轉介連接器為模擬;確定性把關機制與紀錄則完全依畫面所示運行。此非法律意見。
CivicCite 旨在堵住的失效模式。
政府聊天機器人給市民自信卻錯誤的法律答案,而每一個錯誤答案都帶有該市的官方背書。紐約市於 2023 年 10 月上線的 MyCity 機器人,經 The Markup(2024 年 3 月)記錄,告訴房東可以拒絕 Section 8 住房補助券、告訴商家可以拒收現金、告訴雇主可以私吞員工小費。那些答案每一條都違法。
加上檢索並不能修好它。史丹佛與 JELS 研究者(Magesh 等人,2025 年)測得 Lexis+ AI 幻覺率為 17%,Westlaw AI-Assisted Research 為 33%。檢索會拉出成文法;生成仍會誤讀或覆蓋它。危險案例不是捏造的引用。而是引用了正確的成文法卻陳述了錯誤結論,或把已廢止的條文當作仍有效來引用。
風險真實且在擴大。2026 年有 78 項聊天機器人法案橫跨 27 個州,紐約州 S7263 於 2026 年 2 月 26 日進入參議院議場,歐盟 AI 法附件 III 高風險義務自 2026 年 8 月 2 日起可執法,罰款最高 1,500 萬歐元或營業額的 3%。政府法律諮詢落在私經濟職能範圍,因此沒有主權豁免盾牌。持久要求不是更好的模型。而是向監管機構證明,每一個放行的答案都能追溯至現行有效的法律。
LLM 代理提供建議。代理框架之外的確定性程式碼決定什麼被放行。LLM 無法投票讓自己通過把關。
每一則市民查詢由左至右運行:Decompose,然後 Retrieve,然後 Draft,然後 Verify,然後把關,然後紀錄。Decompose(LLM,諮詢性)將查詢拆成原子法律子問題。Retrieve(確定性,無 LLM)以詞彙搜尋與交叉引用的階層遍歷,走訪一份經整理的市政法典知識圖譜,每一候選帶有其引用 id、條文、生效日、廢止日、罰則與機關。Draft(LLM,受約束)僅從檢索集提出一項主張加上一條引用,由允許清單驗證器與一次再詢問加以強制。
Verify 對每項草擬主張執行三項檢查,把關機制再與引用存在條件合併。僅當四項全部成立時,才放行一則子答案。
所引的引用 id 能解析到市政法典圖譜中的真實條文。草擬答案不能發明檢索集中沒有的條號。
確定性:該條文沒有廢止日,且生效日在基準日當天或之前。已廢止或尚未生效的條文,絕不能支撐一份放行的答案。
諮詢性 LLM 檢查:所引條文是否真正支持該主張,回傳蘊涵、相矛盾或中立?這能抓住引用正確成文法卻陳述錯誤結論的情況。
確定性:它讀取圖譜中的 conflicts-with 邊,獨立於蘊涵裁決,因此兩條互相矛盾的條文不會默默產出一份放行的答案。
成文法裁決把關機制是活在代理框架之外的確定性 Python。僅當引用存在、條文現行有效、所引條文蘊涵該主張、且沒有衝突時,才放行一則子答案。否則它扣住該子答案、標示為已核實涵蓋範圍之外,並轉介至正確部門。每個查詢彙總為三種處置之一:RELEASED、PARTIAL,或 REFUSED and ESCALATED。
對每一查詢,無論放行或拒絕,確定性寫入器都會產出一份成文法裁決紀錄:子問題、四項檢查及其裁決、引用、處置,以及有扣住內容時的升級轉介目標。那是法務部門與監管機構可以據以行動的成品,也是為什麼持久指標是可證明的不放行,而不是幻覺率。
時效基準日為 2026-06-17。下方每張圖都是運行中應用程式的畫面截圖。
一名房東問,能否拒絕以 Section 8 住房補助券付租金的租戶。標準助理放行了自信卻違法的「可以」。CivicCite 也草擬了「可以」,但蘊涵檢查判定它與 NYC Admin. Code section 8-107(5) 相矛盾,該條使收入來源歧視違法(紐約市人權委員會,故意違規民事罰鍰最高 250,000 美元)。把關機制阻擋該草稿,改為放行正確、有引用支撐的「不可以」,並標示為已核實、蘊涵、現行有效。左面板是沒有核實把關的普通檢索聊天機器人;右面板是運行完整流程的 CivicCite。
任何階段都可點擊查看其原始輸入與輸出。Verify 階段顯示進入的草擬主張與其引用 id,以及出來的蘊涵裁決:蘊涵,理由引用了關於因合法收入來源(包括 Section 8 住房補助券)而拒絕出租的確切條文用語。這項檢查把引用正確成文法且結論正確,與引用正確成文法卻結論錯誤區分開來。
一名餐車業者問,能否依一般攤販停車規則在計費車位停整天。唯一能處理此事的條文已被廢止,目前沒有現行有效條文規範該問題。時效性檢查失敗,因此 CivicCite 不合成答案。它扣住、將問題連同部分發現轉介至 NYC 311 一般收件,並回傳處置 REFUSED and ESCALATED。誠實棄權勝過自信的錯誤答案。
每一查詢,無論放行或拒絕,都會產出一份成文法裁決紀錄。它捕捉子問題、其領域、草擬主張與引用、四項檢查及其布林裁決、決定、蘊涵標籤,以及任何扣住理由或升級轉介目標。它也點名所對應的標準:NIST AI RMF 治理與量測日誌,以及 FedRAMP 與 StateRAMP 持續監控,作為對齊方向而非認證。
語料為 7 個標題下的 12 條條文,時效基準日為 2026-06-17。現行有效節點為綠色,那一個刻意廢止的節點為紅色虛線,並顯示交叉引用邊,使檢索遍歷可見。在固定的 12 題黃金集上運行(四個已記錄的 MyCity 失效案例、一個跨領域餐車案例、一個僅廢止陷阱,以及一個無涵蓋陷阱),應用程式報告 12 題中有 0 題在沒有已核實、現行有效成文法依據下放行答案,100% 稽核紀錄涵蓋率,以及與標註真實值 100% 的處置一致。我們將這些數字歸因於這個已標註黃金集,絕不作開放世界保證。
示範用來對照的同一分割畫面,並排呈現。
| 維度 | 標準聊天機器人(MyCity 架構) | CivicCite 成文法裁決把關機制 |
|---|---|---|
| 誰決定什麼被放行 | LLM 放行它所草擬的內容 | 代理之外的確定性 Python 把關機制 |
| 正確成文法,錯誤結論 | 原樣放行 | 被蘊涵檢查抓住 |
| 引用已廢止條文 | 原樣放行 | 被時效性檢查抓住 |
| 沒有成文法涵蓋該問題 | 無論如何仍合成答案 | 棄權並升級轉介至部門 |
| 稽核軌跡 | 無 | 每一查詢一份成文法裁決紀錄 |
| 可證明的不放行 | 未衡量 | 已標註黃金集上為 12 題中的 0 題 |
不是。CivicCite 不是聊天機器人,也不是市政法典搜尋引擎。它是坐在聊天機器人平台之上的治理層,是雲端 AI 服務與 GovTech 供應商所沒有的那一塊。代理框架之外的確定性 Python 把關機制,僅在引用存在、現行有效、由所引條文蘊涵、且無衝突時,才放行市民答案。示範中的聊天機器人是合成道具;把關機制才是產品。
LLM 只提供建議。它分解問題,並僅從檢索集草擬一項主張與一條引用。然後確定性程式碼檢查所引成文法存在、以生效日為準現行有效、由所引條文蘊涵、且沒有衝突,僅當四項全部成立時把關機制才放行。在真實的 MyCity Section 8 住房補助券查詢上,草擬的「可以」被蘊涵檢查判定與 NYC Admin. Code section 8-107(5) 相矛盾,把關機制改為放行正確、有引用支撐的「不可以」。
檢索能改善草稿,但無法證明答案可以安全放行。史丹佛與 JELS 研究者(Magesh 等人,2025 年)測得有檢索支撐的法律 AI 仍在幻覺,Lexis+ AI 為 17%,Westlaw AI-Assisted Research 為 33%。即使有完美模型,政府仍須向監管機構證明每一個放行的答案都能追溯至現行有效的法律。那份證明是確定性把關機制與可歸檔紀錄的性質,不是更強寫手的性質。
每一查詢都會產出一份成文法裁決紀錄,無論放行或拒絕,因此黃金集上的稽核涵蓋率為 100%。每份紀錄捕捉子問題、四項檢查及其裁決、引用、處置,以及未回答部分被升級轉介至何處。監管機構可以據以行動的頭條不是幻覺百分比。而是可以證明,沒有已核實、現行有效成文法依據即放行的答案為零,每一次互動都有紀錄支撐。
沒有認證,我們也不如此宣稱。法規框架是對齊與方向,不是認證。成文法裁決紀錄設計為對應 NIST AI RMF 文件,以及 FedRAMP 與 StateRAMP 持續監控日誌,因此合規團隊需要的成品會預設產出。FedRAMP 或 StateRAMP 授權邊界繼承自託管環境,超出本地示範的範圍。
這是證明機制的可執行示範,不是部署,也不是法律意見。語料是 12 條條文的合成但忠實示範圖譜:操作性條文改寫自 NYC Administrative Code、NY Labor Law 與 NYC Health Code 中真實被引用的條文,並帶有擬真的標籤、機關、罰則與日期。市政法典匯入與 311 升級轉介連接器為模擬;確定性檢查、把關機制與紀錄則完全依畫面所示運行。
證明每一個答案都能追溯至現行有效法律,才是難處。我們打造它。
若貴機關正在權衡如何給市民 AI 答案、又不在該市名義下放行錯誤答案,我們真心想聽聽您與法務部門怎麼想。問題正在各州蔓延,答案也會如此。