政府チャットボットの上位に位置するガバナンス層
市の.govドメイン上での誤った回答は、市のお墨付きを帯びる。CivicCiteは、存在する、効力を有する、引用テキストによって含意される、かつ衝突のない法令を伴う場合にのみ、市民向け回答を公開する。そうでなければ棄権し、適切な部署へエスカレーションし、記録を残す。エージェントは助言する。ゲートが決める。
0 / 12
検証済みかつ効力を有する法令根拠なしに公開された回答
固定12件クエリのゴールデンセットにおける目標
100%
Statutory Decision Recordのカバレッジ
公開でも拒否でも、クエリごとに提出可能な記録が1件
4
ゲート条件。公開にはすべて必須
存在する、効力あり、含意される、衝突なし
これは、市条例12条項からなる合成だが忠実なコーパス上で実行できるデモです。市条例の取り込みと311エスカレーションコネクタはシミュレーションです。決定論的ゲートと記録は表示どおりに正確に動作します。法的助言ではありません。
CivicCiteが塞ぐために構築された失敗モード。
政府チャットボットは市民に自信ありげな法的回答を与えるが、それが誤りであり、誤った回答のすべてが市のお墨付きを帯びる。2023年10月にローンチされたNYCのMyCityボットは、The Markup(2024年3月)によって、家主にSection 8バウチャーを拒否できる、事業者にキャッシュレス化できる、雇用主に労働者のチップを着服できると伝えていたことが記録されている。それらの回答はすべて違法だった。
検索を足しても直らない。StanfordとJELSの研究者(Magesh et al., 2025)は、Lexis+ AIの幻覚を17パーセント、Westlaw AI-Assisted Researchを33パーセントと測定した。検索は法令を引っ張ってくる。生成はなお誤読するか上書きする。危険なケースはでっち上げの引用ではない。正しい法令を引用しながら誤った結論を述べること、あるいは廃止済み条項を現行であるかのように引用することである。
リスクは現実であり、拡大している。2026年には27州で78件のチャットボット法案があり、ニューヨーク州のS7263は2026年2月26日に上院本会議に到達し、EU AI Act附属書IIIのハイリスク義務は2026年8月2日に執行可能となり、罰則は最大1,500万ユーロまたは売上高の3パーセントである。政府の法的助言は営利的機能(proprietary function)の領域に位置するため、主権免除の盾はない。持続する要件は、より良いモデルではない。公開されたすべての回答が現行法に遡れることを、規制当局に証明することである。
LLMエージェントは助言する。エージェントの枠組みの外にある決定論的コードが、何を公開するかを決める。LLMが自らをゲートの向こう側へ投票で通すことはできない。
市民の各クエリは左から右へ進む。Decompose、次いでRetrieve、次いでDraft、次いでVerify、次いでゲート、次いで記録。Decompose(LLM、アドバイザリー)はクエリを原子的な法的サブ質問に分割する。Retrieve(決定論的、LLMなし)は、語彙検索と相互参照の階層走査により、キュレーションされた市条例ナレッジグラフを辿り、各候補は引用id、テキスト、施行日、廃止日、罰則、機関を伴う。Draft(LLM、制約付き)は、検索集合からのみ引いた引用とともに主張を提案し、許可リスト検証器と1回の再質問によって強制される。
Verifyは起草された主張ごとに3つのチェックを実行し、ゲートはそれらを引用存在条件と組み合わせる。4つすべてが成り立つときだけ、サブ回答を公開する。
引用された引用idは、市条例グラフ内の実在する条項に解決される。起草された回答は、検索集合にない条番号を捏造できない。
決定論的:条項に廃止日がなく、施行日が基準日以前である。廃止済み、またはまだ効力を生じていない条項が、公開された回答を裏付けることは決してない。
アドバイザリーなLLMチェック:引用テキストは実際に主張を支持するか。含意される、矛盾する、中立のいずれかを返す。これにより、正しい法令を引用しながら誤った結論を述べるケースを捕捉する。
決定論的:含意判定とは独立に、グラフのconflicts-withエッジを読む。互いに矛盾する2つの条項が、黙って公開回答を生み出すことはない。
Statutory Decision Gateは、エージェントの枠組みの外にある決定論的Pythonである。引用が存在し、かつ条項が効力を有し、かつ引用テキストが含意し、かつ衝突がない場合にのみ、サブ回答を公開する。そうでなければサブ回答を保留し、検証済みカバレッジ外と印し、正しい部署へ回す。クエリごとに3つの処分のいずれかに集約する。RELEASED、PARTIAL、またはREFUSED and ESCALATED。
公開でも拒否でも、すべてのクエリに対し、決定論的ライターがStatutory Decision Recordを出力する。サブ質問、4つのチェックとその判定、引用、処分、保留があった場合のエスカレーション先。それが法務局と規制当局が依拠できる成果物であり、持続する指標が幻覚率ではなく、証明可能な非公開である理由である。
現行性の基準日は2026-06-17。以下の画像はすべて実行中アプリのスクリーンショットである。
家主が、Section 8バウチャーで家賃を支払う入居者を拒否できるかを尋ねる。標準アシスタントは自信に満ちた違法な「はい」を出荷する。CivicCiteも「はい」を起草するが、含意チェックはそれをNYC Admin. Code section 8-107(5)によって矛盾すると読む。同条は所得源による差別を違法とする(NYC Commission on Human Rights、故意の違反に対する民事罰は最大250,000ドル)。ゲートは草案を阻止し、代わりに正しい引用に裏付けられた「いいえ」を公開し、検証済み、含意される、効力ありと印す。左パネルは検証ゲートのない平易な検索チャットボット。右パネルはフルパイプラインを実行するCivicCiteである。
どの段階も、生の入力と出力をクリックして確認できる。Verify段階は、入ってくる起草された主張とその引用id、出てくる含意判定を示す。含意される、理由は、Section 8住宅バウチャーを含む適法な所得源を理由に賃貸を拒否することについての条項の正確な文言を引用する。これが、正しい法令を正しい結論とともに引用した場合と、正しい法令を誤った結論とともに引用した場合を分けるチェックである。
フードトラック事業者が、一般露天商の駐車規則の下でメーター付きスペースに終日駐車できるかを尋ねる。それに答える唯一の条項は廃止されており、現在効力を有する条項がこの問いを規律していない。現行性チェックが失敗するため、CivicCiteは回答を合成しない。保留し、部分的な所見を添付してNYC 311一般受付へ問いを回し、処分REFUSED and ESCALATEDを返す。誠実な棄権は、自信に満ちた誤答に勝る。
公開でも拒否でも、すべてのクエリがStatutory Decision Recordを生成する。サブ質問、そのドメイン、起草された主張と引用、真偽判定付きの4つのチェック、決定、含意ラベル、保留理由またはエスカレーション先を捕捉する。マッピングする標準として、NIST AI RMFのガバナンスおよび測定のロギングと、FedRAMPおよびStateRAMPの継続的モニタリングも名指す。認証ではなく、整合の方向としてである。
コーパスは7タイトルにわたる12条項、現行性の基準日は2026-06-17。効力ありノードは緑、意図的に廃止した1ノードは赤の破線、相互参照エッジを示し検索走査が見えるようにする。固定12件クエリのゴールデンセット(文書化された4件のMyCity失敗、マルチドメインのフードトラック事例、廃止のみの罠、カバレッジなしの罠)に対して実行すると、アプリは検証済みかつ効力を有する法令根拠なしに公開された回答が12件中0件、監査記録カバレッジ100パーセント、ラベル付き正解との処分一致100パーセントと報告する。これらの数値はこのラベル付きゴールデンセットに帰属させ、オープンワールドの保証としては決して述べない。
デモが比較する同じ分割画面を、並べて。
| 観点 | 標準チャットボット(MyCityアーキテクチャ) | CivicCite Statutory Decision Gate |
|---|---|---|
| 何を公開するかを誰が決めるか | LLMが起草したものを出荷する | エージェントの外にある決定論的Pythonゲート |
| 正しい法令、誤った結論 | そのまま出荷 | 含意チェックが捕捉 |
| 廃止条項の引用 | そのまま出荷 | 現行性チェックが捕捉 |
| 法令が問いをカバーしない | それでも回答を合成する | 棄権し、部署へエスカレーションする |
| 監査証跡 | なし | クエリごとのStatutory Decision Record |
| 証明可能な非公開 | 測定されない | ラベル付きゴールデンセットで12件中0件 |
いいえ。CivicCiteはチャットボットでも、市条例の検索エンジンでもない。チャットボット基盤の上位に位置するガバナンス層であり、クラウドAIサービスやGovTechベンダーが持っていない部分である。エージェントの枠組みの外にある決定論的Pythonゲートが、引用が存在し、効力を有し、引用テキストによって含意され、衝突がない場合にのみ、市民向け回答を公開する。デモ内のチャットボットは合成の小道具である。ゲートが製品である。
LLMは助言するだけである。問いを分解し、検索集合からのみ引いた引用とともに主張を起草する。次いで決定論的コードが、引用された法令が存在すること、施行日時点で効力を有すること、引用テキストによって含意されること、衝突がないことを確認し、ゲートは4つすべてが成り立つときだけ公開する。実際のMyCity Section 8バウチャークエリでは、起草された「はい」は含意チェックによってNYC Admin. Code section 8-107(5)と矛盾すると捕捉され、ゲートは代わりに正しい引用に裏付けられた「いいえ」を公開する。
検索は草案を改善するが、回答の公開が安全であることを証明できない。StanfordとJELSの研究者(Magesh et al., 2025)は、検索に裏付けられたリーガルAIがなお幻覚することを測定し、Lexis+ AIは17パーセント、Westlaw AI-Assisted Researchは33パーセントだった。完璧なモデルであっても、政府は公開されたすべての回答が現行法に遡れることを規制当局に証明しなければならない。その証明は、より強いライターの性質ではなく、決定論的ゲートと提出可能な記録の性質である。
公開でも拒否でも、すべてのクエリがStatutory Decision Recordを生成するため、ゴールデンセット上の監査カバレッジは100パーセントである。各記録はサブ質問、判定付きの4つのチェック、引用、処分、未回答部分のエスカレーション先を捕捉する。規制当局が依拠できる見出しは幻覚のパーセントではない。検証済みかつ効力を有する法令根拠なしに公開された回答がゼロであることを示せることであり、すべてのやり取りの記録がそれを裏付ける。
認証されておらず、その主張もしない。規制の枠組みは認証ではなく、整合と方向である。Statutory Decision Recordは、NIST AI RMFの文書化とFedRAMPおよびStateRAMPの継続的モニタリングのロギングへマッピングするよう設計されており、コンプライアンスチームが必要とする成果物が既定で生成される。FedRAMPまたはStateRAMPの認可境界はホスティング環境から継承され、ローカルデモの範囲外である。
仕組みを証明する実行可能なデモであり、導入ではなく、法的助言でもない。コーパスは12条項の合成だが忠実なデモグラフである。実効テキストはNYC Administrative Code、NY Labor Law、NYC Health Codeの実在する参照条項から言い換えられ、現実的なラベル、機関、罰則、日付を伴う。市条例の取り込みと311エスカレーションコネクタはシミュレーションである。決定論的チェック、ゲート、記録は表示どおりに正確に動作する。
このデモの背後にある研究 — アーキテクチャ、検証設計、そしてエンタープライズ・ブループリント。
ソリューション全体
法令を引用する政府AIソリューションを見る →すべての回答が現行法に遡れることの証明が、難しい部分である。それを私たちが構築する。
市の名の下に誤った回答を出荷することなく、市民にAI回答をどう与えるかを検討している機関であれば、貴機関と法務局がそれをどう考えているかを、ぜひ伺いたい。問題は州をまたいで広がっており、答えもそうなる。