정부 챗봇 위의 거버넌스 계층

법을 인용하는 정부 AI, 그렇지 않으면 침묵합니다.

시(市)의 .gov 도메인에서 나온 잘못된 답변은 시의 공인된 권위를 등에 업습니다. CivicCite는 존재하는, 효력이 있는, 인용된 텍스트로부터 함의되며, 충돌이 없는 법령을 담은 시민 답변만 내보냅니다. 그렇지 않으면 기권하고, 올바른 부서로 이관하며, 기록을 남깁니다. 에이전트는 자문하고, 게이트가 결정합니다.

0 / 12

검증되고 효력 있는 법령 근거 없이 내보낸 답변

고정된 12개 질의 골든셋에 대한 목표

100%

법령 결정 기록 적용 범위

질의당 제출 가능한 기록 하나, 내보내든 거부하든

4

게이트 조건, 내보내려면 모두 충족해야 함

존재, 효력 있음, 함의됨, 충돌 없음

이는 12개 지자체 법규 조항으로 이루어진 합성적이되 충실한 코퍼스 위의 실행 가능한 데모입니다. 지자체 법규 수집과 311 이관 커넥터는 시뮬레이션되며, 결정론적 게이트와 기록은 표시된 그대로 정확히 실행됩니다. 법률 자문이 아닙니다.

시 도메인에서의 확신에 찬 잘못된 답변은 기능이 아니라 책임입니다

CivicCite가 막도록 설계된 실패 모드입니다.

정부 챗봇은 시민에게 확신을 담은 잘못된 법률 답변을 주고, 모든 잘못된 답변은 시의 공인된 권위를 등에 업습니다. 2023년 10월에 출시된 NYC의 MyCity 봇은 The Markup(2024년 3월)에 의해, 집주인에게 섹션 8 바우처를 거부할 수 있다고, 사업체에게 현금 없는 매장이 가능하다고, 고용주에게 직원 팁을 가져갈 수 있다고 말한 사실이 기록되었습니다. 그 답변은 하나하나가 불법이었습니다.

검색을 추가해도 해결되지 않습니다. Stanford와 JELS 연구진(Magesh et al., 2025)은 Lexis+ AI의 환각을 17퍼센트, Westlaw AI-Assisted Research의 환각을 33퍼센트로 측정했습니다. 검색은 법령을 가져오지만, 생성은 여전히 이를 오독하거나 무시합니다. 위험한 경우는 지어낸 인용이 아닙니다. 올바른 법령을 인용하면서 잘못된 결론을 진술하는 경우, 또는 폐지된 조항을 여전히 현행인 것처럼 인용하는 경우입니다.

노출은 실제이며 커지고 있습니다. 2026년 27개 주에 걸쳐 78개의 챗봇 법안이 있고, 뉴욕의 S7263은 2026년 2월 26일 상원 본회의에 상정되었으며, EU AI Act Annex III 고위험 의무는 2026년 8월 2일부터 집행 가능하고 벌금은 최대 1,500만 유로 또는 매출의 3퍼센트입니다. 정부 법률 자문은 고유 기능(proprietary-function) 영역에 있으므로, 주권 면책 방패는 없습니다. 지속 가능한 요건은 더 나은 모델이 아닙니다. 내보낸 모든 답변이 현행법에 추적됨을 규제 당국에 입증하는 것입니다.

법령 결정 게이트의 작동 방식

LLM 에이전트는 자문합니다. 에이전트 프레임워크 밖의 결정론적 코드가 무엇을 내보낼지를 결정합니다. LLM은 스스로 게이트를 통과하도록 투표할 수 없습니다.

각 시민 질의는 왼쪽에서 오른쪽으로 실행됩니다: Decompose, 이어서 Retrieve, 이어서 Draft, 이어서 Verify, 이어서 게이트, 이어서 기록. Decompose(LLM, 자문)는 질의를 원자적 법률 하위 질문으로 나눕니다. Retrieve(결정론적, LLM 없음)는 어휘 검색과 상호 참조의 계층적 순회로 큐레이션된 지자체 법규 지식 그래프를 탐색하며, 각 후보는 인용 id, 텍스트, 시행일, 폐지일, 처벌, 기관을 담습니다. Draft(LLM, 제약됨)는 검색된 집합에서만 가져온 인용과 함께 주장을 제안하며, 허용 목록 검증기와 한 번의 재질의로 강제됩니다.

게이트가 요구하는 네 가지 점검

Verify는 초안된 주장마다 세 가지 점검을 실행하고, 게이트는 이를 인용-존재 조건과 결합합니다. 네 가지가 모두 성립할 때만 하위 답변을 내보냅니다.

1. 인용이 존재함

인용된 인용 id가 지자체 법규 그래프의 실제 조항으로 해석됩니다. 초안된 답변은 검색 집합에 없는 조항 번호를 지어낼 수 없습니다.

2. 효력 있음 (현행성)

결정론적: 조항에 폐지일이 없고 시행일이 기준일 당일 또는 그 이전입니다. 폐지되었거나 아직 시행되지 않은 조항은 내보낸 답변의 근거가 될 수 없습니다.

3. 함의됨

자문 LLM 점검: 인용된 텍스트가 실제로 주장을 뒷받침하는가, entailed, contradicted, 또는 neutral을 반환하는가? 이는 올바른 법령을 인용하면서 잘못된 결론을 진술하는 경우를 잡아냅니다.

4. 충돌 없음

결정론적: 함의 판정과 독립적으로 그래프의 conflicts-with 간선을 읽으므로, 서로 모순되는 두 조항이 조용히 내보내진 답변을 만들지 않습니다.

게이트와 기록

법령 결정 게이트는 에이전트 프레임워크 밖에 존재하는 결정론적 Python입니다. 인용이 존재하고 조항이 효력이 있으며 인용된 텍스트가 함의되고 충돌이 없을 때만 하위 답변을 내보냅니다. 그렇지 않으면 하위 답변을 보류하고, 검증된 적용 범위 밖으로 표시하며, 올바른 부서로 라우팅합니다. 질의당 RELEASED, PARTIAL, 또는 REFUSED and ESCALATED의 세 처분 중 하나로 집계됩니다.

내보내든 거부하든 모든 질의에 대해, 결정론적 작성기가 법령 결정 기록을 생성합니다. 하위 질문, 네 가지 점검과 그 판정, 인용, 처분, 그리고 무언가 보류되었을 때의 이관 대상. 그것이 법무국과 규제 당국이 조치할 수 있는 산출물이며, 지속 가능한 지표가 환각률이 아니라 입증 가능한 비내보내기인 이유입니다.

처음부터 끝까지 풀어 본 포착 사례

현행성 기준일 2026-06-17. 아래의 모든 이미지는 실행 중인 앱의 스크린샷입니다.

실제 MyCity 섹션 8 질의, 함의에 의해 포착됨

집주인이 섹션 8 바우처로 임대료를 내는 임차인을 거부할 수 있는지 묻습니다. 표준 어시스턴트는 확신에 찬 불법적인 "yes"를 내보냅니다. CivicCite도 "yes"를 초안하지만, 함의 점검은 NYC Admin. Code section 8-107(5)에 의해 contradicted로 읽습니다. 이 조항은 소득원에 따른 차별을 위법으로 만듭니다(NYC Commission on Human Rights, 고의 위반 시 민사 벌금 최대 250,000달러). 게이트는 초안을 차단하고, 대신 검증됨, entailed, 효력 있음으로 표시된 올바른 인용 근거 "No"를 내보냅니다. 왼쪽 패널은 검증 게이트가 없는 일반 검색 챗봇이고, 오른쪽 패널은 전체 파이프라인을 실행하는 CivicCite입니다.

분할 화면: 왼쪽의 표준 검색 챗봇은 섹션 8 바우처 질의에 검증되지 않은 답변을 내보내는 반면, 오른쪽의 CivicCite는 Decompose, Retrieve, Draft, Verify, Gate 파이프라인을 실행하고 NYC Admin. Code section 8-107(5)에 대해서만, 검증됨 및 효력 있음으로 표시하여 답변을 내보냅니다.
왼쪽: 표준 어시스턴트, 법령 근거 없음, 그대로 내보냄. 오른쪽: CivicCite 게이트 RELEASED, 검증되고 효력 있는 인용으로 뒷받침됨.

Verify 단계 내부, 인용된 텍스트에 대해

어느 단계든 원시 입력과 출력을 보려면 클릭할 수 있습니다. Verify 단계는 초안된 주장과 그 인용 id가 들어가고, 함의 판정이 나옵니다: entailed, 이유는 섹션 8 주택 바우처를 포함하는 합법적 소득원 때문에 임대를 거부하는 것에 관한 정확한 조항 문구를 인용합니다. 이것이 올바른 법령을 올바른 결론과 함께 인용하는 경우와 올바른 법령을 잘못된 결론과 함께 인용하는 경우를 가르는 점검입니다.

초안된 주장과 그 인용 id를 입력으로, 인용된 조항의 합법적 소득원 및 섹션 8 주택 바우처에 관한 문구를 인용한 이유와 함께 entailed로 표시된 함의 출력을 보여주는 Verify 단계 상세 패널.
Verify 단계: 초안된 주장과 인용된 법령 텍스트가 들어가고, 뒷받침하는 이유와 함께 entailed 판정이 나옵니다.

폐지된 조항, 현행성에 의해 포착되고 이관됨

푸드트럭 운영자가 일반 판매업자 주차 규칙 아래 유료 주차 공간에 하루 종일 주차하는 것에 대해 묻습니다. 이를 다루는 유일한 조항은 폐지되었고, 현재 효력 있는 조항은 그 질문을 규율하지 않습니다. 현행성 점검이 실패하므로 CivicCite는 답변을 합성하지 않습니다. 보류하고, 부분 소견을 첨부하여 NYC 311 일반 접수로 질문을 라우팅하며, 처분 REFUSED and ESCALATED를 반환합니다. 정직한 기권이 확신에 찬 잘못된 답변보다 낫습니다.

CivicCite가 이를 다루는 유일한 조항이 폐지되었고 효력 있는 법령이 규율하지 않아 푸드트럭 주차 답변을 보류하는 모습. 점검은 cite-exists, in-force, entailed가 실패하고 no-conflict는 통과하며, NYC 311 일반 접수로 라우팅됨.
보류됨: 효력 있는 법령이 질문을 규율하지 않으므로, 허위 답변 없이 부분 소견과 함께 NYC 311로 이관됩니다.

모든 상호작용에 대한 제출 가능한 기록

내보내든 거부하든 모든 질의는 법령 결정 기록을 생성합니다. 하위 질문, 그 영역, 초안된 주장과 인용, 불리언 판정이 있는 네 가지 점검, 결정, 함의 레이블, 그리고 보류 사유 또는 이관 대상을 담습니다. 또한 매핑하는 표준, NIST AI RMF 거버넌스 및 측정 로깅과 FedRAMP 및 StateRAMP 지속적 모니터링을 인증이 아닌 정렬 방향으로 명시합니다.

질의, 처분 RELEASED, 매핑하는 표준, 영역·주장·인용을 담은 하위 답변, 그리고 citation-exists, in-force, entailed, no-conflict 네 점검이 모두 true인 JSON을 보여주는 법령 결정 기록 서랍.
법령 결정 기록: 처분, 네 가지 점검, 인용, 그리고 매핑하는 표준, 질의당 하나.

지자체 법규 그래프, 그리고 골든셋 벤치마크

코퍼스는 7개 타이틀에 걸친 12개 조항이며, 현행성 기준일은 2026-06-17입니다. 효력 있는 노드는 녹색, 의도적으로 폐지된 하나의 노드는 빨간색 점선, 상호 참조 간선이 표시되어 검색 순회가 보입니다. 고정된 12개 질의 골든셋(문서화된 네 가지 MyCity 실패, 다중 영역 푸드트럭 사례, 폐지만 있는 함정, 적용 범위 없음 함정)에서 실행하면, 앱은 검증되고 효력 있는 법령 근거 없이 내보낸 답변 0 of 12, 감사 기록 적용 범위 100퍼센트, 레이블된 정답과의 처분 일치 100퍼센트를 보고합니다. 우리는 그 수치를 이 레이블된 골든셋에 귀속하며, 개방 세계 보장으로 결코 제시하지 않습니다.

7개 타이틀에 걸친 12개 조항의 지자체 법규 그래프. 효력 있는 노드는 녹색, 폐지된 하나의 노드는 빨간색 점선, belongs-to-title과 파란색 점선 상호 참조 간선으로 연결됨. 현행성 기준일 2026-06-17.
지자체 법규 그래프: 효력 있는 노드는 녹색, 폐지된 노드는 빨간색 점선, 상호 참조는 점선.
골든셋 벤치마크 타일: 검증되고 효력 있는 법령 근거 없이 내보낸 답변 0 of 12, 목표 0, 감사 기록 적용 범위 100퍼센트, 레이블된 정답과의 처분 일치 100퍼센트.
골든셋: 검증된 근거 없이 내보낸 답변 0 of 12, 기록 적용 범위 100퍼센트, 처분 일치 100퍼센트.

표준 정부 챗봇 대 CivicCite

데모가 비교하는 바로 그 분할 화면, 나란히.

차원 표준 챗봇 (MyCity 아키텍처) CivicCite 법령 결정 게이트
무엇을 내보낼지를 누가 결정하는가 LLM이 초안한 것을 그대로 내보냄 에이전트 밖의 결정론적 Python 게이트
올바른 법령, 잘못된 결론 그대로 내보냄 함의 점검에 의해 포착됨
폐지된 조항이 인용됨 그대로 내보냄 현행성 점검에 의해 포착됨
법령이 질문을 다루지 않음 어쨌든 답변을 합성함 기권하고 부서로 이관함
감사 추적 없음 질의당 법령 결정 기록 하나
입증 가능한 비내보내기 측정되지 않음 레이블된 골든셋에서 0 of 12

이 데모가 하지 않는 것

  • ✓ 환각 제로 또는 보편적 정확성 보장을 주장하지 않습니다. 측정된 결과는 고정되고 레이블된 골든셋에서 검증되고 효력 있는 법령 근거 없이 내보낸 답변 0 of 12이며, 개방 세계 약속이 아닙니다.
  • ✓ 라이브 커넥터를 사용하지 않습니다. 지자체 법규 수집은 PDF, HTML, 또는 CMS 정규화기가 아니라 하나의 정규화된 그래프로 제공되며, 311 및 CRM 이관은 계산되어 표시되지만 Salesforce Gov Cloud 또는 ServiceNow 커넥터는 라이브 통합이 아니라 인터페이스입니다.
  • ✓ 코퍼스를 법적 공식 원본으로 제시하지 않습니다. NYC Administrative Code, NY Labor Law, NYC Health Code의 실제 참조 조항에서 의역한 12개 조항의 합성적이되 충실한 데모 그래프입니다. 이는 법률 자문이 아닙니다.
  • ✓ FedRAMP, StateRAMP, 또는 NIST 인증을 주장하지 않습니다. 규제 매핑은 인증이 아니라 정렬 방향이며, 인가 경계는 호스팅 환경에서 상속됩니다.
  • ✓ 고객, 배포, 추천사, 또는 ROI를 담지 않습니다. 인터페이스의 Hartwell 311과 래핑된 표준 어시스턴트는 합성 데모 소품입니다. 이는 메커니즘을 입증하는 데모입니다.

구매자가 실제로 묻는 질문

이것은 NYC의 MyCity 같은 또 다른 정부 챗봇인가요?

아닙니다. CivicCite는 챗봇이 아니며 지자체 법규 검색 엔진도 아닙니다. 챗봇 플랫폼 위에 놓이는 거버넌스 계층이며, 클라우드 AI 서비스와 GovTech 벤더가 갖지 못한 부분입니다. 에이전트 프레임워크 밖의 결정론적 Python 게이트는 인용이 존재하고, 효력이 있으며, 인용된 텍스트로부터 함의되고, 충돌이 없을 때만 시민 답변을 내보냅니다. 데모의 챗봇은 합성 소품이고, 게이트가 제품입니다.

정부 AI가 시민에게 불법 조언을 주지 못하게 하려면 어떻게 하나요?

LLM은 자문만 합니다. 질문을 분해하고 검색된 집합에서만 가져온 인용과 함께 주장을 초안합니다. 그런 다음 결정론적 코드가 인용된 법령이 존재하는지, 시행일 기준으로 효력이 있는지, 인용된 텍스트로부터 함의되는지, 충돌이 없는지를 점검하고, 게이트는 네 가지가 모두 성립할 때만 내보냅니다. 실제 MyCity 섹션 8 바우처 질의에서, 초안된 "yes"는 NYC Admin. Code section 8-107(5)에 의해 contradicted로 함의 점검에 포착되고, 게이트는 대신 올바른 인용 근거 "No"를 내보냅니다.

더 나은 모델이나 검색을 늘리면 환각 문제가 그냥 해결되는 것 아닌가요?

검색은 초안을 개선하지만, 답변이 내보내기에 안전함을 입증할 수는 없습니다. Stanford와 JELS 연구진(Magesh et al., 2025)은 검색 기반 법률 AI가 여전히 환각을 일으킨다고 측정했으며, Lexis+ AI는 17퍼센트, Westlaw AI-Assisted Research는 33퍼센트였습니다. 완벽한 모델이 있어도, 정부는 내보낸 모든 답변이 현행법에 추적됨을 규제 당국에 입증해야 합니다. 그 입증은 더 강한 작성기의 속성이 아니라 결정론적 게이트와 제출 가능한 기록의 속성입니다.

모든 답변이 현행법에 추적되었음을 규제 당국이나 감사인에게 입증할 수 있나요?

내보내든 거부하든 모든 질의는 법령 결정 기록을 생성하므로, 골든셋의 감사 적용 범위는 100퍼센트입니다. 각 기록은 하위 질문, 판정이 있는 네 가지 점검, 인용, 처분, 그리고 답하지 못한 부분이 이관된 곳을 담습니다. 규제 당국이 조치할 수 있는 헤드라인은 환각 퍼센트가 아닙니다. 검증되고 효력 있는 법령 근거 없이 내보낸 답변이 제로임을 모든 상호작용의 기록으로 뒷받침하여 보여줄 수 있다는 것입니다.

이것은 FedRAMP 또는 StateRAMP 인증인가요, 그리고 NIST AI RMF에는 어떻게 매핑되나요?

인증되지 않았으며, 그렇다고 주장하지 않습니다. 규제 프레이밍은 인증이 아니라 정렬과 방향입니다. 법령 결정 기록은 NIST AI RMF 문서화와 FedRAMP 및 StateRAMP 지속적 모니터링 로깅에 매핑되도록 설계되어, 컴플라이언스 팀이 필요로 하는 산출물이 기본적으로 생성됩니다. FedRAMP 또는 StateRAMP 인가 경계는 호스팅 환경에서 상속되며 로컬 데모의 범위를 벗어납니다.

이것은 라이브 제품인가요 데모인가요, 그리고 지자체 법규는 실제 법인가요?

메커니즘을 입증하는 실행 가능한 데모이지 배포가 아니며, 법률 자문이 아닙니다. 코퍼스는 12개 조항의 합성적이되 충실한 데모 그래프입니다: 조문 텍스트는 NYC Administrative Code, NY Labor Law, NYC Health Code의 실제 참조 조항에서 의역되었으며, 현실적인 레이블, 기관, 처벌, 날짜가 있습니다. 지자체 법규 수집과 311 이관 커넥터는 시뮬레이션되며, 결정론적 점검, 게이트, 기록은 표시된 그대로 정확히 실행됩니다.

기술 연구

이 데모의 배경 연구 — 아키텍처, 검증 설계, 그리고 엔터프라이즈 청사진.

.gov 도메인에서 시민 앞에 AI를 두시나요?

모든 답변이 현행법에 추적된다는 입증이 어려운 부분입니다. 우리가 구축합니다.

귀하의 기관이 시의 이름으로 잘못된 답변을 내보내지 않으면서 시민에게 AI 답변을 주는 방법을 저울질하고 있다면, 귀하와 법무국이 이를 어떻게 생각하고 계신지 진심으로 듣고 싶습니다. 문제는 여러 주에 퍼지고 있으며, 그에 대한 해답도 그러할 것입니다.

거버넌스 평가

  • ✓ 시민 대면 AI가 검증되지 않은 답변을 내보낼 수 있는 지점을 매핑
  • ✓ 귀하의 법규에 대한 인용-존재, 현행성, 함의, 충돌 점검을 정의
  • ✓ 올바른 부서로의 기권-및-이관 경로를 설계
  • ✓ 법무국이 필요로 하는 법령 결정 기록을 명시

게이트 구축

  • ✓ 귀하의 현행 지자체 법규 위의 결정론적 결정 게이트
  • ✓ 현행성과 상호 참조를 갖춘 지자체 법규 지식 그래프
  • ✓ NIST AI RMF 및 지속적 모니터링 로깅에 매핑된 제출 가능한 기록
  • ✓ 자문 전용 역할의, 제공자를 교체할 수 있는 LLM
소셜

다른 채널에도 게시됨