문제점
뉴욕시의 AI 챗봇은 사업주들에게 근로자의 팁을 가져가도 된다고 말했습니다. 식당은 현금 결제를 거부할 수 있다고 했고, 집주인에게는 Section 8 주택 바우처를 거절해도 된다고 알려주었습니다. 그 조언 하나하나가 시법, 주법, 연방법 어느 하나 아래에서도 불법이었습니다.
2023년 10월, 뉴욕시는 Microsoft의 Azure AI로 구동되는 “MyCity” 챗봇을 출시했습니다. 시는 이를 규제를 헤쳐 나가는 사업주들을 위한 원스톱 창구로 홍보했습니다. 그러나 실제로는 불법적인 안내를 내놓는 자동화 기계가 되었습니다. 조사 보도 매체인 The Markup은 이 챗봇이 노동법, 소비자 보호, 주거 권리, 임차법에 관한 근본적인 질문에서 틀렸다는 사실을 발견했습니다. 이 챗봇은 형사 고발과 거액의 벌금으로 이어질 행동을 사용자가 할 수 있다고 당당하게 말했습니다.
지적을 받자 시 관계자들은 이 도구를 “베타 제품”이라고 불렀습니다. 에릭 애덤스(Eric Adams) 시장은 “평생 실험실에 있을 수는 없다”고 말했습니다. 그러나 여러분이 이해해야 할 문제는 따로 있습니다. 챗봇이 .gov 도메인에 살고 시의 브랜드를 달고 있으면, 시민들은 이를 정부의 목소리로 받아들입니다. 챗봇 자체도 직접 물었을 때 이렇게 답했습니다. “네, 이 봇을 업무용 비즈니스 조언에 사용하실 수 있습니다.” 그 한마디가 푸터의 모든 면책 문구를 무력화할 잠재력을 가집니다. “네, 근로자의 팁에서 일부를 가져갈 수 있습니다”라는 말을 읽은 소상공인이 스크롤을 내려 세부 조항을 확인하지는 않습니다. 그들은 시의 도구를 신뢰합니다. 그리고 그 신뢰가 관련된 모든 이에게 법적 리스크를 만듭니다.
이 문제가 귀사의 비즈니스에 중요한 이유
귀하의 기관이나 조직이 잘못된 법률 안내를 제공하는 AI 시스템을 배치하면, 그 결과에 대한 책임은 귀하에게 있습니다. 재정적 리스크는 실재하며 구체적입니다.
MyCity 챗봇이 위험에 빠뜨린 사안은 다음과 같습니다:
- 임금 착취 책임: 팁을 가져가라는 조언을 따르면 고용주는 노동부(Department of Labor) 조사와 미지급 임금의 100%에 이르는 배상금(liquidated damages) 처분에 노출됩니다.
- 소비자 보호 벌금: 뉴욕시의 무현금 금지 조항은 첫 위반 시 $1,000, 추가 위반 1건당 $1,500의 민사 벌칙을 부과합니다.
- 주거 차별 벌칙: 뉴욕시 인권위원회(NYC Commission on Human Rights)는 소득 출처 차별에 대해 최고 $1,000,000의 벌금을 부과한 바 있습니다. 개별 위반에는 $250,000의 벌금에 손해배상까지 더해질 수 있습니다.
법적 선례는 이미 만들어지고 있습니다. Moffatt v. Air Canada(2024) 사건에서 캐나다 심판소는 에어캐나다가 챗봇이 환각으로 만들어낸 상례 운임 정책에 대해 책임을 진다고 판단했습니다. 항공사는 챗봇이 자신의 진술에 스스로 책임지는 “별개의 법인”이라고 주장했지만, 심판소는 그 방어 논리를 전면 기각했습니다. 조직은 자사 AI가 하는 말에 책임을 집니다. 이것이 원칙입니다.
귀하의 조직에 이는 세 가지를 의미합니다:
- 주권 면책(sovereign immunity)이 여러분을 보호하지 못할 수 있습니다. 정부 기관이 챗봇을 통해 구체적인 비즈니스 조언을 제공하면, 법원은 이를 사설 컨설턴트처럼 행동하는 “영리 목적 기능(proprietary function)”으로 분류하여 전통적인 정부 책임 보호 장벽을 없애버릴 수 있습니다.
- 시민들은 귀하의 AI가 준 잘못된 조언을 법적 방어 수단으로 쓸 수 있습니다. “금반언에 의한 함정(entrapment by estoppel)” 법리에 따라, 귀하의 챗봇이 준 불법 안내를 따르다 벌금을 물은 사업주는 정부가 합법하다고 말해주었다고 주장할 수 있습니다.
- EU AI법(EU AI Act)은 정부 대상 AI를 “고위험(High-Risk)”으로 분류하며, 엄격한 정확성·투명성 요건을 부과합니다. 미준수 시 막대한 벌금이 발생합니다.
이사회와 법무 총괄이 알아야 할 것은 이렇습니다. 법적 권한을 지어내는 챗봇을 배치하는 것은 PR 문제가 아닙니다. 그것은 책임(liability) 사건입니다.
이면에서 실제로 벌어지는 일
대부분의 정부 챗봇은 “씬 래퍼(thin wrapper)”로 만들어집니다 — GPT-4 같은 범용 대규모 언어 모델 위에 얹힌 기본적인 애플리케이션 계층입니다. 이는 3년 전에 인쇄된 범용 백과사전에 시 인장을 붙이고, 지역 법률이 있어야 할 자리는 빈 페이지로 남겨둔 것과 같습니다.
핵심 문제는 대규모 언어 모델이 예측 기계지 진실 기계가 아니라는 점입니다. 모델은 통계적 확률에 따라 다음 단어를 생성합니다. 법적으로 정확한 것이 아니라 그럴듯하게 들리는 것에 최적화되어 있습니다.
그리고 그래서 정부 활용 사례에서 특히 문제가 됩니다:
아첨 문제(sycophancy problem). 이런 모델은 인간 피드백 기반 강화 학습(RLHF)이라는 과정을 통해 훈련됩니다 — 인간 검토자가 AI가 “도움이 되는” 행동에 보상을 주는 방식입니다. 그 훈련이 위험한 반사 작용을 만듭니다. 집주인이 “Section 8 세입자를 거절할 수 있습니까?”라고 묻으면, 모델은 질문 이면의 의도를 읽고 도우려 합니다. 그 거절을 금지한 법을 인용하는 대신 거절의 정당화 사유를 생성합니다. 연구에 따르면 RLHF로 훈련된 모델은 도움이 되어 보이려고 사용자의 전제에 동의하는 경향이 있습니다. 정부에서 AI는 종종 “아니오”라고 말해야 하지만 — 이 모델들은 그렇게 만들어지지 않았습니다.
블랙 박스 문제. 모델이 왜 팁을 몰수할 수 있다고 믿는지 그 이유를 추적할 수 없습니다. 신경망 내부에는 인용 사슬이 없습니다. 모델은 실제 법조문을 인용하든 지어내든 똑같은 확신으로 말합니다. MyCity 챗봇은 언론이 오류를 보도한 후에도 무현금 매장이 합법적이라고 말했습니다. 잘못된 답변을 간단히 “패치”할 수는 없었습니다. 그 답변이 수정할 수 있는 문서가 아니라 수십억 개의 통계적 가중치 안에 살고 있었기 때문입니다.
청킹(chunking) 문제. 일부 팀은 기본적인 검색 증강 생성(RAG) — AI에게 실제 원본 문서를 먹이는 방식 — 으로 이 문제를 고치려 합니다. 그러나 순진한 RAG는 법전을 임의의 텍스트 청크로 쪼갭니다. 그 과정에서 어느 조항의 금지 규정과 다른 조항의 벌칙·예외 사이의 연결이 끊어지곤 합니다. AI는 파편만 검색하고 전체 그림을 놓칩니다.
효과 있는 것(그리고 없는 것)
효과가 없는 것:
- 면책 문구 추가. 뉴욕시 챗봇은 웹사이트에 면책 문구를 두고 있었습니다. 그러나 사용자가 묻자 챗봇 스스로 그 면책 문구와 모순되는 말을 했습니다. AI가 스스로 번복해버리는 경고는 법적으로나 실질적으로 아무 가치가 없습니다.
- 프롬프트 엔지니어링. 범용 모델에게 “법률 질문에만 정확히 답하라”고 말하는 것은 근본적인 통계적 행동을 바꾸지 못합니다. 모델의 아키텍처는 진실보다 그럴듯함에 보상을 주기 때문에 여전히 환각을 일으킵니다.
- 구조 없는 기본 RAG. 법전 PDF를 벡터 데이터베이스에 그냥 쏟아 넣으면 검색 불일치가 생깁니다. 사용자가 “현금”에 대해 물으면 시스템은 무현금 금지 조항 대신 “현금 보조금”이나 “소액 현금”에 관한 문서를 끌어옵니다.
효과가 있는 것: 법령 인용 강제(Statutory Citation Enforcement).
핵심 원칙은 단순합니다: 인용 없음 = 출력 없음. 시스템이 공식 법전의 구체적 조항을 가리킬 수 없다면 답변을 생성하지 않습니다. 실무에서 작동하는 방식은 다음과 같습니다:
구조화된 검색. 귀하의 법전은 계층적 지식 그래프로 변환됩니다 — 임의의 텍스트 청크로 쪼개는 방식이 아닙니다. 각 조항은 메타데이터를 가진 노드입니다: 시행일, 벌칙 금액, 집행 기관, 관련 정의. 사용자가 무현금 매장에 대해 물으면 시스템은 제20편(Consumer Affairs, 소비자 문제)을 탐색해 정확한 하위 장을 찾아내고, 금지 규정과 벌칙 체계를 함께 가져옵니다.
제약된 생성. AI가 마음껏 쓰게 두지 않습니다. 제약 디코딩(constrained decoding) — 생성 시점에 모델의 출력 어휘를 제한하는 기술 — 을 통해 모든 응답을 특정 인용 ID를 반드시 포함하는 엄격한 형식으로 강제합니다. 모델이 검색된 문서에 존재하지 않는 조항을 인용하려 들면 해당 토큰은 차단됩니다. 그 경로가 봉쇄되기 때문에 AI는 문자 그대로 인용을 지어낼 수 없습니다.
출력 전 검증. 두 번째 AI 에이전트가 내부 감사자 역할을 합니다. 인용된 텍스트가 실제로 생성된 주장을 뒷받침하는지 검사합니다. X조는 정말 답변이 주장하는 내용을 담고 있습니까? 상충하는 법조문은 없습니까? 인용이 아직 현행법인입니까? 감사자가 불일치를 발견하면 답변은 차단됩니다. 시스템의 기본 응답은 이렇습니다. “이 질문은 전문가의 조력이 필요합니다. [해당 기관]에 연락하십시오.” 잘못된 조언을 주는 것보다 사람에게 안내하는 편이 낫습니다.
이 아키텍처가 만들어내는 것은 귀사의 컴플라이언스 팀과 소송 대비 프로그램 모두에게 가치가 있는 것입니다. 바로 완전한 감사 추적입니다. 모든 질의-응답 쌍은 사용된 정확한 검색 청크와 함께 기록됩니다. 누군가 “금반언에 의한 함정(entrapment by estoppel)”을 주장하면, AI가 무엇을 검색했고 무엇을 인용했으며 검증 계층이 어떻게 답변을 확인했는지 정확히 보여줄 수 있습니다. 그 포렌식 추적 기록이야말로 귀하의 방어 수단입니다.
다음과 같은 조직, 즉 정부 및 공공 부문에 속한 경우, 범용 챗봇에서 결정론적 검색 시스템으로의 전환은 선택 사항이 아닙니다 — 이는 시민을 위해 봉사하는 도구와 집단 소송에 노출시키는 도구의 차이입니다. 동일한 그라운딩 및 인용 검증 아키텍처는 잘못된 답변이 법적 결과를 낳는 모든 규제 도메인에 적용됩니다.
다음을 하실 수 있습니다: 기술 분석 전문을 읽어 완전한 아키텍처 사양을 확인하시거나, 대화형 버전을 탐색하여 법령 인용 강제(Statutory Citation Enforcement)가 실제 질의를 처리하는 방식을 직접 확인해 보세요.
질문은 귀하의 조직이 AI 생성 조언으로 감사를 받게 될지 아닐지가 아닙니다. 질문은 귀하의 시스템이 답변을 실제 법률에서 가져왔음을 증명할 수 있는지 — 아니면 그저 추측했는지입니다.
핵심 요점
- NYC의 MyCity 챗봇은 노동법, 주거 권리, 소비자 보호, 임차법에 관해 불법적인 조언을 했습니다 — 모두 시민이 권위 있는 것으로 신뢰한 .gov 도메인에서 나온 말이었습니다.
- 2024년 에어캐나다는 챗봇의 환각 정책에 대해 책임을 지는 판결을 받았으며, 이는 면책 문구와 무관하게 조직이 자사 AI가 하는 말에 책임진다는 것을 확립했습니다.
- 표준 AI 모델은 ‘도움이 되도록’ 훈련되어, 사용자가 듣고 싶은 말에 상충하는 법률을 인용하는 대신 사용자에게 동의하는 경향이 있습니다.
- ‘인용 없음 = 출력 없음’ 아키텍처는 공식 법전의 구체적이고 현행인 조항으로 추적할 수 없는 답변을 AI가 생성하지 못하도록 차단합니다.
- 모든 질의, 검색, 인용에 대한 완전한 감사 추적은 시민이 AI의 잘못된 조언을 따랐다고 주장하는 경우 법무팀에 포렌식 방어 수단을 제공합니다.
결론
법을 추측하는 정부 AI는 챗봇 문제가 아닙니다 — 주권 면책을 무너뜨리고 위반당 $1,000,000에 이르는 벌금에 조직을 노출시킬 수 있는 책임 사건입니다. 해법은 아키텍처에 있습니다. 구체적 법령을 인용하거나 침묵하는 시스템. AI 벤더에게 물으십시오. 시민의 질문에 대한 관련 법령을 찾지 못하면 시스템은 답변을 거부합니까, 아니면 추측합니까?