CFO 및 재무 리더용4 분 소요

세무 규제 준수에서 AI를 신뢰할 수 있는가? 아직은 아닙니다.

주요 AI 모델이 당사가 실시한 모든 세무 컴플라이언스 테스트에서 불합격했습니다. 그리고 IRS는 상대평가로 점수를 주지 않습니다.

과제

Veriprajna가 새로운 자동차 대출 이자 공제에 관한 특정 세무 질문으로 ChatGPT, Claude, Gemini를 감사했을 때, 모든 모델이 오답을 냈습니다. 가끔 틀린 것이 아닙니다. 예외 없이 매번 틀렸습니다. 각 AI는 One Big Beautiful Bill Act(OBBBA)에 따른 새로운 공제가 조정총소득(AGI)을 낮출 것이라고 사용자에게 자신 있게 안내했습니다. 하지만 그 답변은 법적으로 틀렸습니다. 해당 공제는 AGI가 아닌 과세표준 소득(Taxable Income)을 낮춥니다. 세법상 이 둘은 완전히 다른 개념입니다.

이는 우연한 오류가 아니었습니다. 이러한 AI 시스템의 학습 방식 자체에 내재된 예측 가능한 실패였습니다. AI는 법률을 과도하게 단순화한 수천 편의 블로그 게시물과 SEO 최적화 기사를 학습했습니다. 실제 법 조문은 훈련 데이터에 한두 번 등장했을 뿐이지만, 블로그 게시물은 수천 번 등장했습니다. 그 결과 AI는 대중적으로 널리 퍼진, 그러나 잘못된 버전의 규칙을 학습한 것입니다.

백서에서는 이를 "합의 오류(Consensus Error)"라고 부릅니다. AI에 정보가 부족했던 것이 아닙니다. AI가 법률의 정답 대신 대중의 답변을 선택한 것입니다. 재무팀이 해당 AI에 의존하면 회사는 대중의 오류를 그대로 이어받게 됩니다. 그리고 미국 국세청(IRS)은 "아마 맞을 것이다"라는 변명을 방어 수단으로 인정하지 않습니다.

비즈니스에 미치는 영향과 위험

이는 추상적인 AI 문제가 아닙니다. 기업의 최종 수익(바텀라인), 세무조사 위험, 규제 준수 의무에 직격탄을 날립니다.

OBBBA 자동차 대출 공제는 연간 ,000를 한도로 하며 특정 소득 수준에서 점진적으로 축소(단계적 폐지)됩니다. 단독 신고자의 경우 ,000를 초과하는 소득 **,000당 **씩 공제액이 감소하여 ,000에서 완전히 사라집니다. 부부 공동 신고자의 경우 감축은 ,000에서 시작하여 ,000에서 끝납니다. AI가 AGI와 과세표준 소득의 구분을 틀릴 경우, 그 후속 피해는 연쇄적으로 확산됩니다.

  • 연방세 과소 납부. 시스템이 이 항목을 총소득공제(above-the-line deduction)로 분류하면 IRS가 예상하는 것보다 낮은 AGI를 신고하게 됩니다. 이는 가산세 부과로 가는 직행로입니다.
  • 주 세무조사 위험. 애리조나주와 같은 주들은 주세 계산을 연방 AGI에 연동합니다. AGI가 잘못되면 AGI 연동형 과세를 시행하는 모든 주에서 주세 계산이 잘못됩니다.
  • 메디케어 보험료 산정 오류. AI의 조언에 의존하는 은퇴자는 결코 실현되지 않을 보험료 인하를 AI가 약속했기 때문에 예상치 못한 IRMAA(소득 관련 월별 조정액) 추가 할증료에 직면할 수 있습니다.
  • 의료비 공제 불인정. 의료비 공제 기준 하한선(floor)은 AGI에 연동됩니다. 잘못 낮아진 AGI를 기준으로 삼으면 자격이 없는 공제를 청구하게 됩니다.
  • 대출기관 보고 의무 위반. OBBBA는 제6050AA조(Section 6050AA)를 신설하여 적격 이자가 ** 이상** 발생하는 모든 대출에 대해 대출기관이 정보 보고서를 제출하도록 의무화했습니다. 차입자의 혜택에만 초점을 맞춘 AI 시스템은 대출기관의 보고 의무를 일상적으로 누락합니다. 이는 미국 내국세법 제6721조/제6722조(IRC Sections 6721/6722)에 따른 구조적인 규제 준수 위반입니다.

이사회는 IRS의 통지서를 받고 나서야 이러한 오류를 알게 되는 상황을 결코 원치 않습니다.

물밑에서 실제로 일어나는 기술적 실체

이러한 문제가 왜 반복되는지 이해하려면 AI 모델이 실제로 어떻게 작동하는지 살펴봐야 합니다. 대규모 언어 모델(LLM)은 공인회계사(CPA)처럼 세법을 "이해"하지 않습니다. 훈련 중에 흡수한 패턴을 기반으로 문장에서 다음 단어를 예측할 뿐입니다. 매우 정교한 자동완성 엔진인 셈입니다.

비유하자면 이렇습니다. 1,000명이 모인 방에서 세무 질문을 던진다고 상상해 보십시오. 그중 900명은 지나치게 단순화된 동일한 블로그 게시물을 읽었습니다. 실제 법 조문을 읽은 사람은 100명뿐입니다. 다수결로 투표하면 오답이 900대 100으로 이깁니다. 이것이 바로 LLM 내부에서 일어나는 일입니다. 모델은 대중적인 버전을 훨씬 더 자주 접했기 때문에 정답보다 대중적인 답변에 더 큰 가중치를 둡니다.

이것이 바로 Veriprajna 연구에서 "합의 오류(Consensus Error)"라고 부르는 실패 모드입니다. 특정 세무 세부 사항에 대해 블로그 생태계의 90%가 잘못 알고 있다면(신규 법안의 경우 흔한 일입니다), 모델은 수학적으로 오답을 내놓을 수밖에 없습니다. 아무리 기발한 프롬프트를 작성해도 이를 해결할 수 없습니다. 수학적 원리 자체가 불리하게 작용하기 때문입니다.

AI에 실제 원본 문서를 제공하는 기술인 검색 증강 생성(RAG)조차 여기서는 한계를 드러냅니다. 테스트에서 OBBBA 법안 전문이 제공된 모델도 여전히 오답을 냈습니다. 이유는 무엇일까요? 법 조문에는 "제163조(h)를 다음과 같이 삽입하여 개정한다..."라고 적혀 있으며, 블로그 글처럼 읽히지 않습니다. AI는 여전히 이를 해석해야 합니다. 그리고 내부 가중치가 수백만 개의 잘못된 예시로 훈련되어 있다면, 올바른 문서를 읽고도 잘못된 결론을 도출합니다. 이미 "믿고 있는" 내용을 확증하는 편향된 독자처럼 행동하는 것입니다.

더 심각한 문제는 추론 과정을 볼 수 없다는 점입니다. RAG 시스템은 어떤 문서를 검색했는지는 보여주지만, 해당 문서에서 답변으로 이어지는 논리적 경로는 보여주지 않습니다. 규제 준수팀은 출처는 확인할 수 있어도 추론은 검증할 수 없습니다. 감사 증적(audit trail)이 있어야 할 자리가 블랙박스로 남아 있는 것입니다.

유효한 해결책과 효과 없는 임시방편

귀사의 팀이 이미 시도하고 있을 만한 방법과 그것이 왜 충분하지 않은지부터 살펴보겠습니다.

프롬프트 엔지니어링: AI에게 "단계별로 생각하라"거나 "수석 세무 감사관처럼 행동하라"고 지시해도 모델에 애초에 존재하지 않는 추론 능력이 생기지는 않습니다. 질문을 어떻게 구성하든 동일하게 편향된 가중치 내에서 작동할 뿐입니다.

더 큰 모델 또는 컨텍스트 윈도우: 동일한 인터넷 데이터를 기반으로 훈련된 더 큰 모델은 동일한 오답 콘텐츠를 더 많이 흡수할 뿐입니다. 데이터 양을 늘린다고 해서 잘못된 출처와 올바른 출처의 비율이 개선되지는 않습니다.

표준 RAG 파이프라인: AI에 공식 문서를 제공하는 것은 검색에는 도움이 되지만 모델은 읽은 내용에 대해 여전히 추론을 수행해야 합니다. 벡터 검색은 자동차 대출에 관한 단락은 찾을 수 있어도 제62조의 AGI 정의는 결코 검색하지 못할 수 있습니다. 해당 조문에는 자동차 대출에 대한 언급이 없기 때문입니다. 세법에서는 법률에 포함된 내용만큼이나 제외(생략)된 내용이 중요합니다. 벡터 검색은 '부재(존재하지 않음)'를 검색할 수 없습니다.

실제로 효과가 있는 것은 언어 이해와 법률적 추론을 분리하는 시스템인 뉴로-심볼릭 아키텍처입니다. 3단계 작동 방식은 다음과 같습니다.

  1. AI가 입력을 판독 (신경망 계층). 청구서나 대출 문서를 업로드하거나 질문을 입력합니다. AI는 차량 종류, 구매일, 최종 조립 장소, 대출 금액 등 구조화된 사실 정보를 추출합니다. 정형화되지 않은 복잡한 실제 데이터를 처리하지만, 공제의 유효성 여부는 결코 판단하지 않습니다.

  2. 논리 엔진이 법률을 적용 (기호 논리 계층). 구조화된 사실 정보는 실제 법 조문을 코드로 구현한 룰 엔진으로 전달됩니다. 이 엔진은 법률을 실행 가능한 코드로 변환하기 위해 특별히 설계된 Catala와 같은 언어를 사용하여 결정론적 검증을 실행합니다. 차량이 미국 내에서 조립되었는가? 소득이 감축 기준선 미만인가? 이 계층은 블로그 글에 접근할 수 없으며 오직 코드 형태의 법률만을 인식합니다.

  3. AI가 결과를 설명 (신경망 계층). 논리 엔진은 구체적인 법 조문 참조와 함께 '승인(ALLOWED)' 또는 '불인정(DENIED)' 판정을 반환합니다. 그런 다음 AI는 이를 귀사의 팀이 쉽게 읽고 이해할 수 있는 명확한 설명으로 변환합니다.

결정적인 차이점은 AI가 법률적 문제를 직접 판단하지 않는다는 것입니다. AI는 인간의 언어를 구조화된 데이터로 변환하고 논리 출력을 다시 인간의 언어로 번역할 뿐입니다. 법률 자체는 결정론적 코드로 실행됩니다.

이를 통해 어떤 챗봇도 제공할 수 없는 결정론적 감사 증적을 확보할 수 있습니다. 감사관이 "시스템이 왜 이 공제를 허용했는가?"라고 물었을 때 그 대답은 "확률적으로 그렇기 때문"이 아닙니다. 대출일자 확인, 차량 종류 확인, 조립 장소 확인, ,000 소득 기준 미만 확인, 적용 법조문 IRC § 163(h)(4)와 같은 추적 가능한 경로입니다. 이 증적은 IRS 세무조사관이나 내부 감사위원회에 그대로 제출할 수 있습니다. 이는 귀사의 AI를 블랙박스에서 연구진이 부르는 "글래스 박스(Glass Box)"로 탈바꿈시킵니다.

핵심 요점

  • ChatGPT, Claude, Gemini 모두 새로운 공제가 세금 신고서의 어느 항목에 적용되는지 혼동하여 동일한 세무 컴플라이언스 테스트에서 전원 불합격했습니다.
  • "합의 오류(Consensus Error)"는 AI가 법 조문의 정답 대신 블로그의 대중적 오답을 학습함을 의미하며, 신규 법안에 대해서는 수학적으로 거의 불가피합니다.
  • RAG(올바른 문서 제공)는 문제를 해결하지 못합니다. AI가 오답 콘텐츠로 훈련된 편향된 내부 가중치로 여전히 추론하기 때문입니다.
  • 뉴로-심볼릭 접근법은 언어 이해와 법률 논리를 분리하므로 AI가 법적 결정을 내리지 않고 결정론적 코드가 판단을 수행합니다.
  • 그 결과 규제 준수팀이 규제 기관에 직접 제출할 수 있는 감사 가능한 논리 증적이 생성되어 블랙박스가 글래스 박스(Glass Box)로 대체됩니다.

결론

표준 AI 모델은 구조적으로 신뢰할 수 있는 세무 컴플라이언스 업무를 수행할 능력이 없습니다. AI는 인터넷에서 학습하며, 인터넷은 세법의 미묘한 차이를 대규모로 왜곡합니다. 해결책은 더 나은 프롬프트가 아니라, 법률을 코드로 실행하고 모든 답변에 대해 감사 가능한 논리 증적을 생성하는 시스템입니다. AI 벤더에게 물어보십시오. "귀사의 시스템이 공제를 총소득공제(above-the-line)와 과세표준 소득공제(below-the-line)로 분류할 때, 감사관에게 시스템이 따른 정확한 법률적 논리 경로를 보여줄 수 있습니까?"

자주 묻는 질문

자주 묻는 질문

왜 ChatGPT는 세무 질문에서 오답을 내놓나요?

ChatGPT를 비롯한 AI 모델은 세법을 지나치게 단순화한 블로그 게시물과 기사가 넘쳐나는 인터넷에서 학습합니다. 수천 개의 블로그가 규칙을 잘못 설명하고 실제 법 조문은 훈련 데이터에 몇 번만 등장하는 경우, AI는 잘못된 버전을 학습하게 됩니다. 이를 '합의 오류(Consensus Error)'라고 부르며, 대중적인 답변이 법적으로 올바른 답변을 압도하는 현상입니다.

RAG(검색 증강 생성)로 세무 컴플라이언스의 AI 환각을 해결할 수 있나요?

검색 증강 생성(RAG)은 AI에 올바른 원본 문서를 제공하지만, '검색'만 해결할 뿐 '추론'은 해결하지 못합니다. 테스트 결과 세법 원문을 제공받은 AI 모델도 수백만 개의 잘못된 예시로 학습된 내부 가중치 편향 때문에 올바른 문서를 읽고도 오답을 냈습니다. 또한 RAG는 세법에서 매우 중요한 '법률에 생략된 제외 사항'을 검색할 수 없습니다.

금융을 위한 뉴로-심볼릭 AI란 무엇인가요?

뉴로-심볼릭 AI는 현대 AI의 언어 이해 능력과 법률을 코드로 실행하는 결정론적 논리 엔진을 결합합니다. AI는 청구서나 질문과 같은 비정형 입력을 처리하여 구조화된 사실을 추출한 다음, 실제 법률을 적용하는 룰 엔진에 전달합니다. AI는 결과를 설명할 뿐 법적 판단을 직접 내리지 않습니다. 이를 통해 모든 답변에 대한 완벽한 감사 증적이 생성됩니다.

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.