세무 컴플라이언스 AI 검증
StatuteGuard는 인코딩된 법령에 대해 AI가 작성한 세무 입장을 결정론적으로 입증하는 벤더 중립적 레이어입니다. 어떤 플랫폼에서든 입장을 붙여넣으면, 법령 인용 사슬과 제출 가능한 IRC §6662 감사 기록과 함께 확정적인 PASS, BLOCK, 또는 NEEDS-REVIEW를 반환합니다. 에이전트가 자문하고, 코드가 결정합니다.
71.4%
결정론적 커버리지
42건 레이블 골든셋
100%
게이트 정밀도, 오차단 0건
42건 레이블 골든셋
20%
IRC §6662 정확성 가산세
서명한 사람에게 귀속됩니다
배포가 아닌 실행 가능한 데모입니다. 모든 입장은 합성이며, 법령 논리는 1차 법에 근거합니다. 세무 또는 법률 자문이 아닙니다.
업계는 초안 작성을 자동화하는 데 앞다퉈 뛰어들었습니다. Thomson Reuters "Ready to Review"는 1040 양식을 자동으로 준비하고, CCH Axcess Expert AI는 수천 개 회계법인에 걸쳐 자문 인사이트 초안을 작성하며, Blue J는 리서치 질문에 답합니다. 그 누구도 자동화하지 않은 것은 가산세가 가장 높은 단계입니다: 이 입장이 법령 하에서 실제로 방어 가능한가?
실제 실패 양식은 나쁜 문법이 아닙니다. 확신에 찬 오분류입니다: 공제를 잘못된 줄에 넣는, 그럴듯하고 잘 쓰인 입장. AI가 공제를 below-the-line이 아닌 above-the-line으로 오분류하면, 20% IRC §6662 정확성 관련 가산세는 초안을 작성한 알고리즘이 아니라 신고서에 서명한 사람에게 적용됩니다. §6663 사기 가산세는 최대 75%에 달합니다. 미국 기업 세무 컴플라이언스 비용은 이미 연간 $126B를 넘으며, IRS 대기업 감사율은 8.8%에서 22.6%로 상승했습니다(WP#1 솔루션 리서치, 2026).
오류를 만들어낸 바로 그 가중치를 통해 LLM이 다른 LLM을 단속하도록 신뢰할 수는 없습니다. 모델 내부 자가 점검은 애초에 입장을 오분류한 바로 그 추론을 다시 실행합니다. 지속 가능한 답은 모델 밖에서 이루어지는 검증입니다.
StatuteGuard는 신뢰 모델을 뒤집습니다. AI가 초안을 작성할 수는 있지만, 그 입장이 방어 가능한지는 결정론적 정책 엔진이 결정합니다. 유일한 LLM 단계는 추출로, 지저분한 자연어를 구조화되고 타입이 지정된 클레임으로 바꿉니다. 확신이 없으면 판정을 보류합니다. 그 이후의 모든 것은 모델이 덮어쓸 수 없는 코드입니다. 우리는 이를 뉴로-심볼릭이라고 부릅니다: 신경망 추출, 기호적 검증.
| 단계 | 무엇이 실행되는가 | 누가 결정하는가 |
|---|---|---|
| 추출 | LLM이 입장 메모를 읽고 타입이 지정된 클레임을 제안하며 신뢰도를 보고합니다. 신뢰도 하한 미만이면 판정하지 않고 에스컬레이션합니다. | LLM (자문 전용) |
| 검색 | GraphRAG가 IRC 상호 참조 지식 그래프를 순회하여 관련된 조항과 그 타입이 지정된 관계를 가져옵니다. | 결정론적 |
| 검증 | 실제 OPA/Rego 정책(또는 동일한 순수 Python 트윈)이 인코딩된 법령에 대해 클레임을 테스트합니다. | 결정론적 |
| 게이트 | PASS(방어 가능), BLOCK(인코딩된 법령과 모순), NEEDS-REVIEW(진정한 회색 지대), 또는 OUT-OF-COVERAGE(V1에 인코딩되지 않음). | 결정론적 |
| 감사 | 제출 가능한 IRC §6662 주의의무 기록을 JSON과 인쇄 가능한 HTML 인증서로 작성합니다. | 결정론적 |
판정이 모델 호출이 아니라 정책 코드이기 때문에, Rego를 읽고 법령과 일치하는지 확인할 수 있습니다. 검증 레이어는 입장당 모델 추론이 아니라 인프라로 실행되며, 초당 수만 건의 입장(실행마다 대략 40k to 60k, 머신과 실행에 따라 다름)으로 측정됩니다.
이 버전에 인코딩된 조항: OBBBA QPVLI(§163(h)(4) / §63(b)(7)), §199A QBI, §163(j) 사업 이자 제한, §1031 동종자산 교환, §280A 재택 사무실, §30D 친환경 차량 세액공제, 그리고 §62/§63 AGI 구분. 그 집합 밖의 모든 것은 OUT-OF-COVERAGE를 반환하고 사람에게 라우팅됩니다. StatuteGuard는 전체 IRC를 인코딩한다고 주장하지 않습니다.
데모는 모두 합성 입장에서 BLOCK, PASS, 에스컬레이션을 차례로 보여줍니다. 아래 스크린샷은 실행 중인 앱의 실제 캡처입니다.
작성된 문구는 다음과 같습니다: "새로운 OBBBA 자동차 대출 이자 공제는 고객의 AGI를 줄이는 above-the-line 공제입니다." 그럴듯하고, 잘 쓰였으며, 틀렸습니다. 적격 승용차 대출 이자는 §63(b)(7)에 따른 below-the-line 공제이며, AGI를 줄이지 않습니다. 데모 자체의 README에 따르면, 주류 세무 준비 안내(H&R Block 사이트 포함)가 이를 above-the-line으로 잘못 표기해 왔습니다. StatuteGuard는 다음을 반환합니다 BLOCK: DO NOT FILE, 인용 사슬 §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63을 애니메이션으로 보여주며, 작성된 대로 신고할 경우 무엇이 깨지는지에 대한 5방향 하방 연쇄를 표시합니다: AGI, AGI 연동 주세, Medicare IRMAA 보험료, 의료비 공제 기준선, 그리고 학자금 대출 소득연동 상환.
추출 단계는 5.93초가 걸렸고, 결정론적 근거 부여는 마이크로초 단위로 판정을 렌더링했습니다.
규정을 준수하는 투자 부동산의 동종자산 교환은 다음을 반환합니다 CLEARED: 작성된 대로 신고해도 안전합니다, 자체 2노드 인용 사슬(§1031(a)(1) 및 §1031(a)(2)-TCJA)과 함께. 이것이 중요한 규율입니다: 올바른 입장은 결코 잘못 플래그되지 않습니다. 골든셋에서 게이트 정밀도는 오차단 0건으로 100%입니다.
파일이 전속적 사업 사용을 입증하지 못하는 재택 사무실 입장은 사실관계 및 정황 판단이며, 결정론적 커버리지 밖입니다. StatuteGuard는 다음을 반환합니다 NEEDS HUMAN REVIEW 허세를 부리는 대신. LLM은 점검 가능한 클레임을 제안하고 신뢰도를 보고합니다. 신뢰도 하한 미만이면 입장은 에스컬레이션되며, 모델이 결코 판정하지 않습니다.
Policy Rules 뷰어는 실제 OPA/Rego 소스 옆에 읽기 가능한 결정 표로 결정론적 법령 논리를 보여줍니다. 이것이 방어할 수 있는 검증 레이어의 요점입니다: 모델의 요약을 신뢰하는 것이 아니라, 코드가 법령과 일치하는지 확인합니다.
감사 단계는 Form SG-6662 실사 작업문서를 생성합니다: 출처, 1차 법령 권위, 추출된 클레임, 판정 서술, 전체 인용 사슬이며, 인쇄하거나 PDF로 저장하여 고객 파일에 보관할 수 있습니다. §6662 정당한 사유 입장을 뒷받침하며, 자문이 아닙니다.
벤치마크 실행은 42건 레이블 골든셋(클린 14건, 오류 16건, 에스컬레이션 12건)을 재생합니다. 스코어보드는 결정론적 커버리지 71.4%, 오차단 0건의 게이트 정밀도 100%, 오류 포착 완전성 100%, 회색 지대의 올바른 에스컬레이션 100%를 보고하며, 모든 판정이 레이블과 일치합니다. 이는 모델 오류율이 아니라 검증 레이어를 기술하므로, 기반 모델이 개선되어도 유지됩니다. 구축 중 판정은 OPA 1.17.1에 대해 교차 검증되었고, 42건 모두에서 순수 Python 트윈과 정확히 일치했습니다.
이 수치는 인코딩된 조항의 고정된 42건 레이블 골든셋에서 측정된 것이며, 개방형 세계 보증이 아닙니다.
StatuteGuard는 초안 작성 도구와 경쟁하거나 컴플라이언스 플랫폼을 대체하지 않습니다. 이미 사용하는 것 위에 올라앉아, 그들이 할 수 없는 한 가지를 점검합니다: 작성된 입장이 법령에 대해 성립하는가.
| 질문 | 초안 작성 AI (ONESOURCE, CCH Axcess, Blue J, ChatGPT) | LLM 자가 점검 | StatuteGuard |
|---|---|---|---|
| 주된 역할 | 입장을 준비하고 초안을 작성 | 자체 초안을 다시 읽음 | 작성된 입장을 법령에 대해 검증 |
| 누가 판정을 내리는가 | 언어 모델 | 같은 모델, 같은 가중치 | 결정론적 정책 엔진 (OPA/Rego) |
| 진정한 회색 지대에서 | 확신에 찬 문장을 생성 | 확신에 찬 문장을 생성 | 사람에게 에스컬레이션 (NEEDS-REVIEW / OUT-OF-COVERAGE) |
| 제출 가능한 §6662 기록 | 아니요 | 아니요 | 예, 인쇄 가능한 실사 작업문서 |
| 어떤 플랫폼의 출력이든 읽음 | 자체 제품에 묶임 | 자체 모델에 묶임 | 설계상 벤더 중립적 |
그 도구들은 초안을 작성하고 준비합니다. StatuteGuard는 검증합니다. 이미 사용하는 플랫폼 위에 올라앉는 벤더 중립적 레이어입니다: ONESOURCE, CCH Axcess, Blue J, ChatGPT, 또는 내부 모델에서 입장을 붙여넣으면, 인코딩된 법령에 대해 확정적인 PASS, BLOCK, 또는 NEEDS-REVIEW를 반환합니다. 신고서를 준비하거나 컴플라이언스 플랫폼을 대체하지 않습니다. 초안 작성 도구가 볼 수 없는 입장 수준 오류를 점검합니다.
아니요, StatuteGuard도 그것을 요구하지 않습니다. 유일한 LLM 단계는 추출로, 지저분한 언어를 구조화된 클레임으로 바꿉니다. 판정은 결정론적 정책 엔진(실제 OPA/Rego, 또는 동일한 순수 Python 트윈)이 내리며, 모델이 덮어쓸 수 없습니다. 오류를 만들어낸 바로 그 가중치를 통해 LLM이 다른 LLM을 단속하도록 신뢰할 수는 없으므로, 결정은 법령에 비추어 읽을 수 있는 정책 코드 속, 모델 밖에 있습니다.
추측하는 대신 사람에게 에스컬레이션합니다. 진정한 사실관계 및 정황 질문(예: §280A 재택 사무실)은 NEEDS-REVIEW를 반환하고, 이 버전에 인코딩되지 않은 조항은 OUT-OF-COVERAGE를 반환합니다. 둘 다 확신에 찬 허세가 아니라 검토자에게 라우팅됩니다. 42건 레이블 골든셋에서 회색 지대는 100% 올바르게 에스컬레이션되었고, 커버리지는 71.4%로 정직하게 표기됩니다.
데모는 API 키 없이 완전히 로컬에서 실행되며, 기본적으로 캐시된 재생 추출을 사용하므로 입장이나 고객 데이터가 경계를 벗어날 필요가 없습니다. 그 로컬·폐쇄·감사 가능한 태세는 Heppner 판결(SDNY, 2026년 2월)이 공개 AI 도구 리서치 질의에 대한 특권 포기 문제를 제기한 이후 의도된 것입니다. 아키텍처는 입장을 외부 서비스로 보내지 않도록, 특권 보호형으로 설계되었습니다.
이 데모에서는 아닙니다. ONESOURCE, CCH Axcess, Blue J REST 커넥터, 라이브 LLM 호출, Neo4j 그래프는 시뮬레이션되거나 스텁 처리됩니다. 데모는 캐시된 재생과 인메모리 JSON 그래프로 항상 오프라인에서 작동합니다. 검증 메커니즘은 실재하며 설계상 벤더 중립적입니다. 프로덕션 빌드는 FastAPI, Neo4j, 라이브 커넥터를 교체 경로로 문서화합니다.
인코딩된 조항의 고정된 42건 레이블 골든셋에서 측정된 것이며, 개방형 세계 보증이 아닙니다. 그 집합에서: 입장의 71.4%가 에스컬레이션 없이 결정론적으로 해결되었고, 게이트 정밀도는 오차단 0건으로 100%였으며, 모든 판정이 레이블과 일치했습니다. 이는 모델 오류율이 아니라 검증 레이어의 커버리지와 정밀도를 기술하므로, 기반 모델이 개선되어도 유지됩니다. §6662 주의의무 입장을 뒷받침하며, 세무 또는 법률 자문이 아닙니다.
20% 가산세는 초안을 작성한 모델이 아니라 서명한 사람에게 귀속됩니다. 결정론적 검증기가 어떤 법령 조항이 어떤 입장을 뒷받침했는지 입증하는 방법입니다.
팀이 한 모델이 다른 모델을 단속하도록 신뢰하지 않고 AI가 작성한 세무 입장을 검증하는 방법을 저울질하고 있다면, 그 생각을 비교하고 싶습니다. 문제는 업계 전반의 것이며, 답도 그럴 것입니다.