税务合规 AI 核验
StatuteGuard 是一层供应商中立的核验层,对照已编码的成文法,以确定性方式证明 AI 起草的税务立场。从任一平台粘贴一份立场,它即返回硬性的 PASS、BLOCK 或 NEEDS-REVIEW,并附带成文法引用链以及一份可归档的 IRC §6662 审计记录。智能体建议,代码裁定。
71.4%
确定性覆盖率
42 例标注黄金集
100%
关卡精确度,0 次误拦截
42 例标注黄金集
20%
IRC §6662 准确性罚金
落在签署人身上
这是可运行的演示,而非一次部署。所有立场均为合成;成文法逻辑以制定法为依据。并非税务或法律意见。
行业争相自动化起草。Thomson Reuters「Ready to Review」自动编制 1040 表,CCH Axcess Expert AI 在数千家事务所起草咨询洞察,Blue J 回答研究问题。没有人自动化的,是罚金最高的那一步:这份立场在成文法下是否真正站得住脚?
真正的失败模式不是语法糟糕。而是自信的错误分类:一份看似合理、写得漂亮的立场,却把一项扣除放在了错误的行上。当 AI 把一项扣除误分类为线上扣除而非线下扣除时, 20% 的 IRC §6662 准确性相关罚金由签署申报表的人承担,而非起草该立场的算法。§6663 欺诈罚金最高可达 75%。美国企业税务合规成本已超过每年 $126B,而 IRS 大型企业审计率已从 8.8% 升至 22.6%(WP#1 解决方案研究,2026 年)。
你不能指望用产生错误的同一套权重,让一个 LLM 去监管另一个 LLM。模型内自检跑的正是当初把立场分错类的同一推理。持久的答案是活在模型之外的核验。
StatuteGuard 反转了信任模型。AI 可以起草,但由确定性策略引擎决定该立场是否站得住脚。唯一的 LLM 步骤是提取:把杂乱的自然语言变成结构化、带类型的主张。不确定时它弃权。下游的一切都是模型无法覆盖的代码。我们称之为神经符号:神经提取,符号核验。
| 阶段 | 运行内容 | 谁裁定 |
|---|---|---|
| 提取 | LLM 阅读立场备忘并提出带类型的主张,同时报告置信度。低于置信度下限时,它升级处理而非自行裁定。 | LLM(仅作咨询) |
| 检索 | GraphRAG 遍历 IRC 交叉引用知识图谱,拉取相关条款及其带类型的关系。 | 确定性 |
| 核验 | 真实的 OPA/Rego 策略(或一套完全相同的纯 Python 孪生实现)对照已编码的成文法检验该主张。 | 确定性 |
| 关卡 | PASS(站得住脚)、BLOCK(与已编码成文法相矛盾)、NEEDS-REVIEW(真正的灰色地带)或 OUT-OF-COVERAGE(未在 V1 中编码)。 | 确定性 |
| 审计 | 将一份可归档的 IRC §6662 尽职调查记录写为 JSON,外加一份可打印的 HTML 证书。 | 确定性 |
因为裁定是策略代码而非一次模型调用,你可以阅读 Rego 并确认它与成文法相符。核验层作为基础设施运行,以每秒数万条立场的量级衡量(各次运行大约 40k 到 60k,取决于机器与运行),而不是按条做模型推理。
本版本已编码的条款:OBBBA QPVLI(§163(h)(4) / §63(b)(7))、§199A QBI、§163(j) 企业利息限制、§1031 同类置换、§280A 家庭办公、§30D 清洁车辆抵免,以及 §62/§63 的 AGI 区分。该集合之外的一切返回 OUT-OF-COVERAGE 并转给人工。StatuteGuard 并不声称已编码全部 IRC。
演示走一遍 BLOCK、一遍 PASS 和一次升级,全部基于合成立场。下方截图是正在运行的应用的真实画面。
一份起草声明写道:「新的 OBBBA 车贷利息扣除是一项线上扣除,会降低客户的 AGI。」它看似合理、写得漂亮,但是错的。合格乘用车贷款利息在 §63(b)(7) 下是线下扣除;它并不降低 AGI。按本演示自带的 README,主流报税指引(包括 H&R Block 的网站)一直将其误标为线上扣除。StatuteGuard 返回 BLOCK:请勿申报,并动画展示引用链 §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63,并标出若按起草内容申报会连锁破坏的 5 项下游后果:AGI、与 AGI 挂钩的州税、Medicare IRMAA 保费、医疗费用扣除门槛,以及学生贷款收入驱动还款。
提取步骤耗时 5.93s;确定性锚定在微秒级渲染出裁定。
一次合规的投资不动产同类置换返回 CLEARED:可按起草内容安全申报,并带有其自身的双节点引用链(§1031(a)(1) 与 §1031(a)(2)-TCJA)。这才是真正要紧的纪律:正确的立场绝不会被误标。黄金集上关卡精确度为 100%,误拦截为 0。
一份家庭办公立场,若档案未能证明专属经营用途,则属于事实与情况检验,落在确定性覆盖之外。StatuteGuard 返回 NEEDS HUMAN REVIEW 而不是虚张声势。LLM 提出可核验的主张并报告置信度;低于下限时,该立场被升级,从不由模型自行裁定。
策略规则查看器把确定性成文法逻辑显示为可读的决策表,旁边是真实的 OPA/Rego 源码。这正是一层你可以为之辩护的核验层的要点:你确认代码与成文法相符,而不是去信任模型对它的摘要。
审计阶段生成一份 Form SG-6662 尽职调查工作底稿:来源、主要成文法依据、提取出的主张、裁定叙述,以及完整引用链,可打印或另存为 PDF 并保留在客户档案中。它支持 §6662 合理事由立场;它不是意见。
「运行基准」回放一套 42 条立场的标注黄金集(14 条干净、16 条错误、12 条升级)。记分板报告 71.4% 确定性覆盖率、100% 关卡精确度且 0 次误拦截、100% 错误捕获完整率,以及 100% 正确升级灰色地带,每一次裁定都与其标签相符。这些描述的是核验层,而非模型错误率,因此在基础模型改进后仍然成立。构建期间,裁定对照 OPA 1.17.1 交叉核验,并在全部 42 例上与纯 Python 孪生实现完全吻合。
这些数字是在已编码条款的固定 42 例标注黄金集上测得的,并非开放世界担保。
StatuteGuard 并不与你的起草工具竞争,也不取代合规平台。它叠在你已在使用的任何工具之上,检查它们做不到的那一件事:起草的立场对照成文法是否成立。
| 问题 | 起草 AI(ONESOURCE、CCH Axcess、Blue J、ChatGPT) | LLM 自检 | StatuteGuard |
|---|---|---|---|
| 主要职责 | 编制并起草立场 | 重读自己的草稿 | 对照成文法核验一份已起草的立场 |
| 谁作出裁定 | 一个语言模型 | 同一个模型,同一套权重 | 确定性策略引擎(OPA/Rego) |
| 面对真正的灰色地带 | 写出言之凿凿的文字 | 写出言之凿凿的文字 | 升级给人工(NEEDS-REVIEW / OUT-OF-COVERAGE) |
| 可归档的 §6662 记录 | 否 | 否 | 是,一份可打印的尽职调查工作底稿 |
| 读取任一平台的输出 | 绑定于其自身产品 | 绑定于其自身模型 | 设计上供应商中立 |
那些工具负责起草和编制。StatuteGuard 负责核验。它是叠在你已在使用的平台之上的供应商中立层:从 ONESOURCE、CCH Axcess、Blue J、ChatGPT 或内部模型粘贴一份立场,它即对照已编码成文法返回硬性的 PASS、BLOCK 或 NEEDS-REVIEW。它不编制申报表,也不取代合规平台;它检查起草工具看不见的立场级错误。
不能,StatuteGuard 也不要求你这样做。唯一的 LLM 步骤是提取:把杂乱语言变成结构化主张。裁定由确定性策略引擎作出(真实的 OPA/Rego,或一套完全相同的纯 Python 孪生实现),模型无法覆盖。你不能指望用产生错误的同一套权重让一个 LLM 去监管另一个 LLM,因此决定活在模型之外、你可以对照成文法阅读的策略代码里。
它升级给人工,而不是猜测。真正的事实与情况问题(例如 §280A 家庭办公)返回 NEEDS-REVIEW;本版本未编码的条款返回 OUT-OF-COVERAGE。两者都转给审核人,而不是自信的虚张声势。在 42 例标注黄金集上,灰色地带被正确升级的比例为 100%;覆盖率如实陈述为 71.4%。
演示完全在本地运行,无需 API 密钥,默认使用缓存回放提取,因此立场或客户数据不必离开边界。这种本地、封闭、可审计的姿态是有意为之:Heppner 裁决(SDNY,2026 年 2 月)就一次面向公开 AI 工具的研究查询提出了特权放弃问题。该架构被设计为特权安全,而不是把立场发送到外部服务。
在本演示中不会。ONESOURCE、CCH Axcess 和 Blue J 的 REST 连接器、实时 LLM 调用以及 Neo4j 图均为模拟或桩实现;演示运行在缓存回放和内存 JSON 图上,以便始终离线可用。核验机制是真实的,并且设计上供应商中立;生产构建将 FastAPI、Neo4j 和实时连接器文档化为替换路径。
它们是在已编码条款的固定 42 条立场标注黄金集上测得的,并非开放世界担保。在该集合上:71.4% 的立场在无需升级的情况下被确定性裁定,关卡精确度为 100% 且 0 次误拦截,每一次裁定都与其标签相符。这些描述的是核验层的覆盖率与精确度,而非模型错误率,因此在基础模型改进后仍然成立。它支持 §6662 尽职调查立场;它不是税务或法律意见。
20% 的罚金落在签署人身上,而非起草的模型。确定性核验器是你证明哪条成文法条款支撑了哪份立场的方式。
若你的团队正在权衡如何核验 AI 起草的税务立场,而又不想信任一个模型去监管另一个模型,我们真心希望对照一下你们的思路。这个问题是全行业的,答案也将如此。