税务合规 AI 核验

你的税务 AI 没有准确性问题。它有的是核验问题。

StatuteGuard 是一层供应商中立的核验层,对照已编码的成文法,以确定性方式证明 AI 起草的税务立场。从任一平台粘贴一份立场,它即返回硬性的 PASS、BLOCK 或 NEEDS-REVIEW,并附带成文法引用链以及一份可归档的 IRC §6662 审计记录。智能体建议,代码裁定。

71.4%

确定性覆盖率

42 例标注黄金集

100%

关卡精确度,0 次误拦截

42 例标注黄金集

20%

IRC §6662 准确性罚金

落在签署人身上

这是可运行的演示,而非一次部署。所有立场均为合成;成文法逻辑以制定法为依据。并非税务或法律意见。

起草问题正在被解决。核验问题并未被解决。

行业争相自动化起草。Thomson Reuters「Ready to Review」自动编制 1040 表,CCH Axcess Expert AI 在数千家事务所起草咨询洞察,Blue J 回答研究问题。没有人自动化的,是罚金最高的那一步:这份立场在成文法下是否真正站得住脚?

真正的失败模式不是语法糟糕。而是自信的错误分类:一份看似合理、写得漂亮的立场,却把一项扣除放在了错误的行上。当 AI 把一项扣除误分类为线上扣除而非线下扣除时, 20% 的 IRC §6662 准确性相关罚金由签署申报表的人承担,而非起草该立场的算法。§6663 欺诈罚金最高可达 75%。美国企业税务合规成本已超过每年 $126B,而 IRS 大型企业审计率已从 8.8% 升至 22.6%(WP#1 解决方案研究,2026 年)。

你不能指望用产生错误的同一套权重,让一个 LLM 去监管另一个 LLM。模型内自检跑的正是当初把立场分错类的同一推理。持久的答案是活在模型之外的核验。

智能体建议,代码裁定。

StatuteGuard 反转了信任模型。AI 可以起草,但由确定性策略引擎决定该立场是否站得住脚。唯一的 LLM 步骤是提取:把杂乱的自然语言变成结构化、带类型的主张。不确定时它弃权。下游的一切都是模型无法覆盖的代码。我们称之为神经符号:神经提取,符号核验。

阶段 运行内容 谁裁定
提取 LLM 阅读立场备忘并提出带类型的主张,同时报告置信度。低于置信度下限时,它升级处理而非自行裁定。 LLM(仅作咨询)
检索 GraphRAG 遍历 IRC 交叉引用知识图谱,拉取相关条款及其带类型的关系。 确定性
核验 真实的 OPA/Rego 策略(或一套完全相同的纯 Python 孪生实现)对照已编码的成文法检验该主张。 确定性
关卡 PASS(站得住脚)、BLOCK(与已编码成文法相矛盾)、NEEDS-REVIEW(真正的灰色地带)或 OUT-OF-COVERAGE(未在 V1 中编码)。 确定性
审计 将一份可归档的 IRC §6662 尽职调查记录写为 JSON,外加一份可打印的 HTML 证书。 确定性

因为裁定是策略代码而非一次模型调用,你可以阅读 Rego 并确认它与成文法相符。核验层作为基础设施运行,以每秒数万条立场的量级衡量(各次运行大约 40k 到 60k,取决于机器与运行),而不是按条做模型推理。

本版本已编码的条款:OBBBA QPVLI(§163(h)(4) / §63(b)(7))、§199A QBI、§163(j) 企业利息限制、§1031 同类置换、§280A 家庭办公、§30D 清洁车辆抵免,以及 §62/§63 的 AGI 区分。该集合之外的一切返回 OUT-OF-COVERAGE 并转给人工。StatuteGuard 并不声称已编码全部 IRC。

它抓住什么,用三种方式展示

演示走一遍 BLOCK、一遍 PASS 和一次升级,全部基于合成立场。下方截图是正在运行的应用的真实画面。

锚点案例:一份被起草为线上扣除的 OBBBA 车贷利息立场

一份起草声明写道:「新的 OBBBA 车贷利息扣除是一项线上扣除,会降低客户的 AGI。」它看似合理、写得漂亮,但是错的。合格乘用车贷款利息在 §63(b)(7) 下是线下扣除;它并不降低 AGI。按本演示自带的 README,主流报税指引(包括 H&R Block 的网站)一直将其误标为线上扣除。StatuteGuard 返回 BLOCK:请勿申报,并动画展示引用链 §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63,并标出若按起草内容申报会连锁破坏的 5 项下游后果:AGI、与 AGI 挂钩的州税、Medicare IRMAA 保费、医疗费用扣除门槛,以及学生贷款收入驱动还款。

StatuteGuard 裁定屏幕,显示对 OBBBA 车贷利息立场作出 BLOCK:请勿申报,成文法锚定阶段在 7 微秒内渲染,六个成文法节点从 §163(h)(1) 到 §63,以及针对 AGI、州所得税、Medicare IRMAA、医疗费用门槛和学生贷款 IDR 的五格下游连锁。

提取步骤耗时 5.93s;确定性锚定在微秒级渲染出裁定。

一次干净的 §1031 置换通过

一次合规的投资不动产同类置换返回 CLEARED:可按起草内容安全申报,并带有其自身的双节点引用链(§1031(a)(1) 与 §1031(a)(2)-TCJA)。这才是真正要紧的纪律:正确的立场绝不会被误标。黄金集上关卡精确度为 100%,误拦截为 0。

StatuteGuard 对投资不动产的 §1031 同类置换显示 CLEARED、可安全申报,并给出 §1031(a)(1) 与 §1031(a)(2)-TCJA 的双节点成文法锚定图。

一个 §280A 灰色地带升级处理

一份家庭办公立场,若档案未能证明专属经营用途,则属于事实与情况检验,落在确定性覆盖之外。StatuteGuard 返回 NEEDS HUMAN REVIEW 而不是虚张声势。LLM 提出可核验的主张并报告置信度;低于下限时,该立场被升级,从不由模型自行裁定。

StatuteGuard 对一份档案未能证明专属使用的 §280A 家庭办公立场运行流水线,图注说明灰色地带立场被路由至 NEEDS HUMAN REVIEW。

你可以亲自阅读这些策略

策略规则查看器把确定性成文法逻辑显示为可读的决策表,旁边是真实的 OPA/Rego 源码。这正是一层你可以为之辩护的核验层的要点:你确认代码与成文法相符,而不是去信任模型对它的摘要。

StatuteGuard 策略规则面板,显示 §280A 家庭办公和 §30D 清洁车辆抵免的决策表,包括 MSRP 上限和修正 AGI 上限,上方为真实的 OPA/Rego 源码注释。

每一次裁定都写出一份可归档记录

审计阶段生成一份 Form SG-6662 尽职调查工作底稿:来源、主要成文法依据、提取出的主张、裁定叙述,以及完整引用链,可打印或另存为 PDF 并保留在客户档案中。它支持 §6662 合理事由立场;它不是意见。

StatuteGuard 可打印尽职调查证书,Form SG-6662,针对被拦截的 OBBBA 立场,显示来源工作底稿、主要来源、提取出的主张、尽职调查裁定清单、裁定叙述以及成文法引用链。

在标注黄金集上测量,在本地评估

「运行基准」回放一套 42 条立场的标注黄金集(14 条干净、16 条错误、12 条升级)。记分板报告 71.4% 确定性覆盖率、100% 关卡精确度且 0 次误拦截、100% 错误捕获完整率,以及 100% 正确升级灰色地带,每一次裁定都与其标签相符。这些描述的是核验层,而非模型错误率,因此在基础模型改进后仍然成立。构建期间,裁定对照 OPA 1.17.1 交叉核验,并在全部 42 例上与纯 Python 孪生实现完全吻合。

StatuteGuard 黄金集基准记分板:71.4% 确定性覆盖率、100% 关卡精确度且零次误拦截、100% 错误捕获完整率、100% 灰色地带被正确升级,以及每秒 58,648 条立场,下方是预期裁定与实际裁定的逐案对照表。

这些数字是在已编码条款的固定 42 例标注黄金集上测得的,并非开放世界担保。

核验层放在哪里

StatuteGuard 并不与你的起草工具竞争,也不取代合规平台。它叠在你已在使用的任何工具之上,检查它们做不到的那一件事:起草的立场对照成文法是否成立。

问题 起草 AI(ONESOURCE、CCH Axcess、Blue J、ChatGPT) LLM 自检 StatuteGuard
主要职责 编制并起草立场 重读自己的草稿 对照成文法核验一份已起草的立场
谁作出裁定 一个语言模型 同一个模型,同一套权重 确定性策略引擎(OPA/Rego)
面对真正的灰色地带 写出言之凿凿的文字 写出言之凿凿的文字 升级给人工(NEEDS-REVIEW / OUT-OF-COVERAGE)
可归档的 §6662 记录 是,一份可打印的尽职调查工作底稿
读取任一平台的输出 绑定于其自身产品 绑定于其自身模型 设计上供应商中立

本演示不做的事

  • 这是可运行的演示,而非已部署的流水线。它证明机制;它不是带客户的生产系统。
  • ONESOURCE、CCH Axcess 和 Blue J 连接器、实时 LLM 调用以及 Neo4j 图均为模拟或桩实现。演示运行在缓存回放提取和内存 JSON 图上,以便离线工作;FastAPI 和 Neo4j 是文档中的生产替换。
  • 展示的每一份立场都是合成的。成文法逻辑以制定法为依据(IRC 与《联邦公报》);这些立场是说明性的,并非真实纳税人或客户。
  • 它编码的是特定条款集合,而非全部 IRC。该集合之外的一切返回 OUT-OF-COVERAGE 并转给人工。
  • 基准数字在已编码条款的 42 例标注黄金集上成立。它们不是「零错误」或「保证合规」的开放世界担保。
  • 它支持 §6662 合理事由与尽职调查立场。它不是税务或法律意见。

税务与合规团队真正会问的问题

这与我们的报税软件或像 Blue J 这样的 AI 研究工具有何不同?

那些工具负责起草和编制。StatuteGuard 负责核验。它是叠在你已在使用的平台之上的供应商中立层:从 ONESOURCE、CCH Axcess、Blue J、ChatGPT 或内部模型粘贴一份立场,它即对照已编码成文法返回硬性的 PASS、BLOCK 或 NEEDS-REVIEW。它不编制申报表,也不取代合规平台;它检查起草工具看不见的立场级错误。

我能信任一个 AI 去检查另一个 AI 的工作吗?

不能,StatuteGuard 也不要求你这样做。唯一的 LLM 步骤是提取:把杂乱语言变成结构化主张。裁定由确定性策略引擎作出(真实的 OPA/Rego,或一套完全相同的纯 Python 孪生实现),模型无法覆盖。你不能指望用产生错误的同一套权重让一个 LLM 去监管另一个 LLM,因此决定活在模型之外、你可以对照成文法阅读的策略代码里。

当一份立场落入规则未覆盖的灰色地带时会发生什么?

它升级给人工,而不是猜测。真正的事实与情况问题(例如 §280A 家庭办公)返回 NEEDS-REVIEW;本版本未编码的条款返回 OUT-OF-COVERAGE。两者都转给审核人,而不是自信的虚张声势。在 42 例标注黄金集上,灰色地带被正确升级的比例为 100%;覆盖率如实陈述为 71.4%。

我们的客户数据或该立场会离开我们的环境吗?

演示完全在本地运行,无需 API 密钥,默认使用缓存回放提取,因此立场或客户数据不必离开边界。这种本地、封闭、可审计的姿态是有意为之:Heppner 裁决(SDNY,2026 年 2 月)就一次面向公开 AI 工具的研究查询提出了特权放弃问题。该架构被设计为特权安全,而不是把立场发送到外部服务。

它是否实时接入 ONESOURCE、CCH Axcess 或 Blue J?

在本演示中不会。ONESOURCE、CCH Axcess 和 Blue J 的 REST 连接器、实时 LLM 调用以及 Neo4j 图均为模拟或桩实现;演示运行在缓存回放和内存 JSON 图上,以便始终离线可用。核验机制是真实的,并且设计上供应商中立;生产构建将 FastAPI、Neo4j 和实时连接器文档化为替换路径。

71.4% 覆盖率和 100% 精确度这些数字究竟意味着什么?

它们是在已编码条款的固定 42 条立场标注黄金集上测得的,并非开放世界担保。在该集合上:71.4% 的立场在无需升级的情况下被确定性裁定,关卡精确度为 100% 且 0 次误拦截,每一次裁定都与其标签相符。这些描述的是核验层的覆盖率与精确度,而非模型错误率,因此在基础模型改进后仍然成立。它支持 §6662 尽职调查立场;它不是税务或法律意见。

技术研究

支撑本演示的研究——架构、核验设计,以及企业蓝图。

在你的 AI 与你的签名之间放一层核验层

20% 的罚金落在签署人身上,而非起草的模型。确定性核验器是你证明哪条成文法条款支撑了哪份立场的方式。

若你的团队正在权衡如何核验 AI 起草的税务立场,而又不想信任一个模型去监管另一个模型,我们真心希望对照一下你们的思路。这个问题是全行业的,答案也将如此。

核验评估

  • 绘制 AI 起草的立场进入你申报工作流的位置
  • 识别应首先编码的最高罚金条款
  • 审查你当前的 §6662 尽职调查证据轨迹
  • 评估你的 AI 工具在 Heppner 之后的特权暴露

构建确定性层

  • 将你的优先条款编码为可读的 OPA/Rego 策略
  • 在你的平台上立起 PASS / BLOCK / NEEDS-REVIEW 关卡
  • 把供应商中立连接器接到你已在运行的工具
  • 生成带完整引用链的可归档 §6662 记录
社交媒体

同步发布于