税務コンプライアンスAI検証

税務AIに精度の問題があるのではない。検証の問題がある。

StatuteGuardは、AIが草案した税務ポジションをエンコードされた制定法に照らして決定論的に証明する、ベンダー中立のレイヤーです。どのプラットフォームからでもポジションを貼り付けると、制定法の引用チェーンと提出可能なIRC §6662監査記録とともに、確定的なPASS、BLOCK、またはNEEDS-REVIEWを返します。エージェントが助言し、コードが決定します。

71.4%

決定論的カバレッジ

42件ラベル付きゴールデンセット

100%

ゲート精度、誤ブロック0件

42件ラベル付きゴールデンセット

20%

IRC §6662正確性加算税

署名した人間に降りかかる

実行可能なデモであり、デプロイメントではありません。すべてのポジションは合成です。制定法ロジックは一次法に根拠を置いています。税務または法律の助言ではありません。

申告書作成の問題は解決されつつある。検証の問題は解決されていない。

業界は草案の自動化に邁進しました。Thomson Reutersの「Ready to Review」は1040を自動作成し、CCH Axcess Expert AIは数千のファームにわたってアドバイザリー洞察を草案し、Blue Jはリサーチの問いに答えます。誰も自動化していないのは、加算税が最も重いステップです。すなわち、このポジションは制定法の下で実際に防御可能なのか、という問いです。

真の失敗モードは、拙い文章ではありません。確信に満ちた誤分類です。すなわち、もっともらしく、よく書かれたポジションが、控除を誤った行に置くことです。AIが控除をbelow-the-lineではなくabove-the-lineとして誤分類すると、 申告書に署名した人間に20%のIRC §6662正確性関連加算税が適用され、草案を作成したアルゴリズムには適用されない。§6663の不正加算税は最大75%に達します。米国の事業税務コンプライアンスのコストはすでに年$126Bを超え、IRSの大規模法人監査率は8.8%から22.6%へと上昇しています(WP#1ソリューション調査、2026年)。

LLMに、誤りを生んだのと同じ重みでLLMを取り締まらせることはできません。モデル内の自己チェックは、そもそもポジションを誤分類したのとまったく同じ推論を走らせます。耐久性のある答えは、モデルの外側に生きる検証です。

エージェントが助言し、コードが決定します。

StatuteGuardは信頼モデルを反転させます。AIが草案することはできますが、ポジションが防御可能かどうかを決めるのは決定論的ポリシーエンジンです。唯一のLLMステップは抽出であり、雑然とした自然言語を構造化された型付きクレームに変換します。不確かなときは判断を控えます。下流のすべては、モデルが上書きできないコードです。これをニューロシンボリックと呼びます。ニューラル抽出、シンボリック検証です。

ステージ 何が動くか 誰が決めるか
Extract LLMがポジションメモを読み、型付きクレームを提案し、その信頼度を報告します。信頼度下限を下回ると、解決せずにエスカレーションします。 LLM(助言のみ)
Retrieve GraphRAGがIRC相互参照ナレッジグラフをたどり、対象となる条項とその型付き関係を引き出します。 決定論的
Verify 実際のOPA/Regoポリシー(または同一の純Pythonツイン)が、エンコードされた制定法に照らしてクレームを検証します。 決定論的
Gate PASS(防御可能)、BLOCK(エンコードされた制定法に矛盾)、NEEDS-REVIEW(真のグレーゾーン)、またはOUT-OF-COVERAGE(V1ではエンコードされていない)。 決定論的
Audit 提出可能なIRC §6662デューデリジェンス記録をJSONおよび印刷可能なHTML証明書として書き出します。 決定論的

判定はポリシーコードでありモデル呼び出しではないため、Regoを読んで制定法と一致することを確認できます。検証レイヤーはインフラとして動作し、1ポジションごとのモデル推論ではなく、1秒あたり数万件のポジションで測定されます(実行によりおよそ40k〜60k、マシンと実行に依存)。

このバージョンでエンコードされている条項:OBBBA QPVLI(§163(h)(4) / §63(b)(7))、§199A QBI、§163(j)事業利子制限、§1031同種交換、§280Aホームオフィス、§30Dクリーン車両税額控除、および§62/§63のAGI区分。この集合の外側はすべてOUT-OF-COVERAGEを返し、人間に回されます。StatuteGuardはIRC全体をエンコードしているとは主張しません。

何を捉えるか、3通りの実例で

デモはBLOCK、PASS、エスカレーションを、すべて合成ポジションで順に示します。以下のスクリーンショットは、稼働中のアプリの実キャプチャです。

アンカー:above-the-lineとして草案されたOBBBA自動車ローン利子ポジション

草案された記述は次のとおりです。「新しいOBBBA自動車ローン利子控除は、顧客のAGIを減額するabove-the-line控除である。」もっともらしく、よく書かれており、そして誤りです。適格乗用車ローン利子は§63(b)(7)の下でbelow-the-line控除であり、AGIを減額しません。デモ自身のREADMEによれば、主流の税務申告ガイダンス(H&R Blockのサイトを含む)はこれをabove-the-lineと誤表示しています。StatuteGuardは BLOCK: DO NOT FILEを返し、引用チェーン §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63 をアニメーションし、草案どおりに提出した場合に崩れるものの5方向下流カスケードをフラグします。AGI、AGI連動の州税、Medicare IRMAA保険料、医療費控除のフロア、学生ローンの所得連動型返済です。

StatuteGuardの判定画面。OBBBA自動車ローン利子ポジションに対しBLOCK: DO NOT FILEを表示。制定法グラウンディング段階は7マイクロ秒で描画され、§163(h)(1)から§63までの6つの制定法ノード、およびAGI、州所得税、Medicare IRMAA、医療費フロア、学生ローンIDRの5パネル下流カスケードを示す。

抽出ステップは5.93s、決定論的グラウンディングはマイクロ秒で判定を描画しました。

クリーンな§1031交換は通過する

投資用不動産の適合する同種交換は CLEARED: 草案どおり提出して問題なしを返し、独自の2ノード引用チェーン(§1031(a)(1)および§1031(a)(2)-TCJA)を伴います。これが重要な規律です。正しいポジションが誤ってフラグされることは決してありません。ゴールデンセットにおいてゲート精度は100%、誤ブロックは0件です。

StatuteGuardが投資用不動産の§1031同種交換に対しCLEARED、提出して問題なしを表示。§1031(a)(1)および§1031(a)(2)-TCJAの2ノード制定法グラウンディンググラフ。

§280Aのグレーゾーンはエスカレーションされる

専属的な事業使用がファイルで立証されていないホームオフィスのポジションは、事実と状況のテストであり、決定論的カバレッジの外にあります。StatuteGuardは NEEDS HUMAN REVIEW を返し、虚勢は張りません。LLMは検証可能なクレームを提案し信頼度を報告します。下限を下回れば、ポジションはエスカレーションされ、モデルが解決することはありません。

StatuteGuardが、ファイルが専属使用を立証していない§280Aホームオフィスのポジションでパイプラインを実行。キャプションは、グレーゾーンのポジションがNEEDS HUMAN REVIEWに回されると記す。

ポリシーは自分で読めます

Policy Rulesビューアは、決定論的な制定法ロジックを、実際のOPA/Regoソースの横に読みやすい決定表として示します。これが、防御できる検証レイヤーの要点です。モデルによる要約を信頼するのではなく、コードが制定法と一致することを確認します。

StatuteGuardのPolicy Rulesパネル。§280Aホームオフィスおよび§30Dクリーン車両税額控除の決定表を、MSRP上限と修正AGI上限を含め、実際のOPA/Regoソースコメントの上に表示。

すべての判定が提出可能な記録を書き出す

監査ステージは、Form SG-6662デューデリジェンスワークペーパーを生成します。出典、第一次制定法根拠、抽出されたクレーム、判定ナラティブ、完全な引用チェーン。印刷またはPDFとして保存し、顧客ファイルに保管できます。§6662の合理的原因ポジションを裏付けます。助言ではありません。

StatuteGuardの印刷可能なデューデリジェンス証明書、Form SG-6662。ブロックされたOBBBAポジションについて、出典ワークペーパー、第一次出典、抽出クレーム、デューデリジェンス判定チェックリスト、判定ナラティブ、制定法引用チェーンを示す。

ラベル付きゴールデンセットで測定、ローカルで評価

Run Benchmarkは42ポジションのラベル付きゴールデンセット(クリーン14、エラー16、エスカレート12)を再生します。スコアボードは、決定論的カバレッジ71.4%、誤ブロック0件でゲート精度100%、エラー捕捉の完全性100%、グレーゾーンの正しいエスカレーション100%、すべての判定がラベルと一致、と報告します。これらは検証レイヤーを記述するものであり、モデルの誤り率ではないため、ベースモデルが改善しても成り立ちます。構築中、判定はOPA 1.17.1と照合され、42件すべてで純Pythonツインと完全に一致しました。

StatuteGuardのゴールデンセット・ベンチマークスコアボード:決定論的カバレッジ71.4%、誤ブロックゼロでゲート精度100%、エラー捕捉の完全性100%、グレーゾーンの正しいエスカレーション100%、1秒あたり58,648ポジション。期待判定対実判定のケースごとのテーブルの上に表示。

これらの数値は、エンコードされた条項の固定42件ラベル付きゴールデンセットで測定されたものであり、オープンワールドの保証ではありません。

検証レイヤーが収まる場所

StatuteGuardは、草案ツールと競合せず、コンプライアンスプラットフォームを置き換えません。すでに使っているものの上位に位置し、それらにはできない一事を検査します。草案されたポジションが制定法に対して成り立つかどうかです。

問い 草案AI(ONESOURCE、CCH Axcess、Blue J、ChatGPT) LLM自己チェック StatuteGuard
主たる仕事 ポジションの作成と草案 自身の草案を再読する 草案されたポジションを制定法に照らして検証する
誰が判定を下すか 言語モデル 同じモデル、同じ重み 決定論的ポリシーエンジン(OPA/Rego)
真のグレーゾーンでは 確信に満ちた文章を生成する 確信に満ちた文章を生成する 人間にエスカレーション(NEEDS-REVIEW / OUT-OF-COVERAGE)
提出可能な§6662記録 いいえ いいえ はい、印刷可能なデューデリジェンスワークペーパー
どのプラットフォームの出力でも読む 自社製品に紐づく 自社モデルに紐づく 設計上ベンダー中立

このデモが行わないこと

  • 実行可能なデモであり、デプロイ済みパイプラインではありません。メカニズムを証明します。顧客のいる本番システムではありません。
  • ONESOURCE、CCH Axcess、Blue Jのコネクタ、ライブLLM呼び出し、Neo4jグラフはシミュレートまたはスタブです。デモはキャッシュ再生抽出とインメモリJSONグラフで動作し、オフラインで動きます。FastAPIとNeo4jが文書化された本番差し替えです。
  • 示されるポジションはすべて合成です。制定法ロジックは一次法(IRCおよびFederal Register)に根拠を置いています。ポジションは例示であり、実在の納税者や顧客ではありません。
  • 特定の条項集合をエンコードしており、IRC全体ではありません。その外側はすべてOUT-OF-COVERAGEを返し、人間に回されます。
  • ベンチマーク数値は、エンコードされた条項の42件ラベル付きゴールデンセットで成り立ちます。「ゼロエラー」や「保証されたコンプライアンス」というオープンワールドの保証ではありません。
  • §6662の合理的原因およびデューデリジェンスポジションを裏付けます。税務または法律の助言ではありません。

税務・コンプライアンスチームが実際に問うこと

税務申告ソフトやBlue JのようなAIリサーチツールと何が違うのか?

それらのツールは草案し、作成します。StatuteGuardは検証します。すでに使っているプラットフォームの上位に位置するベンダー中立レイヤーです。ONESOURCE、CCH Axcess、Blue J、ChatGPT、または社内モデルからポジションを貼り付けると、エンコードされた制定法に照らして確定的なPASS、BLOCK、またはNEEDS-REVIEWを返します。申告書を作成せず、コンプライアンスプラットフォームを置き換えません。草案ツールが見えないポジション単位の誤りを検査します。

あるAIの成果を別のAIに検査させて信頼できるか?

いいえ。StatuteGuardもそれを求めません。唯一のLLMステップは抽出であり、雑然とした言語を構造化されたクレームに変換します。判定は決定論的ポリシーエンジン(実際のOPA/Rego、または同一の純Pythonツイン)が下し、モデルは上書きできません。LLMに、誤りを生んだのと同じ重みでLLMを取り締まらせることはできないため、決定はモデルの外側、制定法に照らして読めるポリシーコードに置かれます。

ルールがカバーしないグレーゾーンにポジションが落ちた場合は?

推測せず、人間にエスカレーションします。真の事実と状況の問い(たとえば§280Aホームオフィス)はNEEDS-REVIEWを返し、このバージョンでエンコードされていない条項はOUT-OF-COVERAGEを返します。どちらも、確信に満ちた虚勢ではなくレビュアーに回されます。42件ラベル付きゴールデンセットでは、グレーゾーンは100%正しくエスカレーションされました。カバレッジは71.4%と正直に示しています。

顧客データやポジションは環境の外に出るか?

デモはAPIキーなしで完全にローカルに動作し、既定ではキャッシュ再生抽出を使うため、ポジションも顧客データも境界の外に出す必要はありません。このローカル、閉鎖、監査可能な姿勢は、Heppner判決(SDNY、2026年2月)が公開AIツールへのリサーチクエリをめぐる秘匿特権の放棄の問いを提起したあとに、意図的に取られたものです。アーキテクチャは、ポジションを外部サービスに送るのではなく、秘匿特権を損なわないよう設計されています。

ONESOURCE、CCH Axcess、Blue Jにライブ接続するか?

このデモではしません。ONESOURCE、CCH Axcess、Blue JのRESTコネクタ、ライブLLM呼び出し、Neo4jグラフはシミュレートまたはスタブです。デモはキャッシュ再生とインメモリJSONグラフで動作し、常にオフラインで動きます。検証メカニズムは実在し、設計上ベンダー中立です。本番ビルドはFastAPI、Neo4j、ライブコネクタを差し替え経路として文書化しています。

71.4%カバレッジと100%精度の数値は実際に何を意味するか?

エンコードされた条項の固定42ポジション・ラベル付きゴールデンセットで測定されたものであり、オープンワールドの保証ではありません。そのセットでは、71.4%のポジションがエスカレーションなしで決定論的に解決され、ゲート精度は誤ブロック0件で100%、すべての判定がラベルと一致しました。これらは検証レイヤーのカバレッジと精度を記述するものであり、モデルの誤り率ではないため、ベースモデルが改善しても成り立ちます。§6662デューデリジェンスポジションを裏付けます。税務または法律の助言ではありません。

技術研究

このデモを支える研究 — アーキテクチャ、検証設計、エンタープライズ青写真。

AIと署名のあいだに検証レイヤーを置く

20%の加算税は、草案したモデルではなく、署名した人に降りかかります。どの制定法条項がどのポジションを裏付けたかを証明するのが、決定論的ベリファイアです。

チームが、あるモデルに別のモデルを取り締まらせることなく、AIが草案した税務ポジションをどう検証するかを検討しているなら、その考え方をぜひ比較したいと考えています。問題は業界全体のものであり、答えもそうなるでしょう。

検証アセスメント

  • AIが草案したポジションが申告ワークフローに入る地点を洗い出す
  • 最初にエンコードすべき、加算税が最も重い条項を特定する
  • 現行の§6662デューデリジェンス証拠トレイルをレビューする
  • AIツールのHeppner後の秘匿特権エクスポージャーを評価する

決定論的レイヤーを構築する

  • 優先条項を読みやすいOPA/Regoポリシーとしてエンコードする
  • プラットフォーム上にPASS / BLOCK / NEEDS-REVIEWゲートを立ち上げる
  • すでに動かしているツールへベンダー中立コネクタを配線する
  • 完全な引用チェーン付きの提出可能な§6662記録を生成する
ソーシャル

他のプラットフォームでも公開