税務コンプライアンスAI検証
StatuteGuardは、AIが草案した税務ポジションをエンコードされた制定法に照らして決定論的に証明する、ベンダー中立のレイヤーです。どのプラットフォームからでもポジションを貼り付けると、制定法の引用チェーンと提出可能なIRC §6662監査記録とともに、確定的なPASS、BLOCK、またはNEEDS-REVIEWを返します。エージェントが助言し、コードが決定します。
71.4%
決定論的カバレッジ
42件ラベル付きゴールデンセット
100%
ゲート精度、誤ブロック0件
42件ラベル付きゴールデンセット
20%
IRC §6662正確性加算税
署名した人間に降りかかる
実行可能なデモであり、デプロイメントではありません。すべてのポジションは合成です。制定法ロジックは一次法に根拠を置いています。税務または法律の助言ではありません。
業界は草案の自動化に邁進しました。Thomson Reutersの「Ready to Review」は1040を自動作成し、CCH Axcess Expert AIは数千のファームにわたってアドバイザリー洞察を草案し、Blue Jはリサーチの問いに答えます。誰も自動化していないのは、加算税が最も重いステップです。すなわち、このポジションは制定法の下で実際に防御可能なのか、という問いです。
真の失敗モードは、拙い文章ではありません。確信に満ちた誤分類です。すなわち、もっともらしく、よく書かれたポジションが、控除を誤った行に置くことです。AIが控除をbelow-the-lineではなくabove-the-lineとして誤分類すると、 申告書に署名した人間に20%のIRC §6662正確性関連加算税が適用され、草案を作成したアルゴリズムには適用されない。§6663の不正加算税は最大75%に達します。米国の事業税務コンプライアンスのコストはすでに年$126Bを超え、IRSの大規模法人監査率は8.8%から22.6%へと上昇しています(WP#1ソリューション調査、2026年)。
LLMに、誤りを生んだのと同じ重みでLLMを取り締まらせることはできません。モデル内の自己チェックは、そもそもポジションを誤分類したのとまったく同じ推論を走らせます。耐久性のある答えは、モデルの外側に生きる検証です。
StatuteGuardは信頼モデルを反転させます。AIが草案することはできますが、ポジションが防御可能かどうかを決めるのは決定論的ポリシーエンジンです。唯一のLLMステップは抽出であり、雑然とした自然言語を構造化された型付きクレームに変換します。不確かなときは判断を控えます。下流のすべては、モデルが上書きできないコードです。これをニューロシンボリックと呼びます。ニューラル抽出、シンボリック検証です。
| ステージ | 何が動くか | 誰が決めるか |
|---|---|---|
| Extract | LLMがポジションメモを読み、型付きクレームを提案し、その信頼度を報告します。信頼度下限を下回ると、解決せずにエスカレーションします。 | LLM(助言のみ) |
| Retrieve | GraphRAGがIRC相互参照ナレッジグラフをたどり、対象となる条項とその型付き関係を引き出します。 | 決定論的 |
| Verify | 実際のOPA/Regoポリシー(または同一の純Pythonツイン)が、エンコードされた制定法に照らしてクレームを検証します。 | 決定論的 |
| Gate | PASS(防御可能)、BLOCK(エンコードされた制定法に矛盾)、NEEDS-REVIEW(真のグレーゾーン)、またはOUT-OF-COVERAGE(V1ではエンコードされていない)。 | 決定論的 |
| Audit | 提出可能なIRC §6662デューデリジェンス記録をJSONおよび印刷可能なHTML証明書として書き出します。 | 決定論的 |
判定はポリシーコードでありモデル呼び出しではないため、Regoを読んで制定法と一致することを確認できます。検証レイヤーはインフラとして動作し、1ポジションごとのモデル推論ではなく、1秒あたり数万件のポジションで測定されます(実行によりおよそ40k〜60k、マシンと実行に依存)。
このバージョンでエンコードされている条項:OBBBA QPVLI(§163(h)(4) / §63(b)(7))、§199A QBI、§163(j)事業利子制限、§1031同種交換、§280Aホームオフィス、§30Dクリーン車両税額控除、および§62/§63のAGI区分。この集合の外側はすべてOUT-OF-COVERAGEを返し、人間に回されます。StatuteGuardはIRC全体をエンコードしているとは主張しません。
デモはBLOCK、PASS、エスカレーションを、すべて合成ポジションで順に示します。以下のスクリーンショットは、稼働中のアプリの実キャプチャです。
草案された記述は次のとおりです。「新しいOBBBA自動車ローン利子控除は、顧客のAGIを減額するabove-the-line控除である。」もっともらしく、よく書かれており、そして誤りです。適格乗用車ローン利子は§63(b)(7)の下でbelow-the-line控除であり、AGIを減額しません。デモ自身のREADMEによれば、主流の税務申告ガイダンス(H&R Blockのサイトを含む)はこれをabove-the-lineと誤表示しています。StatuteGuardは BLOCK: DO NOT FILEを返し、引用チェーン §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63 をアニメーションし、草案どおりに提出した場合に崩れるものの5方向下流カスケードをフラグします。AGI、AGI連動の州税、Medicare IRMAA保険料、医療費控除のフロア、学生ローンの所得連動型返済です。
抽出ステップは5.93s、決定論的グラウンディングはマイクロ秒で判定を描画しました。
投資用不動産の適合する同種交換は CLEARED: 草案どおり提出して問題なしを返し、独自の2ノード引用チェーン(§1031(a)(1)および§1031(a)(2)-TCJA)を伴います。これが重要な規律です。正しいポジションが誤ってフラグされることは決してありません。ゴールデンセットにおいてゲート精度は100%、誤ブロックは0件です。
専属的な事業使用がファイルで立証されていないホームオフィスのポジションは、事実と状況のテストであり、決定論的カバレッジの外にあります。StatuteGuardは NEEDS HUMAN REVIEW を返し、虚勢は張りません。LLMは検証可能なクレームを提案し信頼度を報告します。下限を下回れば、ポジションはエスカレーションされ、モデルが解決することはありません。
Policy Rulesビューアは、決定論的な制定法ロジックを、実際のOPA/Regoソースの横に読みやすい決定表として示します。これが、防御できる検証レイヤーの要点です。モデルによる要約を信頼するのではなく、コードが制定法と一致することを確認します。
監査ステージは、Form SG-6662デューデリジェンスワークペーパーを生成します。出典、第一次制定法根拠、抽出されたクレーム、判定ナラティブ、完全な引用チェーン。印刷またはPDFとして保存し、顧客ファイルに保管できます。§6662の合理的原因ポジションを裏付けます。助言ではありません。
Run Benchmarkは42ポジションのラベル付きゴールデンセット(クリーン14、エラー16、エスカレート12)を再生します。スコアボードは、決定論的カバレッジ71.4%、誤ブロック0件でゲート精度100%、エラー捕捉の完全性100%、グレーゾーンの正しいエスカレーション100%、すべての判定がラベルと一致、と報告します。これらは検証レイヤーを記述するものであり、モデルの誤り率ではないため、ベースモデルが改善しても成り立ちます。構築中、判定はOPA 1.17.1と照合され、42件すべてで純Pythonツインと完全に一致しました。
これらの数値は、エンコードされた条項の固定42件ラベル付きゴールデンセットで測定されたものであり、オープンワールドの保証ではありません。
StatuteGuardは、草案ツールと競合せず、コンプライアンスプラットフォームを置き換えません。すでに使っているものの上位に位置し、それらにはできない一事を検査します。草案されたポジションが制定法に対して成り立つかどうかです。
| 問い | 草案AI(ONESOURCE、CCH Axcess、Blue J、ChatGPT) | LLM自己チェック | StatuteGuard |
|---|---|---|---|
| 主たる仕事 | ポジションの作成と草案 | 自身の草案を再読する | 草案されたポジションを制定法に照らして検証する |
| 誰が判定を下すか | 言語モデル | 同じモデル、同じ重み | 決定論的ポリシーエンジン(OPA/Rego) |
| 真のグレーゾーンでは | 確信に満ちた文章を生成する | 確信に満ちた文章を生成する | 人間にエスカレーション(NEEDS-REVIEW / OUT-OF-COVERAGE) |
| 提出可能な§6662記録 | いいえ | いいえ | はい、印刷可能なデューデリジェンスワークペーパー |
| どのプラットフォームの出力でも読む | 自社製品に紐づく | 自社モデルに紐づく | 設計上ベンダー中立 |
それらのツールは草案し、作成します。StatuteGuardは検証します。すでに使っているプラットフォームの上位に位置するベンダー中立レイヤーです。ONESOURCE、CCH Axcess、Blue J、ChatGPT、または社内モデルからポジションを貼り付けると、エンコードされた制定法に照らして確定的なPASS、BLOCK、またはNEEDS-REVIEWを返します。申告書を作成せず、コンプライアンスプラットフォームを置き換えません。草案ツールが見えないポジション単位の誤りを検査します。
いいえ。StatuteGuardもそれを求めません。唯一のLLMステップは抽出であり、雑然とした言語を構造化されたクレームに変換します。判定は決定論的ポリシーエンジン(実際のOPA/Rego、または同一の純Pythonツイン)が下し、モデルは上書きできません。LLMに、誤りを生んだのと同じ重みでLLMを取り締まらせることはできないため、決定はモデルの外側、制定法に照らして読めるポリシーコードに置かれます。
推測せず、人間にエスカレーションします。真の事実と状況の問い(たとえば§280Aホームオフィス)はNEEDS-REVIEWを返し、このバージョンでエンコードされていない条項はOUT-OF-COVERAGEを返します。どちらも、確信に満ちた虚勢ではなくレビュアーに回されます。42件ラベル付きゴールデンセットでは、グレーゾーンは100%正しくエスカレーションされました。カバレッジは71.4%と正直に示しています。
デモはAPIキーなしで完全にローカルに動作し、既定ではキャッシュ再生抽出を使うため、ポジションも顧客データも境界の外に出す必要はありません。このローカル、閉鎖、監査可能な姿勢は、Heppner判決(SDNY、2026年2月)が公開AIツールへのリサーチクエリをめぐる秘匿特権の放棄の問いを提起したあとに、意図的に取られたものです。アーキテクチャは、ポジションを外部サービスに送るのではなく、秘匿特権を損なわないよう設計されています。
このデモではしません。ONESOURCE、CCH Axcess、Blue JのRESTコネクタ、ライブLLM呼び出し、Neo4jグラフはシミュレートまたはスタブです。デモはキャッシュ再生とインメモリJSONグラフで動作し、常にオフラインで動きます。検証メカニズムは実在し、設計上ベンダー中立です。本番ビルドはFastAPI、Neo4j、ライブコネクタを差し替え経路として文書化しています。
エンコードされた条項の固定42ポジション・ラベル付きゴールデンセットで測定されたものであり、オープンワールドの保証ではありません。そのセットでは、71.4%のポジションがエスカレーションなしで決定論的に解決され、ゲート精度は誤ブロック0件で100%、すべての判定がラベルと一致しました。これらは検証レイヤーのカバレッジと精度を記述するものであり、モデルの誤り率ではないため、ベースモデルが改善しても成り立ちます。§6662デューデリジェンスポジションを裏付けます。税務または法律の助言ではありません。
このデモを支える研究 — アーキテクチャ、検証設計、エンタープライズ青写真。
ソリューション全体
税務コンプライアンスAI検証ソリューションを見る →20%の加算税は、草案したモデルではなく、署名した人に降りかかります。どの制定法条項がどのポジションを裏付けたかを証明するのが、決定論的ベリファイアです。
チームが、あるモデルに別のモデルを取り締まらせることなく、AIが草案した税務ポジションをどう検証するかを検討しているなら、その考え方をぜひ比較したいと考えています。問題は業界全体のものであり、答えもそうなるでしょう。