
すべてのAIが同じ税務の問いに誤答した——法文を確認するまで誰も気づかなかった理由
それは火曜日の夜のことだった。私はブラウザの3つのタブ——ChatGPT、Claude、Gemini——を見つめていた。そのすべてが私にまったく同じことを告げていた。そして3つともすべて間違っていた。
問いはきわめて単純だった。新設されたオムニバス予算調整法(OBBBA)の下で、納税者は自家用車のローン利息を控除できるか? すべてのモデルが「できる」と答えた。すべてのモデルが、適用期間、対象車両の要件、さらには所得制限に至るまで、その条項を正確に解説した。そしてすべてのモデルが、その控除を税法典の誤ったセクションに位置づけた。つまり、そこから導き出される下流の財務アドバイスは、まったく使い物にならない屑同然だったのだ。
わずかにずれていたのではない。「まあ、解釈次第ですね」という話でもない。ただ明白に間違っていた。公認会計士(CPA)がもしそのアドバイスに従えば、内国歳入庁(IRS)の税務調査を引き起こすような間違いだ。退職者が予期せぬメディケア追加保険料で何千ドルも失いかねない種類の間違いだ。そして何より恐ろしいのは、あらかじめ正解を知っていなければ決して見抜けないという点だった。AIの回答は非の打ちどころがないように聞こえた。
その瞬間は、コンプライアンスにおけるAIに対する私の考え方を根本から変えた。言語モデルがハルシネーション(幻覚)を起こしたことに驚いたからではない——モデルがそうした挙動を示すことは誰もが知っている。私を動揺させたのは、3つすべてのモデルがまったく同じ理由で、寸分違わず同じハルシネーションを起こしたことだった。モデルたちはインターネットから誤った答えを学習しており、インターネット上の情報があまりにも一様に間違っていたため、モデルが自己修正するためのシグナルがどこにも残っていなかったのだ。
私たちはこの現象を「合意エラー(Consensus Error)」と呼び始めた。そして一度それを理解すると、もう見過ごすことはできなくなった。
合意エラーとは何か、そしてなぜ警戒すべきなのか?
AIを扱う人の多くは、ハルシネーションをよく知っている。モデルが存在しない引用を捏造したり、統計をでっち上げたり、事実でないことを自信満々に断言したりする瞬間のことだ。それらも十分に恐ろしいが、ある程度ランダムでもある。何かがおかしいという直感や、Googleで素早く検索することによって、捏造を見抜ける場合が多い。
合意エラーはそれとは異なる。AIが誤った答えを出すのはデータが不足しているからではなく、学習したデータそのものが圧倒的かつ確信を持って不正確だからだ。モデルは暗闇の中で当て推量をしているわけではない。インターネット上の多数派の意見をユーザーにそのまま反射して返しているにすぎず、その多数派の意見が法的に誤りだったのである。
インターネット自体が間違っているとき、それで学習したすべてのAIは同じ妄想を受け継ぐ。合意エラーは単なるバグではない——言語モデルが学習する仕組みそのものに内在する性質なのだ。
その計算ロジックを少し考えてみてほしい。ある特定の税法条項に関するウェブ上の記事の90%が、表現を簡略化したり、法典の異なる2つのセクションを混同したり、互いの間違いをコピーし合ったりして不正確に解説していたとしよう。その場合、モデルの内部重みは高い確信度で誤った答えへと収束していく。実際の法文がトレーニングデータの中に存在していたとしても、それは難解な法律用語で1〜2回登場するにすぎない。一方で、誤った解釈は分かりやすくSEO最適化された文章として何千回も登場するのだ。
モデルは設計通りの動作をする。つまり、最も確率の高い次のトークンを予測する。そして最も確率の高いトークンこそが、間違ったトークンなのだ。
3つのAIを破綻させた自動車ローン控除

具体的な事例を順を追って説明しよう。細部こそが重要だからだ。
OBBBAは「適格乗用車ローン利息(Qualified Passenger Vehicle Loan Interest)」と呼ばれる新たな区分を創設した。これは2025課税年度から2028課税年度まで利用可能な、米国で組み立てられた新車の乗用車ローンの支払利息に対する時限的な控除である。ここまでは何の問題もない。どのAIもこの部分は正しく理解していた。
破綻が生じるのはここからだ。この控除が追加されたのは、内国歳入法(IRC)第63条(課税所得を規定)であり、追加されなかったのは、内国歳入法(IRC)第62条(調整後総所得〈AGI〉を規定)のほうだ。税務において、この違いこそがすべてである。
第62条の控除——「インライン控除前(above-the-line)」——はAGIを減額する。AGIは、学生ローン返済プラン、医療費控除の下限、社会保障給付への課税、メディケア追加保険料など、無数の恩恵の受給資格を左右する。AGIを引き下げることで、下流における節税の連鎖が一気に広がるのだ。
第63条の控除——「インライン控除(below-the-line)」——は課税所得を減額する。連邦税の納税額を節約することにはなるが、AGIに対しては何の影響も与えない。それらの下流の恩恵は何一つ受けられない。
主要なLLMはすべて、この控除がAGIを引き下げるとユーザーに伝えた。一つ残らずだ。金融コンテンツのエコシステムがそう主張していたからである。広く共有された解説記事やSEO最適化された記事は、「自動車ローンの利息が控除対象に!」といった見出しを掲げながら、税額計算のどの段階で適用されるかを明記しなかった。第62条と第63条の違いは、クリック数を狙うコンテンツ制作者にとって退屈すぎたようだ。
だが、そのアドバイスに従った納税者にとっては、その結果は極めて現実的で深刻なものとなる。
AGIが低くなると誤って申告した退職者は、予期せぬメディケアIRMAA追加保険料に直面する可能性がある。所得連動型学生ローン返済プランを利用している借り手は、減額返済の受給資格を失う恐れがある。所得税を連邦AGIに連動させているアリゾナ州のような納税者は、州税の税務調査を受けるリスクがある。私は財務上の連鎖的な影響の全貌について私たちの研究のインタラクティブ版で執筆したが、その波及効果は大方の予想以上に深刻だ。
なぜRAGではこれを解決できなかったのか?
「単にRAGを使えばいい。実際の法文を取得させれば問題は解決する」という反論が聞こえてきそうだ。
私たちは試した。だが解決にはならなかった。
検索拡張生成(RAG)——ユーザーの質問と並んで関連文書をモデルのコンテキストウィンドウに投入する手法——は、ハルシネーションに対する業界の現在の標準的な解決策である。多くのユースケースにおいて、これは有効だ。しかし法的な推論においては、私たちのテストですぐに明らかになった3つの構造的弱点を抱えている。
第1に、税法は物語のような読み物ではない。OBBBAは「これはインライン控除である」などとは書いていない。「第163条(h)を、第(3)項の後に次の新たな項を挿入することにより改正する……」と書かれているのだ。モデルは一連の改正条項から税法典の論理的状態を再構築しなければならない。取得されたチャンクに「控除を認める」と書かれていても、計算フローにおけるその位置が明示されていない場合、モデルはそのギャップを自身のトレーニングバイアス——つまりブログ記事——で埋めてしまう。
第2に、ベクトル検索が見つけ出すのは類似しているものであり、記載がないことによって関連するものではない。自動車ローン控除に関するクエリは、自動車ローン控除に関する段落を取得する。第62条でAGIを定義している段落は取得しない——その段落には自動車ローンについて一切言及されていないからだ。それは列挙しないことによって単に除外しているにすぎない。法律において、リストから何かが欠落していることには重大な意味がある。だがベクトル類似度検索において、不在は不可視である。
第3に——これが私を夜も眠れなくさせる点なのだが——RAGが解決するのは「検索」であって「推論」ではない。モデルの目の前に正しい法文を提示したとしても、何百万もの誤ったトレーニング例によって内部重みが歪んでいれば、モデルは依然としてそれを誤解する。モデルはバイアスのかかった読者となり、テキストが実際に何を述べているかではなく、自分が期待するものを見てしまうのだ。
RAGはAIの前に適切な文書を提示する。しかし、正しい本を手にした偏見のある読者は、依然として間違った結論に達する。
さまざまな検索戦略、チャンクサイズ、プロンプト構成を何週間もテストした後、私のチームはすべてを明確にする議論に至った。エンジニアの一人は、RAGパイプラインの改良——より良い埋め込み、より精密なチャンキング、「取得されたテキストのみを使用する」という明示的な指示——を続けたいと考えた。法務アドバイザーは彼を見て言った。「あなたは算数ができない人に、より良い眼鏡を作ろうとしているのよ。」彼女の言う通りだった。問題はモデルが何を見られるかではなかった。モデルが何を推論できるかだったのだ。
AIが法律の解釈を誤ると何が起きるか?
OBBBAの事例には、問題をさらに悪化させる逓減(フェーズアウト)ルールも含まれている。控除額の上限は年間10,000ドルで、納税者の所得が100,000ドル(単身申告)または200,000ドル(夫婦合算申告)を1,000ドル上回るごとに200ドルずつ減額される。それぞれ150,000ドルまたは250,000ドルに達した時点で、控除は完全に消滅する。
125,000ドルの所得がある仮想の納税者でこれをテストしたところ、モデルたちは苦戦した。フェーズアウトを完全に無視したモデルもあった。別のモデルは、まったく異なる計算式を持つ別の条項である児童税額控除から借用した減額カーブを適用した。モデルたちは実際のルールを計算するのではなく、見慣れた構造にパターンマッチングを行っていたのだ。
これが合意エラーの上に重なる「算術ハルシネーション(Arithmetic Hallucination)」の問題だ。モデルは法解釈の枠組みを誤るだけでなく、計算自体も誤る。そして量子化によって効率的なデプロイのためにこれらのモデルを圧縮すると、推論能力は言語能力よりも急速に劣化する。モデルはより自信ありげに聞こえる一方で、精度は低くなっていく。それはどの領域でも危険な組み合わせだが、税務コンプライアンスにおいては致命的な負債となる。
大半の人が完全に見落としている別の側面もある。OBBBAは第6050AA条も新設し、新たな報告義務を貸し手に課している。適格車両ローンで600ドル以上の利息を受け取るすべての事業者は、IRSに情報申告書を提出しなければならない。銀行や信用組合がこの新法について何をすべきかをモデルに尋ねたところ、モデルは借り手の控除にほぼ専念して回答した——コンテンツエコシステムがそれについてしか書いていなかったからだ。貸し手のコンプライアンス義務はほとんど認識されなかった。規制の変更を要約するためにAIを利用しているフィンテック企業にとって、その見落としは組織的な不遵守と、内国歳入法第6721条および第6722条に基づく罰則を意味しかねない。
実際に機能するアーキテクチャ

自動車ローンの大失敗の後、私はコンプライアンスに言語モデルを使用するというアプローチ全体が根本的に破綻していると確信し、1か月を過ごした。その後、私たちは私の考えを変えるようなものを構築した——LLMについてではなく、それをどのように使うべきかについてだ。
その洞察は、一度気づけば単純なものだった:AIに法律の推論を求めるのをやめることだ。AIには得意なこと——言語の理解——をやらせ、推論は論理を実際に処理できるものに委ねるのである。
これがニューロシンボリックAIの根底にある核心的なアイデアだ。ニューラルネットワークの言語的流暢さと、シンボリック論理システムの決定論的厳密性を組み合わせたハイブリッド・アーキテクチャである。私たちは「決定論的税務エンジン(Deterministic Tax Engine)」と呼ぶものを構築した。これは3つの段階で機能する。
第1段階は意図パーサー(Intent Parser)だ。ここがLLMの役割であり、LLMが最も得意とすることを行う。ユーザーが請求書をアップロードしたり、質問を入力したり、銀行口座の明細を連携したりする。ニューラル層は構造化されたエンティティ(車両の種類、購入日、ローン金額、組み立て場所、納税者の所得)を抽出する。税務上の取扱いについては何も判断しない。乱雑な人間の現実をクリーンなデータに変換するだけである。
第2段階は真実アンカー(Truth Anchor)だ。ここでシンボリック層が引き継ぐ。私たちは税法を「読まれる」テキストとしてではなく、Catala(フランス政府の税務行政のためにINRIAが開発)やPROLEG(Prologベースの法的推論システム)などの専用言語を用いた実行可能ロジックとしてエンコードする。法文がプログラムとなるのだ。Truth Anchorはナレッジグラフにクエリを発行し、エンコードされたルールを適用し、欠落している事実がないか確認し、決定論的な結果を計算する。車両がメキシコで組み立てられた場合、控除は否認される。所得が逓減(フェーズアウト)の基準値を超えている場合、減額分は1セント単位で計算される。確率はない。推測もない。
第3段階は応答ジェネレーター(Response Generator)だ。もう一つのニューラル層だが、制約が課されている。ロジックソルバーの出力——「控除:否認。理由:所得水準13万5,000ドルでフェーズアウトを超過」——を受け取り、明確で人間が読める言葉に翻訳する。LLMは回答を読みやすくする。回答を変える自由はゼロである。
私たちはAIに法律を推測させない。法律を計算するよう教えるのだ。ニューラル層が言語を扱い、シンボリック層が真実を扱う。どちらも互いの領分を侵そうとはしない。
この切り離しこそが合意エラーを根絶する。ニューラル層はトレーニングから、人気のある金融サイトが自動車ローン利息はAGIを引き下げると書いていることを「知っている」かもしれない。しかし、ニューラル層がその判断を下すよう求められることは決してない。車両の詳細を抽出することだけが求められる。決定権はシンボリック層にあり、シンボリック層はRedditにアクセスすることはなく、エンコードされた法文にのみアクセスするのだ。
Catalaがデフォルト・例外ロジックをどのように処理するか、またAnswer Set Programming(回答集合プログラミング)が納税申告書全体の整合性をどのようにチェックするかなど、完全な技術アーキテクチャと形式的分析については、詳細な研究論文を公開している。
なぜこれが単なる一つの税額控除にとどまらない重要性を持つのか?
正直に打ち明けよう。私が最初に合意エラーについて人々に説明し始めたとき、最も多かった反応は「なるほど、でもそれは一つの極端な例外事例(エッジケース)でしょう。ほとんどの場合、AIは正しく答えていますよ」というものだった。
その反応は問題の本質を見誤っている。OBBBAの自動車ローン控除は特別な事例ではない。極めて典型的なものだ。議会が新しい条項を可決するたびに、IRSがガイダンスを出す前にコンテンツエコシステムは何千もの単純化された、時には不正確な解釈を生み出す。州が連邦の税務上の取扱いから分離するたびに、インターネットの情報は遅れをとる。裁判所の判決が既存の法律の解釈を変更するたびに、古い解釈は何年にもわたってトレーニングデータに残り続ける。
合意エラーはエッジケースではない。複雑であったり、最近変更されたり、一般のライターによる理解が不十分であったりする法律のあらゆる領域におけるデフォルトの状態なのだ。つまり、税法の大部分がこれに該当する。
より広範な意味合いは、リスクの高い領域で私たちがAIに何を期待するかという点にある。現在のパラダイム——LLMにより多くのコンテキストを与え、より優れたプロンプトを書き、より大きなウィンドウを用意する——は、根本的に不適合なアーキテクチャに対する漸進的な改善にすぎない。パターンマッチングエンジンに形式的推論を行わせようとしているのだ。時に運良く正解することもある。だが税務コンプライアンスにおいて、「時々」では通用しない。
ブラックボックスからグラスボックスへ
税務調査官と向かい合って座ったことがある人にとって、極めて重要なことがもう一つある。それはトレーサビリティ(追跡可能性)である。
標準的なLLMが納税者に「はい、それを控除できます」と答え、後からIRSがそれに異議を唱えた場合、監査証跡はどうなるのか? モデルはコンテキストを踏まえて「はい」が最も確率の高い次のトークンであると予測しただけだ。それは税務調査官に提示できる回答ではない。
私たちのニューロシンボリック・エンジンでは、すべての判定がグラフパスを生成する:
Deduction_Allowed = True (理由:Loan_Dateが2025〜2028年の期間内である[検証済み]、Vehicle_TypeがPassengerである[検証済み]、Assembly_LocationがUSである[検証済み]、Incomeがフェーズアウト基準値未満である[検証済み]、Rule_ReferenceはIRC § 163(h)(4))。
そのチェーン内のすべてのノードが監査可能である。すべての事実は情報源文書にまで遡ることができる。すべてのルールは法典の特定のセクションにまで遡ることができる。新しいIRSの通達が出たり、条項が改正されたりして何らかの変更があった場合、ナレッジグラフとロジックソルバーを更新すれば、影響を受けるすべての判定に自動的にレビュー用のフラグが立てられる。
これにより、AIは信仰に基づいて信頼しなければならないものから、要求に応じて検証できるものへと変貌を遂げる。人々はいつも、このアプローチは単にLLMを使うよりも遅く、コストがかかるのではないかと私に尋ねる。率直に答えよう。法文の初期エンコードには確かな労力が必要だ。だが一度エンコードしてしまえば、判定の実行はほぼ一瞬であり、全取引の100%をチェックするコストは1%をチェックするコストに近づく。これは従来のサンプリングベースの監査に対するわずかな改善ではない。保証のまったく新しい次元なのだ。
誰もまだ問いかけていない疑問
私が最も懸念しているのはここだ。金融サービス業界は、AIアシスタント、AI税務申告ツール、AIコンプライアンス監視ツールの導入へとひた走っている。マーケティングでは「AI搭載」と謳い、利用規約の細則には「税務上の助言ではない」と記されている。そしてその狭間で、何百万もの人々が、権威があるように聞こえ、本物の法律を引用し、実際の日付や金額に言及しながらも、控除を税法典の誤ったセクションに位置づける回答を受け取っているのだ。
私たちは、AIが明らかに間違っていて人間がそれを見抜ける世界にいるのではない。AIが、見抜くために深いドメイン専門知識を必要とする形で巧妙に間違っている世界にいるのだ。それは明白な失敗よりも危険である。再確認しようとする本能そのものを削ぎ落としてしまうからだ。
問題は、税務コンプライアンスにAIを使うべきかどうかではない。当然使うべきなのだ——法典の複雑さは、人間が一貫して適用できる能力の限界を超えてしまっている。問題は、私たちが運用する領域の性質を尊重するAIシステムを構築する覚悟があるかどうかだ。税法は決定論的である。法文によって定義された正しい答えと間違った答えが存在し、それは一般の評判によって決まるものではない。法的な真実を確率分布として扱うアーキテクチャは、モデルがどれほど巨大になろうと、プロンプトがどれほど巧妙になろうと、常に合意エラーに対して脆弱であり続ける。
税法において、人気は真実の代用にはならない。インターネット上で1万回繰り返された回答も、それに1度だけ矛盾する法文よりも正しくなることは決してないのだ。
私たちがVeriprajnaを設立したのは、コンプライアンスにおけるAIにとって「信頼せよ、されど検証せよ」の時代はすでに終わったと確信しているからだ。企業の信頼を獲得するシステムとは、まず検証し、その後に語るシステムである——論理が監査可能であり、計算が決定論的であり、AIの確信度がトークンの確率よりも強固な基盤に支えられているシステムなのだ。
法文はインターネットがどう考えているかなど意に介さない。あなたのAIもそうあるべきだ。


