稅務合規 AI 核驗

你的稅務 AI 沒有準確性問題。它有核驗問題。

StatuteGuard 是一層供應商中立的機制,以確定性方式對照已編碼的成文法,證明 AI 起草的稅務立場。從任何平台貼上一份立場,它會回傳硬性的 PASS、BLOCK 或 NEEDS-REVIEW,並附上成文法引用鏈與可歸檔的 IRC §6662 查核紀錄。智能體建議,程式碼裁決。

71.4%

確定性涵蓋率

42 案標註黃金集

100%

把關精確度,0 次誤擋

42 案標註黃金集

20%

IRC §6662 準確性罰則

落在簽署人身上

可執行的示範,而非部署。所有立場皆為合成;成文法邏輯植基於第一手法律。非稅務或法律意見。

編製問題正在被解決。核驗問題則否。

產業競相自動化起草。Thomson Reuters「Ready to Review」自動編製 1040 表,CCH Axcess Expert AI 為數千家事務所起草諮詢見解,Blue J 則回答研究問題。沒有人自動化的,是罰則最高的那一步:這個立場在成文法下真的站得住嗎?

真正的失效模式不是文法糟糕,而是自信的錯誤分類:一份看似合理、寫得漂亮的立場,卻把一項扣除放在錯誤的欄位。當 AI 把一項扣除誤歸為 AGI 前扣除而非 AGI 後扣除時,該 20% 的 IRC §6662 準確性相關罰則落在簽署申報表的人身上,而非起草該立場的演算法。§6663 詐欺罰則最高可達 75%。美國企業稅務合規成本每年已超過 $126B,而 IRS 對大型企業的查核率已從 8.8% 升至 22.6%(WP#1 解決方案研究,2026)。

你不能指望一個 LLM 用產出錯誤的同一組權重,去監管另一個 LLM。模型內自我檢查,跑的正是當初把立場分錯類的同一套推理。可持久的答案,是活在模型之外的核驗。

智能體建議,程式碼裁決。

StatuteGuard 顛倒了信任模型。AI 可以起草,但由確定性政策引擎決定該立場是否站得住。唯一的 LLM 步驟是擷取:把凌亂的自然語言轉成結構化、具型別的主張。不確定時它會棄權。下游的一切都是模型無法凌駕的程式碼。我們稱之為神經符號式:神經擷取,符號核驗。

階段 執行內容 由誰裁決
Extract LLM 讀取立場備忘錄並提出具型別的主張,同時回報其信心。低於信心門檻時,它會升級轉交而非逕行裁定。 LLM(僅供諮詢)
Retrieve GraphRAG 遍歷 IRC 交叉引用知識圖譜,拉取涉及的條文及其型別化關係。 確定性
Verify 真實的 OPA/Rego 政策(或一份相同的純 Python 雙生實作)對照已編碼的成文法測試該主張。 確定性
Gate PASS(站得住)、BLOCK(與已編碼成文法相矛盾)、NEEDS-REVIEW(真正的灰色地帶),或 OUT-OF-COVERAGE(未納入 V1 編碼)。 確定性
Audit 以 JSON 寫出可歸檔的 IRC §6662 盡職調查紀錄,外加可列印的 HTML 憑證。 確定性

因為判定來自政策程式碼而非一次模型呼叫,你可以讀 Rego 並確認它與成文法相符。核驗層以基礎設施方式運行,以每秒數萬筆立場計量(各次運行約 40k 至 60k,視機器與運行而定),而非每筆立場一次模型推論。

本版本已編碼的條文:OBBBA QPVLI(§163(h)(4) / §63(b)(7))、§199A QBI、§163(j) 企業利息限制、§1031 同種類交換、§280A 住家辦公室、§30D 潔淨車輛抵免,以及 §62/§63 的 AGI 區分。該集合以外的一切皆回傳 OUT-OF-COVERAGE 並轉交人工。StatuteGuard 並未聲稱已編碼完整 IRC。

它抓得到什麼,用三種方式呈現

示範走一筆 BLOCK、一筆 PASS 與一次升級轉交,全部基於合成立場。下方截圖是運行中應用程式的真實畫面。

錨點案例:一份被起草為 AGI 前扣除的 OBBBA 車貸利息立場

一份起草陳述寫道:「新的 OBBBA 車貸利息扣除屬 AGI 前扣除,會降低客戶的 AGI。」它看似合理、寫得漂亮,而且是錯的。合格乘用車貸款利息依 §63(b)(7) 為 AGI 後扣除;它不會降低 AGI。依本示範自有的 README,主流報稅指引(含 H&R Block 網站)已將其誤標為 AGI 前扣除。StatuteGuard 回傳 BLOCK: DO NOT FILE,並以動畫呈現引用鏈 §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63,並標示若依起草內容申報會連鎖出問題的五路下游後果:AGI、與 AGI 連動的州稅、Medicare IRMAA 保費、醫療費用扣除門檻,以及學生貸款所得驅動還款。

StatuteGuard 判定畫面,顯示 OBBBA 車貸利息立場為 BLOCK: DO NOT FILE,成文法奠基階段於 7 微秒內完成渲染,從 §163(h)(1) 到 §63 共六個法定節點,以及針對 AGI、州所得稅、Medicare IRMAA、醫療費用門檻與學生貸款 IDR 的五面板下游連鎖。

擷取步驟耗時 5.93s;確定性奠基於微秒級完成判定渲染。

一筆乾淨的 §1031 交換通過

一筆合規的投資不動產同種類交換回傳 CLEARED: safe to file as drafted,並附有其自身的雙節點引用鏈(§1031(a)(1) 與 §1031(a)(2)-TCJA)。這才是真正要緊的紀律:正確的立場絕不會被誤擋。黃金集上的把關精確度為 100%,誤擋為 0。

StatuteGuard 對一筆投資不動產的 §1031 同種類交換顯示 CLEARED、可依起草內容安全申報,並附有 §1031(a)(1) 與 §1031(a)(2)-TCJA 的雙節點成文法奠基圖。

一筆 §280A 灰色地帶升級轉交

一份檔案未能證明專屬營業使用的住家辦公室立場,屬於事實與情況測試,落在確定性涵蓋之外。StatuteGuard 回傳 NEEDS HUMAN REVIEW 而非虛張聲勢。LLM 提出可核對的主張並回報信心;低於門檻時,該立場會被升級轉交,絕不由模型逕行裁定。

StatuteGuard 對一份檔案未能證明專屬使用的 §280A 住家辦公室立場執行流程,圖說註明該灰色地帶立場轉至 NEEDS HUMAN REVIEW。

你可以親自讀這些政策

Policy Rules 檢視器把確定性成文法邏輯顯示為可讀的決策表,旁附真實 OPA/Rego 原始碼。這正是可辯護核驗層的意義:你確認程式碼與成文法相符,而不是去信任模型對它的摘要。

StatuteGuard Policy Rules 面板顯示 §280A 住家辦公室與 §30D 潔淨車輛抵免的決策表,含 MSRP 上限與修正 AGI 上限,置於真實 OPA/Rego 原始碼註解之上。

每一次判定都會寫出一份可歸檔紀錄

查核階段產出 Form SG-6662 盡職調查工作底稿:來源、主要法定依據、擷取的主張、裁定敘述,以及完整引用鏈,可列印或存成 PDF 並留存在客戶檔案中。它支持 §6662 合理事由立場;它不是意見。

StatuteGuard 可列印的盡職調查憑證,Form SG-6662,針對被阻擋的 OBBBA 立場,顯示來源工作底稿、主要來源、擷取的主張、盡職調查裁定檢核表、裁定敘述,以及成文法引用鏈。

在標註黃金集上量測,於本機評估

執行 Benchmark 會重播一套 42 筆立場的標註黃金集(14 筆乾淨、16 筆錯誤、12 筆升級轉交)。計分板回報 71.4% 確定性涵蓋率、100% 把關精確度且 0 次誤擋、100% 錯誤捕捉完整度,以及 100% 正確升級轉交灰色地帶,每一筆判定皆與其標籤相符。這些描述的是核驗層,而非模型錯誤率,因此在基礎模型進步時仍然成立。建構期間,判定已對照 OPA 1.17.1 交叉核對,並在全部 42 案上與純 Python 雙生實作完全相符。

StatuteGuard 黃金集基準計分板:71.4% 確定性涵蓋率、100% 把關精確度且零次誤擋、100% 錯誤捕捉完整度、100% 灰色地帶正確升級轉交,以及每秒 58,648 筆立場,下方為各案預期判定對實際判定表。

這些數字是在已編碼條文的固定 42 案標註黃金集上量測,並非開放世界保證。

核驗層適合放在哪裡

StatuteGuard 不與你的起草工具競爭,也不取代合規平台。它疊加在你既有工具之上,檢查它們做不到的那一件事:起草的立場是否對得上成文法。

問題 起草 AI(ONESOURCE、CCH Axcess、Blue J、ChatGPT) LLM 自我檢查 StatuteGuard
主要工作 編製並起草立場 重讀自己的草稿 對照成文法核驗已起草的立場
由誰作出判定 語言模型 同一模型、同一組權重 確定性政策引擎(OPA/Rego)
面對真正的灰色地帶 產出自信滿滿的文字 產出自信滿滿的文字 升級轉交人工(NEEDS-REVIEW / OUT-OF-COVERAGE)
可歸檔的 §6662 紀錄 是,一份可列印的盡職調查工作底稿
讀取任何平台的輸出 綁定於自家產品 綁定於自家模型 設計上供應商中立

本示範不做什麼

  • 它是可執行的示範,不是已部署的管線。它證明機制;它不是有客戶的生產系統。
  • ONESOURCE、CCH Axcess 與 Blue J 連接器、即時 LLM 呼叫,以及 Neo4j 圖譜皆為模擬或以樁程式替代。示範以快取重播擷取與記憶體內 JSON 圖譜運行,因此可離線使用;FastAPI 與 Neo4j 是文件記載的生產替換路徑。
  • 展示的每一筆立場皆為合成。成文法邏輯植基於第一手法律(IRC 與《聯邦公報》);立場僅供說明,並非真實納稅人或客戶。
  • 它編碼特定條文集合,而非完整 IRC。該集合以外的一切皆回傳 OUT-OF-COVERAGE 並轉交人工。
  • 基準數字在已編碼條文的 42 案標註黃金集上成立。它們不是「零錯誤」或「保證合規」的開放世界保證。
  • 它支持 §6662 合理事由與盡職調查立場。它不是稅務或法律意見。

稅務與合規團隊真正會問的問題

這與我們的報稅軟體,或像 Blue J 這類 AI 研究工具有何不同?

那些工具負責起草與編製。StatuteGuard 負責核驗。它是疊加在你既有平台之上的供應商中立層:從 ONESOURCE、CCH Axcess、Blue J、ChatGPT 或內部模型貼上一份立場,它會對照已編碼成文法回傳硬性的 PASS、BLOCK 或 NEEDS-REVIEW。它不編製申報表,也不取代合規平台;它檢查起草工具看不見的立場層級錯誤。

我能信任一個 AI 去檢查另一個 AI 的工作嗎?

不能,而 StatuteGuard 也不要求你這麼做。唯一的 LLM 步驟是擷取,把凌亂語言轉成結構化主張。判定由確定性政策引擎作出(真實 OPA/Rego,或一份相同的純 Python 雙生實作),模型無法凌駕。你不能指望一個 LLM 用產出錯誤的同一組權重去監管另一個 LLM,因此裁決活在模型之外、你可對照成文法閱讀的政策程式碼裡。

當立場落在規則未涵蓋的灰色地帶時會怎樣?

它會升級轉交人工,而不是猜測。真正的事實與情況問題(例如 §280A 住家辦公室)回傳 NEEDS-REVIEW;本版本未編碼的條文回傳 OUT-OF-COVERAGE。兩者都轉交審查者,而非自信虛張聲勢。在 42 案標註黃金集上,灰色地帶 100% 被正確升級轉交;涵蓋率誠實陳述為 71.4%。

客戶資料或該立場會離開我們的環境嗎?

示範完全在本機運行、無需 API 金鑰,預設使用快取重播擷取,因此沒有立場或客戶資料必須離開邊界。這種本機、封閉、可稽核的姿態是刻意的:Heppner 裁定(SDNY,2026年2月)就一筆公開 AI 工具的研究查詢,提出了特權拋棄的問題。架構設計為特權安全,而非把立場送到外部服務。

它會即時連接 ONESOURCE、CCH Axcess 或 Blue J 嗎?

在本示範中不會。ONESOURCE、CCH Axcess 與 Blue J 的 REST 連接器、即時 LLM 呼叫,以及 Neo4j 圖譜皆為模擬或以樁程式替代;示範以快取重播與記憶體內 JSON 圖譜運行,因此始終可離線使用。核驗機制是真實的,且設計上供應商中立;生產建置將 FastAPI、Neo4j 與即時連接器記載為可替換路徑。

71.4% 涵蓋率與 100% 精確度這些數字實際代表什麼?

它們是在已編碼條文的固定 42 筆立場標註黃金集上量測,並非開放世界保證。在該集合上:71.4% 的立場未經升級轉交即以確定性方式裁定,把關精確度為 100% 且 0 次誤擋,每一筆判定皆與其標籤相符。這些描述的是核驗層的涵蓋率與精確度,而非模型錯誤率,因此在基礎模型進步時仍然成立。它支持 §6662 盡職調查立場;它不是稅務或法律意見。

技術研究

支撐本示範的研究——架構、核驗設計,以及企業藍圖。

在你的 AI 與你的簽名之間放上一層核驗

20% 的罰則落在簽署的人身上,而非起草的模型。確定性核驗器,就是你證明哪一條成文法條文支撐哪一份立場的方式。

若你的團隊正在衡量如何核驗 AI 起草的稅務立場,而不信任由一個模型去監管另一個模型,我們很願意對照彼此的思路。問題是全產業的,答案也會是。

核驗評估

  • 盤點 AI 起草的立場從何處進入你的申報工作流程
  • 找出應優先編碼、罰則最高的條文
  • 檢視你目前的 §6662 盡職調查證據軌跡
  • 評估你的 AI 工具在 Heppner 之後的特權暴露

建置確定性層

  • 將你的優先條文編碼為可讀的 OPA/Rego 政策
  • 在你的平台上立起 PASS / BLOCK / NEEDS-REVIEW 把關機制
  • 把供應商中立連接器接到你既有工具
  • 產生附完整引用鏈的可歸檔 §6662 紀錄
社群媒體

同步發佈於