稅務合規 AI 核驗
StatuteGuard 是一層供應商中立的機制,以確定性方式對照已編碼的成文法,證明 AI 起草的稅務立場。從任何平台貼上一份立場,它會回傳硬性的 PASS、BLOCK 或 NEEDS-REVIEW,並附上成文法引用鏈與可歸檔的 IRC §6662 查核紀錄。智能體建議,程式碼裁決。
71.4%
確定性涵蓋率
42 案標註黃金集
100%
把關精確度,0 次誤擋
42 案標註黃金集
20%
IRC §6662 準確性罰則
落在簽署人身上
可執行的示範,而非部署。所有立場皆為合成;成文法邏輯植基於第一手法律。非稅務或法律意見。
產業競相自動化起草。Thomson Reuters「Ready to Review」自動編製 1040 表,CCH Axcess Expert AI 為數千家事務所起草諮詢見解,Blue J 則回答研究問題。沒有人自動化的,是罰則最高的那一步:這個立場在成文法下真的站得住嗎?
真正的失效模式不是文法糟糕,而是自信的錯誤分類:一份看似合理、寫得漂亮的立場,卻把一項扣除放在錯誤的欄位。當 AI 把一項扣除誤歸為 AGI 前扣除而非 AGI 後扣除時,該 20% 的 IRC §6662 準確性相關罰則落在簽署申報表的人身上,而非起草該立場的演算法。§6663 詐欺罰則最高可達 75%。美國企業稅務合規成本每年已超過 $126B,而 IRS 對大型企業的查核率已從 8.8% 升至 22.6%(WP#1 解決方案研究,2026)。
你不能指望一個 LLM 用產出錯誤的同一組權重,去監管另一個 LLM。模型內自我檢查,跑的正是當初把立場分錯類的同一套推理。可持久的答案,是活在模型之外的核驗。
StatuteGuard 顛倒了信任模型。AI 可以起草,但由確定性政策引擎決定該立場是否站得住。唯一的 LLM 步驟是擷取:把凌亂的自然語言轉成結構化、具型別的主張。不確定時它會棄權。下游的一切都是模型無法凌駕的程式碼。我們稱之為神經符號式:神經擷取,符號核驗。
| 階段 | 執行內容 | 由誰裁決 |
|---|---|---|
| Extract | LLM 讀取立場備忘錄並提出具型別的主張,同時回報其信心。低於信心門檻時,它會升級轉交而非逕行裁定。 | LLM(僅供諮詢) |
| Retrieve | GraphRAG 遍歷 IRC 交叉引用知識圖譜,拉取涉及的條文及其型別化關係。 | 確定性 |
| Verify | 真實的 OPA/Rego 政策(或一份相同的純 Python 雙生實作)對照已編碼的成文法測試該主張。 | 確定性 |
| Gate | PASS(站得住)、BLOCK(與已編碼成文法相矛盾)、NEEDS-REVIEW(真正的灰色地帶),或 OUT-OF-COVERAGE(未納入 V1 編碼)。 | 確定性 |
| Audit | 以 JSON 寫出可歸檔的 IRC §6662 盡職調查紀錄,外加可列印的 HTML 憑證。 | 確定性 |
因為判定來自政策程式碼而非一次模型呼叫,你可以讀 Rego 並確認它與成文法相符。核驗層以基礎設施方式運行,以每秒數萬筆立場計量(各次運行約 40k 至 60k,視機器與運行而定),而非每筆立場一次模型推論。
本版本已編碼的條文:OBBBA QPVLI(§163(h)(4) / §63(b)(7))、§199A QBI、§163(j) 企業利息限制、§1031 同種類交換、§280A 住家辦公室、§30D 潔淨車輛抵免,以及 §62/§63 的 AGI 區分。該集合以外的一切皆回傳 OUT-OF-COVERAGE 並轉交人工。StatuteGuard 並未聲稱已編碼完整 IRC。
示範走一筆 BLOCK、一筆 PASS 與一次升級轉交,全部基於合成立場。下方截圖是運行中應用程式的真實畫面。
一份起草陳述寫道:「新的 OBBBA 車貸利息扣除屬 AGI 前扣除,會降低客戶的 AGI。」它看似合理、寫得漂亮,而且是錯的。合格乘用車貸款利息依 §63(b)(7) 為 AGI 後扣除;它不會降低 AGI。依本示範自有的 README,主流報稅指引(含 H&R Block 網站)已將其誤標為 AGI 前扣除。StatuteGuard 回傳 BLOCK: DO NOT FILE,並以動畫呈現引用鏈 §163(h)(1) → §163(h)(4)(A) → §63(b)(7) → §62/§63,並標示若依起草內容申報會連鎖出問題的五路下游後果:AGI、與 AGI 連動的州稅、Medicare IRMAA 保費、醫療費用扣除門檻,以及學生貸款所得驅動還款。
擷取步驟耗時 5.93s;確定性奠基於微秒級完成判定渲染。
一筆合規的投資不動產同種類交換回傳 CLEARED: safe to file as drafted,並附有其自身的雙節點引用鏈(§1031(a)(1) 與 §1031(a)(2)-TCJA)。這才是真正要緊的紀律:正確的立場絕不會被誤擋。黃金集上的把關精確度為 100%,誤擋為 0。
一份檔案未能證明專屬營業使用的住家辦公室立場,屬於事實與情況測試,落在確定性涵蓋之外。StatuteGuard 回傳 NEEDS HUMAN REVIEW 而非虛張聲勢。LLM 提出可核對的主張並回報信心;低於門檻時,該立場會被升級轉交,絕不由模型逕行裁定。
Policy Rules 檢視器把確定性成文法邏輯顯示為可讀的決策表,旁附真實 OPA/Rego 原始碼。這正是可辯護核驗層的意義:你確認程式碼與成文法相符,而不是去信任模型對它的摘要。
查核階段產出 Form SG-6662 盡職調查工作底稿:來源、主要法定依據、擷取的主張、裁定敘述,以及完整引用鏈,可列印或存成 PDF 並留存在客戶檔案中。它支持 §6662 合理事由立場;它不是意見。
執行 Benchmark 會重播一套 42 筆立場的標註黃金集(14 筆乾淨、16 筆錯誤、12 筆升級轉交)。計分板回報 71.4% 確定性涵蓋率、100% 把關精確度且 0 次誤擋、100% 錯誤捕捉完整度,以及 100% 正確升級轉交灰色地帶,每一筆判定皆與其標籤相符。這些描述的是核驗層,而非模型錯誤率,因此在基礎模型進步時仍然成立。建構期間,判定已對照 OPA 1.17.1 交叉核對,並在全部 42 案上與純 Python 雙生實作完全相符。
這些數字是在已編碼條文的固定 42 案標註黃金集上量測,並非開放世界保證。
StatuteGuard 不與你的起草工具競爭,也不取代合規平台。它疊加在你既有工具之上,檢查它們做不到的那一件事:起草的立場是否對得上成文法。
| 問題 | 起草 AI(ONESOURCE、CCH Axcess、Blue J、ChatGPT) | LLM 自我檢查 | StatuteGuard |
|---|---|---|---|
| 主要工作 | 編製並起草立場 | 重讀自己的草稿 | 對照成文法核驗已起草的立場 |
| 由誰作出判定 | 語言模型 | 同一模型、同一組權重 | 確定性政策引擎(OPA/Rego) |
| 面對真正的灰色地帶 | 產出自信滿滿的文字 | 產出自信滿滿的文字 | 升級轉交人工(NEEDS-REVIEW / OUT-OF-COVERAGE) |
| 可歸檔的 §6662 紀錄 | 否 | 否 | 是,一份可列印的盡職調查工作底稿 |
| 讀取任何平台的輸出 | 綁定於自家產品 | 綁定於自家模型 | 設計上供應商中立 |
那些工具負責起草與編製。StatuteGuard 負責核驗。它是疊加在你既有平台之上的供應商中立層:從 ONESOURCE、CCH Axcess、Blue J、ChatGPT 或內部模型貼上一份立場,它會對照已編碼成文法回傳硬性的 PASS、BLOCK 或 NEEDS-REVIEW。它不編製申報表,也不取代合規平台;它檢查起草工具看不見的立場層級錯誤。
不能,而 StatuteGuard 也不要求你這麼做。唯一的 LLM 步驟是擷取,把凌亂語言轉成結構化主張。判定由確定性政策引擎作出(真實 OPA/Rego,或一份相同的純 Python 雙生實作),模型無法凌駕。你不能指望一個 LLM 用產出錯誤的同一組權重去監管另一個 LLM,因此裁決活在模型之外、你可對照成文法閱讀的政策程式碼裡。
它會升級轉交人工,而不是猜測。真正的事實與情況問題(例如 §280A 住家辦公室)回傳 NEEDS-REVIEW;本版本未編碼的條文回傳 OUT-OF-COVERAGE。兩者都轉交審查者,而非自信虛張聲勢。在 42 案標註黃金集上,灰色地帶 100% 被正確升級轉交;涵蓋率誠實陳述為 71.4%。
示範完全在本機運行、無需 API 金鑰,預設使用快取重播擷取,因此沒有立場或客戶資料必須離開邊界。這種本機、封閉、可稽核的姿態是刻意的:Heppner 裁定(SDNY,2026年2月)就一筆公開 AI 工具的研究查詢,提出了特權拋棄的問題。架構設計為特權安全,而非把立場送到外部服務。
在本示範中不會。ONESOURCE、CCH Axcess 與 Blue J 的 REST 連接器、即時 LLM 呼叫,以及 Neo4j 圖譜皆為模擬或以樁程式替代;示範以快取重播與記憶體內 JSON 圖譜運行,因此始終可離線使用。核驗機制是真實的,且設計上供應商中立;生產建置將 FastAPI、Neo4j 與即時連接器記載為可替換路徑。
它們是在已編碼條文的固定 42 筆立場標註黃金集上量測,並非開放世界保證。在該集合上:71.4% 的立場未經升級轉交即以確定性方式裁定,把關精確度為 100% 且 0 次誤擋,每一筆判定皆與其標籤相符。這些描述的是核驗層的涵蓋率與精確度,而非模型錯誤率,因此在基礎模型進步時仍然成立。它支持 §6662 盡職調查立場;它不是稅務或法律意見。
20% 的罰則落在簽署的人身上,而非起草的模型。確定性核驗器,就是你證明哪一條成文法條文支撐哪一份立場的方式。
若你的團隊正在衡量如何核驗 AI 起草的稅務立場,而不信任由一個模型去監管另一個模型,我們很願意對照彼此的思路。問題是全產業的,答案也會是。