環繞你法律 AI 的驗證層
AI 草擬的書狀會引用不存在的判例,或引用真實判例卻主張與該判例相反的命題。CiteGuard 是環繞你 AI 的那一層:它把每一則引註對照 CourtListener 上的真實判例法加以錨定,以確定性方式攔截捏造,把無法驗證的項目轉交人工,並簽署一份稽核憑證。它告訴你什麼可以安全呈遞,以及哪些必須由人工處理。
0
捏造的引註仍可能通過把關
確定性信任不變式,經單元測試驗證
20
真實判例納入基準語料庫
快取自 CourtListener,公開的美國判例法資料庫
8/8
核心驗證器測試全部通過
離線且可重現(python tests/test_core.py)
這是一個可實際運行的示範。樣本書狀、當事人與案件標示皆為合成摘錄,文件管理連接器為模擬。語料庫、即時 CourtListener 查核、確定性把關機制與測試皆為真實。
法院已經在制裁這種情況,而草擬工具並不檢查自己的產出。
失效模式不是文法差。文法完美,這才危險。AI 草擬一份讀起來像合夥人寫的書狀,卻引用從未作成的判例,或引用真實判例卻用來支持與其相反的命題。即使是專為法律打造的工具也會這樣:在一項受控研究中,Westlaw Precision 有 33%、Lexis+ 有 17% 的時間產生幻覺(Stanford RegLab,《Journal of Empirical Legal Studies》,2025)。
後果已經到來。截至 2026 年初,已有 1,222 件涉及 AI 幻覺引註的有紀錄法院案件,法院也開始制裁:第六巡迴法院於 2026 年 3 月處以 30,000 美元制裁。治理規則隨之而來。ABA Formal Opinion 512 以及超過 300 項司法常設命令,如今要求律師在呈遞前驗證 AI 產出,但不到 20% 的事務所有任何 AI 使用政策。
草擬者不是修正這個問題的正確位置。更強的模型仍然在草擬,而法院並不在乎模型有多自信。它在乎的是引註是否存在、是否說了你所主張的內容。因此持久的答案不是更聰明的寫作者,而是一個獨立的層:對照獨立權威檢查產出、以確定性攔截捏造,並誠實面對它無法驗證的部分。
保證級的部分是確定性程式碼。需要裁量判斷的部分是會棄權的 LLM。做決定的是把關機制,不是模型。
貼上任何 AI 草擬的書狀,流程即時運行:擷取每一則引註及其主張命題,對照真實判例法加以錨定,執行確定性存在性檢查與 LLM 支持度檢查,套用確定性政策把關機制,並匯出一份已簽署的稽核憑證。儀表板顯示各階段在系統主控台亮起,串流每一次真實 CourtListener 請求及其 URL、狀態與延遲,因此沒有任何黑箱。
存在性與捏造檢查以及政策把關機制,是對照真實判例法的純 Python。捏造引註是由即時 CourtListener 零結果查詢證明不存在,而非猜測,因為買方需要可證明的捏造攔截與可稽核的把關機制,而不是 LLM 的片面之詞。
支持度檢查閱讀真實判決意見書,並詢問它是否支持主張命題 P。供應商可替換,且在不確定或無依據時棄權、轉交人工審查。它提供建議;從不握有最終決定權。
每一則引註恰好解析為一種判定。轉交人工的判定會誠實說明原因,而代表 CourtListener 無法連線的那一種,絕不被摺疊成捏造。
| 判定 | 含義 | 決定者 |
|---|---|---|
| VERIFIED_SUPPORTED | 真實判例,且判決意見書支持該主張命題 | 存在性檢查加上支持度檢查 |
| VERIFIED_UNSUPPORTED(需審查) | 真實判例,但判決意見書並未清楚支持該命題 | 連同脈絡轉交人工 |
| FABRICATED | 真實判例法中無此判例 | 確定性、即時零結果查詢 |
| OUTSIDE_COVERAGE | 真實判例但不在快取子集中,誠實標示 | 確定性,絕不會錯誤標為已驗證 |
| UNVERIFIED | CourtListener 無法連線,因此無法證明其不存在 | 確定性,絕不摺疊成捏造 |
把關機制是確定性的。僅當捏造引註為零且未解析引註為零時,才回傳 FILING_READY,否則回傳 NOT_FILING_READY。這意味著即使沒有任何捏造,單一則未經審查的引註也會按設計卡住整份呈遞。然後一鍵匯出一份已簽署的 JSON 稽核憑證,逐則記錄判定、證據摘錄、真實 CourtListener URL、模型與版本(或 deterministic,或 abstained)、驗證器版本、UTC 時間戳記,以及把關結果。
此示範附帶四份樣本書狀。我們走兩份:Mixed Motion 書狀同時帶有一則真實引註、一則捏造引註與一則語料庫外引註;以及 Clean Motion 書狀,其中每一則引註皆為真實。以下每張圖都是運行中應用程式的畫面。案件標示僅供說明,並非真實案件。
左側是一份 AI 草擬的排除證據聲請。右側,系統主控台逐階段亮起,串流每一次真實 CourtListener 請求及其 URL、狀態與延遲,並附支持度檢查推理。這是第一則引註 Miranda v. Arizona, 384 U.S. 436,對照基準語料庫解析,同時支持度檢查閱讀判決意見書文本。
書狀引用 Halstead v. Ferngate Holdings, 823 U.S. 1199。存在性檢查向 CourtListener 發送即時 GET,得到 200 且 0 筆結果,因為 U.S. Reports 沒有第 823 冊。判定為 FABRICATED,是被證明不存在而非猜測。同一次運行中,Brown v. Board of Education, 347 U.S. 483 是真實判例但不在快取子集中,因此被誠實標為 OUTSIDE_COVERAGE,而非錯誤的已驗證。把關讀數為 NOT_FILING_READY:1 則捏造、2 則未解析、1 則自動放行。
這是 Clean Motion 書狀,每一則引註都是真實且切題的判例。當判決意見書文本確立該主張命題時,支持度檢查加以確認。Miranda v. Arizona, 384 U.S. 436 通過為已驗證,因為多數意見本身判示嫌疑人必須被告知其律師權與緘默權,並附 CourtListener 上真實判例的連結。哪些切題引註亮綠放行、哪些轉交審查,各次運行可能不同,因為支持度檢查是唯一非確定性步驟,但像 Miranda 這樣的切題引註會可靠地放行。
在 Mixed Motion 審查上,計分板讀數為 1 則已驗證、1 則捏造、2 則需審查。Bell Atlantic Corp. v. Twombly, 550 U.S. 544 是真實判例,但摘錄並未明確確立它被用來支持的主張命題,因此支持度檢查連同推理標為需審查,而不是自信地打分。這種保守棄權就是設計:自信的紅色不支持判定刻意罕見,因為對模稜兩可的判決意見書,誠實的做法是交給人工。
這是同一份 Clean Motion 書狀的憑證。Miranda 通過為已驗證,但 Terry v. Ohio 與 Strickland v. Washington 被轉交審查,因此把關停在尚未可呈遞,印章讀為暫緩審查,即使沒有任何一則引註是捏造的。憑證列出每一則引註及其判定與支持度檢查結果,並證明每一則都已對照 CourtListener 檢查存在性、捏造引註以確定性被識別,以及需要脈絡判斷的引註被轉交人工。它匯出為你附加於呈遞的已簽署 JSON 紀錄。看起來乾淨的書狀,並不等於可呈遞的書狀。
語料庫是從 CourtListener(公開的美國判例法資料庫)快取的 20 則真實判決,包括 Miranda、Twombly、Iqbal、Terry、Strickland、International Shoe、Erie、Baker v. Carr、Chevron 與 Daubert。存在性與捏造檢查也在請求當下即時查詢 CourtListener,因此捏造攔截具權威性,而不限於該子集。20 則判例語料庫是快取子集,因此支持度裁決是在真實判例上以小 N 示範,且該範圍被明白陳述,而非包裝成普遍準確度。
CiteGuard 不是另一個草擬器。它是決定什麼可以安全呈遞的那一層。
| 面向 | 未經驗證的 AI 書狀 | CiteGuard 驗證層 |
|---|---|---|
| 捏造判例偵測 | 讀起來具權威性,未被攔截 | 確定性、即時零結果查詢 |
| 真實但誤用的引註 | 原樣送出 | 連同脈絡轉交人工審查 |
| 不確定的支持度檢查 | 模型仍斷言一個判定 | 棄權,交給人工 |
| 來源溯源 | 無 | 每一則引註附真實 CourtListener 連結 |
| 呈遞決策 | 草擬者的自信 | 確定性把關機制,捏造為零且未解析為零 |
| ABA Op. 512 的稽核軌跡 | 無 | 每一份書狀一份已簽署 JSON 憑證 |
不會。CiteGuard 不草擬、也不做法律研究,因此不與 Harvey、Westlaw Precision 或 Lexis Protege 競爭。它是環繞它們任何一個產出的驗證層。它接收 AI 草擬書狀,告訴律師什麼可以安全呈遞、哪些必須由人工處理,並以影子或諮詢模式與你既有工具並行運行。
存在性檢查向 CourtListener(公開的美國判例法資料庫)查詢精確引註。像 Halstead v. Ferngate Holdings, 823 U.S. 1199 這樣的捏造引註回傳零結果(U.S. Reports 沒有第 823 冊),因此以確定性標為 FABRICATED,而非猜測。若 CourtListener 無法連線,該引註標為 UNVERIFIED 而非捏造,因為缺乏證明並非證明不存在。這個區分是確定性、經單元測試驗證的不變式。
不能盲目信任,這正是支持度檢查會棄權的原因。它是一個 LLM 步驟,閱讀真實判決意見書,僅在判決意見書文本確立要旨時才將引註標綠確認,如同 Miranda v. Arizona。當判決意見書並未明確支持所述主張命題時,它將引註轉交人工審查,而不是虛張聲勢給出判定。模型提供建議;確定性把關機制與律師做決定。
不會,因為可呈遞是治理屬性,不是模型屬性。法院不在乎模型有多自信;它在乎引註是否存在、是否說了你所主張的內容。因此持久的需求是一個獨立層:把每一項主張錨定於真實判例法、以確定性攔截捏造,並誠實面對它無法驗證的部分。這個要求在任何模型品質下都成立。
一鍵匯出一份已簽署 JSON 憑證,逐則引註記錄判定、證據摘錄、真實 CourtListener URL、模型與版本(或 deterministic 或 abstained)、驗證器版本、UTC 時間戳記,以及把關結果。它是顯示律師在呈遞前已驗證 AI 產出的成品,這正是 ABA Formal Opinion 512 與 300 多項司法常設命令如今所要求的。在示範中憑證為 JSON;PDF 匯出延後。
這是證明機制的可運行示範,不是已部署的流程。四份樣本書狀、當事人與案件標示被標為合成摘錄,文件管理連接器為模擬。真實的部分:20 則判例語料庫快取自 CourtListener,存在性與捏造檢查在請求當下即時打到 CourtListener,確定性把關機制與 8 項測試全過完全如所示運行,且捏造引註確實不存在於真實判例法中。
支撐這個示範的研究——架構、驗證設計與企業藍圖。
完整解決方案
探索法律 AI 引註驗證與治理解決方案 →驗證層才是硬功夫。我們打造它。
若貴所正在摸索如何讓律師使用 AI,又不冒呈遞捏造引註的風險,我們真心想聽聽你們怎麼想。這個問題是全產業的,答案也會是。