環繞你法律 AI 的驗證層

捏造判例在書狀呈遞前即以確定性被攔截。

AI 草擬的書狀會引用不存在的判例,或引用真實判例卻主張與該判例相反的命題。CiteGuard 是環繞你 AI 的那一層:它把每一則引註對照 CourtListener 上的真實判例法加以錨定,以確定性方式攔截捏造,把無法驗證的項目轉交人工,並簽署一份稽核憑證。它告訴你什麼可以安全呈遞,以及哪些必須由人工處理。

0

捏造的引註仍可能通過把關

確定性信任不變式,經單元測試驗證

20

真實判例納入基準語料庫

快取自 CourtListener,公開的美國判例法資料庫

8/8

核心驗證器測試全部通過

離線且可重現(python tests/test_core.py)

這是一個可實際運行的示範。樣本書狀、當事人與案件標示皆為合成摘錄,文件管理連接器為模擬。語料庫、即時 CourtListener 查核、確定性把關機制與測試皆為真實。

一份看起來具權威性的書狀,可能引用根本不存在的判例

法院已經在制裁這種情況,而草擬工具並不檢查自己的產出。

失效模式不是文法差。文法完美,這才危險。AI 草擬一份讀起來像合夥人寫的書狀,卻引用從未作成的判例,或引用真實判例卻用來支持與其相反的命題。即使是專為法律打造的工具也會這樣:在一項受控研究中,Westlaw Precision 有 33%、Lexis+ 有 17% 的時間產生幻覺(Stanford RegLab,《Journal of Empirical Legal Studies》,2025)。

後果已經到來。截至 2026 年初,已有 1,222 件涉及 AI 幻覺引註的有紀錄法院案件,法院也開始制裁:第六巡迴法院於 2026 年 3 月處以 30,000 美元制裁。治理規則隨之而來。ABA Formal Opinion 512 以及超過 300 項司法常設命令,如今要求律師在呈遞前驗證 AI 產出,但不到 20% 的事務所有任何 AI 使用政策。

草擬者不是修正這個問題的正確位置。更強的模型仍然在草擬,而法院並不在乎模型有多自信。它在乎的是引註是否存在、是否說了你所主張的內容。因此持久的答案不是更聰明的寫作者,而是一個獨立的層:對照獨立權威檢查產出、以確定性攔截捏造,並誠實面對它無法驗證的部分。

CiteGuard 如何運作

保證級的部分是確定性程式碼。需要裁量判斷的部分是會棄權的 LLM。做決定的是把關機制,不是模型。

貼上任何 AI 草擬的書狀,流程即時運行:擷取每一則引註及其主張命題,對照真實判例法加以錨定,執行確定性存在性檢查與 LLM 支持度檢查,套用確定性政策把關機制,並匯出一份已簽署的稽核憑證。儀表板顯示各階段在系統主控台亮起,串流每一次真實 CourtListener 請求及其 URL、狀態與延遲,因此沒有任何黑箱。

兩套引擎,刻意拆開

確定性 Python(保證級)

存在性與捏造檢查以及政策把關機制,是對照真實判例法的純 Python。捏造引註是由即時 CourtListener 零結果查詢證明不存在,而非猜測,因為買方需要可證明的捏造攔截與可稽核的把關機制,而不是 LLM 的片面之詞。

一個會棄權的 LLM 步驟

支持度檢查閱讀真實判決意見書,並詢問它是否支持主張命題 P。供應商可替換,且在不確定或無依據時棄權、轉交人工審查。它提供建議;從不握有最終決定權。

每一則引註對應五種誠實判定之一

每一則引註恰好解析為一種判定。轉交人工的判定會誠實說明原因,而代表 CourtListener 無法連線的那一種,絕不被摺疊成捏造。

判定 含義 決定者
VERIFIED_SUPPORTED 真實判例,且判決意見書支持該主張命題 存在性檢查加上支持度檢查
VERIFIED_UNSUPPORTED(需審查) 真實判例,但判決意見書並未清楚支持該命題 連同脈絡轉交人工
FABRICATED 真實判例法中無此判例 確定性、即時零結果查詢
OUTSIDE_COVERAGE 真實判例但不在快取子集中,誠實標示 確定性,絕不會錯誤標為已驗證
UNVERIFIED CourtListener 無法連線,因此無法證明其不存在 確定性,絕不摺疊成捏造

政策把關機制

把關機制是確定性的。僅當捏造引註為零且未解析引註為零時,才回傳 FILING_READY,否則回傳 NOT_FILING_READY。這意味著即使沒有任何捏造,單一則未經審查的引註也會按設計卡住整份呈遞。然後一鍵匯出一份已簽署的 JSON 稽核憑證,逐則記錄判定、證據摘錄、真實 CourtListener URL、模型與版本(或 deterministic,或 abstained)、驗證器版本、UTC 時間戳記,以及把關結果。

一份書狀、每一條路徑,從頭走到尾

此示範附帶四份樣本書狀。我們走兩份:Mixed Motion 書狀同時帶有一則真實引註、一則捏造引註與一則語料庫外引註;以及 Clean Motion 書狀,其中每一則引註皆為真實。以下每張圖都是運行中應用程式的畫面。案件標示僅供說明,並非真實案件。

流程對照真實判例法即時運行

左側是一份 AI 草擬的排除證據聲請。右側,系統主控台逐階段亮起,串流每一次真實 CourtListener 請求及其 URL、狀態與延遲,並附支持度檢查推理。這是第一則引註 Miranda v. Arizona, 384 U.S. 436,對照基準語料庫解析,同時支持度檢查閱讀判決意見書文本。

CiteGuard 儀表板:左側為 AI 草擬書狀,右側為系統主控台,顯示擷取、錨定、支持度檢查、把關與憑證各階段,並附 CourtListener 請求的即時追蹤。
即時流程:擷取、對照真實判例法錨定、支持度檢查、把關、憑證,下方串流 CourtListener 追蹤。

一則捏造判例,以確定性被攔截

書狀引用 Halstead v. Ferngate Holdings, 823 U.S. 1199。存在性檢查向 CourtListener 發送即時 GET,得到 200 且 0 筆結果,因為 U.S. Reports 沒有第 823 冊。判定為 FABRICATED,是被證明不存在而非猜測。同一次運行中,Brown v. Board of Education, 347 U.S. 483 是真實判例但不在快取子集中,因此被誠實標為 OUTSIDE_COVERAGE,而非錯誤的已驗證。把關讀數為 NOT_FILING_READY:1 則捏造、2 則未解析、1 則自動放行。

一份書狀的 CiteGuard 驗證計分板,顯示 1 則已驗證、1 則捏造、2 則需審查,Halstead v. Ferngate 823 U.S. 1199 標為捏造、Brown v. Board of Education 標為涵蓋範圍外,把關讀數為請勿呈遞。
一份書狀、每種結果:一則真實引註已驗證,Halstead 823 U.S. 1199 以零結果查詢判定為捏造,Brown v. Board 為涵蓋範圍外,其餘轉交需審查。

一則真實判例依判決意見書本身的要旨亮綠放行

這是 Clean Motion 書狀,每一則引註都是真實且切題的判例。當判決意見書文本確立該主張命題時,支持度檢查加以確認。Miranda v. Arizona, 384 U.S. 436 通過為已驗證,因為多數意見本身判示嫌疑人必須被告知其律師權與緘默權,並附 CourtListener 上真實判例的連結。哪些切題引註亮綠放行、哪些轉交審查,各次運行可能不同,因為支持度檢查是唯一非確定性步驟,但像 Miranda 這樣的切題引註會可靠地放行。

即時支持度檢查追蹤,從 CourtListener 拉取真實 Miranda v. Arizona 判決意見書,並引用其本身關於羈押訊問警告的要旨,將 384 U.S. 436 標為已驗證,同時接著錨定 Terry v. Ohio。
支持度檢查閱讀真實判決意見書並引用多數意見本身的要旨,因此 Miranda 384 U.S. 436 通過為已驗證,錨定於真實文本並附來源連結。

它轉交人工,而不是虛張聲勢給出判定

在 Mixed Motion 審查上,計分板讀數為 1 則已驗證、1 則捏造、2 則需審查。Bell Atlantic Corp. v. Twombly, 550 U.S. 544 是真實判例,但摘錄並未明確確立它被用來支持的主張命題,因此支持度檢查連同推理標為需審查,而不是自信地打分。這種保守棄權就是設計:自信的紅色不支持判定刻意罕見,因為對模稜兩可的判決意見書,誠實的做法是交給人工。

一份誤用先例的書狀,其中 Erie Railroad v. Tompkins 與 Celotex Corp. v. Catrett 是被用來支持錯誤主張命題的真實判例;追蹤顯示支持度檢查閱讀每一份真實判決意見書,發現該論點並未確立,並將它們轉交需審查。
真實判例被用來支持錯誤的主張命題:支持度檢查閱讀判決意見書,看出該論點並未確立,並轉交需審查,而不是虛張聲勢。關鍵字比對會漏掉這一點。

即使是乾淨的書狀,也會被卡住直到每一則引註解析完成

這是同一份 Clean Motion 書狀的憑證。Miranda 通過為已驗證,但 Terry v. Ohio 與 Strickland v. Washington 被轉交審查,因此把關停在尚未可呈遞,印章讀為暫緩審查,即使沒有任何一則引註是捏造的。憑證列出每一則引註及其判定與支持度檢查結果,並證明每一則都已對照 CourtListener 檢查存在性、捏造引註以確定性被識別,以及需要脈絡判斷的引註被轉交人工。它匯出為你附加於呈遞的已簽署 JSON 紀錄。看起來乾淨的書狀,並不等於可呈遞的書狀。

Hartwell Capital Partners 案件的引註驗證憑證,標為尚未可呈遞,列出三則引註及已驗證與需審查判定,並附暫緩審查印章。
已簽署憑證,標為尚未可呈遞並附暫緩審查印章,因為引註仍需人工判斷。

錨定於獨立權威

語料庫是從 CourtListener(公開的美國判例法資料庫)快取的 20 則真實判決,包括 Miranda、Twombly、Iqbal、Terry、Strickland、International Shoe、Erie、Baker v. Carr、Chevron 與 Daubert。存在性與捏造檢查也在請求當下即時查詢 CourtListener,因此捏造攔截具權威性,而不限於該子集。20 則判例語料庫是快取子集,因此支持度裁決是在真實判例上以小 N 示範,且該範圍被明白陳述,而非包裝成普遍準確度。

基準語料庫面板列出 20 則從 CourtListener 精選的真實判例,包括 Strickland v. Washington、Ashcroft v. Iqbal、Terry v. Ohio、Whitman v. American Trucking 與 Chevron,各附引註與快取的判決意見書。
20 則判例的基準語料庫,快取自 CourtListener,並在請求當下即時查詢以進行存在性與捏造檢查。

未經驗證的 AI 產出對照 CiteGuard

CiteGuard 不是另一個草擬器。它是決定什麼可以安全呈遞的那一層。

面向 未經驗證的 AI 書狀 CiteGuard 驗證層
捏造判例偵測 讀起來具權威性,未被攔截 確定性、即時零結果查詢
真實但誤用的引註 原樣送出 連同脈絡轉交人工審查
不確定的支持度檢查 模型仍斷言一個判定 棄權,交給人工
來源溯源 每一則引註附真實 CourtListener 連結
呈遞決策 草擬者的自信 確定性把關機制,捏造為零且未解析為零
ABA Op. 512 的稽核軌跡 每一份書狀一份已簽署 JSON 憑證

這個示範不做什麼

  • ✓ 它不做法律研究或草擬,也不與 Harvey、Westlaw 或 Lexis 競爭。它是環繞產出該書狀的任何模型的驗證層。
  • ✓ 它不宣稱在支持度上有完美的 AI 判斷。支持度檢查是由 LLM 輔助並會棄權、是非確定性的,並按設計把不確定案例轉交人工。它不會把每一則誤用引註自動標成紅色不支持;自信的紅色判定刻意罕見。
  • ✓ 它不把看起來乾淨的書狀當成可呈遞。只有捏造與存在性是確定性保證。8 項測試全過與 20 則判例語料庫是此建置示範的範圍,而非開放世界準確度主張。
  • ✓ 它不把樣本書狀、判例或案件標示呈現為真實客戶或案件。它們被標示為合成摘錄。捏造引註確實不存在於真實判例法中。
  • ✓ 它不使用即時文件管理連接器。iManage 或 NetDocuments 連接器為模擬,預設錨定使用公開多數意見摘錄(完整判決意見書文本需要免費的 CourtListener token),PDF 憑證、不利待遇檢查與 GraphRAG 則延後。
  • ✓ 它不附帶客戶、案例研究、推薦或 ROI 數字。目前都不存在。這是證明機制的示範,不是正式部署。

律師真正會問的問題

這會取代 Harvey、Westlaw 或 Lexis 嗎?

不會。CiteGuard 不草擬、也不做法律研究,因此不與 Harvey、Westlaw Precision 或 Lexis Protege 競爭。它是環繞它們任何一個產出的驗證層。它接收 AI 草擬書狀,告訴律師什麼可以安全呈遞、哪些必須由人工處理,並以影子或諮詢模式與你既有工具並行運行。

它如何知道一則引註是捏造的,而不只是缺失?

存在性檢查向 CourtListener(公開的美國判例法資料庫)查詢精確引註。像 Halstead v. Ferngate Holdings, 823 U.S. 1199 這樣的捏造引註回傳零結果(U.S. Reports 沒有第 823 冊),因此以確定性標為 FABRICATED,而非猜測。若 CourtListener 無法連線,該引註標為 UNVERIFIED 而非捏造,因為缺乏證明並非證明不存在。這個區分是確定性、經單元測試驗證的不變式。

我能信任 AI 來判斷一則判例是否真正支持我的論點嗎?

不能盲目信任,這正是支持度檢查會棄權的原因。它是一個 LLM 步驟,閱讀真實判決意見書,僅在判決意見書文本確立要旨時才將引註標綠確認,如同 Miranda v. Arizona。當判決意見書並未明確支持所述主張命題時,它將引註轉交人工審查,而不是虛張聲勢給出判定。模型提供建議;確定性把關機制與律師做決定。

更好的 AI 模型會不會讓這變得多餘?

不會,因為可呈遞是治理屬性,不是模型屬性。法院不在乎模型有多自信;它在乎引註是否存在、是否說了你所主張的內容。因此持久的需求是一個獨立層:把每一項主張錨定於真實判例法、以確定性攔截捏造,並誠實面對它無法驗證的部分。這個要求在任何模型品質下都成立。

稽核憑證對 ABA Opinion 512 與常設命令實際上證明了什麼?

一鍵匯出一份已簽署 JSON 憑證,逐則引註記錄判定、證據摘錄、真實 CourtListener URL、模型與版本(或 deterministic 或 abstained)、驗證器版本、UTC 時間戳記,以及把關結果。它是顯示律師在呈遞前已驗證 AI 產出的成品,這正是 ABA Formal Opinion 512 與 300 多項司法常設命令如今所要求的。在示範中憑證為 JSON;PDF 匯出延後。

這是正式產品還是示範,其中什麼是真實的?

這是證明機制的可運行示範,不是已部署的流程。四份樣本書狀、當事人與案件標示被標為合成摘錄,文件管理連接器為模擬。真實的部分:20 則判例語料庫快取自 CourtListener,存在性與捏造檢查在請求當下即時打到 CourtListener,確定性把關機制與 8 項測試全過完全如所示運行,且捏造引註確實不存在於真實判例法中。

技術研究

支撐這個示範的研究——架構、驗證設計與企業藍圖。

要把 AI 草擬的產出放到法院面前?

驗證層才是硬功夫。我們打造它。

若貴所正在摸索如何讓律師使用 AI,又不冒呈遞捏造引註的風險,我們真心想聽聽你們怎麼想。這個問題是全產業的,答案也會是。

驗證評估

  • ✓ 對應你的 AI 工作流程可能呈遞未經驗證引註的位置
  • ✓ 為你的判例法定義存在性、錨定與支持規則
  • ✓ 設計人工審查轉交與棄權門檻
  • ✓ 訂定你的 ABA Op. 512 義務所需的稽核憑證

打造這一層

  • ✓ 一個覆蓋你真實判例法來源的確定性驗證器
  • ✓ 一個棄權而非虛張聲勢的支持度檢查
  • ✓ 政策把關機制,以及每一次呈遞一份已簽署稽核憑證
  • ✓ 模型可替換,以影子模式環繞你的法律 AI 運行
社群媒體

同步發佈於