环绕你法律 AI 的核验层
AI 起草的书状会引用并不存在的案件,或虽存在但所说与所引主张相反的案件。CiteGuard 是环绕你 AI 的那一层:它将每一处引文对照 CourtListener 上的真实判例法落地,以确定性方式捕获伪造,把无法核验的内容路由给人工,并签发审计证书。它告诉你什么可以安全提交,以及究竟什么需要人工。
0
伪造引文可通过门禁
确定性信任不变量,已单元测试
20
真值语料中的真实案件
从公开美国判例库 CourtListener 缓存
8/8
核心核验器测试通过
离线且可复现(python tests/test_core.py)
这是一份可运行的演示。示例书状、当事人及案件标题均为合成摘录,文档管理连接器为模拟。语料库、实时 CourtListener 核查、确定性门禁以及测试均为真实。
法院已经在为此实施制裁,而起草工具并不核查自己的产出。
失败模式不是语法糟糕。语法完美,这正是危险所在。AI 起草一份读起来像合伙人写的书状,却引用从未作出的判决,或引用一起真实案件来支持与其主张相反的命题。即便是专用法律工具也会如此:在一项对照研究中,Westlaw Precision 的幻觉率为 33%,Lexis+ 为 17%(斯坦福 RegLab,Journal of Empirical Legal Studies,2025)。
后果已经到来。到 2026 年初,已有 1,222 起有记录的涉及 AI 幻觉引文的法院案件,法院已开始制裁:第六巡回上诉法院于 2026 年 3 月开出 $30,000 罚金。治理规则随之而来。ABA Formal Opinion 512 以及超过 300 份司法常设令,现在要求律师在提交前核验 AI 输出,而只有不到 20% 的律所有任何 AI 使用政策。
起草器不是修这个问题的正确位置。更强的模型仍然在起草,而法院并不在乎模型有多自信。它在乎引文是否存在、是否说了你所声称的内容。因此耐久的答案不是更聪明的写作者,而是独立的一层:对照独立权威核查产出、以确定性捕获伪造,并对无法核验的内容保持诚实。
保证级的部分是确定性代码。判断环节是会弃权的 LLM。裁定的是门禁,不是模型。
粘贴任何 AI 起草的书状,流水线即实时运行:抽取每一处引文及其主张,对照真实判例法落地,运行确定性存在性核查与 LLM 支持核查,应用确定性策略门禁,并导出已签名的审计证书。仪表盘以系统控制台展示各阶段亮起,并流式输出每一次真实 CourtListener 请求及其 URL、状态和延迟,因此没有任何黑箱。
存在性与伪造核查以及策略门禁,是对照真实判例法运行的纯 Python。伪造引文由实时 CourtListener 零结果回查证明不存在,而非猜测,因为买家需要可证明的伪造捕获和可审计的门禁,而不是 LLM 的一面之词。
支持核查阅读真实判决意见,并询问其是否支持主张 P。它可切换供应商,并在不确定或未落地时弃权、路由给人工复核。它提供建议;从不拥有最终决定权。
每一处引文恰好落成一种裁定。路由给人工的裁定会诚实说明原因;表示 CourtListener 不可达的那一种,绝不会被折叠成伪造。
| 裁定 | 含义 | 由何裁定 |
|---|---|---|
| VERIFIED_SUPPORTED | 真实案件,且判决意见支持该主张 | 存在性核查加支持核查 |
| VERIFIED_UNSUPPORTED(需复核) | 真实案件,但判决意见并未明确支持该主张 | 连同上下文路由给人工 |
| FABRICATED | 真实判例法中无此案件 | 确定性、实时零结果回查 |
| OUTSIDE_COVERAGE | 真实案件但不在缓存子集中,如实标记 | 确定性,绝不会虚假验证 |
| UNVERIFIED | CourtListener 不可达,因此缺失未经证明 | 确定性,绝不会折叠为伪造 |
门禁是确定性的。仅当伪造引文为零且未决引文为零时,它才返回 FILING_READY,否则返回 NOT_FILING_READY。这意味着即便没有任何伪造,只要有一处未经复核的引文,也会按设计拦住整份提交。然后一键导出已签名的 JSON 审计证书,逐条记录每处引文的裁定、证据片段、真实 CourtListener URL、模型及版本(或 deterministic,或弃权)、核验器版本、UTC 时间戳以及门禁结果。
演示附带四份示例书状。我们走通其中两份:「混合动议」书状同时带有一处真实引文、一处伪造引文和一处语料外引文;以及「干净动议」书状,其中每一处引文都是真实的。下方每张图都是运行中应用的截图。案件标题仅为示意,并非真实案件。
左侧是一份 AI 起草的排除证据动议。右侧,系统控制台按阶段亮起,流式输出每一次真实 CourtListener 请求及其 URL、状态和延迟,并附带支持核查推理。这是第一处引文 Miranda v. Arizona, 384 U.S. 436,在支持核查阅读判决意见文本的同时,对照真值语料作出裁定。
该书状引用 Halstead v. Ferngate Holdings, 823 U.S. 1199。存在性核查向 CourtListener 发送实时 GET,得到 200 且 0 条结果,因为《美国判例汇编》没有第 823 卷。裁定为 FABRICATED,是被证明不存在,而非猜测。同一次运行中,Brown v. Board of Education, 347 U.S. 483 是一起真实案件但不在缓存子集中,因此被如实标记为 OUTSIDE_COVERAGE,而非虚假验证。门禁显示 NOT_FILING_READY:1 处伪造、2 处未决、1 处自动放行。
这是「干净动议」书状,其中每一处引文都是真实且切题的案件。当判决意见文本确立该主张时,支持核查予以确认。Miranda v. Arizona, 384 U.S. 436 标绿为已验证,因为多数意见本身认定嫌疑人必须被告知获得律师协助权和保持沉默权,并附有 CourtListener 上真实案件的链接。具体哪些切题引文标绿放行、哪些路由至复核,可能因每次运行而不同,因为支持核查是唯一的非确定性步骤,但像 Miranda 这样的切题引文会可靠地放行。
在「混合动议」复核中,记分板显示 1 处已验证、1 处伪造、2 处需复核。Bell Atlantic Corp. v. Twombly, 550 U.S. 544 是一起真实案件,但摘录并未明确确立其所引主张,因此支持核查将其标为需复核并附带推理,而非自信地打分。这种保守弃权正是设计:自信的红色「无依据」裁定刻意罕见,因为对模棱两可的判决意见,诚实的做法是交给人工。
这是同一份「干净动议」书状的证书。Miranda 标绿为已验证,但 Terry v. Ohio 与 Strickland v. Washington 被路由至复核,因此门禁停在未达提交就绪,印章显示待复核暂扣,即便没有任何一处引文是伪造的。证书列出每一处引文及其裁定与支持核查结果,并证明每一处都已对照 CourtListener 核查存在性、伪造引文被确定识别、需要语境判断的引文被路由给人工。它导出为已签名的 JSON 记录,可附于提交材料。看起来干净的书状,并不等于提交就绪的书状。
语料库是从公开美国判例库 CourtListener 缓存的 20 份真实判决,包括 Miranda、Twombly、Iqbal、Terry、Strickland、International Shoe、Erie、Baker v. Carr、Chevron 和 Daubert。存在性与伪造核查也会在请求时实时查询 CourtListener,因此伪造捕获具有权威性,而不限于该子集。20 案语料是缓存子集,因此支持裁决是在小规模真实案件上演示的,该范围被如实陈述,而非包装成普遍准确率。
CiteGuard 不是又一个起草器。它是决定什么可以安全提交的那一层。
| 维度 | 未经核验的 AI 书状 | CiteGuard 核验层 |
|---|---|---|
| 伪造案件检测 | 读起来权威,未被捕获 | 确定性、实时零结果回查 |
| 真实但被误用的引文 | 原样发出 | 连同上下文路由给人工复核 |
| 不确定的支持核查 | 模型仍断言裁定 | 弃权,交给人工 |
| 溯源 | 无 | 每处引文一条真实 CourtListener 链接 |
| 提交决定 | 起草器的自信 | 确定性门禁,零伪造且零未决 |
| 面向 ABA Op. 512 的审计轨迹 | 无 | 每份书状一份已签名 JSON 证书 |
不。CiteGuard 不起草,也不做法律检索,因此不与 Harvey、Westlaw Precision 或 Lexis Protege 竞争。它是环绕无论它们产出什么内容的核验层。它接收 AI 起草的书状,告诉律师什么可以安全提交、究竟什么需要人工,并以影子或咨询模式与你已在使用的工具并行运行。
存在性核查向公开美国判例库 CourtListener 查询确切引文。像 Halstead v. Ferngate Holdings, 823 U.S. 1199 这样的伪造引文返回零结果(《美国判例汇编》没有第 823 卷),因此被确定标记为 FABRICATED,而非猜测。若 CourtListener 不可达,该引文被标记为 UNVERIFIED 而非伪造,因为缺乏证明并不等于证明不存在。这一区分是确定性、已经单元测试的不变量。
不能盲目信任,这正是支持核查会弃权的原因。它是一步 LLM:阅读真实判决意见,仅当判决文本确立该判决要旨时才将引文标绿确认,正如 Miranda v. Arizona 那样。当判决意见并未明确支持所述主张时,它将引文路由给人工复核,而非虚张声势地给出裁定。模型提供建议;确定性门禁与律师作出决定。
不会,因为提交就绪是治理属性,不是模型属性。法院并不在乎模型有多自信;它在乎引文是否存在、是否说了你所声称的内容。因此耐久的需求是独立的一层:将每一项主张锚定于真实判例法,以确定性捕获伪造,并对无法核验的内容保持诚实。该要求在任何模型质量下都成立。
一键导出已签名的 JSON 证书,逐条记录每处引文的裁定、证据片段、真实 CourtListener URL、模型及版本(或 deterministic 或弃权)、核验器版本、UTC 时间戳以及门禁结果。这正是证明律师在提交前核验了 AI 输出的凭证,也是 ABA Formal Opinion 512 以及 300 多份司法常设令现在所要求的。演示中证书为 JSON;PDF 导出被延后。
这是一份可运行的演示,用来证明机制,而不是已部署的流水线。四份示例书状、当事人及案件标题被标注为合成摘录,文档管理连接器为模拟。真实的是:20 案语料从 CourtListener 缓存,存在性与伪造核查在请求时实时命中 CourtListener,确定性门禁与 8 项全过单元测试按所示运行,伪造引文在真实判例法中确实不存在。
本演示背后的研究——架构、核验设计,以及企业蓝图。
完整解决方案
探索「法律 AI 引文核验与治理」解决方案 →核验层才是难的部分。我们来构建它。
如果你的律所正在琢磨如何让律师使用 AI,同时避免在提交材料中出现伪造引文,我们非常想听听你是如何思考这件事的。这个问题是全行业性的,答案也将如此。