
一面绿旗救不了你:2026 年法律 AI 幻觉的真实面目
2026 年 3 月,两名律师走出第六巡回上诉法院时,两人合计被罚 $30,000,而他们诉状中所引用的案例并非全是虚构的。这个细节正是没人愿意去正视的,也正是我每天埋头做我所做之事的原因。
我是从问题内部走到这一步的。在创办 Veriprajna 之前,我做过诉讼助理律师,而这份工作中没人愿意美化的部分就是引注核查——晚上 11 点对着一份满是修订标记的诉状,圈出一处引注,潦草地写下这个案例真的是这么说的吗?在页边空白处。当第一波法律 AI 浪潮到来时,我以为它会让那样的夜晚消失。结果它反而让那些夜晚更危险了,因为这些工具变得非常擅长生成那种看起来已经过核查的引注。法律 AI 引注核查结果证明,它并不是一个你可以随手开启的功能。它是一个需要有人去搭建的层,而几乎没有人搭建过。
这是我想在本文中捍卫的观点:真正会在 2026 年让一家律所受到制裁的幻觉,并不是你现有工具被设计去捕捉的那种。那个著名的失败——凭空捏造的案例——基本上已经解决了。而正在不断升级的失败,是真实存在、却被引用错误、还挂着一面绿旗的案例。
人人都记得 Mata 案。几乎没人学到正确的教训
即便你不知道名字,你也知道这个故事。Mata v. Avianca,2023 年:一名律师向 ChatGPT 索取支持性案例,它生成了Varghese v. China Southern Airlines——令人信服的案卷编号、貌似可信的法院、详尽的内部引注——而这个案例根本不存在。随之而来的是 $5,000 的罚款和足以毁掉整个职业生涯的难堪。
这个行业从 Mata 案中吸取的教训是“AI 会编造案例”。于是整个行业针对编造出来的案例构建了防御机制。Thomson Reuters 有 KeyCite。LexisNexis 有 Shepard's,那个数十年历史的黄金标准。Harvey 将其输出锚定在 LexisNexis 的数据库中。这些引证核查工具在应对 Mata 式问题上确实很在行:给它们一条对应不到任何东西的引注,它们会告诉你它对应不到任何东西。
问题在于,这个行业解决了 2023 年的问题,却以为自己已经解决了 2026 年的问题。
看看 2026 年 2 月在新奥尔良真正发生了什么。一名律师因提交十一处捏造或曲解的引注而受到制裁。真正应该让你彻夜难眠的部分是:他同时使用了 ChatGPT 和 Westlaw Precision AI。他用的是那款有据可依、专门打造、有引证核查工具支撑的工具——却仍然提交了一份招致制裁的诉状。“减少”不等于“消除”,而这两个词之间的鸿沟,正是如今责任所在之处。
你的工具看不见的失败

让我精确地描述这种失败模式,因为精确本身就是全部的关键。
AI 引用了一个真实的案例,用来支持一个该案例并不支持的主张。案卷编号是有效的。案例确实存在。KeyCite 返回一面绿旗。Shepard's 也表示认同。而分析仍然是错的——因为 AI 把异议意见当作多数意见的裁判要旨来引用,或者引用了一个解读某部两年前已被修订的成文法版本的案例。
这正是斯坦福大学那项研究真正测量到的东西——该研究经过同行评审,发表于Journal of Empirical Legal Studies,时间是 2025 年,它测出的 Westlaw Precision 的幻觉率为33%,而 Lexis+ AI 的为 17%。人们读到“33% 的幻觉率”,脑海中浮现的是一款每三次查询就编造一个案例的工具。那并不是这些数字的含义。它们大多是错误的分析,针对的是真实的引注。你的核查工具确认案例存在。它确实存在。它只是从未声称要核查案例究竟说了什么。
我来讲得具体些,因为正是这个例子最终让我自己的团队停止了争论。一名诉讼助理律师请一个 AI 助手研究针对特拉华州法下违反受信义务主张的抗辩理由。这个工具返回了一份干净利落的分析,引用了Stone v. Ritter(2006 年)来论证董事监督责任的标准。这条引注是真实的。裁判要旨摘要是准确的——就 2006 年而言。工具遗漏的是,特拉华州最高法院 2019 年在Marchand v. Barnhill一案中的判决大幅扩展了Caremark监督义务,而此后衡平法院的判决意见在此基础上构建了一套“关键任务”合规标准。
Stone v. Ritter仍然挂着一面绿色的 KeyCite 旗标。它从未被推翻。它依然是“有效判例”。而一份在 2026 年的立案中倚赖它的诉状仍然是错的,因为该裁判要旨的实际适用范围已被此后发生的一切所收窄——而这恰恰是引证核查旗标并非为呈现而设计的那类进展。
引证核查工具告诉你一个案例还活着。它不会告诉你这个案例是否仍然是你的 AI 所说的那个意思。
这就是引注捏造与语境幻觉之间的区别,也是整个这个领域中最重要的一个区分。在截止期限压力下审阅输出的初级助理律师不会发现它,因为这条引注看起来是对的。它确实是对的——就工具一直以来唯一核查的那个意义而言。
我们一开始也搞错了——而且是我极力主张那么做的
我想诚实地讲讲我是怎么明白这一点的,因为我并不是靠推理想通的。我一开始交付的就是错的东西。
当我的团队构建我们第一个核查器时,我曾主张——在我们自己的设计评审上,当众、带着几分自信地——只要案例是真实的,我们就没问题。于是我们的第一条流水线本质上就是把引证核查的逻辑重跑了一遍。它确认每一个被引用的案例都存在,并调取其处理状态。快速、利落,而且在一次试点中,它让一份诉状一路畅通地抵达了一个绿色的仪表盘。
然后一位试点用户——一名真正的诉讼律师——对我们工具已经放行的一段内容提出了质疑。被引用的案例是真实的。我们的核查器很满意。可诉状归于它的那条裁判要旨,出自该判决意见中并不具约束力的那一部分。我们的系统对此没有任何判断,因为我把它设计成对此没有任何判断。我不过是重建了一个 Shepard's,却把它叫做核查。
那次失败为我们之后所做的一切埋了单。把引证核查跑得更快并不是核查——那只是同样的盲区套上了一个更漂亮的界面。转向是被逼出来的:我们必须构建一个层,让它越过引证核查的处理状态,读入后续的引用参考,它追问后来的案例是否对某条裁判要旨作出了区分或收窄,它会标记出那些核心主张已被实质性修改的判决意见——即便案例本身仍然是有效判例。这才是那个工程问题。无论我们把引证核查跑得多快,它都永远解决不了。
为什么买了 Harvey 也填不上这个缺口?
人们以为平台厂商会解决这个问题,我也理解为什么——这些平台非同凡响,而资金流向表明大家都认同这一点。Harvey 在 2026 年 3 月凭借约 $190 million 的年度经常性收入达到了 $11 billion 的估值,定制智能体数量超过 25,000 个,并被半数 AmLaw 100 律所采用。Thomson Reuters 以 $650 million 收购了 Casetext,并将其并入 CoCounsel 的 agentic 工作流。LexisNexis 在 2026 年 2 月用 Lexis+ Protege 取代了 Lexis+ AI——四个专门化智能体,300 多个预置工作流。
这些并不是问题所在。我坦率地告诉各家律所:留着你们的平台。缺口在于,这些工具没有一个附带独立的核查层,而其中较好的那些工具会坦承输出核查是用户自己的责任。LexisNexis 在斯坦福的数据出炉之后悄悄收回了它“100% 无幻觉”的说法,是有原因的。
而且,这些平台把核查问题变得更难,而非更简单,靠的是转向 agentic。当一个长跨度的智能体运行一套多步骤的研究与起草工作流时,其输出并不是一段带引注的文字——而是一条由它们串成的链,每一步都喂给下一步,每一处都是语境错误可以进入并传播的地方。当一名初级助理律师在晚上 11 点通过 Slack 问我,这个智能体的输出是否可以安全地拿去立案时,诚实的回答是:在有某种东西把每一条引注对照被引案例真正的裁判要旨逐一读过、并记录下是哪一个智能体步骤生成了它之前,都不行。那条审计轨迹不是可有可无的东西。它是法官常规命令越来越多地要求的东西。而这并不是我在提防的某个边缘工作流——企业法律 AI 的采用率在一年之内从 23% 翻倍到 52%,Gartner 预计到 2026 年将有 40% 的企业应用嵌入特定任务的智能体;引注链的失败模式会随着它们中的每一个而扩大。
那么,究竟什么才能捕捉到一个被引用错误的真实案例?

不是另一个 AI——而是另一份工作。这个核查层处在 AI 的输出与人的签名之间,它做引证核查工具不会做的事:它不止步于一个案例是否仍是有效判例,而是深入后续的引用参考,追问后来的判决意见是否对该裁判要旨作出了区分或收窄,并标记出那些核心主张已被实质性修改的案例——即便判例摘要读起来依然干净。处理状态是这场探究的起点,而不是终点。
在底层,检索的重要性超出人们的预期。向量搜索——大多数 retrieval-augmented 系统中的默认方式——找到的是那些在文本上与查询相似的案例。法律权威并不是按文本相似度组织的;它是按案例之间如何相互引用、区分和推翻来组织的。那是一张图,而不是一张列表。建立在法律知识图谱而非扁平向量索引之上的检索,已被证明在法律工作的检索相关性上比向量搜索高出约 14%——这就是呈现出真正具约束力的案例,与呈现出仅仅听起来像具约束力的案例之间的差别。图谱正是你用来找到那个Marchand——它悄然重塑了Stone,那个人人仍在引用的案例。
这正是我们在 Veriprajna 所构建的层——即那套引注核查流水线、知识图谱基础设施,以及治理系统——它们让 AI 输出可以安全地拿去立案——而且我们是围绕一家律所已经在用的任何平台来构建它的,无论是 Harvey、Lexis Protege 还是一个开源模型,而不是要求任何人拆掉一个运转良好的工具。
没人会放进幻灯片的那部分:治理
在技术问题之下还有第二个问题,正是它把一次制裁变成一桩职业过失索赔。
大约有68% 的法律从业者承认至少用过一次未经批准的 AI 工具,而每五家律所中不到一家有正式的 AI 政策——尽管如今近十分之七的律师在工作中使用生成式 AI,这一比例在一年之内翻了一番。因此,大多数律所都有律师把客户事务喂进无人批准的工具,既没有用了哪款工具的记录,也没有核查步骤,更没有审计轨迹。职业过失责任保险公司已经注意到了这一点。它们正把 AI 使用写入保单的考量之中,而在没有律师监督下的未经授权使用,恰恰是当一桩索赔落下时会使承保失效的那类情形。
监管底线也在移动,而大多数律所还没有达到它。2024 年 7 月发布的 ABA 第 512 号正式意见,为生成式 AI 列出了六项伦理义务——其中包括胜任能力、保密、对法庭的坦诚以及监督——它还带有两条人们容易忽略的锋刃。你不能就学习一款你将经常使用的工具所花的时间向客户计费。而且一家联邦法院已经裁定,AI 生成的工作成果不受律师—当事人特免权的保护。与此同时,300 多名法官已发布各自的 AI 常规命令,每一条都有自己的披露或证明要求,佛罗里达州在 2026 年 2 月增加了一项披露强制规定,而我遇到过的律所没有一家有系统化的方式来追踪哪位法官要求什么。而且这条底线仍在抬升:欧盟《AI 法案》将于 2026 年 8 月生效,科罗拉多州的《AI 法案》于 6 月生效,而欧盟的《产品责任指令》如今将 AI 作为严格责任下的产品对待——这就把风险敞口从单个受制裁的助理律师身上转移到了律所的资产负债表上。
影子 AI 不是一个纪律问题。它是一道基础设施缺口——人们会绕开那些不适合自己工作方式的工具。
一套名副其实的治理系统,不会只是把一份政策记录在一个没人读的 PDF 里。它在工作流中强制执行政策,记录每一条 AI 辅助的引注,生成某一司法辖区所要求的披露措辞,并产出一条审计轨迹,让一位监督合伙人能够诚实地证明每一条引注都经过了核查。
各家律所总会问我的问题
开场白通常是某个版本的:如果我手动核查每一条引注,那我岂不是把 AI 给我的效率都扔掉了吗?是的——而这正是把核查内建进流水线、而不是留给午夜里一个疲惫的助理律师的全部意义所在。对 AI 输出做手动引注核查无法规模化,而跳过它就是那份职业过失风险。这个层的存在,恰恰是为了让速度在安全之下得以留存。
接着是怀疑论者的版本:这不是小题大做吗——语境幻觉真的能有多频繁地咬你一口?到 2026 年初,Charlotin 幻觉数据库已经收录超过1,222 起有记录的案例——即美国法院文件中的 AI 幻觉案例,高于 2025 年底的 729 起以上。曲线正朝着错误的方向发展,制裁已经从 $500 的轻拍升级为如今司空见惯的五位数罚款,而这个数字只统计了那些被抓住并被公开的案例。我一直在一个浏览器标签页里开着那个数据库。就在你没留意的时候,这个数字还在往上跳。
而来自管理合伙人的问题,几乎总是:难道四大会计师事务所或一家大型系统集成商不能把这一切都搞定吗?他们可以配置你的平台,而且他们会为此收取 $500K 到 $2 million 的费用。但配置 Harvey 是在部署一个平台——它并不是构建那个平台有意留给你的核查层。这是两个不同的问题,而其中只有一个才是会让你受到制裁的那个。
如果是晚上 11 点的那位助理律师,我会对他说什么
法律 AI 市场正从 2026 年约 $5.6 billion 迈向 2030 年的 $12.5 billion,而法律研究是其中最大的一块。这种增长是真实的,这些工具也当之无愧。但整个行业都在为输出做优化——更快的研究、更多的智能体、更长的自主工作流——同时把核查当作别人的责任,而这在实践中意味着没有任何人负责。
在 2026 年让你受到制裁的那个案例,会通过你现有工具运行的每一项检查。它会真实存在。它会挂着一面绿旗。它会被引用来支持某个它并不完全那么说的主张,而在截止期限压力下、于午夜里读着它的那个你,不会发现这一点,因为屏幕上的一切都在说它没问题。
这并不是不信任法律 AI 的理由。这是构建平台所遗漏的那一个层的理由——即那个核查与治理层,它读的是案例真正的裁判要旨,而不只是它是否还在喘气。安装了它的律所会保住速度。而没有安装的那些,则会一次一份责令说明理由的命令地,不断发现一面绿旗从来没有向他们承诺过什么。