政府AI为何败在读反真实法条,而不只是凭空捏造;以及我为它建造确定性决策门时学到了什么。
Artificial IntelligenceGovernmentLegal

法条是真的。答案依然违法。

Ashutosh SinghalAshutosh Singhal2026年6月28日15 min

我第一次亲眼看到一个政府聊天机器人自信却答错,就是关于第8条住房券的问题。

一位房东用平常话问:他能不能拒绝一位要用住房券付房租的租户。正确答案是不能。拒绝构成纽约市《行政法典》§ 8-107(5) 下的收入来源歧视,市人权委员会可对故意违规处以最高250,000美元的民事罚款。这不是偏题刁难。这是已成定论的法律。而在2023年10月,纽约市自己的MyCity机器人——运行在Azure AI上——却告诉企业主和房东相反的答案。The Markup在2024年3月记录了这一切:机器人说房东可以拒收住房券持有者,商店可以只收电子支付拒收现金,雇主可以从员工小费里抽成。每一个答案都是违法的,每一个都带着市政府印章,挂在.gov域名上。

我建造CivicCite,并不是因为某个模型产生了幻觉。我建造它,是因为那些几乎正确的答案,我想告诉你那个彻底改变我对整个问题看法的例子。如果你想亲自看看这个系统,它在这里:veriprajna.com/zh-Hans/demos/government-municipal-ai。语料是一张合成但忠实的演示图谱,并非法律意见。但机制是真实的,而机制才是值得争论的部分。

真正让我难以释怀的,不是机器人捏造了一部法律。而是看着我自己的流水线拉出了正确的法条,却仍然起草出错误的答案。

我花了一周给检索够不到的问题加检索

我起步的方式几乎和GovTech里所有人一样:坚信修复说谎聊天机器人的办法就是更好的检索。把真实的市政法典交给模型。让每一个答案都锚定在真实条款上。检索增强生成——对「模型会胡编」这一标准恐惧的标准答案。故事干净,演示漂亮,而我信了它太久。

然后我读到斯坦福的数据,整个故事就塌了。Magesh及其同事在2025年通过JELS发表的研究中,测量了两款正是按这种方式打造的专用法律研究工具。Lexis+ AI在17%的查询上产生幻觉。Westlaw的AI-Assisted Research在33%的查询上产生幻觉。这些不是玩具聊天机器人。它们是先检索法条、再生成答案的系统,由整个业务就是把法律搞对的公司打造。第二款工具大约每三个答案里仍有一个是错的。检索改善了草稿。它并没有让答案可以安全发布。

我想诚实说说那种感觉,因为我刚花了一周搭建同样的架构,还为自己聪明得意。我的流水线把市民的问题拆解成原子级法律子问题,从市政法典图谱中检索候选条款,并约束模型只能根据检索到的内容起草。在第8条问题上,它做到最后一步之前全都正确。它找到了§ 8-107(5)。正确的法条。它抽出了关于合法收入来源的原文。然后它起草了一句大意是:是的,你可以拒绝住房券。

正确的法律。错误的答案。叠在同一份草稿里。

检索把正确的法条交到模型手里。它丝毫阻止不了模型把那部法条读反。

那一周,问题在我眼前变了形。我一直把幻觉当敌人,幻觉是真实存在的,但它是你能想象去抓住的失败。真正把MyCity那些答案送出去的失败更隐蔽、也更糟:引用了正确条款,却陈述了错误结论。整句话里没有任何捏造。没有任何东西能被「你是不是瞎编的」过滤器抓住,因为什么都没瞎编。只是对一部就摆在眼前的法律的自信误读。那种失败模式对检索是隐形的,因为检索只检查法条是否在场,从不检查句子是否按正确方向解读了它。

哪个更糟:一部捏造的法律,还是一部真实却被读反的法律?

我不断回到这个问题,答案也越来越确定。捏造的法律反而是更安全的失败。

想想市民面对这两种情况会怎么做。一部明显捏造的法条读起来怪,引用的条款对不上,感觉不对劲。一部真实却被读反的法条读起来完美。它有真实的引证。条款存在。房东读到「是的,你可以拒绝住房券」,看到附上的真实法典编号,然后照做。于是就有了一次违法拒租、一位可主张歧视的租户,以及一条指向政府答案的纸质痕迹。引证的正确性,恰恰是错误结论变得危险的原因。它就是坏建议借以登场的那份凭证。

所以我最在意的检查从来不是「这条引证是否真实」,而是「这条引证是否真的支持这句话」。在流水线里,这项检查是蕴含:给定已起草的主张和被引条款的原文,文本是蕴含该主张、与之矛盾,还是两者都不是。在第8条草稿上,模型的「可以」会被§ 8-107(5)判定为矛盾,因为该条款明确说的是相反的意思。草稿死在那里。最终存活、并被闸门放行的,是纠正后的主张:房东不得拒绝,而这里是这么规定的法条。

Verify阶段被打开供检查,显示其原始输入——关于第8条住房券的已起草主张与引证id nyc-admin-8-107-5——以及其原始输出:蕴含标签entailed,并以所引条款原文作为理由。
每一个阶段都可以打开。这是Verify,展示已起草的主张、对照核查的法条原文,以及蕴含标签entailed。被引法律是否真的支持这句话,是你可以读到的东西,而不是一个你只能盲目接受的分数。

我坚持要有的、也是那个界面存在的原因,是蕴含不是一个你必须相信的黑箱。你可以打开Verify阶段,阅读它的原始输入与输出:已起草的主张、对照核查的法条原文、标签,以及用条款自身措辞给出的理由。一个你无法检查的裁决不是验证。那只是制作更精良的第二意见。 我已经用昂贵的方式学会了:让一个模型去裁判另一个模型,只会给你两个彼此同意的模型,而这远不如看起来那么有力。

最终奏效的一招,是停止试图让模型变得可信

我记得那个确切的重新框定,因为它当时像是放弃,事后却成了整个设计。我不再试图让模型变得可信,而是开始让它的可信度变得无关紧要。

转变是这样的。CivicCite里的语言模型是顾问。它拆解问题,起草候选答案,给出蕴含意见。它永远没有权放行任何东西。坐在智能体框架之外、用朴素确定性Python写成的,是我称之为法定决策门(Statutory Decision Gate)的东西:只有四个条件同时成立时,它才放行一个子答案——引证存在、条款现行有效、被引文本蕴含该主张、且没有任何冲突。缺任何一条,答案就不发出。其中两项检查是纯粹的算术与逻辑。现行有效是日期比较:条款没有废止日期,且其生效日期不晚于基准日。冲突是一次图谱读取。没有提示词,没有温度,没有人能说服它。

CivicCite分屏。左侧普通助手发出的答案标注为无法定依据、无蕴含检查、无现行有效检查、原样发出;CivicCite一侧显示法定决策门读数为RELEASED,一放行、零扣留,答案携带纽约市《行政法典》§ 8-107(5),标注为已验证来源、现行有效。
闸门读数为RELEASED,一放行、零扣留。答案得以发出,只因为它携带纽约市《行政法典》§ 8-107(5),标注为已验证来源、现行有效。左侧普通助手则原样发出了答案,无法定依据,也没有任何检查。

我现在常说两句话。一句是智能体给建议,闸门做决定。 另一句是:无论草稿多么自信,大语言模型都不能把自己投过闸门。这比听起来更重要,因为这个领域最诱人的失败,就是让模型给自己的工作打分,再把那个分数叫做「验证」。起草答案的模型,不能同时是证明答案安全的那个东西。闸门故意比模型更笨,也故意在模型之外,而这正是全部要点。智能提出。代码裁定。

模型是好的写作者,却是差的裁判。所以我让它写,却从不让它判。

演示对自己的边界是诚实的,我也会诚实。语料是一张合成但忠实的市政法典图谱,由真实条款改写而成,并非正式记录来源。311升级路由是计算出来并展示的,但连到真实案件系统的连接器是桩代码。受约束的起草使用白名单校验器加一次重新询问,而不是生产级的token级解码。真实的是决策逻辑,而决策逻辑就是产品。

为什么我信任沉默,胜过信任一个好答案

我没想到会为演示拒绝回答而骄傲,而现在那是它最让我喜欢的动作。最清楚的例子是一辆餐车。

一位摊贩问:在一般摊贩停车规则下,他能否整天把车停在咪表车位。普通助手兴高采烈却错误地回答,把一条规则当作现行有效来引用。CivicCite也起草了候选答案,候选引用的停车条款已被废止。然后现行有效检查运行。该条款有废止日期。现行有效失败。闸门没有退回到某条相邻规则并虚张声势,而是扣留答案,将该问题标为超出已验证覆盖范围,并把部分发现一并路由给一个在线部门。

CivicCite扣留了对餐车咪表停车问题的回答。消息写明:唯一涉及一般摊贩在咪表车位停车的条款已被废止,目前没有现行有效条款管辖此事。四项检查显示引证存在、现行有效与蕴含全部失败,无冲突通过,问题被路由至纽约市311一般接件。
诚实的不回答。覆盖该停车问题的唯一条款已废止,因此现行有效失败,检索集中没有任何条款管辖,闸门扣留并把问题路由至纽约市311一般接件,而不是虚张声势地回复。
政府域名上的错误答案不是尴尬。它是挂着市名的法律责任。

看看那个界面拒绝做什么。它不从一条已死法条合成一个看似合理的答案。它用平常话说明:唯一涉及此事的条款已被废止,目前没有任何现行有效条款管辖该问题,然后把市民转交出去,而不是猜测。诚实的弃权胜过自信的错误答案,在政府尤其如此。 而在政府里,利害关系不是声誉。政府法律建议处于专有职能(proprietary-function)地带,这意味着当答案最终出错时,没有主权豁免的盾牌可躲。

这不再是假想忧虑,这也是我现在而不是以后建造这东西的部分原因。2026年有78项与聊天机器人相关的法案横跨27个州。纽约的S7263于2026年2月26日进入参议院全会。欧盟《人工智能法案》附件III高风险义务将于2026年8月2日可强制执行,罚款最高可达1,500万欧元或全球营业额的3%。监管问题正从「你的AI有没有用」转向「你能否证明你的AI被允许那样说」。沉默你可以辩护。自信的错误答案你不能。

监管者真正能据此行动的那个数字

我曾经以为这类系统的头条指标是幻觉率,现在我认为那种直觉完全反了。百分比是交给监管者的错误东西。

想象你是市法务部——那个在答案出错时承担法律责任的办公室。「我们的聊天机器人幻觉率只有4%」并不令人安心。这等于承认:每一百个市民里有四个得到了带着市政府权威、背后却没有任何东西支撑的答案。真正有意义的数字,不是模型多常出错,而是是否曾有任何未经核实的东西被放行出门。所以我围绕基准构建的指标是:在一个固定、已标注的12查询黄金集上,跑真实流水线,统计在没有已验证、现行有效法定依据的情况下被放行的答案数量。目标是十二个里零个。

幻觉率告诉监管者你失败了多少次。它无法告诉他们你抓住了错误。
黄金集基准视图,三块磁贴。十二个答案中零个在没有已验证现行有效法定依据的情况下被放行,目标为零;审计记录覆盖率100%;与真实标注的处置一致率100%;下方是跑过流水线的十二条已标注查询列表。
12查询黄金集跑过真实流水线。目标是零个答案在没有已验证、现行有效依据的情况下被放行;每个查询一份可归档记录;处置与已标注真实结果一致。这是固定标注集,不是开放世界承诺。

我想精确说明那个数字是什么、不是什么,因为过度宣称会背叛整个前提。它是固定标注集上的结果,不是开放世界保证,也不是「零幻觉」——我认为任何诚实的人都不该兜售这个说法。模型仍然会起草不完美的主张。重点是未经核实的主张被扣留,而不是它们从未被起草。与那个数字并列的还有两个:100%审计记录覆盖——无论发出还是拒绝,每个查询一份可归档记录;以及与已标注真实结果的处置一致。普通RAG基线——没有闸门的MyCity架构——会在同一集合上发出那些有据可查的违法答案。那种比较是上下文,不是头条。

记录是我最会拼死捍卫的部分。

法定决策记录抽屉显示JSON。验证器veriprajna-civiccite版本0.1,处置RELEASED,标准列表点名NIST AI RMF的Govern与Measure日志记录以及FedRAMP StateRAMP持续监控,以及住房领域子答案引用纽约市《行政法典》§ 8-107(5),检查项引证存在、现行有效、蕴含与无冲突全部为真,决策RELEASE。
为该查询写入的记录。处置RELEASED、引证、全部四项检查,以及决策,以JSON形式。它点名NIST AI RMF与FedRAMP StateRAMP日志记录作为其构建所朝向的标准。每个查询都会得到一份这样的记录,无论答案是否发出。

每一个查询,无论放行还是拒绝,都会产生一份法定决策记录:处置、引证、全部四项检查结果、决策,作为你可以归档并重跑的结构化数据。它点名NIST AI RMF日志记录以及FedRAMP与StateRAMP持续监控作为其构建所朝向的标准。我对那句话很谨慎。「构建所朝向」是方向,不是认证,我不会声称CivicCite已通过其中任何一项认证。但审计者不想要「模型很聪明」的承诺。审计者想要一份按每次交互的记录,精确展示为何允许一个答案存在,并且以经得起有人试图拆穿的形式。可复现性把决策变成证据,而证据是监管者可以据以行动的东西。

如果你更想看它运转而不是听我描述,这里是整套演示从头到尾在跑。

我留下的那个问题

我不断回到一件事:自己的反应让我吃惊。第一次看CivicCite拒绝一个问题并路由给某个部门时,我内心有一部分把它读成系统失败。

它并没有失败。它在做那些自信机器人做不到的一件事:知道自己能证明到哪里、并停在那里。我花了太久优化「好答案」,以至于悄悄假定好答案就是目标。不是。在政府里,目标是可辩护的答案,而「好」与「可辩护」之间的距离,正是这个产品存在的全部理由。可辩护的答案有时看起来像一条已放行的引证。同样经常地,它看起来像一个被路由的问题与一份已归档的记录。

所以我会留给任何为政府建造AI、或购买AI的人的问题,不是「你的模型有多准」。更好的模型会越来越擅长写出流畅、在语境中却错误的答案,因为流畅从来不是缺失的那一块。我在任何东西离开闸门之前问的问题更窄、也更难。你现在能否证明:这个确切答案追溯到一部存在且现行有效的法条,而那份证明能否经得起一个想让它失败的法庭?如果答案是否定的,模型有多好都无关紧要。系统应当保持沉默。 无论哪种结果,你都可以在这里看它如何决定:veriprajna.com/zh-Hans/demos/government-municipal-ai

信任不属于一个你必须相信的模型。它属于你可以审计的代码。

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。