伊利诺伊州HB 3773禁止邮政编码代理变量,EU AI Act依赖相同地理数据。Clarion输出CONFLICT并对双重风险敞口定价,而非出具合格徽章。
人工智能治理招聘合规

伊利诺伊州禁止EU AI Act要求保留的邮政编码字段:我构建了直面冲突而非虚假通过的AI招聘审计系统

Ashutosh SinghalAshutosh Singhal2026年7月21日13 min

2025年12月2日,纽约州主计长发布了一项针对同一样本(32家公司)的审查报告,此前纽约市消费者和工人保护局(DCWP)已根据Local Law 144对该样本进行过审查;在DCWP仅发现1起违规的地方,州主计长统计出了17起潜在违规。DCWP同意转向主动执法。

我读到这篇报告时,曾以为艰巨的工程难题在于检测:即构建能够捕获初次筛查遗漏的偏见的工具。编写规则包改变了我的看法,因为检测其实只是较为简单的那一半。真正困难的部分在于,当雇主在纽约、科罗拉多、伊利诺伊、德克萨斯、加利福尼亚和欧盟使用自动化招聘工具时,需要面对六个监管机构,他们要求六种格式截然不同的文件,而且至少在一个环节上,其中两个机构对同一列数据提出了截然相反的要求。

因此,我为此构建了一套合规层,一个名为Clarion的控制台,它位于雇主现已运行的AI招聘工具之上,读取一份供应商评分导出数据,用确定性代码计算各项不利影响统计数据,并将单次审计结果分发为针对六个司法管辖区的交付物。您可以在 veriprajna.com/demos/ai-hiring-compliance 查看其实际运行效果。下文的所有内容均基于虚构雇主“Acme Logistics, Inc.”在职位需求REQ-2026-0412下的1,040条植入合成候选人记录导出数据运行。我亲自在这些数据中植入了违规项,这也是我能够确切说明该引擎本应发现什么内容的唯一原因。

通过的审计并非法律所要求的审计

由于数据集是我亲自植入的,最初的结果依然让我颇感恼火。供应商自我审计所交付的边际五分之四检验(four-fifths test)轻松通过:种族影响比率最低为0.8196,西语裔和黑人并列最低值;性别影响比率最低为0.8744。两者均处于或高于0.80基准线。代码中没有任何强制断言该项通过的逻辑。0.8196是夹具(fixture)上计算得出的真实结果,它凭自身实力越过了基准线。屏幕上的比率卡明确显示:供应商到此便止步了。

Local Law 144并未止步于此。它要求计算种族与性别的交叉比率,而合成候选人由三种模拟工具评分(Workday-Spotlight风格的评分器、HireVue风格的视频面试环节、Eightfold风格的匹配引擎),它们是构建在合成数据之上的测试夹具适配器,属于原型而非真实集成。按种族和性别对相同记录进行切分后,情况发生了反转。相对于白人/男性(White / Male)参考单元格(130名候选人中通过68人,通过率52.31%),黑人/女性(Black / Female)单元格在130名候选人中仅通过44人,即33.85%。影响比率0.6471。 西班牙裔/女性(Hispanic / Female)单元格同样未通过,比率为0.7647。

Clarion选择率分析对话框显示边际种族和性别比率均高于0.80,其下方的种族×性别选择网格(LL144)中,黑人/女性(Black / Female)单元格相对于白人/男性(White / Male)的1.00读数为0.65。
同一次筛选决定,呈现了两次。边际种族比率0.8196和性别比率0.8744越过了五分之四线,而下方的网格显示,黑人/女性(Black / Female)相对于白人/男性(White / Male)的1.00读数为0.65,入选比例为34%对52%。

西班牙裔/女性(Hispanic / Female)是我与自己的引擎产生分歧的地方。在alpha为0.05的Benjamini-Hochberg假发现率控制下,只有黑人/女性(Black / Female)单元格在统计学上是稳健的(q = 0.0185)。西班牙裔/女性单元格的q值为0.1629,因此引擎对其进行了标记,但明确拒绝将其认定为显著。我原本希望两个单元格都算上,因为两个未通过的单元格比一个更有说服力。然而引擎区分了稳健发现与偶然结果——如果我是报告另一端的雇主,我也希望自己的数据能受到同样严谨的审视。

六个监管机构,六份截然不同的文件

我接连编写了六个规则包,并不断尝试将它们压缩成单一分数,因为仪表盘所能容纳的只有一个数字,而这也是买家所期望的。但这套逻辑在面对法规时彻底瓦解。纽约市要求提供交叉不利影响报告及张贴的公开摘要。科罗拉多州SB 24-205要求记录在案的合理注意影响评估和风险管理程序,且未规定任何具体方法,将于2026年6月30日生效。德克萨斯州TRAIGA拒绝将差别影响作为独立依据,而是审查主观意图。加利福尼亚州FEHA ADS修正案自2025年10月1日起生效,并再次提出了其专属的文件格式要求。EU AI Act将招聘归为Annex III高风险类别,要求自2026年8月2日起实施Article 10数据治理并建立Article 11技术文件。

单一分数的设想在德克萨斯州规则包上宣告破灭。我此前已经基于交叉比率构建了纽约市的交付物,而TRAIGA在证据层面使这些完全相同的统计数据对其自身的评估毫无关联,因此无论我采用何种权重,都不可能让一个数字同时代表两者的诉求。六个不同的问题以六种不同的形式提出,而一个公平性分数大约只能回答其中的一个半。因此,Clarion生成六份交付成果,每份都附有其专属的法规条文引用、生效日期和所需格式,控制台的标题磁贴报告的是合规覆盖范围而非综合评分:管辖区交付物 6、最低影响比率 0.65、需人工介入事项 9。

Clarion基准结果视图列出了六个管辖区交付物行:NYC Local Law 144、科罗拉多州SB 24-205、伊利诺伊州HB 3773、德克萨斯州TRAIGA、加利福尼亚州FEHA ADS以及EU AI Act Annex III,显示的是各不相同的结论而非清一色的绿色通过。
单次审计运行,六行结果,错杂的结论而非六个绿色标志,每一行都带有自身专属的交付物格式、法规引用和生效日期。

那一列错杂的结果才是诚实的输出,但却没有任何厂商在实际交付这样的产品。来自康奈尔大学、数据与社会研究所(Data & Society)以及《消费者报告》(Consumer Reports)的研究人员检查了391家纽约市雇主是否按Local Law 144的要求进行了审计,结果发现公开发布偏见审计的仅占4.6%(FAccT 2024)。这项义务现已生效。合规率低得近乎四舍五入的舍入误差,而在我看来,这一巨大差距很大程度上源于那些真诚地以为供应商提供的单一合格比率就已经解决了所有问题的雇主。

zip_region上的Cramér's V达到0.3321,以及两个诉求完全相反的监管体系

在真正理解邮政编码问题之前,我曾为其编写了一个冲突解决器,而删掉它的那一刻,整个产品的形态发生了改变。引擎通过相关性来检测受保护阶层的代理变量,而 zip_region 与种族的Cramér's V相关系数达到0.3321(偏差校正后为0.3253),超过了0.2的阈值。它确属代理变量。这绝非见疑即报的启发式策略:school_tier 在同一次运行中为0.0711,顺利通过。

伊利诺伊州HB 3773自2026年1月1日起实施,禁止将邮政编码作为受保护阶层的代理变量,因此适配伊利诺伊州的安全配置必须屏蔽地理信息。而EU AI Act Article 10(3)要求训练数据具有相关性、代表性和完整性,在实践中这往往依赖于伊利诺伊州刚刚要求你移除的地理覆盖信息。屏蔽该字段,就会削弱欧盟的代表性义务;保留该字段,就会违反伊利诺伊州法规。单一的模型配置无法同时满足两者的要求。

我最初的解决器曾强行选出了一个‘胜者’。它比较了两者的风险敞口,选择了较大的一方,并为另一方输出合格状态——而这种行为恰恰会导致在归档文件中出现虚假陈述。我移除了该逻辑,代之以关卡允许得出的结论:CONFLICT。随后,协调器会撰写一份法律策略备忘录而非合格证明:运行两套部署配置,即针对伊利诺伊州的推理采用全面的地理信息屏蔽,针对欧盟的训练数据则采用粒度较粗的区域特征。或者,如果必须强制使用单一配置,则选择风险敞口更大的监管体系并记录已接受的风险,同时注明欧盟高风险处罚的法定上限为1,500万欧元或全球年度营业额的3%(以较高者为准)。

Clarion冲突登记册(Conflict Register)对话框显示伊利诺伊州HB 3773与EU AI Act在邮政编码字段和地理覆盖范围上存在CONFLICT,并附有建议采用两套部署配置的策略备忘录。
已打开的冲突登记册。伊利诺伊州HB 3773与EU AI Act Article 10(3)在同一地理字段上形成对立、提供双配置建议,以及深层的拒绝逻辑——即备忘录对两条分支的风险均予以量化定价,而非直接出具任何认证。
在法庭上,宣称‘合规’的仪表板只是一件证物;而一份写明‘我们知情、我们权衡了两个分支的代价、并做出了抉择’的备忘录,才是真正的辩护理由。

作为总法律顾问,我每一次都会做出这样的抉择;而任何旨在宽慰买家的产品都绝不会提供这种权衡方案,因为在宣誓质证来临之前,能够宽慰人心的版本往往卖得更好。

我曾试图说服自己的系统给出通过结论

我进行了自己最担心的实验,即探究是否能通过调整提示词来诱导系统给出更好的结论。Clarion中有六个司法管辖区智能体,外加一个冲突协调器和一个对抗性怀疑论者(adversarial skeptic),它们均基于Pydantic AI构建且支持热插拔不同的模型供应商。我重写了叙述提示词,让语气偏向宽容,就像承受季度业绩压力的供应商所做的那样。文字确实变得更加温和。但没有一个数字发生变动,也没有一个结论发生改变,因为每一项统计数据、每一次阈值比较以及每一个关卡判定都存在于 engine.pyrulepacks.py 之中,完全独立于智能体框架之外。

反过来同样体现了这种特性。在完全未配置模型供应商的情况下,智能体编组会回退到确定性模板,应用程序的运行结果完全一致:相同的六份交付物、相同的0.6471、相同的CONFLICT。智能体提供建议,代码做出裁决,而12项引擎测试全部牢牢锁定了植入的基准事实(ground truth),从而确保边际通过与交叉失败在不同运行之间绝不会出现漂移。

智能体可以解读法规并撰写备忘录。但它们绝不能成为判定是否跨越阈值的决策者,因为只要给出更具说服力的提示词,就能收买它们的赞同。

我起初并不是这种看法。我最初以为智能体才是核心产品,算术只是底层管道,但我完全把关系搞反了。我更换了模型供应商,更换了提示词,甚至在没有任何API密钥的情况下运行,引擎依然在Black / Female上返回0.6471,并在 zip_region 上得出CONFLICT结论。我对模型所做的任何优化,改进的都只是备忘录的措辞,而审计员核查的实质内容毫无变化。

一份通过的偏见审计从未触及的三大法律理论

我构建对抗性怀疑论者原本是期望它就统计数据展开辩驳,但它却将精力放在了对适用范围的质疑上。它拒绝为三件事亮绿灯,而且每一件都代表着一份通过的偏见审计无法覆盖的独立法律理论

第一是自我归类。供应商断言‘我们的评分器不是AEDT’的备忘录会被直接驳回,因为根据 Mobley v. Workday 案中提出的代理人理论(agent theory),任何推荐或筛选候选人的工具都属于决策链条的一部分。该理论目前尚未形成终审判例(holding),仍有待裁决,这也是为什么该事项会被转交给人类法律顾问进行适用范围认证,而不是直接赋予某种状态颜色。

第二是无障碍访问(accessibility)。在参加视频面试环节的432名候选人中,标准语音的词错率(WER)为0.0794,而104名非标准语音候选人的词错率高达0.3016,两者相差3.8倍;而Local Law 144从未对此进行过测试,因为LL144只针对种族和性别。在 D.K. v. Intuit/HireVue 案中提出的理论属于《美国残疾人法案》(ADA)范畴,即使是一份完美的偏见审计也完全无法触及这一问题。Clarion检测到了这一差距,并将其移交给人工ADA审查。它并不负责构建无障碍便利(accommodation)工作流,我也不会对此假装可以。

第三是《公平信用报告法》(FCRA),它根本不在乎公平与否。在这份导出数据中,有510名候选人是基于第三方抓取的数据进行评分并依据数值分数进行筛选的,这正是 Kistler v. Eightfold 案所争议的模式。如果该平台被认定为消费者报告机构,那么无论最终结果多么平衡,每一位被评分的候选人都有权获得不利行动通知(adverse-action notice)和争议申诉途径。Clarion检测到该触发条件后,会将其转派给不利行动与争议处理基础设施。它同样不会代为构建面向候选人的门户网站。我认为这是三者中最不符合直觉的一点,也是在公平性方面面面俱到的团队最容易忽略的问题,因为统计数据根本无法提供答案。FCRA所追问的是该平台究竟 是什么,即使一家公司通过了报告中的每一项影响比率,仍可能因从未向数百人发送通知而面临违规风险。

Clarion人工证明队列(Human Proof Queue)对话框列出了怀疑论者的三项质疑:AEDT适用范围转派给人工法律顾问认证、视频面试ASR流程转派给人工ADA无障碍审查,以及第三方评分数据流转派给FCRA不利行动基础设施。
人工证明队列将供应商的每一项主张与其不构成抗辩的理由逐一对应。分数的公平性与FCRA无关,该队列明确指出了这一点并就此中止。

我会交付给最终签字人的合规包

在整个构建过程中,我始终把一个问题贴在眼前:实际在此文件上签字的人真正需要的是什么?而答案绝不是一个分数。在六个监管体系下,引擎评估了13项合规义务,并给出了2项PASS、2项FAIL、7项NEEDS_PROOF以及2项CONFLICT的判定。以这批植入的合成导出数据的覆盖率来看,13项义务中仅有2项由数据本身自动满足,而有9项因属于NEEDS_PROOF或CONFLICT而被转派给具体责任人处理。对于一套标榜自动化的系统而言,这种比例看似失败;但作为一份审计报告,这却是我唯一愿意署名的形式。

导出的成果是由17个节点构成的SHA-256哈希链捆绑包,每个节点都链接到前一个节点的哈希值,因此对任何节点的任何篡改都会破坏整条链。它以JSON和可打印的HTML数据包形式输出,每个数字都附带其输入数据和计算过程,每个裁定都附有其法规引用。该哈希链在每次运行时都会进行验证,其防篡改特性也经过了单元测试。

导出的Clarion预审计包显示了一条完整性标识行,内容为SHA-256哈希链、17个节点、VERIFIED,随后是针对NYC Local Law 144各监管体系的裁定及其义务表。
可打印审计员数据包中跨17个链式节点显示完整性VERIFIED,随后是每个监管体系的裁定,每项义务旁均附有证据和规则引用,且边际五分之四检验的PASS与交叉测试的FAIL并列呈现在同一张LL144表格中。

Veriprajna并不签署这份文件。独立Local Law 144审计员的角色属于DCI、ORCAA和Secretariat等机构,而本合规包的全部设计目标,就是为了让这类机构能够无需重写便可直接签署。完整运行过程(包括冲突备忘录)的演示详见 veriprajna.com/demos/ai-hiring-compliance

如果您想亲眼目睹关卡做出拒绝判定的过程,而不是听我在此描述,这里提供了端到端的完整运行过程,包含冲突备忘录。

冲突备忘录并没有让雇主的合规程度比前一天提升分毫。它所增加的,是一份清晰可读、注明日期且责任可追溯的权衡记录;这样一来,在两年后当有人追问是谁决定保留邮政编码字段、以及做出决定时他们知晓何种情况时,雇主可以拿出一份能回答所有问题的文档,而不是一个苍白且必须费力解释的绿色徽章。

相关研究

面向多司法管辖区雇主的 AI 招聘合规与偏见审计 | Veriprajna解决方案页面
The Algorithmic Ableism Crisis: Deep AI Governance for Enterprise Hiring | Veriprajna交互式白皮书
The Algorithmic Accountability Mandate | Veriprajna交互式白皮书
The Algorithmic Agent: AI Recruitment Liability & Deep AI Solutions | Veriprajna交互式白皮书
The Architecture of Accountability: Enterprise AI After Eightfold | Veriprajna交互式白皮书
Engineering Fairness in AI Recruitment: Causal AI vs Predictive AI | Veriprajna交互式白皮书
The Deterministic Imperative: Engineering Regulatory Truth | Veriprajna交互式白皮书
The Glass Box Paradigm: Fair AI Recruitment with Knowledge Graphs | Veriprajna交互式白皮书
The Paradox of Default: Securing the Human-AI Frontier | Veriprajna交互式白皮书
The Algorithmic Ableism Crisis: Deconstructing the Aon-ACLU Complaint and the Imperative for Deep AI Governance技术深度解析
The Algorithmic Accountability Mandate: Transforming Enterprise Talent Systems from Commodity Wrappers to High-Fidelity Deep AI Solutions技术深度解析
The Algorithmic Agent: Navigating Liability and Technical Rigor in the Era of Deep AI Recruitment技术深度解析
The Architecture of Accountability: Why Enterprise AI Requires Deep Engineering in the Wake of the Eightfold AI Litigation技术深度解析
Beyond the Mirror: Causal AI for Fair Recruitment技术深度解析
The Deterministic Imperative: Engineering Regulatory Truth in the Age of Algorithmic Accountability技术深度解析
The Glass Box Paradigm: Fairness in Enterprise Recruitment技术深度解析
The Paradox of Default: Securing the Human-AI Frontier in the Age of Agentic Autonomy技术深度解析

同步发布于

更多文章

一名求职者的档案被六枚监管印章朝六个方向撕扯:LL144、FEHA、伊利诺伊、得克萨斯、科罗拉多、欧盟。
人工智能合规

我们做了一次偏见审计,想同时满足六部 AI 招聘法律。它在上线的同一周就失效了。

为一家同时在纽约、芝加哥、丹佛、奥斯汀和伦敦招聘的公司把 AI 招聘合规做到位——这是我在尝试过程中学到的东西。

May 29, 202612 min read
一张引人注目的、聚焦AI招聘技术与残障排斥交叉点的编辑风格图片,核心意象是一套系统正自信满满地为一份存在缺陷的输入打分。
人工智能招聘

一套AI系统让一位失聪女性去"练习积极倾听"——那一刻我看清了这个行业已经烂到根子里

Intuit与HireVue歧视案,如何暴露了企业招聘AI的致命缺陷——以及为什么真正的修复需要一套彻底不同的架构。

Mar 22, 202612 min read
一幅极具冲击力的编辑插画:一个人的剪影被简化为一个数字分数,呈现文章的核心张力——AI评分系统与招聘中人的自主权之间的冲突。
人工智能招聘

一部55年前的旧法律,正在瓦解AI招聘行业——而这早该发生了

Eightfold AI诉讼揭示了:当企业把招聘决策当成广告精准投放来处理会发生什么——以及为什么真正的解药是工程架构,而非一句道歉

Mar 21, 202615 min read
一幅极具冲击力的编辑类图像,传达招聘中"算法把关"的概念——一道数字化的筛选之墙,横亘在求职者与工作机会之间。
人工智能招聘

法院刚刚裁定:数百万求职者可能遭到了软件的歧视

我以构建 AI 系统为生——而 Workday 的这项裁决,以所有恰当的方式让我感到不寒而栗

Mar 20, 202615 min read
一幅冲击力十足的画面:一扇巨大的金库大门被敞开,锁上显示着"123456",门内露出一排排人形剪影档案——直指主题,即用最脆弱的安全防线大规模守护着极度私密的个人数据。
人工智能网络安全

6400万人申请了一份工作,一个"123456"的密码却泄露了他们的秘密

麦当劳AI招聘平台的数据泄露不需要天才黑客——只需一个浏览器和一个默认登录口令。这就是整个AI行业都该为之恐惧的原因。

Mar 19, 202615 min read
在AI监管与合规领域的招聘/雇佣决策背景下,对比展示透明且可审计的AI系统与不透明黑盒系统的视觉隐喻图。
人工智能技术

95%的企业正在违反一项大多数人甚至不知其存在的AI法规

一次失败的纽约审计让我明白为何套壳AI无法在监管下生存——以及我们正在构建的替代方案

Mar 18, 202612 min read
一张编辑风格的配图,表现AI性格筛查如何成为一道针对神经多样性求职者的隐形过滤器。
人工智能招聘

那套意外变成医学检查的招聘算法:当AI性格测评沦为残障筛查

一家大型咨询公司标榜"无偏见"的AI工具,最终却把自闭症候选人筛了出去——以及这件事如何教会我构建真正有效的AI

Mar 16, 202613 min read
一幅概念性编辑插图,以交响乐团试奏的帘幕象征盲选、公平的评估——正是本文的核心类比。
人工智能招聘

学会歧视女性的AI招聘工具——以及它教会我如何打造真正公平的AI

为什么市面上每一款"AI驱动"的招聘工具都在问错问题,而因果AI又是如何改变答案的

Feb 12, 202616 min read
一张简洁的编辑风格插画,将知识图谱结构叠加在招聘概念之上,用清晰可追溯的路径把技能连接到岗位,以透明对比黑箱的不透明。
人工智能招聘

亚马逊造出一个自学会歧视女性的AI招聘系统。我造了一个从设计上就不可能歧视的。

知识图谱如何从架构上根除招聘决策中的偏见——以及为什么给黑箱模型"打补丁"永远都不够。

Feb 11, 202612 min read

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。