您的招聘 AI 已经是一项负债——唯一的问题是您是否已经意识到这一点。曾经沉寂的执法如今已启动,一起正在进行的集体诉讼直指企业中部署最为广泛的 HCM 平台,而一家在纽约市、加利福尼亚、科罗拉多、欧盟和伊利诺伊各地筛选候选人的全国性雇主,需要的是一套合规架构,而非一份政策文件。我们的工作,是构建公平性与审计基础设施,让招聘 AI 能够经受住审计、诉讼以及下一部法律的考验。
纽约市《地方法第 144 号》的执法转向
纽约州审计长于 2025 年 12 月审查了《地方法第 144 号》的执法情况,发现纸面规定与实际执行之间存在落差。在 32 家公司中,该市自己的消费者保护机构(DCWP)仅认定了 恰好一起 不合规案件,而审计长的审查人员在同一样本中却发现了 至少 17 起 潜在违规行为。 75% 的有关自动化招聘工具的投诉电话被错误转接,从未送达执法机构。该法自 2023 年 7 月起即具有可执行力,然而负责执行它的机构却实际上未在运作。
那个时代正在终结。DCWP 已承诺以 EEOC 和 FTC 的备案作为执法线索,罚款最高可达 每项违规每日 1,500 美元。
多法域合规地图
纽约市只是众多法域之一。一家全国性雇主要面对五套相互重叠的制度,每一套都有各自的定义、期限和罚则:
| 制度 | 核心要求 | 关键日期 | 罚则风险 |
|---|---|---|---|
| 纽约市《地方法第 144 号》 (AEDT 框架) | 对自动化就业决策工具进行年度独立偏见审计;DCWP 现以 EEOC/FTC 的备案作为执法线索 | 自 2023 年 7 月起可执行 | 每项违规每日最高 1,500 美元 |
| 加利福尼亚 FEHA (自动化决策系统) | 偏见测试、对所有 ADS 输入与输出进行四年记录保存、责任延伸至提供工具的供应商 | 于 2025 年 10 月 1 日生效 | — |
| 科罗拉多 SB 24-205 | 风险管理政策,随后是影响评估(重大决策标准) | 政策须于 2026 年 6 月 30 日前完成;影响评估须于 2027 年 2 月前完成 | — |
| 《欧盟人工智能法案》 (附件三高风险) | 所有用于招聘和候选人评估的 AI 均属高风险;须履行合格评定义务;招聘中的情绪识别被彻底禁止 | 合格评定自 2026 年 8 月 2 日起可执行;情绪识别禁令自 2025 年 2 月起生效 | 最高 3,500 万欧元或全球营业额的 7% |
| 伊利诺伊 BIPA +《AI 视频面试法》 | 在《AI 视频面试法》之上叠加了针对任何在评估过程中采集生物特征数据的工具的生物特征数据责任 | — | — |
将这些制度之间的定义冲突整合为一套单一的运营架构——而非五份彼此独立的政策文件——才是真正的合规难题。
Mobley 诉 Workday 案:为何供应商合同无法为您挡责
Mobley 诉 Workday 案是每位首席人力资源官都应研读的案例。Derek Mobley 向 100 多家使用 Workday AI 筛选功能的公司投递求职申请,每一次都被拒绝。 2025 年 5 月,一家联邦法院有条件地批准了针对年龄歧视主张的集体诉讼认证,该集体据信包括 数百万名求职者。 2025 年 7 月,范围扩大至涵盖由 HiredScore 的 AI 功能处理的申请人,该公司于 2024 年被 Workday 收购。
法院认定,AI 服务提供商可在"代理人"理论下就就业歧视承担 直接责任 (详见 我们关于 AI 招聘中算法代理人责任的研究)。这并非抽象的法律风险——而是一起针对企业中部署最广泛的 HCM 平台的正在进行的集体诉讼。
AI 筛选中有据可查的偏见问题
其背后的偏见问题已有充分的记录:
- 一项 华盛顿大学 的研究发现,AI 简历筛选工具偏好与白人相关联的姓名的比例达 85% ,样本涵盖 500 多个招聘岗位。
- 斯坦福 研究人员发现,在资质完全相同的情况下,AI 筛选给予年长男性候选人的评分系统性地高于女性或更年轻的候选人。
- 代理歧视贯穿于那些在界面上看似中立、但在统计上与受保护特征相关联的信号之中:邮政编码对应种族,毕业年份对应年龄,姓名模式对应原籍国。
根据 《员工选拔程序统一指南(UGESP)》 制定的五分之四规则提供了标准检验方法,但它只是一个实际显著性的门槛。法院越来越多地要求同时进行统计显著性检验——而运行任一检验都需要达到一定粒度的人口统计数据,而大多数 ATS 平台并不原生采集这类数据。我们从混杂信号中分离出真实偏见的工程方法,详述于 我们关于公平招聘因果 AI 的技术白皮书。
平台整合正在让独立审计变得更难
独立的 HR AI 供应商市场正整合为平台生态系统,在其中招聘 AI、ATS 和 HCM 数据都置于同一道围墙之后:
- Workday 于 2025 年 10 月以 45 亿美元收购 Paradox ,并收购了 HiredScore (于 2024 年 3 月),打造出一套集成的招聘 AI 技术栈,在单一平台中融合了对话式筛选、候选人评分和人才情报。
- SAP 收购了 SmartRecruiters,交易额超过 15 亿美元 ,时间为 2025 年 1 月。
- Dayforce 私有化,通过一笔 123 亿美元 与 Thoma Bravo 的交易完成。
这种整合带来的合规问题,不同于通常的供应商锁定。当您的偏见监测工具与它所监测的招聘 AI 来自同一家供应商时,审计便不再独立。当您的人口统计数据存放于供应商的租户架构中、受其访问控制约束时,您若不通过其 API,就无法运行 LL144 和 FEHA 所要求的交叉分析。当供应商推送模型更新时,您上一次的偏见审计便告失效——但您可能无法收到足够精细的通知,以得知哪些选拔标准发生了变化。
持续监测需要一套 独立于 供应商技术栈、可从多个数据源读取、并按您自己的时间表和方法运行公平性计算的基础设施。
招聘中的智能体 AI 打破了所有现有的审计框架
52% 的人才主管 计划在 2026 年部署对管道各阶段负有端到端责任的 AI 智能体。这些并非回答候选人问题的聊天机器人。智能体 AI 系统会自主从多个渠道寻源候选人、依据动态标准评估资质、发送个性化外联、安排面试,并在每一步无需人类触发的情况下推进候选人通过管道各阶段。Paradox 的 Olivia 已能处理 100 多场同时进行的候选人对话 ,并在 48 小时 内完成以往需要一周的筛选流程。
治理难题在于,现有的偏见审计框架假定由人类触发决策、由模型给出建议。而智能体系统会做出一连串决策,其中一个智能体的输出会成为下一个智能体的输入。这一链条中的哪个决策造成了不利影响?当没有任何人类审查中间步骤时,就《民权法》第七章而言,谁才是决策者?在 我们关于企业 AI 问责架构的研究中,我们深入探讨了这一决策归因难题。
OWASP 于 2026 年 3 月发布了其首份 《智能体应用十大》 ,识别出目标劫持、工具滥用和失控智能体等风险。但针对多步骤自主招聘管道的偏见审计方法,尚未形成一套标准。那些在部署智能体招聘工具时,未从一开始就构建决策归因与人工干预架构的组织,正在制造一种在集体诉讼取证请求到来时才会追溯性浮现的责任。
基于技能的招聘并非天然公平
从以资历为本转向以技能为本的招聘,是人才招募领域最重大的变革之一。AI 技能匹配工具声称在预测工作绩效方面达到 78% 的准确率 ,企业则报告 首年留存率提高 25–35%。但技能本体本身也编码着偏见(在 我们关于以知识图谱实现招聘 AI 公平性的研究中,我们探讨了这一问题)。哪些经历算作展现了某项"技能",取决于是谁设计了这套分类体系。如果本体将正式认证的权重置于同等的实践经验之上,就会使来自非传统背景的候选人处于不利地位。如果它把特定工具的熟练度(Tableau、Python)视为可与其背后的分析能力相互替代,就会在匹配中制造出虚假的精确性。
内部流动使这一问题更加复杂。万事达报告称,节省了 2,100 万美元 ,所用的 AI 人才市场将外部招聘成本削减了 30%。但基于技能画像来推荐横向调动和拓展性任务的内部流动 AI,如果其技能数据反映的是历史上谁获得了发展机会、而非谁能够胜任岗位,就可能固化既有的模式。人才市场平台市场正以 每年 25% 的速度增长,到 2033 年将达到 100 亿美元。如今构建这些系统的组织,正在编码那些将持续多年的劳动力结构决策。
我们为 HR 与人才技术构建什么
我们的做法,是构建位于您的招聘 AI(无论您使用哪家供应商)与您的监管义务(无论您在哪些法域运营)之间的合规与公平性基础设施。这是架构性的工作,而非评估性的工作——每一项合作都以交付可运行的系统为目标,而非幻灯片。合作旨在交付:
- 跨平台偏见监测 ,它通过一个供应商中立的数据层,连接 Workday、SuccessFactors、Oracle HCM、Greenhouse、Lever 以及独立的 ATS 平台。
- 持续的不利影响计算 ,同时采用五分之四规则和统计显著性方法,并在自我认定数据不足时,以贝叶斯改进型姓氏地理编码(BISG)进行人口统计推算。
- 多法域合规映射 ,它将 LL144 的 AEDT 框架、加利福尼亚 FEHA 的 ADS 规则、科罗拉多 SB 24-205 的重大决策标准,以及《欧盟人工智能法案》附件三的高风险分类之间的定义冲突,整合为一套单一的运营架构。
- 审计追踪系统 ,它在智能体招聘管道中捕获决策来源,将每一次筛选、评分和推进决策归因到产生它的具体模型版本、输入数据和选拔标准。
- 无障碍评估架构 ,它评估与岗位相关的胜任力,而不会因神经多样性的沟通风格、非典型的面试行为或与残障相关的便利安排而给候选人扣分,在 我们关于 AI 治理中算法能力歧视危机的研究中,我们论及了这一领域。
我们不销售招聘 AI。我们的合作旨在让招聘 AI 变得可审计、合规且经得起辩护。
关键要点
- 执法如今已启动: 2025 年 12 月纽约审计长的审查在 32 家公司中发现了 17 起以上潜在的 LL144 违规,而 DCWP 仅标记出一起;罚款最高可达每项违规每日 1,500 美元。
- 五套制度同时来袭: 纽约市 LL144(自 2023 年 7 月起)、加利福尼亚 FEHA(2025 年 10 月 1 日)、科罗拉多 SB 24-205(2026–2027 年)、《欧盟人工智能法案》(2026 年 8 月 2 日;最高 3,500 万欧元或营业额的 7%)以及伊利诺伊 BIPA,全都触及同一套招聘技术栈。
- 供应商不会替您承担风险: Mobley 诉 Workday 案(2025 年 5 月/7 月)认证了一个由数百万人组成的集体,并认定 AI 提供商在"代理人"理论下承担直接责任。
- 偏见是被测量出来的,而非假设: 85% 的白人姓名偏好(华盛顿大学)、对年长男性候选人系统性更高的评分(斯坦福),以及仅靠五分之四规则/UGESP 检验无法捕捉的代理信号。
- 整合与智能体 AI 抬高了门槛: Workday–Paradox(45 亿美元)、SAP–SmartRecruiters(15 亿美元以上)和 Dayforce(123 亿美元)将审计与供应商绑定,而 52% 的人才主管计划在 2026 年部署现有审计框架无法归因的自主智能体。
常见问题解答
当 AI 招聘工具产生歧视时,谁来担责——雇主还是供应商?
是雇主。就差别性影响而言,《民权法》第七章的责任归于雇主,无论该 AI 工具是否为现成采购。Mobley 诉 Workday 案(2025 年)对此作了扩展,认定 AI 服务提供商也可在代理人理论下承担直接责任,但该裁决是在雇主责任之上叠加供应商责任,而非将其转移。EEOC 的立场(尽管指南被撤回,历届政府始终一致)是:五分之四规则适用于 AI 驱动的招聘决策,一如它适用于人类做出的决策。如果您供应商的筛选工具对某个受保护群体产生不利影响,那么在指控中作为被诉方的是您,而非供应商。与供应商签订的合同赔偿条款,很少能经受住集体诉讼的实际成本。我们构建偏见监测基础设施,让雇主无论供应商如何报告,都能对其 AI 招聘工具的选拔率、不利影响比率和人口统计结果拥有独立的可见性。
在执法力度不断加大的情况下,我们如何遵守纽约市《地方法第 144 号》?
LL144 要求对在纽约市用于招聘或晋升的任何自动化就业决策工具(AEDT)进行年度独立偏见审计。2025 年 12 月州审计长的审查揭示,DCWP 在执法上基本处于失能状态,仅发现 1 起违规,而审计人员则识别出 17 起以上。此后 DCWP 已承诺以 EEOC 和 FTC 的备案作为执法线索,罚款最高可达每项违规每日 1,500 美元。合规要求计算性别、种族/族裔及交叉类别的影响比率,这需要达到一定粒度的人口统计数据,而大多数 ATS 平台并不原生支持。我们构建数据采集基础设施、面向低自我认定人群的 BISG 推算,以及全年产出审计就绪文档的持续监测管道,而非在一年一度的单次审计前手忙脚乱。
《欧盟人工智能法案》对筛选欧盟候选人的美国公司意味着什么?
《欧盟人工智能法案》根据附件三第 4 点,将所有用于招募、筛选、评估候选人或对候选人作出决策的 AI 归类为高风险。合格评定义务自 2026 年 8 月 2 日起具有可执行力。招聘中的情绪识别自 2025 年 2 月 2 日起已被禁止。罚款可达 3,500 万欧元或全球年营业额的 7%,以较高者为准。任何总部设在美国、筛选属于欧盟居民的候选人,或使用拥有欧盟客户的 HCM 平台的公司,都在适用范围之内。相关要求包括技术文档、人工监督机制、数据治理和日志记录。CEN 与 CENELEC 错过了标准制定的期限,因此不存在符合性推定的捷径。我们直接对照法规文本,构建满足附件四要求的合格评定文档、人工监督架构和日志记录基础设施。
在我们的自我认定数据不完整时,如何运行偏见审计?
这是招聘 AI 合规中最常见的技术障碍。自愿自我认定率通常太低,无法为较小的受保护类别产生具有统计显著性的结果,而交叉分析(LL144 所要求)又加剧了样本量问题。标准做法是贝叶斯改进型姓氏地理编码(BISG),它根据姓氏和人口普查地块数据推算种族/族裔概率。BISG 为联邦监管机构所接受,并用于公平放贷分析,但其准确性因地理位置和人口密度而异。我们在传统自我认定采集的同时实施 BISG,构建统计检验基础设施以同时运行五分之四规则(实际显著性)和卡方检验或 Fisher 精确检验(统计显著性),并设计数据管道,使分析得以持续运行,而非依赖一年一度的单次快照。
我们应当自建 AI 招聘工具,还是从 Workday 或 Eightfold 等供应商处采购?
自建还是采购的问题自 2025 年以来已发生转变。Workday 对 Paradox(45 亿美元)和 HiredScore 的收购,加上 SAP 对 SmartRecruiters(15 亿美元以上)的收购,意味着采购方正整合为平台生态系统,其中转换成本高昂,偏见监测又与供应商自己的工具绑定。采购路径能让您更快部署、由供应商管理更新,但您会继承供应商的合规风险(参见 Mobley 诉 Workday 案),并丧失独立审计能力。自建路径为您带来设计即具备的可审计性和多法域灵活性,但需要持续的工程投入。大多数企业最终落在两者之间:他们保留 HCM 平台用于核心工作流,同时在其上构建一个供应商中立的合规与监测层。这正是我们通常所架构的——那个独立层,让任何供应商的招聘 AI 无论平台如何整合都可审计、可合规。
对于自主寻源和筛选候选人的智能体 AI 系统,我们如何审计?
您无法用传统的偏见审计方法来审计它们。现有框架假定由模型给出建议、由人类作出决策。智能体招聘系统会做出一连串自主决策:从多个渠道寻源候选人、评估资质、发送外联、安排面试,并在无人类触发的情况下推进管道阶段。不利影响可能源自链条中的任何一步,而在没有决策归因日志的情况下,您无法确定是哪个智能体、哪个模型版本或哪份输入数据导致了这一结果。我们构建具备三个核心组件的智能体招聘治理架构:决策归因,将每一次筛选、评分和推进动作标记到其具体的智能体和模型版本;在每个管道阶段独立进行的持续不利影响监测;以及在人口统计失衡超过可配置阈值时设有强制审查门槛的人工干预节点。
我们如何让 AI 招聘评估对神经多样性候选人无障碍?
大多数 AI 评估在不衡量岗位相关胜任力的情况下,惩罚非典型的沟通风格。Aon 的 AI 在"活力"一项上给自闭症候选人打了低分,引发了 ACLU 向 FTC 提出的投诉。一位失聪的原住民女性被一项 AI 评估告知要"练习主动倾听"。《美国残疾人法》(ADA)要求雇主提供衡量岗位技能、而非残障相关特征的无障碍评估,而神经多样性状况因影响集中、沟通和学习等主要生活活动,常常符合 ADA 项下残障的认定。我们设计评估架构,将岗位相关的胜任力评估与沟通风格评分分开,提供无需候选人披露残障状态的替代评估路径,并将便利安排的工作流内建到系统中,而非将其作为例外流程来处理。
跨多个法域的 AI 招聘合规,其真实成本是多少?
成本取决于有多少 AI 系统触及招聘决策,以及您的候选人分布在多少个法域。来自独立机构的 LL144 偏见审计,每套系统每年花费 15,000 至 75,000 美元。《欧盟人工智能法案》的合格评定估计每套系统需 5,000 至 50,000 欧元,每套系统平均年度合规成本为 29,277 欧元。加利福尼亚 FEHA 要求对 ADS 进行四年记录保存,这意味着需要日志记录基础设施。科罗拉多 SB 24-205 要求风险管理政策和影响评估。将合规改造进现有系统的成本,是从一开始就将其内建的 3 至 5 倍。平均每次招聘成本已达 4,700 美元(Gartner 2025),AI 工具可将其降低 20–30%,但一旦发生一起集体诉讼,那些节省便会化为乌有。Mobley 诉 Workday 案代表着横跨数百万申请人的潜在责任风险。我们根据实际的 AI 覆盖面和法域风险来界定合作范围,而非假设性的覆盖。
满怀信心地构建您的 AI。
与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。
Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。