您的偏见审计通过了。您的系统仍在歧视。
大多数 AI 偏见审计只是对种族和性别套用五分之四规则,生成一份 PDF,然后宣布合规。这种做法存在三个问题。
- 五分之四规则是一种粗糙的工具。 它源自《统一指南》(29 CFR 1607),是为 1978 年招聘实践设计的筛查阈值。它无法检测代理歧视——邮政编码、通勤距离或就读院校在不指名种族的情况下,编码了与种族相同的信息。
- 聚合指标掩盖了交叉性差异。 华盛顿大学的一项研究发现,基于 LLM 的简历筛选工具偏向与白人相关的姓名的比例达 85% ,且从未在与白人男性相关的姓名与与黑人男性相关的姓名之间偏向后者。聚合的种族指标会完全错过这种叠加效应。
- 一次性审计把公平当作永久状态。 模型会漂移,输入分布会变化,还会加入新特征。一个在 1 月通过审计的系统,到 3 月可能就在歧视,而在投诉出现之前无人知晓。
我们的做法是构建旨在比统计筛查更深入的公平审计,详见 我们关于超越表层 AI 的信任架构的研究。出发点是理解“公平”对您的具体系统意味着什么,因为数学证明您无法同时兼顾一切。
每一次审计都是一次明确的选择,而非默认设置
Chouldechova 的不可能定理(2017) 证明:当各群体的基础发生率不同时,任何不完美的分类器都无法同时满足校准性和相等的错误率。 Kleinberg、Mullainathan 和 Raghavan 证明了一个更普遍的结论:三个直觉上的公平性条件除在平凡情形外无法同时成立。
这些并非学术脚注。它们意味着每一次公平审计都需要就优先考虑哪些标准做出明确选择,而这一选择会带来法律、伦理和商业上的后果。我们会在任何人开始优化之前,先把这一取舍摆到台面上。
代理歧视:您移除的特征仍然留在模型里
从模型输入中移除种族、性别或年龄,并不能消除歧视。它只是移除了歧视的直接证据,却让其机制原封不动地保留下来。
- 一个 放贷 模型如果剔除种族但保留邮政编码,就会继承居住隔离的模式,而正是这种模式使邮政编码在许多地区成为近乎完美的种族代理。
- 一个 招聘 工具如果剔除年龄,却使用毕业年份、工作年限和技术栈年代(COBOL 与 Kubernetes 之别),就能高保真地重建出年龄。
我们的方法运用因果图分析,追踪受保护属性如何流经特征空间进入预测结果,该方法详见 我们关于用于公平招募与招聘的因果 AI 的研究。问题不在于某个特征是否与种族相关,而在于流经该特征的差异究竟代表一个正当的业务因素(信用历史确实能预测还款),还是受保护身份的代理(信用评分编码了历史上的放贷歧视)。
这种区分需要特定领域的判断,而不仅仅是统计检验。该项目会与理解该领域的人协作,为每个系统构建因果图,识别从受保护属性到结果的每一条路径,并将每条路径归类为正当、有问题或需进一步调查。预期产出是一张标示歧视从何处进入系统的地图,而不仅仅是一个证明其存在的数字。
交叉性审计:单一维度检验失效之处
独立检验种族和性别会错过最严重的差异。针对黑人女性的算法偏见无法解释为反黑人偏见加反女性偏见之和。叠加效应造成的独特劣势,只有在您考察交叉点时才会显现。一项 2024 年的面部分析研究 发现,性别分类算法对 深肤色女性的误分类率约为 30%,远超任何单一人口统计维度的错误率。
实际挑战在于统计功效。交叉性子群体(居住在农村邮政编码区、年龄超过 50 岁的黑人女性)规模很小,而随着样本量缩减,标准假设检验会迅速丧失功效。天真的子群体分析要么因样本太小无法达到显著性而错过真实差异,要么因估计不稳定而产生误报。
我们的方法用 贝叶斯层次模型 来应对这一问题,它在相关子群体之间借用统计强度,即使对小规模群体也能提供可信区间。它还运用 序贯检验框架 ,随时间累积证据,而不是要求在单次快照中获得全部统计功效。其结果是一套交叉性监测,旨在新出现的差异达到聚合指标才会捕捉到的水平之前,就将其检测出来。
跨领域审计:招聘、放贷、保险、医疗
每个领域都有自己的监管框架、公平标准和代理歧视模式。
| 领域 | 监管态势 |
|---|---|
| 招聘 | 纽约市 LL144 强制要求每年进行独立的偏见审计并公开发布摘要。 2025 年 12 月纽约州审计长的审计 发现 75% 的 AEDT 投诉电话被错误转接,而在审计人员发现 17 项潜在违规之处,该机构仅认定了 1 起不合规案例。执法正在收紧: 伊利诺伊州 HB 3773 (2025 年 1 月生效)禁止歧视性的 AI 雇佣决策,而 Mobley 诉 Workday 案于 2025 年 5 月成为首个获认证的全国性 AI 偏见集体诉讼。 |
| 放贷 | 联邦执法正在分裂。 CFPB 于 2025 年 11 月提议取消 ECOA 下的差别影响分析,但各州总检察长正在填补空缺。马萨诸塞州于 2025 年 7 月以 250 万美元 了结了一起 AI 承保歧视案。 |
| 保险 | 科罗拉多州 SB 21-169 禁止对算法和预测模型进行不公平的歧视性使用,要求车险和健康险公司在 2026 年 7 月前提交年度合规报告。 |
| 医疗 | 临床算法中基于种族的校正面临持续的审视:脉搏血氧仪高估深肤色患者的血氧水平,已导致诊断延误。但当种族被用作模型无法通过其他方式捕捉的真实风险因素的代理时,移除种族同样可能损害相关人群。 |
对于招聘 AI,项目的范围被设定为超越 LL144 的最低要求,纳入交叉性分析、代理特征检验和反事实公平性检查,并借鉴 我们关于 AI 招聘责任的研究。
从根源而非症状入手的缓解措施
偏见缓解分为三个流水线阶段,选错阶段会浪费精力或引入新问题。
| 阶段 | 技术 | 擅长之处 | 失效之处 |
|---|---|---|---|
| 预处理 | 重采样、重加权、公平表征学习 | 修正源自数据采集环节的偏见 | 当偏见来自正当的分布差异时会失效 |
| 过程处理 | 公平性约束、对抗性去偏、公平性正则化 | 可直接控制准确性与公平性之间的取舍 | 当基础发生率确实不同时强行实现人口统计均等会损害校准性。在放贷中,模型要么过度批准高风险申请人,要么在受约束群体中对低风险申请人批准不足。 |
| 后处理 | 按群体设定的阈值、Fairlearn 的 ThresholdOptimizer | 实现最快 | 仅适用于分类,在推理时需要群体标签,且只治标不触及机制 |
我们的做法会根据偏见在流水线中的进入位置、监管框架的要求,以及组织能容忍的准确性与公平性取舍,来选择干预阶段。每一项缓解措施的范围都设定为产出一份有文档记录的评估,展示其对公平性指标和系统性能两方面的影响,并明确陈述其中的取舍。
持续监测 vs. 年度审计
年度审计是监管的最低要求,而非技术上的充分条件。与反馈回路交互的模型可能在两次审计之间产生偏见:例如过往决策会塑造未来申请人池的招聘工具,或审批模式会影响征信机构数据的放贷模型。
我们的做法是采用序贯假设检验构建持续的公平性监测,实时检测新出现的差异,而不是等到积累了足够数据才运行传统的显著性检验,这一问责模型在 我们关于留存工程与算法问责的研究中有所探讨。当公平性指标越过可配置阈值时,监测会触发警报,并对聚合与交叉性子群体的性能分别跟踪。这就是在您的年度审计报告中才发现歧视问题,与在其发生两周后即捕获它之间的区别。
对于代理式 AI 系统,公平性监测更为关键:多智能体编排可能通过智能体交互和反馈回路产生涌现性偏见,而任何针对单一智能体的审计都无法检测到这类偏见。
工具包和平台止步之处,以及定制工作的起点
IBM AIF360 提供 71 项公平性指标和 13 种偏见缓解算法。 Fairlearn 提供 ThresholdOptimizer、ExponentiatedGradient 和 GridSearch 归约。二者都是有价值的起点。但都不做最难的那部分。
- 二者都需要受保护属性标签作为输入,而组织往往无法收集这类数据。
- 二者都假定用户知道应优化哪个公平性指标,而这需要针对具体领域驾驭不可能定理。
- 二者都不会构建那张将代理歧视与正当风险因素区分开来的因果图。
- 二者都不处理标准统计检验会丧失功效的交叉性分析。
诸如 Holistic AI 和 Credo AI 这样的治理平台提供合规跟踪、模型清单管理和风险评分。它们会告诉您哪些模型需要审计,以及审计结果是否为最新。但它们并不执行审计方法本身:因果分析、交叉性检验、缓解措施的选择、准确性与公平性取舍的记录。我们的项目会与客户已在使用的任何平台或工具包集成。我们带来的是方法论层面。
要点总结
- 五分之四规则(29 CFR 1607)是 1978 年时代的筛查阈值,会错过代理歧视和交叉性歧视。
- Chouldechova(2017)以及 Kleinberg、Mullainathan & Raghavan 证明,没有任何分类器能同时满足所有公平性标准,因此每一次审计都是一次明确的优先级选择。
- 因果图分析描绘出种族、年龄等被移除的属性如何通过邮政编码、毕业年份等代理重新进入模型。
- 贝叶斯层次方法和序贯检验方法能揭示单一维度和聚合指标所掩盖的交叉性差异。
- 监管因领域而异——纽约市 LL144、伊利诺伊州 HB 3773、ECOA、科罗拉多州 SB 21-169——因此缓解阶段和监测必须针对每个系统来选择。
- 工具包(AIF360、Fairlearn)和治理平台(Holistic AI、Credo AI)只是起点;因果、交叉性和取舍方法论才是定制工作。
常见问题解答
一次 AI 偏见审计的成本是多少,需要多长时间?
范围对成本的影响超过任何其他因素。对单个招聘工具进行、采用标准五分之四规则分析的、符合 LL144 的聚焦审计,可在两周内完成。这只是打钩合规。而一次包含因果代理分析、交叉性子群体检验、反事实公平性评估和有文档记录的缓解建议的全面审计,则需 6-10 周,具体取决于系统复杂度、数据可得性以及适用的监管框架数量。大多数买家真正应当问的成本问题,是不合规的代价。纽约市 LL144 的罚款为每项违规每天 500-1,500 美元。科罗拉多州 SB 205 允许每项违规最高 20,000 美元。马萨诸塞州刚刚以 250 万美元了结了一起 AI 放贷歧视案。审计投入只是单次执法行动代价的零头。
如果我们无法同时满足所有公平性指标,应该使用哪一个?
您无法同时满足所有指标。Chouldechova(2017)证明,当各群体的基础发生率不同时,任何不完美的分类器都无法同时实现校准性以及相等的假阳性率和假阴性率。Kleinberg、Mullainathan 和 Raghavan 证明了一个更广泛的不可能性。指标的选择取决于领域和法律框架。在放贷中,校准性很重要,因为风险评分需要反映真实的违约概率,定价才能奏效。均等几率也很重要,因为在 ECOA 下,差别化的错误率会造成差别影响责任。在招聘中,选拔率均等(人口统计均等)是起点,因为五分之四规则将其操作化了,但在《统一指南》下,均等几率和预测均等对测试验证也很重要。我们会针对每位客户的具体系统和监管背景,逐一梳理不可能性取舍,然后才让任何人开始优化。
我们已从模型中移除了种族。为什么它仍然表现出差别影响?
因为其他特征承载着相同的信息。邮政编码编码了居住隔离。毕业年份和技术栈年代重建出年龄。就业空档与残疾和照护责任相关。就读院校与种族和社会经济地位相关。通勤距离与社区构成相关。移除标签并不能移除信号。我们使用因果图分析来追踪从受保护属性经特征空间到模型输出的每一条路径。其中一些路径流经正当的业务因素(信用历史确实能预测还款)。另一些则流经编码了历史歧视的代理。审计会识别出哪些路径属于哪一类,缓解措施则针对代理路径,而不扰动正当路径。
当我们使用供应商的招聘工具时,会因 AI 歧视而被起诉吗?
会。根据《民权法案》第七章、FCRA 及各州雇佣法,雇主对供应商 AI 工具产生的歧视性结果仍负有责任。在 Mobley 诉 Workday 案(2025 年 5 月)中,法院认定 AI 供应商作为雇主的代理人可对雇佣歧视直接承担责任。在 Eightfold AI 集体诉讼(2026 年 1 月)中,平台及使用它的雇主都面临风险敞口。科罗拉多州 SB 205 对部署方施加了单独的义务,无论系统由谁构建。使用供应商工具并不能转移法律风险,只是转移了技术复杂度,因为您需要审计一个并非自己构建的系统。我们使用基于输出的检验方法审计供应商 AI 工具,这类方法无需访问供应商的源代码或模型内部。
LL144 合规审计与全面公平审计之间有什么区别?
LL144 要求进行独立的偏见审计,考察按种族/族裔和性别类别划分的选拔率,并将结果公开发布。那是下限,而非上限。2025 年 12 月纽约州审计长的审计发现,DCWP 的执法流于表面:75% 的投诉被错误转接,审计人员识别出 17 项潜在违规,而 DCWP 仅认定 1 项。全面审计更进一步:跨组合受保护属性的交叉性分析、对间接编码受保护信息的特征进行因果代理检测、反事实公平性检验、量化公平性主张对未测量混杂因素稳健程度的敏感性分析,以及有文档记录的准确性与公平性取舍分析,并阐明不可能定理的含义。当执法趋于严格时,能经受住审视的正是这种全面版本。
当我们无法获取受保护属性数据时,如何检验偏见?
这是公平审计中最棘手的实际问题之一。所有主要工具包(AIF360、Fairlearn)都要求受保护属性作为输入。实践中,许多组织无法收集个人层面的种族、性别或残疾数据,尤其是在雇佣情境之外。可选方案包括:贝叶斯改进姓氏地理编码(BISG),用于从姓名和地理位置推断种族(CFPB 用于公平放贷分析);从聚合数据估计群体层面差异的生态推断方法;以及输出扰动检验,即构造仅改变受保护属性代理的反事实输入并测量决策变化。每种方法都有其局限。BISG 对多种族个体和某些族裔群体会引入自身的偏差。我们会针对具体人群和监管背景选择并验证代理方法,记录插补引入的不确定性,而不是把估计出的属性当作真实数据。
我们需要持续的偏见监测,还是年度审计就足够了?
年度审计是监管者要求的最低标准,但它并不能保证您安全。与反馈回路交互的模型会在两次审计之间产生偏见:一个拒绝某些背景候选人的招聘工具会基于自身的排斥进行训练,从而强化该模式。审批模式影响征信机构数据的放贷模型会造成自我实现的预言。随着客户人口结构或申请人池的变化,输入分布也会发生偏移。我们用序贯假设检验构建持续监测,实时检测新出现的公平性退化,并在指标越过阈值时触发警报。监测会分别跟踪聚合与交叉性子群体的性能。实际区别在于:年度审计会告诉您模型已经偏见了数月,而持续监测能在数周内告诉您。
当传统公平性指标不适用时,我们如何审计 LLM 和生成式 AI 的偏见?
传统公平性指标(均等几率、人口统计均等)是为具有明确受保护群体和可测量结果的二元分类器设计的。生成式 AI 产生开放式的文本、图像或推荐,其偏见表现为刻板关联、质量差异或跨人口统计情境的拒答模式。我们通过以下方式评估 LLM 偏见:基于场景的探测(系统性地改变提示中的人口统计信号并测量输出差异)、根据具体部署情境改编的基准套件(BBQ、StereoSet、CrowS-Pairs),以及对生产环境输出进行抽样并评估差别对待模式的输出审计。挑战在于,在模糊情境中 LLM 表现出与刻板印象一致的错误的比例高达 77%(BBQ 基准研究),而且这些偏见比分类器偏见更难缓解,因为它们分布在数十亿参数中,而非集中于少数几个特征。
未通过偏见审计或未进行审计的实际处罚是什么?
各司法管辖区的处罚正在迅速升级。纽约市 LL144:每项违规每天 500-1,500 美元,并按每位受影响的申请人叠加。科罗拉多州 SB 205(2026 年 6 月生效):根据《消费者保护法》,每项违规最高 20,000 美元。欧盟《AI 法案》(2026 年 8 月执法):对被禁止的做法处以最高 3,500 万欧元或全球营业额 7% 的罚款,对高风险不合规处以 1,500 万欧元或 3%。除法定处罚外,诉讼风险也很现实:马萨诸塞州总检察长在 2025 年 7 月从单起 AI 放贷歧视和解中收取了 250 万美元。SafeRent 因住房筛选算法歧视支付了 227.5 万美元。Mobley 诉 Workday 是首个获认证的全国性 AI 偏见集体诉讼。相比其中任何一项结果,全面审计的成本都只是四舍五入的误差。
AI 偏见在保险承保中适用哪些监管要求?
科罗拉多州 SB 21-169 最为详尽。它禁止保险公司以基于受保护特征产生不公平歧视性结果的方式使用外部消费者数据、算法和预测模型。车险和健康险公司必须在 2026 年 7 月 1 日前提交年度合规报告。科罗拉多州保险司已提议进行定量检验,比较含与不含估计种族变量的模型,以识别歧视性特征。另外,已有 24 个州采纳了 NAIC 示范公告,要求保险公司在其 AI 治理项目中纳入透明度和公平性。精算公平问题与统计公平问题不同:精算上有依据的风险区分可能产生统计差异,这在保险法下是合法允许的,但在雇佣或放贷法下则会构成歧视。我们帮助保险团队用为保险特定监管背景构建的检验框架来驾驭这一区别。
满怀信心地构建您的 AI。
与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。
Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。
