住房AI合规

在固定合成数据集上,最不利群体0.694的DIR开启了Equora跨480种配置的整改搜索。

Equora将测得的差异转化为对低差异替代方案的可复现搜索,同时将精度成本、精确决策证据以及发布门禁始终置于监控之中。

0.694 to 0.875

最不利群体DIR变化趋势

固定合成测试数据集

480

已评估配置数量

等选择性有界搜索

0.36%

测得的精度成本

AUC 0.7823 to 0.7788

此处显示的所有主要结果均来自包含9,000条记录的固定合成申请人数据池。Equora是一项工程演示,并非法律咨询或生产决策系统。

核心问题

公平性指标可以识别差异,但无法决定业务应对措施。

租户筛选审计可能会向法务与模型风险团队表明不同受保护群体之间的结果存在差异。随后真正的难点开始出现:确定表面中立的替代方案能否在降低差异的同时保留有用的模型性能,并在日后可完整复现。

2024年11月的SafeRent和解案为筛选系统为何面临严格审查提供了重要背景。这笔$2.275 million的和解案不包含任何不当行为的认定,且本演示并不复现该具体法律事件。

红色警告评分所无法提供的证据

  • 01究竟实际评估了哪些中立替代方案
  • 02候选模型是否在同等选择性水平下进行对比
  • 03选定的修改方案需要牺牲多少测得的性能
  • 04面向申请人的告知理由是否与实际决策记录相符

来源: DOJ Civil Rights Division case page 以及 2024年11月20日提交的Final Approval Order。

工作原理

审计结果输入有界整改搜索。

测量、搜索、推荐以及发布检查全流程保持确定性。

测量

在整改前测量基准线

Equora将ScreenScore v3(偏向信用基准线)拟合在附带的合成池上,并报告批准率、disparate-impact ratio(DIR)、统计均等差(SPD)以及equalized-odds差距。种族和住房补贴凭证状况属于审计字段,而非模型特征。

搜索

在同等选择性下评估明确的中立性修改

最少歧视替代方案(Least Discriminatory Alternative, LDA)搜索评估可选特征子集、信用评分上限、保障性收入处理及正则化强度的480种组合。搜索空间明确且有界。

选择

依据可复现规则进行选择

引擎绘制精度与最小DIR的帕累托前沿,然后在配置的0.03预算范围内选择测得AUC损失最小的合格候选方案。若无候选方案合格,则返回无安全替代方案。

门禁

拒绝对缺乏支撑的解释文本予以放行

精确线性模型归因可识别出排名前三的负面贡献特征。特征依据比对审查器会将这些驱动因素与通知中的理由进行对比,并将缺乏支撑或笼统的解释转交人工复核。

演示实证

从基准线到推荐方案的全过程权衡保持透明。

这些界面展示了在固定合成测试集上运行的实际本地演示。

Equora帕累托前沿显示合成基准线DIR为0.694,推荐替代方案DIR为0.875,测得的精度成本为0.36百分点
核心佐证:评估了480种配置,240种处于配置门禁和AUC预算之内,推荐的权衡结果记录在帕累托前沿上。
Equora完成的合成租户筛选审计,包含最不利群体的disparate-impact ratio以及受保护群体的审计结果
基准线审计在替代方案搜索开始前精准识别差异。
Equora通知验证显示具备特征支撑的理由顺利通过,而笼统理由被转交人工复核
发布门禁仅核实特征依据的真实性,并不对通知的全面法律合规性进行担保。

客观实态

当工作流超越单纯审计时所带来的改变

Equora旨在使有界的整改决策可供审查,而不是将单一指标转化为法律判决。

评估维度 单独的公平性评分 Equora工程实证
测量了什么?单一模型配置下的差异固定测试集上的DIR、SPD、EO差距、批准率及置信区间
可以改变什么?未明确在同等选择性下对比的表面中立配置预设网格
为何选择此推荐?无选择记录有界搜索合格候选方案中测得的AUC损失最小者
能否核查通知理由?超出评分涵盖范围将引用的特征与排名前三的精确负面贡献驱动因素进行比对

本演示不涵盖的内容

Equora并不确立法律合规性,不对模型是否公平作出认证,不穷尽搜索所有可能的模型,亦不验证真实生产环境下的住房成效。其0.80阈值为演示中配置的五分之四政策门禁。

申请人池为合成数据,规则集为静态配置,未构建生产环境连接器。通知审查器仅验证特征依据,而UCI Adult运行属于基于人口普查收入的公开公平性基准测试,并非租户实际数据。

住房、风险及合规团队常问的问题

当租户筛选模型未达到演示配置的五分之四政策门禁时,Equora会如何处理?

Equora在同等选择性下评估480种明确且表面中立的配置。它会推荐在演示配置的五分之四政策门禁及精度预算范围内测得AUC损失最小的合格候选方案;若无方案合格,则返回无安全替代方案。

DIR低于0.80是否能证明违反了Fair Housing Act?

不能。Equora使用0.80作为演示配置的五分之四政策门禁,而非法律定论。五分之四经验法则源自雇佣选拔指导方针,本身并不能单独决定住房法律责任。

推荐的替代方案牺牲了多少模型性能?

在固定合成测试集上,AUC从0.7823微调至0.7788。测得的损失为0.0036,在界面中显示为0.36%的精度成本,而最不利群体的DIR从0.694大幅提升至0.875。

Equora是否使用大语言模型作出租户筛选决策?

不使用。确定性代码负责计算指标、应用阈值、评估替代方案并选出推荐项。语言模型即便启用,也仅限于起草通知文本,离线模式则采用确定性模板。

不利行为通知(Adverse-Action Notice)检查是否能证明完全符合FCRA要求?

不能。特征依据审查器仅检查所列理由是否与模型排名前三的负面特征贡献相匹配。它会将缺乏依据或笼统的理由转交人工复核,但不会核实法定通知的每一项构成要件,亦不确立法律充分性。

此住房AI演示中的数据是否来自真实申请人?

不是。主要数据集是由9,000条记录组成的固定附带合成租户筛选池。单独运行的UCI Adult Census Income是一项公开公平性基准,用于测试相同的审计代码,而非住房验证数据集。

技术研究

本演示背后的核心研究 —— 架构设计、验证方案与企业落地蓝图。

社交媒体

同步发布于

使应对审计红线的处置流程具备可复现性。

将模型性能、政策边界与举证责任整合进统一步骤的审查中。

如果您的团队正在为住房AI定义审计、整改及发布控制措施,请与我们联系,共同探讨审查应保留哪些证据。

已展示的审计与证据控制能力

  • ✓ 受保护群体指标体系设计
  • ✓ 政策门禁规范定义
  • ✓ 置信度与统计显著性报告
  • ✓ 可供审计的JSON与HTML成果物

已展示的整改与发布控制能力

  • ✓ 有界中立替代方案搜索
  • ✓ 精度与差异权衡深度审查
  • ✓ 精确决策驱动因素归因
  • ✓ 结合人工复核的发布门禁