住房AI合规
Equora将测得的差异转化为对低差异替代方案的可复现搜索,同时将精度成本、精确决策证据以及发布门禁始终置于监控之中。
0.694 to 0.875
最不利群体DIR变化趋势
固定合成测试数据集
480
已评估配置数量
等选择性有界搜索
0.36%
测得的精度成本
AUC 0.7823 to 0.7788
此处显示的所有主要结果均来自包含9,000条记录的固定合成申请人数据池。Equora是一项工程演示,并非法律咨询或生产决策系统。
核心问题
租户筛选审计可能会向法务与模型风险团队表明不同受保护群体之间的结果存在差异。随后真正的难点开始出现:确定表面中立的替代方案能否在降低差异的同时保留有用的模型性能,并在日后可完整复现。
2024年11月的SafeRent和解案为筛选系统为何面临严格审查提供了重要背景。这笔$2.275 million的和解案不包含任何不当行为的认定,且本演示并不复现该具体法律事件。
来源: DOJ Civil Rights Division case page 以及 2024年11月20日提交的Final Approval Order。
工作原理
测量、搜索、推荐以及发布检查全流程保持确定性。
测量
Equora将ScreenScore v3(偏向信用基准线)拟合在附带的合成池上,并报告批准率、disparate-impact ratio(DIR)、统计均等差(SPD)以及equalized-odds差距。种族和住房补贴凭证状况属于审计字段,而非模型特征。
搜索
最少歧视替代方案(Least Discriminatory Alternative, LDA)搜索评估可选特征子集、信用评分上限、保障性收入处理及正则化强度的480种组合。搜索空间明确且有界。
选择
引擎绘制精度与最小DIR的帕累托前沿,然后在配置的0.03预算范围内选择测得AUC损失最小的合格候选方案。若无候选方案合格,则返回无安全替代方案。
门禁
精确线性模型归因可识别出排名前三的负面贡献特征。特征依据比对审查器会将这些驱动因素与通知中的理由进行对比,并将缺乏支撑或笼统的解释转交人工复核。
演示实证
这些界面展示了在固定合成测试集上运行的实际本地演示。
客观实态
Equora旨在使有界的整改决策可供审查,而不是将单一指标转化为法律判决。
| 评估维度 | 单独的公平性评分 | Equora工程实证 |
|---|---|---|
| 测量了什么? | 单一模型配置下的差异 | 固定测试集上的DIR、SPD、EO差距、批准率及置信区间 |
| 可以改变什么? | 未明确 | 在同等选择性下对比的表面中立配置预设网格 |
| 为何选择此推荐? | 无选择记录 | 有界搜索合格候选方案中测得的AUC损失最小者 |
| 能否核查通知理由? | 超出评分涵盖范围 | 将引用的特征与排名前三的精确负面贡献驱动因素进行比对 |
Equora并不确立法律合规性,不对模型是否公平作出认证,不穷尽搜索所有可能的模型,亦不验证真实生产环境下的住房成效。其0.80阈值为演示中配置的五分之四政策门禁。
申请人池为合成数据,规则集为静态配置,未构建生产环境连接器。通知审查器仅验证特征依据,而UCI Adult运行属于基于人口普查收入的公开公平性基准测试,并非租户实际数据。
Equora在同等选择性下评估480种明确且表面中立的配置。它会推荐在演示配置的五分之四政策门禁及精度预算范围内测得AUC损失最小的合格候选方案;若无方案合格,则返回无安全替代方案。
不能。Equora使用0.80作为演示配置的五分之四政策门禁,而非法律定论。五分之四经验法则源自雇佣选拔指导方针,本身并不能单独决定住房法律责任。
在固定合成测试集上,AUC从0.7823微调至0.7788。测得的损失为0.0036,在界面中显示为0.36%的精度成本,而最不利群体的DIR从0.694大幅提升至0.875。
不使用。确定性代码负责计算指标、应用阈值、评估替代方案并选出推荐项。语言模型即便启用,也仅限于起草通知文本,离线模式则采用确定性模板。
不能。特征依据审查器仅检查所列理由是否与模型排名前三的负面特征贡献相匹配。它会将缺乏依据或笼统的理由转交人工复核,但不会核实法定通知的每一项构成要件,亦不确立法律充分性。
不是。主要数据集是由9,000条记录组成的固定附带合成租户筛选池。单独运行的UCI Adult Census Income是一项公开公平性基准,用于测试相同的审计代码,而非住房验证数据集。
将模型性能、政策边界与举证责任整合进统一步骤的审查中。
如果您的团队正在为住房AI定义审计、整改及发布控制措施,请与我们联系,共同探讨审查应保留哪些证据。