住房AI合規

在固定合成資料集上,最不利群體0.694的DIR開啟了Equora跨480種配置的改善搜尋。

Equora將測得的差異轉化為對低差異替代方案的可重現搜尋,同時將精確度成本、精確決策證據以及發布門禁始終置於監控之下。

0.694 to 0.875

最不利群體DIR變化趨勢

固定合成測試資料集

480

已評估配置數量

等選擇性有界搜尋

0.36%

測得的精確度成本

AUC 0.7823 to 0.7788

此處顯示的所有主要結果均來自包含9,000筆記錄的固定合成申請人資料池。Equora是一項工程演示,並非法學諮詢或生產決策系統。

核心問題

公平性指標可以識別差異,但無法決定業務應對措施。

租戶篩選審計可能會向法務與模型風險團隊表明不同受保護群體之間的結果存在差異。隨後真正的難點開始出現:確定表面中立的替代方案能否在降低差異的同時保留有用的模型效能,並在日後可完整重現。

2024年11月的SafeRent和解案為篩選系統為何面臨嚴格審查提供了重要背景。這筆$2.275 million的和解案不包含任何不當行為的認定,且本演示並不重現該具體法律事件。

紅色警告評分所無法提供的證據

  • 01究竟實際評估了哪些中立替代方案
  • 02候選模型是否在同等選擇性水準下進行對比
  • 03選定的修改方案需要犧牲多少測得的效能
  • 04面向申請人的告知理由是否與實際決策記錄相符

來源: DOJ Civil Rights Division case page 以及 2024年11月20日提交的Final Approval Order。

運作原理

審計結果輸入有界改善搜尋。

測量、搜尋、推薦以及發布檢查全流程保持確定性。

測量

在改善前測量基準線

Equora將ScreenScore v3(偏向信用基準線)擬合在附帶的合成池上,並報告核准率、disparate-impact ratio(DIR)、統計均等差(SPD)以及equalized-odds差距。種族和住房補貼憑證狀況屬於審計欄位,而非模型特徵。

搜尋

在同等選擇性下評估明確的中立性修改

最少歧視替代方案(Least Discriminatory Alternative, LDA)搜尋評估可選特徵子集、信用評分上限、保障性收入處理及正則化強度的480種組合。搜尋空間明確且有界。

選擇

依據可重現規則進行選擇

引擎繪製精確度與最小DIR的帕累托前沿,然後在配置的0.03預算範圍內選擇測得AUC損失最小的合格候選方案。若無候選方案合格,則返回無安全替代方案。

門禁

拒對缺乏支撐的解釋文字予以放行

精確線性模型歸因可識別出排名前三的負面貢獻特徵。特徵依據比對審查器會將這些驅動因素與通知中的理由進行對比,並將缺乏支撐或籠統的解釋轉交人工複核。

演示實證

從基準線到推薦方案的全過程權衡保持透明。

這些畫面展示了在固定合成測試集上運行的實際本地演示。

Equora帕累托前沿顯示合成基準線DIR為0.694,推薦替代方案DIR為0.875,測得的精確度成本為0.36百分點
核心佐證:評估了480種配置,240種處於配置門禁和AUC預算之內,推薦的權衡結果記錄在帕累托前沿上。
Equora完成的合成租戶篩選審計,包含最不利群體的disparate-impact ratio以及受保護群體的審計結果
基準線審計在替代方案搜尋開始前精準識別差異。
Equora通知驗證顯示具備特徵支撐的理由順利通過,而籠統理由被轉交人工複核
發布門禁僅核實特徵依據的真實性,並不對通知的全面法律合規性進行擔保。

客觀實態

當工作流程超越單純審計時所帶來的改變

Equora旨在使有界的改善決策可供審查,而不是將單一指標轉化為法律判決。

評估維度 單獨的公平性評分 Equora工程實證
測量了什麼?單一模型配置下的差異固定測試集上的DIR、SPD、EO差距、核准率及信賴區間
可以改變什麼?未明確在同等選擇性下對比的表面中立配置預設網格
為何選擇此推薦?無選擇記錄有界搜尋合格候選方案中測得的AUC損失最小者
能否核查通知理由?超出評分涵蓋範圍將引用的特徵與排名前三的精確負面貢獻驅動因素進行比對

本演示不涵蓋的內容

Equora並不確立法律合規性,不對模型是否公平作出認證,不窮盡搜尋所有可能的模型,亦不驗證真實生產環境下的住房成效。其0.80閾值為演示中配置的五分之四政策門禁。

申請人池為合成資料,規則集為靜態配置,未構建生產環境連接器。通知審查器僅驗證特徵依據,而UCI Adult運行屬於基於人口普查收入的公開公平性基準測試,並非租戶實際資料。

住房、風險及合規團隊常問的問題

當租戶篩選模型未達到演示配置的五分之四政策門禁時,Equora會如何處理?

Equora在同等選擇性下評估480種明確且表面中立的配置。它會推薦在演示配置的五分之四政策門禁及精確度預算範圍內測得AUC損失最小的合格候選方案;若無方案合格,則返回無安全替代方案。

DIR低於0.80是否能證明違反了Fair Housing Act?

不能。Equora使用0.80作為演示配置的五分之四政策門禁,而非法律定論。五分之四經驗法則源自僱傭選拔指導方針,本身並不能單獨決定住房法律責任。

推薦的替代方案犧牲了多少模型效能?

在固定合成測試集上,AUC從0.7823微調至0.7788。測得的損失為0.0036,在介面中顯示為0.36%的精確度成本,而最不利群體的DIR從0.694大幅提升至0.875。

Equora是否使用大語言模型作出租戶篩選決策?

不使用。確定性程式碼負責計算指標、套用閾值、評估替代方案並選出推薦項。語言模型即便啟用,也僅限於起草通知文字,離線模式則採用確定性範本。

不利行為通知(Adverse-Action Notice)檢查是否能證明完全符合FCRA要求?

不能。特徵依據審查器僅檢查所列理由是否與模型排名前三的負面特徵貢獻相匹配。它會將缺乏依據或籠統的理由轉交人工複核,但不會核實法定通知的每一項構成要件,亦不確立法律充分性。

此住房AI演示中的資料是否來自真實申請人?

不是。主要資料集是由9,000筆記錄組成的固定附帶合成租戶篩選池。單獨運行的UCI Adult Census Income是一項公開公平性基準,用於測試相同的審計程式碼,而非住房驗證資料集。

技術研究

本演示背後的核心研究 —— 架構設計、驗證方案與企業落地藍圖。

社群媒體

同步發佈於

使應對審計紅線的處置流程具備可重現性。

將模型效能、政策邊界與舉證責任整合進統一步驟的審查中。

如果您的團隊正在為住房AI定義審計、改善及發布控制措施,請與我們聯繫,共同探討審查應保留哪些證據。

已展示的審計與證據控制能力

  • ✓ 受保護群體指標體系設計
  • ✓ 政策門禁規範定義
  • ✓ 信賴度與統計顯著性報告
  • ✓ 可供審計的JSON與HTML產出物

已展示的改善與發布控制能力

  • ✓ 有界中立替代方案搜尋
  • ✓ 精確度與差異權衡深度審查
  • ✓ 精確決策驅動因素歸因
  • ✓ 結合人工複核的發布門禁