问题所在
2022年,海军联邦信用合作社(Navy Federal Credit Union)拒绝了超过半数的黑人房贷申请人,而白人申请人的批准率则达77%。这29个百分点的差距是全美前50大房贷发放机构中最大的。与此同时,在马萨诸塞州认定其AI贷款模型对黑人、西语裔及非美国公民借款人造成不成比例的损害后,Earnest Operations LLC于2025年7月支付了250万美元的和解金。
这些绝非孤立事件,而是全行业结构性问题的警示信号。如果你的机构在信贷业务中使用了自动化决策——几乎每家贷款机构都在使用——你正面临着同样的风险敞口。
Earnest的核心问题在于一个名为“院校违约率”(Cohort Default Rate, CDR)的变量。该指标用于追踪特定学校的平均贷款违约情况,表面上听起来十分中立。然而,由于数十年来的系统性资金匮乏与财富差距,传统黑人大学(HBCUs)往往承受着更高的违约率。通过在模型中对CDR赋予权重,Earnest让个人申请者为其毕业院校所承受的历史劣势买单——而完全忽视了他们个人的财务健康状况。该算法在纸面上看似中立于种族,但在实际运作中却固化了歧视。
在海军联邦,问题甚至更难以捉摸。当研究人员对十多项因素——收入、债务收入比、房产价值、社区等——进行控制后,具有完全相同背景的黑人申请人被拒贷的概率仍是白人申请人的两倍以上。该信用合作社的核保算法内部存在某种传统信用因素无法解释的机制,正在持续产生偏见。
为何这对你的业务至关重要
财务层面的后果已经显现。Earnest支付了250万美元以了结一项州级调查;海军联邦则面临合并集体诉讼和国会质询。2024年5月,一名联邦法官裁定针对海军联邦的“差别影响”(disparate impact)指控可以继续推进,从而为深入调查该信用合作社内部模型逻辑的证据开示打开了大门。
以下是这对你的机构意味着什么:
- 监管执法正变得越来越具体。 美国消费者金融保护局(CFPB)现在要求对不利授信决定给出“准确且具体的理由”。如果真正的拒贷原因是某个非传统数据点触发了算法标记,你绝不能仅以“收入不足”为由敷衍申请人。“算法做出的决定”绝非合法的抗辩理由。
- 仅凭统计学差异就足以在驳回起诉动议中胜出。 法院正将举证责任转移到贷款机构身上。你的机构必须证明其核保流程既是业务所必需的,又是现有方案中歧视性最小的选择。
- 政策与实践之间的脱节是一项重大负债。 Earnest内部虽有要求对模型例外情况进行高级别监督的政策,但调查人员发现核保人员频繁绕过模型,并在没有任何记录的情况下擅自应用随意标准。这种脱节使得该系统既无法被审计,也无法在法律上进行辩护。
- 国家基准让异常值无所遁形。 CFPB公布的全美平均拒贷率为:白人申请人5.6%,黑人申请人16.2%——差距达10.6个百分点。而海军联邦的差距几乎是该数字的三倍。如果你的数据高于全美平均水平,监管机构必定会注意到。
你的董事会、总法律顾问以及监管机构都会提出同一个问题:你能解释你的AI是如何做出贷款决策的吗?如果你无法给出明确的答案,你将承担Earnest和海军联邦目前所面临的同等风险。
底层实际发生了什么
当今大多数AI贷款工具都是业内所谓的“套壳”(wrappers)。可以将其理解为给通用产品贴上一个新标签。这些系统获取你的数据,将其传递给GPT-4或Gemini等通用大语言模型(LLM),然后返回一个结果。它们表面上看起来非常精密,但在底层却缺乏金融监管机构所要求的领域特定规则、透明度层和因果推理能力。
这其中存在着根本性的错配:金融服务需要确定性逻辑——相同的输入必须始终产生相同的输出。然而大语言模型本质上是概率性的,它们预测的是序列中的下一个词,并不检索事实,也不进行精算。在信贷核保场景中,LLM可能会产生“幻觉”——捏造一个听起来合理、但在申请人的实际财务档案中毫无依据的拒贷理由。
这绝非理论层面的风险。当加拿大航空的聊天机器人凭空捏造了一项根本不存在的丧亲优惠票价政策时,该航空公司被判承担法律责任。同样的原则完全适用于你的贷款决策。
通用AI平台还缺乏垂直领域上下文,无法准确解读房贷文件、纳税申报表和银行流水账单。若没有行业特定的训练,这些模型会误读收入模式和现金流,从而导致对信用良好的借款人产生误拒。此外,由于LLM是在充斥着历史偏见的海量互联网文本上训练出来的,它们可能会将某些国籍或职业与较低的信用度关联起来——即便具体申请人的个人数据完全合规无可挑剔。
最糟糕的是:这些问题在表层审计中完全无法显现。偏见深植于研究人员所称的模型“潜在空间”(latent space)中——即形成关联特征的隐藏层。如果缺乏合适的工具,在监管机构或原告律师找上门之前,你根本察觉不到它的存在。
什么有效(以及什么无效)
让我们先从经不起推敲的做法说起:
- “我们已经从模型中剔除了种族字段。” 剔除种族字段并不能消除种族偏见。像学校违约率、邮政编码和消费习惯等代理变量(proxy variables)承载着相同的特征信号。Earnest从未询问过申请人的种族,但依然构成了歧视。
- “我们使用的是声誉良好的第三方AI供应商。” 外包你的AI并不能外包你的法律责任。CFPB追究的是贷款机构的责任,而非供应商。如果你的供应商的模型无法解释其决策依据,合规缺口将完全由你承担。
- “我们的团队会人工审核边缘案例。” 无结构的非正式人工干预反而会让情况变得更糟。Earnest的核保人员在没有任何记录的情况下绕过模型,制造了一个算法偏见与人为偏见并存的混合系统——而且两者都无法被审计。
真正有效的解决方案是分层架构,它根据每类决策的具体要求将其分别处理:
输入端:在AI接触数据之前进行数据验证。 每一个数据点都要经过准确性、完整性、一致性、及时性、相关性和代表性检查。这可以防止受污染的数据产生带有偏见的结果。你的系统应当清楚了解其数据血统(data lineage)——即每项输入的来源及其处理过程。
处理端:选用恰当的模型处理恰当的任务。 硬性合规检查(例如居住地要求)通过确定性规则引擎运行,确保每次都给出相同的答案。结构化信用评分采用梯度提升决策树等可解释模型。LLM仅用于处理文档分析等非结构化任务,并通过名为检索增强生成(Retrieval-Augmented Generation, RAG)的技术锚定在申请人的实际档案中——即向AI喂送真实源文件,而非让其凭空猜测。
输出端:每一项决策都有据可查。 像SHAP(SHapley Additive exPlanations,一种基于博弈论、为每个输入因素分配特定贡献得分的方法)这样的可解释性工具,能为每一项不利授信决定生成随时可供审计的理由。更进一步,系统还能生成反事实解释(counterfactual explanations):“如果你的信用额度使用率降低15%,或者收入增加5,000美元,此笔贷款本可获批。”这正是CFPB现在所要求的具体程度。
审计轨迹的优势将这一切紧密联结在一起。每一次人工干预都会被强制记录理由。持续监控系统同时追踪模型漂移(model drift,即新输入数据与训练集不再匹配)与偏差漂移(bias drift),并在差别影响比率跌破可接受阈值时触发实时警报。你的合规团队得到的是一份具有法律抗辩力的记录,而不是一个黑箱。当监管机构前来质询时,你可以向他们准确展示每一项决策是如何做出、核验并归档记录的。
NIST AI风险管理框架2.0现在要求提供“AI软件物料清单”(AI Bill of Materials)——即数据源、模型及第三方组件的完整清单。如果你今天无法拿出一份清单,你的机构就存在着监管机构正在重点审查的治理漏洞。
关键要点
- 海军联邦在白人与黑人申请人之间29个百分点的房贷批准率差距是全美前50大贷款机构中最大的——且研究人员无法用收入、债务或房产价值来合理解释。
- Earnest因在其AI贷款模型中使用了一个表面中立但实际充当种族代理变量的学校违约率变量,支付了250万美元和解金。
- CFPB现在要求对每一次拒贷都给出具体且准确的理由——“算法做出的决定”在法律上绝非站得住脚的回答。
- 基于大语言模型构建的通用AI套壳在设计上本质是概率性的,无法提供金融监管机构所要求的确定性、可解释的决策。
- 分层架构——用于合规的确定性规则、用于评分的可解释模型、用于文档的锚定LLM——能够建立起你的机构为决策进行法律抗辩所需的审计轨迹。
总结
监管机构已不再过问你是否使用了AI。他们真正质问的是:你是否能够解释AI做出的每一项决定,证明其是现有方案中歧视性最小的选择,并完整记录每一次人工干预。交不出答卷的代价将体现为巨额和解金、集体诉讼证据开示以及国会听证会。不妨这样质问你的AI供应商:当你的模型拒绝一名贷款申请人时,它能否给出具体的反事实解释——即具体需要做出哪些改变才能获批——并提供展示每个输入变量使用理由的完整审计轨迹?