
你的采购AI给表现更好的供应商打了更低的分——是这套数学在作祟
上个季度,我曾用一整个漫长的夜晚,盯着一张单一的采购评分卡,而它打破了我在采购工作中多年来一直抱持的一个假设。
那是一次例行的采购事件——工业紧固件,五家供应商,属于那种没人会为之失眠的品类。平台的AI在交付、质量、财务稳定性和价格上对它们进行了排名。供应商A,一家有着十二年历史、背后有数千笔交易的现有供应商,得了92分。一家有着三年历史、经过认证的少数族裔所有企业得了71分。从表面上看,这是个干净利落的结果。现有供应商凭实力胜出。翻篇吧。
但我没有就此翻篇。我逐行拆解了那些交付子分数,而我的发现,正是我如今以构建采购AI公平性审计业务为生的原因。那家较小的供应商拥有更好的准时交付率——98.1%,而现有供应商为97.2%。可它的交付得分却依然更低。
表现更好的供应商,排名却更差。不是因为模型对他们有偏见——而是因为数学本身有偏见。
数据所说的与分数所说的之间的这道鸿沟,就是全部故事所在。让我带你看看它是如何发生的,为什么市面上没有一个采购平台会替你解决它,以及要真正构建出能解决它的东西,究竟需要付出什么。
偏见不在模型里。它在历史里。

这是我花了太久才接受的部分:那套算法里没有任何恶意。没人为多元化供应商写入惩罚项。这种偏见是在历史支出数据上训练所产生的结构性后果——而一旦你看见了它,就再也无法视而不见。
交付表现占供应商得分的25%,而AI把它计算为准时率,并按交易笔数加权。现有供应商在4,200笔交易上的97.2%,生成了24.1分(满分25)的置信度加权交付得分。而少数族裔所有的供应商在仅仅180笔交易上的98.1%,只生成了16.8分。同样的指标。更好的原始数字。却丢掉了八分——仅仅因为置信度加权。
然后,同样的模式在每个环节重演。质量评分依赖审计频率,而审计频率与合同数量相关。财务稳定性评分把营收规模当作风险承受能力的代理指标。等到模型算到价格竞争力时,这道差距在数学上已经无法逾越。
这种排斥会自我强化,而这正是它丑陋之处。一家供应商得分更低,于是赢得更少的合同,于是积累更少的交易,于是下一个周期他们的置信度得分更低。该算法把更多的历史数据等同于更可靠——而任何从未获得机会去建立那段历史的供应商,将为此永远付出代价。
在你的支出历史上训练出来的AI,预测的不是最好的供应商。它预测的是你已经用过的那家供应商。
为什么你的采购平台不会替你解决这个问题?
我的第一反应是显而易见的那个:SAP、Coupa、GEP或Ivalua肯定早就处理了这件事。它们正把巨量的工程投入到agentic AI中。Joule的投标分析代理会比较供应商报价并推荐授标。Coupa的Navi用自然语言运行供应商发现,而该公司在单个季度里录得约150亿美元的客户节省。Ivalua提供了三十多个开箱即用的AI代理。GEP在其整个从寻源到付款的套件中都部署了agentic AI。
于是我去寻找那些公平性指标。差异影响测试。他们如何审计自家评分引擎以查找不利影响的公开方法论。
根本没有。我查遍了这四大平台。没有一家公布供应商评分的公平性指标。Coupa在博客文章中承认,AI提供商应当"展示偏见缓解措施"——但这句话背后没有任何有据可查的审计流程。它是个谈资,而不是一项功能。
而且说实话,一旦你理解了平台经济学,你就不再指望它了。这些供应商构建的是面向其整个客户群、为降本和风险缓解而优化的通用型评分。添加针对你的分包目标、你的供应商类别、你的监管辖区量身定制的公平性约束,就意味着要为他们拥有的每一个客户维护一套不同的模型配置。那不是产品路线图。那是一场支持噩梦。
这比单纯的方便有着更锋利的一面。合同越来越多地写成让责任落到你身上,而非供应商身上——联邦法院一直在扩大AI问责,而平台协议悄悄地把风险转移给了客户。所以当一家被略过的供应商最终问起为什么他们的分数是71时,审计结论上写的是你的名字,而不是SAP的。而随着这些代理变得越来越自主,情况还会更糟:当一个机器人自行触发一笔授标或一笔付款——或者凭空幻觉出一份从未存在过的协议时——合同早已确保责任在你,而非AI供应商。平台给你的是速度。而公平性这一层——以及随之而来的责任——从来都注定是你自己的。
那个我确信会奏效——却没有奏效的解决方案
我要告诉你我做错的那个版本,因为它正是大多数团队最先想到的版本。
如果模型给较小的和多元化的供应商打了偏低的分,直觉上的解决办法就是往另一边的天平上压一根手指。加一个多元化调整项。给经过认证的供应商加几分,以补偿置信度惩罚。我们勾勒的正是这个方案。它感觉很公平。它感觉是在纠偏。
它是个陷阱,而揭穿它的并不是一个工程问题——而是一个法律问题。
在我们构建这个加分项的同时,我也在通读我们的联邦承包商客户实际所处的监管环境,而它刚刚变成了一片雷区。一方面,FAR第19部分要求承包商分别达到针对小企业、退伍军人所有、服务致残退伍军人所有、HUBZone和女性所有分包商的百分比目标——而执法近来已经收紧。另一方面,2025年7月签署的第14319号行政命令,禁止联邦采购携带"意识形态偏见或社会议程"的AI,并明确点名了DEI。
静下心想一想。如今,一家联邦承包商在一条规则下被法律要求推进多元化供应商,同时又被另一条规则从法律上禁止将社会议程植入采购AI。我们的多元化加分——一个硬编码的、偏向受保护类别的天平砝码——正是EO 14319旨在扼杀的那种东西。我们本会交付一个披着解决方案外衣的合规负债。它撑不过第一次审计。
当你通过添加另一种偏见来纠正偏见的那一刻,你就构建了一个在听证室里无法为之辩护的东西。
正是那次失败,为我重新界定了整个问题。目标从来不是让AI偏袒任何人。目标是让它可被证明地不偏袒任何人——并拿出证据。
打开局面的那条招聘规则

转折点来自一条就业歧视规则,据我所知,采购领域几乎没有人在应用它。
EEOC的五分之四规则——29 CFR 1607.4——规定任何群体的遴选率都必须至少达到遴选率最高群体的80%。它是为招聘歧视而写的。但供应商遴选在结构上与候选人遴选完全相同:你有类别、有晋级率、有一个阈值。同一套统计检验可以直接套用。
于是我们拿它去检验真实的评分输出。如果一套AI让60%的非多元化供应商越过评分阈值,五分之四规则就要求它必须让至少48%的经认证的少数族裔和女性所有供应商晋级。而在按交易量加权的评分中,我们反复看到的实际比率更接近22%。这就是0.37的差异比——不到法定下限的一半。
这个数字不是一个软性信号。0.37的差异比是不利影响的初步证据——与法院对招聘歧视主张所适用的标准相同。这类发现会演变成合同流失和审计问题,而不只是一份措辞强硬的备忘录。
而这正是它比任何公平性加分都更重要的原因:五分之四检验不偏袒任何人。它只是衡量。它给了我们一条同时满足两位主人的路径——既向FAR第19部分的审计员证明多元化供应商获得了公平的机会,又向EO 14319的审查员证明我们没有向天平添加任何意识形态砝码。只是数学,对称地应用,最后给出一个数字。
而且这不只是联邦层面的问题。大多数州已经把多元化评分纳入它们的采购评估——仅伊利诺伊州就把一份RFP技术分中高达20%的分数分配给供应商多元化——因此,那个会让联邦审计翻船的同一个差异比,也在悄悄地让州承包商流失它被明确要求去争取的分数。评分走到哪里,五分之四检验就跟到哪里。
你如何证明一套采购AI是公平的?
于是我们不再试图去修复任何人的模型,而是构建了一个位于其之上的审计层。这正是如今在veriprajna.com/solutions/procurement-ai-fairness上的东西的核心:一个与供应商无关的公平性审计器,它连接到SAP Ariba、Coupa、GEP或Ivalua,读取平台已经产出的供应商评分输出,并对其进行差异影响检验。
与供应商无关是一个刻意的选择,而不是图省事。我们不碰平台的模型——我们不必碰,而且坦白说,我们也不想承担重新训练别人评分引擎的责任。我们把AI的输出当作受检验的对象:按供应商类别提取遴选率,计算五分之四差异比,分解出差距在评分栈的哪个环节产生(几乎总是置信度加权,几乎从不是价格),然后交给采购官员一些他们可以带进会议室的东西。
最后这部分才是真正重要的交付物。不是一个写着"看起来没问题"的仪表盘。而是一份数学证明,证明AI对每一个供应商类别都一视同仁——或者一份具体的、有出处的发现,说明它并没有做到,并点明差异比和那个出问题的评分因子。一份CPO可以摆到领导层面前、合规官可以归档、审计员无法一挥手打发掉的东西。
"这不就是一个带计算器的DEI项目吗?"
这是我听到最多的反对意见,通常来自那些被监管的反复无常灼伤过、对任何带有社会议程气味的东西都心存戒备的人。这是个合理的问题,而答案是否定的——而这个区别正是全部要点所在。
一个DEI项目会预先认定某个结果是可取的,并朝它引导。而差异影响审计则什么都不认定。它衡量的是这些遴选率是否达到了法院对歧视主张所适用的、早已确立的统计阈值。如果你的AI通过了五分之四检验,审计就会如实说明,你也就有了中立性的证据。如果没通过,审计会告诉你是哪个评分因子导致的——而修复办法几乎总是让数学更准确,而非更不准确,因为把98.1%的交付率通过置信度加权压到16.8,既不公平也不正确。
人们也会问我,为什么现在就很紧迫,明明采购AI感觉还处于早期。它确实还早——而这恰恰就是那个窗口期。放眼整个行业,49%的采购团队正在运行AI试点,但只有4%实现了有意义的部署。瓶颈不在技术。而在信任。领导层不会为他们无法向利益相关者或监管者证明其合理性的自主供应商评分开绿灯。公平性证据不是部署之后才拴上去的可有可无之物。对许多组织而言,它正是解锁部署的那个东西。
第三个问题总是关于多元化发现工具——拥有2000万供应商数据库的Supplier.io、Tealbook、Fairmarkit。它们不是已经解决了这个问题吗?没有。它们帮你找到多元化供应商。但它们中没有一个会审计:一旦这些供应商进入漏斗,你的评分算法是否给了他们公平的机会。找到一家合格的少数族裔所有的供应商,然后任由置信度加权把他们埋在71分,这不是进步。这只是通往同样排斥的一条更高效的路径。
那堵没人想筑起的墙
我一次又一次回到那张紧固件评分卡。五家供应商,一次例行的采购事件,以及一段悄悄裁定表现更好的供应商理应落败的数学——不是因为有谁想要那样,而是因为算法把熟悉误当成了优秀。
这就是采购AI中偏见的问题所在。它不是以偏见的面目登场。它是以一个置信区间、一个交易笔数、一个看起来完全合理的25%权重的面目登场。每一步都站得住脚。它筑起的那堵墙却站不住脚。
你无法用意图为自己开脱,你也无法通过把天平往另一边倾斜来修复它——我试过了,而法律禁止它是对的。你只能做一件事:衡量它,证明它,并让那份证据成为你可以毫不畏缩地交给审计员的东西。这种衡量而非修正的立场,正是我们在Veriprajna所构建的全部。你的采购AI很快。当一家被略过的供应商第一次问起为什么时,唯一将真正重要的问题,是你能否证明它是公平的。如果你能拿出差异比以及产生它的那份审计,你就有了答案。如果拿不出,你面对的就不是公平性问题——而是一个等待传票的取证问题。


