採購供應商評分儀表板,儘管交付表現更佳,仍將得分 71 的供應商排在得分 92 者之下。
Artificial IntelligenceProcurementBusiness

你的採購 AI 給更優秀的供應商打了更低分——揭開背後作祟的那道數學

Ashutosh SinghalAshutosh Singhal2026年6月8日11 min

上一季,我曾花了一整個漫長的夜晚,盯著一張採購計分卡,而它打破了我在採購領域工作多年來一直抱持的一個假設。

那是一次例行的招標——工業緊固件,五家供應商,屬於那種沒人會為之失眠的品類。平台的 AI 依據交付、品質、財務穩定性與價格對它們進行了排名。供應商 A 是一家有十二年歷史的老牌供應商,背後累積了數千筆交易,得分為 92。一家擁有三年歷史、通過認證的少數族裔所有企業則得分 71。表面上看,這是個乾淨俐落的結果。老牌供應商憑實力勝出。翻頁過去就好。

只是我並沒有翻頁過去。我把交付子分數逐行拆解,而我的發現,正是我如今花時間建立採購 AI 公平性稽核以維生的原因。較小的那家供應商擁有更出色的準時交付率——98.1%,相比老牌供應商的 97.2%。然而它在交付項目上的得分反而更低。

表現更好的供應商,排名反而更差。這並不是因為模型對它們有偏見——而是因為數學本身有偏見。

資料所說的與分數所說的之間的那道落差,正是整個故事的核心。讓我帶你了解它是如何發生的、為什麼市面上沒有任何採購平台會替你修正它,以及要打造一個真正能修正它的東西,究竟需要什麼。

偏見不在模型裡,而在歷史裡。

兩張供應商面板:97.2% 涵蓋 4,200 筆交易,得分 24.1/25;98.1% 涵蓋 180 筆交易,得分 16.8/25。

以下是我花了太久才願意接受的部分:那個演算法裡沒有任何惡意。沒有人為多元化供應商編寫懲罰。這種偏見是以歷史支出資料進行訓練所帶來的結構性後果——而一旦你看見了它,就再也無法視而不見。

交付績效佔供應商分數的 25%,而 AI 將其計算為準時率,再按交易數量加權。老牌供應商在 4,200 筆交易中的 97.2%,產生了一個以信賴度加權的交付分數 24.1(滿分 25)。這家少數族裔所有的供應商在僅僅 180 筆交易中的 98.1%,卻只產生了 16.8。相同的指標。更好的原始數字。單單因為信賴度加權,就損失了八分。

接著,同樣的模式在各處反覆出現。品質評分依賴稽核頻率,而稽核頻率與合約量相關。財務穩定性評分把營收規模當作風險承受能力的替代指標。等到模型算到價格競爭力時,這道差距在數學上早已無法逾越。

這種排除具有自我強化的特性,這正是它醜陋之處。一家供應商得分較低,於是贏得的合約更少,於是累積的交易更少,於是它在下一週期的信賴度分數又更低。演算法正把更多的歷史資料等同於更可靠——而任何從未獲得機會累積這段歷史的供應商,都將為此永遠付出代價。

以你的支出歷史訓練出來的 AI,並不會預測出最好的供應商。它預測的是你早已使用過的供應商。

為什麼你的採購平台不會替你修正這件事?

我的第一直覺是顯而易見的那個:SAP、Coupa、GEP 或 Ivalua 想必早已處理好這件事了吧。它們正投入龐大的工程資源到 agentic AI。Joule 的競標分析代理(Bid Analysis Agent)會比較供應商的競標並推薦得標者。Coupa 的 Navi 以自然語言執行供應商探索,該公司單一季度就實現了約 150 億美元的客戶節省。Ivalua 推出了超過三十個開箱即用的 AI 代理。GEP 則在其整套採購到付款(source-to-pay)套件中都部署了 agentic AI。

於是我開始尋找公平性指標。差別性影響(disparate-impact)測試。以及它們如何針對自身評分引擎稽核不利影響的公開方法論。

一個都沒有。我查遍了全部四大平台。它們之中沒有任何一家公布供應商評分的公平性指標。 Coupa 在部落格文章中承認,AI 供應商應「展現偏見緩解」——但那句話背後並沒有任何有文件記載的稽核流程。它是一個談資,而非一項功能。

而老實說,一旦你理解了平台的經濟學,你就不再期待它了。這些供應商打造的是通用型評分,針對其整個客戶群的成本削減與風險緩解進行最佳化。要加入為你的分包目標、你的供應商品類、你的監管管轄權量身調校的公平性約束,將意味著要為他們所擁有的每一個客戶維護一套不同的模型配置。那不是產品路線圖。那是一場支援惡夢。

這件事有比「便利」更尖銳的一面。合約越來越常寫成把責任落在你身上,而不是供應商身上——聯邦法院一直在擴大 AI 的問責範圍,而平台協議悄悄地把風險轉移給客戶。因此,當一家被略過的供應商最終問起為什麼他們的分數是 71 時,被寫在稽核結果上的是你的名字,而不是 SAP 的。而且隨著這些代理變得越來越自主,情況只會更糟:當一個機器人自行觸發一筆得標或一筆付款——或者憑空捏造出一份從未存在過的幻覺協議時——合約早已確保責任是你的,而不是 AI 供應商的。平台給你的是速度。而公平性這一層——以及隨之而來的責任——從一開始就注定是你的。

我確信會奏效——結果卻沒有——的那個修正方案

我來跟你說說我做錯的那個版本,因為那是大多數團隊最先會採用的版本。

如果模型給較小型與多元化的供應商打了過低的分數,直覺上的修正就是往另一個方向按下天平。加入一個多元性調整。把通過認證的供應商加個幾分,以補償信賴度懲罰。我們草擬的正是這個方案。它感覺很公平。它感覺很有矯正意味。

那是一個陷阱,而揭穿它的並不是一個工程問題——而是一個法律問題。

在我們建構這個加分機制的同時,我也正在通讀我們的聯邦承包商客戶實際身處的監管環境,而它才剛剛變成一片雷區。一方面,FAR 第 19 部分要求承包商為小型企業、退伍軍人所有、服務致殘退伍軍人所有、HUBZone 以及女性所有的分包商達成各自獨立的百分比目標——而執法近來已趨嚴格。另一方面,2025 年 7 月簽署的第 14319 號行政命令,禁止聯邦採購帶有「意識形態偏見或社會議程」的 AI,並明確點名 DEI。

請靜下心來想一想。一家聯邦承包商如今在法律上被要求,依據一條規則要推進多元化供應商,同時又在法律上被禁止,依據另一條規則把社會議程植入採購 AI。我們的多元性加分——一個硬編碼、偏袒受保護類別、按在天平上的拇指——正是第 14319 號行政命令被撰寫來扼殺的那種東西。我們原本會交付一個披著解決方案外衣的合規責任。它撐不過第一次稽核。

在你透過加入另一種偏見來修正偏見的那一刻,你就打造出了一個在聽證會上無法為之辯護的東西。

那次失敗,正是為我重新框定了整個問題的關鍵。目標從來就不是讓 AI 偏袒任何人。目標是讓它明顯地不偏袒任何一方——並且拿出證明。

破解這道難題的那條招聘規則

五分之四規則長條圖:60% 非多元化,48% 下限,22% 多元化獲晉級,0.37 差距比。

轉捩點來自一條就我所知在採購界幾乎沒有人在應用的就業歧視規則。

EEOC 的五分之四規則——29 CFR 1607.4——規定任何群體的選取率都必須至少達到選取率最高群體的 80%。它是為招聘歧視而撰寫的。但供應商的選取在結構上與候選人選取完全相同:你有各種類別、晉級率以及一個門檻。同一套統計檢定可以直接套用進來。

於是我們用真實的評分輸出來執行這套檢定。如果一個 AI 讓 60% 的非多元化供應商通過評分門檻,五分之四規則就規定它必須讓至少 48% 通過認證的少數族裔與女性所有供應商也通過。而在以交易量加權的評分中,我們一再看到的實際比率更接近 22%。那是一個 0.37 的差距比——不到法定下限的一半。

那個數字並不是一個微弱的訊號。0.37 的差距比是不利影響的表面證據(prima facie evidence)——這與法院會套用在招聘歧視訴訟上的標準完全相同。這是那種會演變成合約損失與稽核結果、而不只是一份措辭強硬備忘錄的發現。

而這正是它比任何公平性加分都更重要的原因:五分之四檢定不偏袒任何人。它只是衡量。它給了我們一個同時滿足兩位主人的方法——向 FAR 第 19 部分的稽核員證明多元化供應商正獲得公平的機會,同時向第 14319 號行政命令的審查員證明,我們沒有在天平上加入任何意識形態的拇指。只有數學,對稱地套用,最後附上一個數字。

而這不僅僅是一個聯邦層級的問題。大多數州早已把多元性評分納入其採購評估之中——光是伊利諾伊州,就把一份 RFP 的技術分數中最高達 20% 導向供應商多元性——因此,同一個會讓聯邦稽核不通過的差距比,也悄悄地讓一個州級承包商流失掉它被明確要求去爭取的分數。五分之四檢定會跟著評分走到任何地方。

你要如何證明一個採購 AI 是公平的?

於是我們不再試圖修正任何人的模型,而是打造了一個位於其上的稽核層。這就是如今veriprajna.com/solutions/procurement-ai-fairness所在之處的核心:一個與供應商無關的公平性稽核工具,它能連接到 SAP Ariba、Coupa、GEP 或 Ivalua,讀取平台早已產生的供應商評分輸出,並針對差別性影響進行檢測。

與供應商無關是一個刻意的選擇,而非圖個方便。我們不碰平台的模型——我們不必碰,而且坦白說,我們不想承擔重新訓練別人評分引擎的責任。我們把 AI 的輸出當作受檢驗的對象:按供應商類別拉出選取率,計算五分之四差距比,分解出這道差距在評分堆疊中的哪一環產生(幾乎總是信賴度加權,幾乎從不是價格),並交給採購官一份他們可以帶進會議室的東西。

最後那一部分才是真正重要的交付成果。不是一個寫著「看起來沒問題」的儀表板。而是一份數學證明,證明 AI 對每一個供應商類別都一視同仁——或者一份具體、有來源佐證的發現,指出它並沒有做到,並點名差距比與那個違規的評分因子。一份 CPO 能擺在領導層面前、合規官能歸檔、稽核員無法揮手帶過的東西。

「這不就是一個配了計算機的 DEI 計畫嗎?」

這是我最常收到的反對意見,通常來自那些被監管的來回擺盪灼傷過、對任何聞起來像社會議程的東西都心懷戒備的人。這是個公允的問題,而答案是否定的——而這個區別,正是整個重點所在。

一個 DEI 計畫會預先認定某個結果是可取的,並朝它引導。而一個差別性影響稽核則什麼都不決定。它衡量的是選取率是否越過了一個法院會套用在歧視訴訟上、且早已確立的統計門檻。如果你的 AI 通過了五分之四檢定,稽核就會這麼說,你也就有了你的中立性證明。如果它未通過,稽核就會告訴你是哪一個評分因子導致了它——而修正方法幾乎總是讓數學更準確,而不是更不準確,因為把 98.1% 的交付率信賴度加權壓低到 16.8,既不公平也不正確。

人們也會問我,為什麼這件事現在就很急迫,畢竟採購 AI 感覺還很早期。而它確實還很早期——那正是那扇窗口。放眼整個產業,49% 的採購團隊正在進行 AI 試點,但只有 4% 達到了有意義的部署。瓶頸不在技術。而在信任。領導層不會替一套他們無法向利害關係人或監管者交代的自主供應商評分開綠燈。公平性證明並不是部署之後才附加上去的一項加分功能。對許多組織而言,它正是那個解鎖部署的關鍵。

第三個問題總是關於那些多元性探索工具——擁有兩千萬供應商資料庫的 Supplier.io、Tealbook、Fairmarkit。難道那些不是已經解決這個問題了嗎?並沒有。它們幫助你找到多元化的供應商。但它們之中沒有一個會稽核你的評分演算法在這些供應商進入漏斗之後,是否給了他們公平的機會。找到一家合格的少數族裔所有供應商,然後卻放任信賴度加權把他們埋沒在 71 分,這並不是進步。這是一條通往同樣排除結果、卻更有效率的路。

那道沒有人有意去築起的牆

我一再回到那張緊固件計分卡。五家供應商、一次例行招標,以及一段悄悄判定一家表現更好的供應商活該落敗的數學——不是因為有誰想要那樣,而是因為演算法把熟悉誤認為優秀

這就是採購 AI 中偏見的本質。它並非以偏見的姿態現身。它以一個信賴區間、一個交易計數、一個看起來完全合理的 25% 權重的姿態現身。每一步都站得住腳。它所築起的那道牆,卻站不住腳。

你無法靠意圖為那件事辯解脫身,你也無法靠把天平往另一邊傾斜來修正它——我試過,而法律禁止它是對的。你只能做一件事:衡量它、證明它,並讓那份證明成為你能毫不退縮地交給稽核員的東西。那種「衡量而非矯正」的立場,就是我們在Veriprajna所打造的一切的全部。你的採購 AI 很快。而唯一真正將起作用的問題——在第一次有被略過的供應商問起為什麼的時候——就是你能否證明它是公平的。如果你能出示差距比以及產生它的那份稽核,你就有了一個答案。如果你不能,那你面對的就不是一個公平性問題——而是一個等著傳票上門的證據開示問題。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。