AI 定價合規與演算法公平性
當 Civil Investigative Demand (CID) 到達時,回應應當是一份檔案。Equity 是一個定價可防禦性稽核層,架構於零售商既有的任何定價引擎之上。它重播引擎自身的決策日誌,為每個定價輸入評估受保護群體資訊洩漏,包含單一特徵檢查無法察覺的複合代理變數。它在確定性程式碼中對照 EEOC four-fifths rule 把關結果,衡量公平性限制在營收上的成本,展示顯而易見的修正方法為何會被操弄,並將紀錄封裝進一份經過 SHA-256 雜湊、對應法規、專為該調查要求打造的證據包中。
+26.2%
相同 SKU,少數族裔佔多數 ZIP 與舊裝置群組面臨更高價格
3,037 與 2,880 次帶種子合成決策的群組平均值,匹配的需求訊號
0.43 到 0.82
在具備公平意識的獎勵形塑後,EEOC four-fifths ratio 從 Fail 轉為 Pass
在此合成引擎與情境下,經衡量的營收成本為 1.3%
0.73
兩個組成部分各自通過的複合代理變數之聯合互資訊
Referral × Dwell Time;單獨移除 ZIP 與裝置仍以 0.59 未能通過把關
本頁面上的每項示範數據皆為帶種子的合成數據。ShopMart Dynamic Pricing 是我們建置作為客戶所運行引擎替身的 LinUCB 上下文老虎機,Aura Wireless Earbuds 與 10,000 名購物者皆為生成數據,且植入了代理結構,讓稽核有實質對象可供偵測。未對任何真實零售商進行稽核,亦無任何真實購物者被超收費用。
在具備 New York 與 California 業務量的電子商務平台上,總法律顧問或定價主管所運行的動態定價引擎從未納入種族或收入,卻依然暴露於風險之中,因為引擎依據郵遞區號、裝置等級與工作階段行為進行定價,而這些輸入項每一項都帶有人口統計訊號。追求營收最佳化的上下文老虎機會找出能預測支付意願的每一項輸入,包括那些實際上預測購物者身分的特徵。ZIP 預測收入;收入預測價格敏感度;舊款 Android 手機預測較少的比價行為。這些都不是種族。但全部都隨種族連動。當 Civil Investigative Demand (CID) 送達時,沒有這類紀錄的團隊將耗費數月進行被動的鑑識提取。
FTC 就 Eversight 定價實驗與 Instacart 達成的 $60M 和解協議(FTC,2025 年 12 月)是一項基於結果的執法行動。訴狀記錄了不同購物者在相同商品上看到不同的價格,差距高達 23%。這不是針對基於群體歧視的裁定,也不取決於演算法被告知了什麼。
New York 的 Algorithmic Pricing Disclosure Act 於 November 10, 2025 生效,規定個人資料影響價格時必須進行顯著揭露,每次違規可處最高 $1,000 的民事罰款。Colorado SB 24-205 於 June 30, 2026 生效,將定價視為需要進行影響評估的重大決定。
EU AI Act 的高風險義務自 August 2, 2026 起適用。EU AI Act (Articles 13 and 14) 涵蓋高風險透明度與反歧視文件記錄,高風險違規處罰最高可達法定上限 €15M 或全球營業額的 3%。
此管線是對引擎自身決策日誌的單次處理:受稽核引擎的 10,000 次定價決策、確定性輸入稽核、four-fifths 把關、與可操弄上限對照比較的公平性限制合成、代理人旁白、SHA-256 雜湊證據包,以及標註基準。代理人提供建議,程式碼做出決定,無論底層採用哪種模型,這種劃分正是讓證據包具備呈遞效力的關鍵。
01 / THE ENGINE UNDER AUDIT
受稽核引擎為 ShopMart Dynamic Pricing,這是一個以 seed=42 初始化的 7 臂 LinUCB 上下文老虎機,針對 10,000 名購物者的合成標註族群,為單一 SKU(牌價 $79.00 的 Aura Wireless Earbuds)進行定價。它依據 ZIP income index、device tier、referral、dwell time、cart size、repeat rate、session count、premium membership 與 hour 進行定價,再加上許多真實引擎所具備的 referral 與 dwell 交叉項。受保護群體為稽核從未接收的潛在標籤。在此示範中,此老虎機即為受稽核引擎。
02 / THE DETERMINISTIC INPUT AUDIT
Run Audit 以純 numpy 計算每個定價輸入對受保護群體的絕對 Pearson 相關性、正規化互資訊、特徵對的聯合互資訊,以及反事實價格變動:將受保護群體的某個輸入覆寫為優勢群體的參考值,保持其他一切不變,重新執行引擎自身的策略,並衡量受保護群體的價格變動幅度。裁決規則為程式碼,依序檢查:有效樣本低於 400 的輸入會作為 Insufficient Evidence 返回,而非給予代理變數裁決(本次運行中無任何輸入觸發此規則);具備任何實質關聯的雙重用途忠誠度訊號,會在違規測試執行前被判定為 ABSTAIN 並轉交法律審查;絕對相關性至少為 0.30 或互資訊至少為 0.05 者為 VIOLATION;相關性介於 0.20 至 0.30 者為 ABSTAIN;其他所有情況皆為 PASS。對於其他所有輸入,反事實僅作佐證,絕不單獨觸發裁決;僅對於雙重用途訊號,實質的反事實變動才會計入 ABSTAIN 裁決。
03 / THE GATE AND THE CONSTRAINT
Disparate-Impact Gate 套用適應於價格梯次的 EEOC four-fifths rule (29 CFR 1607.4(D)):以受保護群體獲得優惠價格梯次的比率除以優勢群體的比率,對照 0.80 的門檻。Remediation 隨後合成 Fairness-Aware Reward Shaping,將每個價格持續拉向來自第二個老虎機(在移除四個代理輸入後訓練而成)的無代理參考價格,並以二分搜尋法尋找通過 0.80 的最小拉力權重。它與設定在合理價格 115% 的 Hard-Cap Baseline(天真的修正方案)並列展示,並對兩者衡量其操弄特徵。
04 / THE CREW AND THE PACK
Feature Auditor 解釋每個被標記的輸入,Adversarial Challenger 則主張將棄權的輸入視為合法訊號的理由;Regulatory Mapper 角色是一張固定表格,將每個 VIOLATION 關聯至五種法規體系,並將 ABSTAIN 關聯至單一法律審查行。該團隊可替換模型提供者,在未設定模型提供者時可退回至確定性範本,使應用程式運行完全相同,且無法計算數字或設定裁決。Evidence Pack 將引擎名稱與版本、受稽核族群、把關機制、每項發現及其理由、法規對應、補救結果以及敘述摘要封裝成 JSON 加上可列印的 HTML 封包,並以封包內文的 SHA-256 摘要作為防篡改雜湊。
控制台包含兩個視圖加上對話方塊。手動視圖包含 Pricing Outcome Comparison 卡片以及串流每個階段的活動面板;每項結果都會以名為 Audit Results、Remediation Results 或 Evidence Pack Results 的對話方塊開啟,而在 Run Audit 完成前,Remediation 與 Evidence Pack 會保持停用狀態。Run Benchmark 會切換至獨立的 Benchmark Results 視圖。About Demo 在螢幕上說明了情境邊界:一個具有已知標準答案的合成引擎,其結果展示了方法論,並非經過實地驗證之意圖的證據。以下每個數字皆落在此邊界之內。
示範稽核了單一 SKU 上的 10,000 次帶種子合成定價決策。以下是運行時在螢幕上呈現的內容,依其顯示順序排列。







以上數字來自單一 SKU 上 10,000 次定價決策的帶種子合成族群,具有植入且可重現的代理結構。這些數據顯示該方法能以標註集合的精準度復原植入結構。它們不是真實定價數據上的準確率,不是針對競爭對手的基準測試,亦非針對任何真實零售商的指控。
| 問題 | Equity 在此示範中的作為 | 在此示範範疇之外的項目 |
|---|---|---|
| 整合 | 稽核示範應用程式所附帶作為替身引擎的 LinUCB 老虎機,其架構設計使客戶的引擎可在適配器後方進行替換。 | 任何適配器程式碼或即時定價平台連接器。此建置版本中不存在任何連接器,且文中提及的廠商皆非客戶或合作夥伴。 |
| 人口統計數據 | 讀取應用程式中寫入的十個 New York 與 California ZIP 的精選參考表,以及帶種子的裝置偏態。 | 即時人口普查或裝置持有數據串流。該表格規模小且為人工策劃,受保護群體亦為植入的標籤。 |
| 發現 | 復原植入的代理結構,並在封包中記錄每個輸入的裁決及其理由。 | 現實世界歧視或主觀意圖的證明;此機制不做出關於主觀意圖的裁決。 |
Equity 不為任何客戶設定價格,亦不取代 Pricefx、PROS、Zilliant 或 Competera;引擎負責定價,Equity 負責稽核與限制。它不證明合規、不保證通過審查,亦不提供法律建議;該證據包是提供給客戶法律顧問的證據。此建置版本涵蓋單一 SKU 以及從稽核到證據包的不利衝擊流程;演算法勾結、多法域揭露中介軟體、串流監控與結帳介面皆不在其範圍之內。Pricing Outcome Comparison 卡片上的 South Bronx 與 Upper East Side 個人檔案是多 ZIP、多裝置群組的代表性標籤,並非針對任何真實社區的陳述。
因為引擎不需要看到種族或收入就能依據它們定價。在此示範中,受稽核引擎依據 ZIP income index、device tier 與工作階段行為進行定價,而這些輸入項目帶有受保護群體資訊:ZIP income index 與其相關性達 0.95,device tier 達 0.32。在帶種子的合成族群上的結果顯示,在需求訊號匹配的相同耳機上,少數族裔佔多數 ZIP、舊裝置群組面臨高出 26.2% 的價格,且 four-fifths 比率為 0.43(相對於 0.80 門檻)。FTC 對 Instacart 的執法行動是一起針對結果的案件,涉及不同購物者在相同商品上看到不同的價格,而非針對演算法被告知了什麼內容的裁定。
在此引擎上,不夠。基準測試中的 Fairness Through Unawareness 基準在排除 ZIP 與裝置輸入後重新訓練,four-fifths 比率僅從 0.43 上升至 0.59,依然未通過。購物者如何造訪以及停留時間長短各自單獨通過檢查,但兩者結合卻以 0.73 的互資訊對該群組進行了編碼。逐特徵相關性對該特徵對視而不見;聯合互資訊檢查則能察覺,這正是為何稽核不僅評估單一輸入,還會評估交互作用的原因。
你可以這麼做,而示範展示了追求營收最佳化的機制會如何應對。Hard-Cap Baseline 禁止任何高於合理參考價格 115% 的定價。引擎放棄了 0.2% 的營收以符合條文字面要求,卻將 29% 的受保護群體定價於上限 1% 的範圍內,因此 four-fifths 比率僅達到 0.59,仍未通過把關。上限就是目標。Fairness-Aware Reward Shaping 沒有可鎖定的邊界,並在此合成引擎上以 1.3% 的營收成本在 0.82 通過把關。
不會。Equity 從不設定價格。它稽核引擎的決策並提出限制條件;您的引擎,無論是 Pricefx、PROS、Zilliant、Competera 或客製化老虎機,繼續負責定價。與客戶引擎的接合點是已記錄的文件化替換點;在此示範中沒有適配器程式碼,亦無即時整合,因此我們建置的 LinUCB 老虎機即為引擎,並直接接受稽核。
任何律師需要進行辯護的內容皆非模型輸出:統計數據、門檻比較、每項裁決、限制條件以及封包雜湊,全部來自代理層之外的確定性 numpy 程式碼。Feature Auditor 與 Adversarial Challenger 撰寫敘述文字;它們從不計算數字,亦無法設定或變更裁決,且法規對應為固定表格而非模型輸出。在沒有模型提供者的情況下,團隊會退回至確定性範本,應用程式會產生相同的裁決。錄製導覽中的旁白是經過驗證的快取模型輸出,封包標頭亦對此予以說明。
一份以 JSON 與可列印 HTML 呈現、可直接因應 CID 的證據包。它記錄了引擎名稱與版本、受稽核的 10,000 次決策、補救前後的 four-fifths 把關結果、每個輸入的裁決及其理由、每個被標記輸入與 EEOC four-fifths rule、NY Algorithmic Pricing Disclosure Act、Colorado AI Act SB 24-205、EU AI Act (Articles 13 and 14) 以及 FTC Act Section 5 的法規對應、補救結果,以及封包內文的 SHA-256 摘要。我們提供證據;裁量決定權由您的法務團隊掌握。
這是一項標註集合自我檢驗,應當被視為自我檢驗。該基準測試重新生成示範中帶種子的 10,000 次決策合成族群,並向其提出一個問題:稽核是否找出了我們植入的三個代理變數,且未標記其他任何項目?答案是肯定的。三個變數皆被標記,四個合法需求訊號均未被標記,而單一雙重用途訊號被棄權而非標記或清除。這表明該方法能復原植入的結構。真實的定價日誌充滿干擾因子,且在倫理上無法透過 A/B 測試對不同人口群體收取不同價格,因此在實際專案中,同一套機制產生的是供法律審查的證據,絕非自動化裁決。
我們是 AI 工程團隊,不是定價廠商,也不是合規認證機構。我們從您引擎自身的決策日誌開始,交付一份您的法律顧問可以呈遞的證據包;至於其所顯示內容的裁決權,始終屬於他們。
具成效的初次會談應當具體明確:哪款引擎為您的目錄定價、它檢視哪些輸入、是否帶有能依據複合代理變數定價的交叉項或決策樹,以及您的業務量涉及 New York、California、Colorado 或歐盟中的哪些法域。我們可以與您的定價、法務及數據團隊共同完成稽核、限制條件合成以及證據包格式設定。