ציות לתמחור בינה מלאכותית והוגנות אלגוריתמית

האלגוריתם לעולם אינו רואה גזע או הכנסה. הוא רואה מיקוד ומכשיר. אותו מוצר, אותות ביקוש מותאמים. מחיר גבוה ב-26%.

כאשר ה-Civil Investigative Demand (CID) מגיע, התשובה צריכה להיות קובץ. Equity היא שכבת ביקורת להגנה על תמחור שיושבת מעל כל מנוע תמחור שקמעונאי כבר מפעיל. היא משחזרת את יומן ההחלטות של המנוע עצמו, מדרגת כל קלט תמחור עבור דליפת קבוצה מוגנת כולל הפרוקסיז המורכבים שבדיקות ברמת המאפיין הבודד אינן מסוגלות לראות. היא בוחנת את התוצאה מול ה-EEOC four-fifths rule (29 CFR 1607.4(D)) בקוד דטרמיניסטי, מודדת מהי עלות אילוץ ההוגנות בהכנסות, מראה מדוע התיקון הברור מאליו נתון למניפולציה, וחותמת את הרשומה לתוך מארז ראיות מגובה hash מסוג SHA-256 וממופה לרגולציה, שנבנה בדיוק עבור דרישה זו.

+26.2%

מחיר גבוה יותר עבור קוהורט של אזורי מיקוד עם רוב למיעוטים ומכשירים ישנים, עבור אותו SKU

ממוצעי קוהורט על פני 3,037 ו-2,880 החלטות סינתטיות עם seed, אותות ביקוש מותאמים

0.43 to 0.82

יחס EEOC four-fifths rule (29 CFR 1607.4(D)), מכישלון למעבר, לאחר עיצוב תגמול מודע-הוגנות

בעלות הכנסות מדודה של 1.3% במנוע ותרחיש סינתטיים אלה

0.73

מידע הדדי משותף של פרוקסי מורכב ששני רכיביו עוברים כל אחד בנפרד

Referral × Dwell Time; השמטת ZIP ומכשיר בלבד עדיין נכשלת בשער ב-0.59

כל נתון הדגמה בעמוד זה הוא סינתטי ונוצר מ-seed. מנוע ShopMart Dynamic Pricing הוא contextual bandit מסוג LinUCB שבנינו כממלא מקום למנוע שלקוח יפעיל, ה-Aura Wireless Earbuds ו-10,000 הקונים מיוצרים, ומבנה הפרוקסי נשתל כדי שלביקורת יהיה משהו אמיתי לתפוס. שום קמעונאי אמיתי לא בוקר ושום קונה אמיתי לא חויב ביתר.

רגולטורים הפסיקו להזדקק לכוונת מכוון. האכיפה נשענת כעת על מה שהמנוע ביצע, וצוות תמחור שמעולם לא תיעד את הנתונים הנכונים אינו יכול להוכיח זאת.

יועץ משפטי ראשי או מנהל תמחור בפלטפורמת מסחר אלקטרוני עם נפחי פעילות ב-New York וב-California מפעיל מנוע תמחור דינמי שלעולם אינו קולט גזע או הכנסה ועדיין חשוף, מכיוון שהמנוע מתמחר לפי מיקוד (ZIP code), רמת מכשיר והתנהגות הפעלה, וכל אחד מאלה נושא אות דמוגרפי. מודל contextual bandit הממטב הכנסות ימצא כל קלט החוזה נכונות לשלם, כולל אלה שבאמת חוזים מיהו הקונה. מיקוד חוזה הכנסה; הכנסה חוזה רגישות למחיר; טלפון Android ישן חוזה פחות השוואת מחירים. אף אחד מאלה אינו גזע. כולם נעים יחד איתו. עד שה-Civil Investigative Demand (CID) מגיע, צוות ללא שום תיעוד כזה מבזבז חודשים בחילוץ פורנזי תגובתי.

תיק ה-FTC הוכרע על פי מה שהאלגוריתם עשה

הסדר הפשרה בסך $60M של ה-FTC עם Instacart בנוגע לניסויי התמחור של Eversight (דצמבר 2025 ,FTC) היה הליך מבוסס-תוצאה. התלונה תיעדה קונים שונים שנחשפו למחירים שונים עבור פריטים זהים, בפערים של עד 23%. זו לא הייתה קביעה של אפליה קבוצתית, והיא לא הייתה תלויה במה שהוזן לאלגוריתם.

חובות גילוי והערכת השפעה כבר מופיעות בספר החוקים

חוק New York's Algorithmic Pricing Disclosure Act, שנכנס לתוקף ב-November 10, 2025, מחייב גילוי בולט לעין כאשר נתונים אישיים משפיעים על מחיר ונושא קנס אזרחי של עד $1,000 לכל הפרה. חוק Colorado SB 24-205, שנכנס לתוקף ב-June 30, 2026, מתייחס לתמחור כהחלטה בעלת השלכות מהותיות (consequential decision) המחייבת הערכת השפעה.

חובות האיחוד האירופי חלות החל מ-August 2, 2026, בצמוד לתקרה סטטוטורית

חובות הסיכון הגבוה של ה-EU AI Act חלות החל מ-August 2, 2026. סעיפים EU AI Act (Articles 13 and 14) מכסים שקיפות בסיכון גבוה ותיעוד נגד אפליה, ואי-ציות בסיכון גבוה גורר ענישה עד למקסימום סטטוטורי של €15M או 3% מהמחזור הגלובלי.

כל נתון סטטיסטי, כל פסק דין וה-hash מתקיימים בקוד דטרמיניסטי. הסוכנים כותבים פרוזה ואינם יכולים לגשת לאף אחד מהם.

הצינור הוא מעבר יחיד על יומן ההחלטות של המנוע עצמו: 10,000 החלטות תמחור מהמנוע המבוקר, ביקורת קלטים דטרמיניסטית, שער ארבע-חמישיות, סינתזת אילוץ הוגנות בהשוואה לתקרה הניתנת למניפולציה, ניסוח הסברים בידי סוכנים, מארז ראיות מגובה hash מסוג SHA-256 ומבחן ביצועים מתויג (benchmark). סוכנים מייעצים, קוד מחליט, וההפרדה הזו היא ששומרת על המארז כשיר להגשה משפטית ללא תלות במודל היושב מתחתיו.

01 / המנוע המבוקר

מודל bandit מיטבי-הכנסות שלעולם אינו רואה את המאפיין המוגן

המנוע המבוקר הוא ShopMart Dynamic Pricing, מודל contextual bandit מסוג LinUCB בעל 7 זרועות עם seed=42, המתמחר SKU יחיד, ה-Aura Wireless Earbuds במחיר מחירון של $79.00, עבור אוכלוסייה מתויגת סינתטית של 10,000 קונים. הוא מתמחר לפי מדד הכנסה לפי מיקוד (ZIP income index), רמת מכשיר, מקור הפניה (referral), זמן שהייה (dwell time), גודל עגלה, שיעור קנייה חוזרת, מספר הפעלות, חברות פרימיום ושעה, בתוספת איברי הצלבה של הפניה כפול שהייה מהסוג שמנועים אמיתיים רבים כוללים. הקוהורט המוגן הוא תווית סמויה שהביקורת אינה מקבלת לעולם. בהדגמה, מודל bandit זה הוא המנוע המבוקר.

02 / ביקורת הקלטים הדטרמיניסטית

שלושה ציונים לכל קלט, וציון רביעי שמזהה זוגות

הפעלת Run Audit מחשבת, ב-numpy טהור, את מתאם פירסון המוחלט של כל קלט תמחור מול הקוהורט המוגן, את המידע ההדדי המנורמל שלו, מידע הדדי משותף עבור זוגות מאפיינים, ותנועת מחיר נגדית-עובדתית (counterfactual): דריסת קלט יחיד עבור הקוהורט המוגן בערך הייחוס של הקוהורט המועדף, השארת כל השאר קבוע, הרצה חוזרת של מדיניות המנוע עצמו ומדידה של מידת התזוזה במחיר של הקוהורט המוגן. כללי פסק הדין הם קוד, הנבדקים לפי סדר: קלט שהמדגם האפקטיבי שלו נמוך מ-400 מוחזר כ-Insufficient Evidence במקום לקבל פסק דין של פרוקסי, כלל שאף קלט בהרצה זו אינו מפעיל; אות מועדון לקוחות בעל שימוש כפול עם זיקה מהותית כלשהי מסווג כ-ABSTAIN ומנותב לסקירה משפטית לפני הרצת בדיקת ההפרה; מתאם מוחלט של לפחות 0.30 או מידע הדדי של לפחות 0.05 הוא VIOLATION; מתאם מ-0.20 ועד 0.30 הוא ABSTAIN; כל השאר הוא PASS. עבור כל קלט אחר, הניתוח הנגדי-עובדתי מאמת ולעולם אינו מפעיל פסק דין בפני עצמו; רק עבור אות השימוש הכפול תנועה נגדית-עובדתית מהותית נחשבת לטובת ה-ABSTAIN.

03 / השער והאילוץ

תקן משפטי חיצוני, ולאחריו תיקון ללא גבול הניתן למניפולציה

שער ההשפעה השונה (Disparate-Impact Gate) מחיל את ה-EEOC four-fifths rule (29 CFR 1607.4(D)) המותאם למדרגות מחיר: שיעור קבלת מדרגת המחיר המועדפת של הקוהורט המוגן חלקי זה של הקוהורט המועדף, מול סף של 0.80. לאחר מכן, שלב ה-Remediation מסנתז עיצוב תגמול מודע-הוגנות (Fairness-Aware Reward Shaping), המושך כל מחיר באופן רציף לעבר מחיר ייחוס נקי מפרוקסי ממודל bandit שני שאומן ללא ארבעת קלטי הפרוקסי, ומבצע חיפוש בינארי אחר משקל המשיכה הקטן ביותר שעובר את הסף של 0.80. הוא מוצג לצד קו בסיס של תקרה קשיחה (Hard-Cap Baseline) ב-115% מהמחיר ההוגן, התיקון הנאיבי, כאשר חתימת המניפולציה (gaming signature) נמדדת עבור שניהם.

04 / הצוות והמארז

הסבר מילולי מלמעלה, רשומה חתומה מלמטה

תפקיד Feature Auditor מסביר כל קלט שסומן ו-Adversarial Challenger טוען בעד התייחסות לקלט שנמנע (abstained) כאות לגיטימי; תפקיד Regulatory Mapper הוא טבלה קבועה המצמידה כל VIOLATION לחמישה משטרים ואת ה-ABSTAIN לשורת סקירה משפטית יחידה. צוות הסוכנים ניתן להחלפת ספק, נסוג לתבניות דטרמיניסטיות כאשר לא מוגדר ספק מודל כך שהאפליקציה פועלת באופן זהה, ואינו יכול לחשב מספר או לקבוע פסק דין. לחיצה על Evidence Pack חותמת את שם המנוע וגרסתו, האוכלוסייה המבוקרת, השער, כל ממצא עם הנימוק שלו, המיפוי הרגולטורי, תוצאת התיקון וסיכום ההסברים לתוך JSON בתוספת מארז HTML להדפסה, עם תמצית SHA-256 של גוף המארז כ-hash המעיד על שיבוש.

הקונסולה כוללת שני מבטים בתוספת תיבות דו-שיח. המבט הידני מכיל את כרטיס Pricing Outcome Comparison ופאנל פעילות המזרים כל שלב; כל תוצאה נפתחת כתיבת דו-שיח בכותרת Audit Results,‏ Remediation Results או Evidence Pack Results, והכפתורים Remediation ו-Evidence Pack נשארים מושבתים עד להשלמת Run Audit. לחיצה על Run Benchmark עוברת למבט Benchmark Results נפרד. כפתור About Demo מציין את גבולות התרחיש על המסך: מנוע סינתטי עם ground truth ידוע, שתוצאותיו ממחישות את השיטה ואינן מהוות ראיה לכוונת מכוון שאומתה בשטח. כל מספר להלן נמצא בתוך גבולות אלה.

אותו מוצר, אותות ביקוש מותאמים, פער של 26%. כאן הביקורת מוצאת אותו, בוחנת אותו בשער, מתקנת אותו וחותמת אותו.

ההדגמה מבקרת 10,000 החלטות תמחור סינתטיות עם seed עבור SKU יחיד. להלן מה שההרצה מציגה על המסך, בסדר שבו היא מציגה זאת.

קונסולת Equity עם כרטיס Pricing Outcome Comparison פתוח לפני ביצוע ביקורת כלשהי. ערכת החלטות Decision Set A, Reference, מציגה את ה-Aura Wireless Earbuds במחיר מוצג של $74.06 מול מחירון של $79.00, עם הפרופיל המייצג ZIP 10021 Upper East Side NYC, מכשיר iPhone חדש, סל של 3 פריטים עם הפניה אורגנית, תג Reference Cohort ירוק, וכותרת תחתונה שבה נכתב Matched Cohort · n=2,880 ו-No Proxy Lift. ערכת החלטות Decision Set B, Exposed, מציגה את אותן אוזניות ב-$93.47 עם הפרופיל ZIP 10456 South Bronx NYC, מכשיר Android ישן, תג Proxy Risk Identified אדום וכותרת תחתונה שבה נכתב Matched Cohort · n=3,037 ו-Review Required. ביניהן שונות מדודה של +26.2% מתויגת בתור Same SKU, Matched Demand Signals. כפתורי הכותרת מציגים About Demo,‏ Run Benchmark,‏ Remediation,‏ Evidence Pack ו-Run Audit, ופס כותרת משנה בתחתית מציין כי Set A is a high-income-zip, new-device cohort.
כרטיס זה מוצג על המסך לפני שרצה פעולה כלשהי: שני קוהורטים מותאמים, SKU יחיד. קוהורט אזור המיקוד בעל ההכנסה הגבוהה והמכשירים החדשים רואה מחיר של $74.06; קוהורט אזור המיקוד עם רוב למיעוטים והמכשירים הישנים רואה מחיר של $93.47, פער של 26.2% על אותן אוזניות עם אותות ביקוש מותאמים. אלה ממוצעי קוהורט על פני 2,880 ו-3,037 החלטות סינתטיות, ולא שני קונים שנבחרו בקפידה (cherry-picked), והמיקוד (ZIP) והמכשיר בכל כרטיס הם הפרופיל המייצג של הקוהורט; הקוהורטים עצמם משתרעים על פני מספר מיקודים ושתי משפחות המכשירים. למנוע שיצר פער זה מעולם לא נאמר דבר שעורך דין היה מזהה כמוגן.
תיבת הדו-שיח Audit Results המציגה את טבלת Input Audit: Which Features Are Demographic Proxies? עם העמודות Pricing Input,‏ |r| vs Protected,‏ Mutual Information,‏ Counterfactual ו-Verdict. השורה Zip Income Idx מציגה 0.95, 1.00, +7.8%, VIOLATION. השורה Device Tier מציגה 0.32, 0.08, +2.9%, VIOLATION. השורה Referral × Dwell Time, המתויגת כ-Interaction, מציגה 0.00, 0.73, +1.7%, VIOLATION, כאשר הסמן נח עליה. השורה Premium Member מציגה 0.24, 0.04, -1.3%, ABSTAIN. השורות Referral,‏ Dwell Time,‏ Cart Size,‏ Repeat Rate,‏ Session Count ו-Hour כולן מציגות PASS. מקרא מתחת מציין Violation: Flagged Proxy,‏ Abstain: Routed To Legal Review,‏ Cleared: Legitimate Demand Signal, ולאחריו שלוש הערות של Feature Auditor.
המדדים Zip Income Idx ו-Device Tier הם הפרוקסיז הברורים מאליהם, עם מתאם פירסון של 0.95 ו-0.32. ביקורת לפי מאפיין בודד אינה מסוגלת להפיק את שורת ה-VIOLATION השלישית. המאפיין Referral לבדו מציג מתאם של 0.00 ומידע הדדי של 0.00, המאפיין Dwell Time לבדו מציג 0.17 ו-0.03, ושניהם מקבלים PASS. המידע ההדדי המשותף שלהם עם הקבוצה המוגנת הוא 0.73, רווח אינטראקציה של 0.71 מעל המאפיין הבודד הטוב ביותר. האוכלוסייה בנויה כך שהגעה אורגנית עם שהייה ארוכה והגעת השוואה עם שהייה קצרה מסמנות שתיהן את הקוהורט המוגן: אף קלט לבדו אינו מפריד בין הקבוצות, הצמד עושה זאת. תוכנית ציות המבקרת קלטים בזה אחר זה בודקת את האובייקט הלא נכון. גודל עגלה, שיעור קנייה חוזרת, מספר הפעלות ושעה מקבלים Cleared כאותות ביקוש לגיטימיים; הביקורת אינה מסמנת כל דבר שהיא רואה.
תיבת הדו-שיח Audit Results בגלילה לתחתיתה. למעלה יושבות שורות ה-PASS עבור Referral,‏ Dwell Time,‏ Cart Size,‏ Repeat Rate,‏ Session Count ו-Hour, מקרא פסקי הדין, שלוש הערות של Feature Auditor והערת Adversarial Challenger לגבי premium_member. מתחתיהן כרטיס Disparate-Impact Gate: EEOC Four-Fifths Rule מציג חוגה אדומה המורה על 0.43, Four-Fifths Ratio (Threshold 0.80), Fail, וארבעה אריחים: 36% Protected Cohort Receiving The Favorable Price Tier,‏ 83% Advantaged Cohort Receiving The Favorable Price Tier,‏ 64% Protected Cohort In The Highest Price Tier, ו-+15.6% Mean Overcharge: Protected Versus Advantaged.
השער מחיל תקן משפטי, המחושב בקוד, ומועדף כאן פירושו מדרגת המחיר שאינה הגבוהה ביותר. 36% מהקוהורט המוגן מקבלים אותה מול 83% מהקוהורט המועדף, ו-0.36 חלקי 0.83 שווה 0.434, הרבה מתחת לסף ארבע-החמישיות של 0.80 ב-29 CFR 1607.4(D). 64% מהקוהורט המוגן נמצאים במדרגת המחיר הגבוהה ביותר ותוספת המחיר הממוצעת (mean overcharge) היא 15.6% לאורך כל האוכלוסייה. מעל החוגה, ה-Adversarial Challenger טוען לטובת הטבת המועדון עבור Premium Member, קלט שהקוד כבר ניתב לסקירה משפטית. הקוד אינו מסמן ואינו מסיר אותו, וכלל פסק הדין קבע את ה-ABSTAIN לפני שהערה זו נכתבה. כפתור Show Audit Results משכתב את תג Set B בכרטיס Pricing Outcome Comparison ברגע שתיבת דו-שיח זו נפתחת; סגירתה גורמת לכרטיס להציג כעת Gate Failed, 0.43 < 0.80.
תיבת הדו-שיח Remediation Results בכותרת Fairness Constraint: From Detection To Remediation. אריח אדום מציג 0.43, Four-Fifths Before, Fail, Engine As Shipped; חץ מצביע על אריח ירוק המציג 0.82, Four-Fifths After, Pass, Revenue Cost -1.3%. למטה, עיצוב תגמול מודע-הוגנות (Fairness-Aware Reward Shaping), המתויג כ-Recommended Control, מפרט Four-Fifths Ratio 0.82 Pass,‏ Revenue Cost -1.3%,‏ Gaming Signature 2% ו-Pull Weight 0.65. לצידו, Hard-Cap Baseline (115% Of Fair Price) מפרט Four-Fifths Ratio 0.59 Fail,‏ Revenue Cost -0.2%,‏ Gaming Signature 29% Priced At The Cap ו-Verdict Gamed To The Boundary. האותיות הקטנות מציינות שתקרת סף ממוטבת עד לקצה שלה, שעיצוב תגמול מושך כל מחיר לעבר ייחוס נקי מפרוקסי מבלי ליצור גבול שניתן לתמרן, ושהשפעת ההכנסות ספציפית למנוע ולתרחיש סינתטיים אלה.
תקרה קשיחה ב-115% ממחיר הייחוס ההוגן עולה 0.2% מההכנסות ועדיין נכשלת בשער ב-0.59, מכיוון שממטב ההכנסות מתייחס לתקרה כאל יעד: 29% מהקוהורט המוגן מתומחרים מחדש בטווח של 1% ממנה, ותיבת הדו-שיח מכנה זאת Gamed To The Boundary. עיצוב תגמול מודע-הוגנות (Fairness-Aware Reward Shaping) מושך כל מחיר באופן רציף לעבר מחיר ייחוס נקי מפרוקסי, אינו מותיר למנוע קצה לתמחר מולו, ועובר את השער ב-0.82 עם משקל משיכה של 0.65 וחתימת מניפולציה של 2%. במנוע סינתטי זה הדבר עולה 1.3% מההכנסות, והאותיות הקטנות באפליקציה עצמה מציינות שהנתון ספציפי למנוע ולתרחיש אלה.
תיבת הדו-שיח Evidence Pack Results בכותרת CID-Ready Evidence Pack עם קישור Open Full Pack. חמישה אריחים מציגים 10 Inputs Audited And Recorded,‏ 0.43 Four-Fifths Ratio As Shipped,‏ 0.82 Four-Fifths Ratio After Remediation,‏ 4 Findings Mapped To Regulation ו-<2s Evidence-Pack Generation Time. מתחתיהם שורת אותיות קטנות על המיפוי הרגולטורי והיות הרשומה append-only ומוגנת משיבוש (tamper-evident), תיבת hash מסוג SHA-256, ושורת נתיב שמירה המציינת את data/cid_evidence_pack.json ו-data/cid_evidence_pack.html. כפתורי הכותרת מציגים כעת Remediation Complete,‏ Pack Exported ו-Rerun Audit.
תיבת דו-שיח זו היא הקבלה. המארז מתעד 10 קלטים שבוקרו, את השער כפי שנמסר ולאחר תיקון, ו-4 ממצאים הממופים לרגולציה: שלוש תוצאות ה-VIOLATION שכל אחת מהן מוצמדת לחמשת המשטרים במיפוי הרגולטורי של המארז, וה-ABSTAIN המוצמד לשורת סקירה משפטית יחידה. ה-hash הוא תמצית SHA-256 של גוף המארז: חותם המעיד על שיבוש המשתנה בכל ייצוא מכיוון שהמארז נושא את זמן יצירתו. האריח <2s הוא התווית של תיבת הדו-שיח לבנייה שהיא מיידית למעשה, ולא תזמון benchmark.
מארז הראיות להדפסה פתוח בלשונית דפדפן, בכותרת Pricing Defensibility: CID-Ready Evidence Pack. שורת כותרת מציינת את סכמת vp-cid-pack/1.0, את המנוע ShopMart Dynamic Pricing (contextual MAB) linucb-7arm seed=42, 10,000 החלטות מבוקרות והסבר מילולי שמור במטמון של claude-opus-4-8. תחת Disparate-Impact Gate (EEOC four-fifths) ארבעה אריחים מציגים Four-fifths ratio 0.43 threshold 0.8,‏ Favorable-tier rate protected 0.36 advantaged 0.83,‏ Protected in top tier 64% ו-Representative gap +26% Aura Wireless Earbuds. טבלת Findings מפרטת כל קלט עם פסק דין, |r|,‏ MI, ניתוח נגדי-עובדתי ונימוק, כאשר שורות VIOLATION צבועות באדום, שורות PASS בירוק ושורת ה-ABSTAIN של premium_member בענבר, ומסתיימת בשורת הפרוקסי המורכב referral × dwell_time. סעיף Regulatory Mapping מתחיל מתחתיה.
קישור Open Full Pack הוא הטופס שהיועץ המשפטי יקבל: אותו JSON המעובד כמסמך להדפסה, המפרט איזה מנוע ואיזו גרסת בנייה, כמה החלטות, נתוני השער, פסק הדין של כל קלט עם הנימוק שלו, והמיפוי הרגולטורי שורה אחר שורה. הכותרת מציינת שההסבר המילולי הגיע מפלט מודל שמור במטמון; כל מספר לצידו הגיע מהביקורת הדטרמיניסטית, ואותו seed משחזר אותם בכל הרצה. התשובה ל-Civil Investigative Demand (CID) הופכת לקובץ זה.
מבט Benchmark Results כשתיבת הדו-שיח Benchmark Results פתוחה מעליו, בכותרת Validation Benchmark: Labeled Evaluation Set. הערה מסבירה שמבנה הפרוקסי נשתל במערך סינתטי מתויג זה כך שניתן לנקד שחזור, הימנעות ותיקון מול ground truth שהביקורת אינה בודקת. ארבעה אריחים מציגים 100% Precision: Proxies Correctly Flagged,‏ 100% Recall: Planted Proxies Recovered,‏ 0 Legitimate Signals Incorrectly Flagged ו-1/1 Dual-Use Signals Correctly Abstained. למטה, Baseline: Fairness Through Unawareness מפרט Remove ZIP And Device Inputs,‏ Four-Fifths Ratio 0.59 Fails,‏ Reason Compound Proxy Still Leaks; לצידו Equity Constraint מפרט Four-Fifths Ratio 0.82 Pass,‏ Revenue Cost -1.3% ו-Hard-Cap Baseline 0.59 Fails. כפתור Back To Manual Testing יושב בפינה הימנית העליונה.
כפתור Run Benchmark הוא הבדיקה העצמית של השיטה, והיקפה מצוין בתיבת הדו-שיח עצמה. הוא בונה מחדש מאפס את אותה אוכלוסייה ואותו מנוע עם seed=42 ומנקד את הביקורת מול התוויות השתולות שלעולם אינו רואה: 3 of 3 פרוקסיז שתולים שוחזרו, 0 אותות לגיטימיים סומנו, 1 of 1 אותות בעלי שימוש כפול נמנעו. קו הבסיס לצידו הוא קו ההגנה הסטנדרטי: הסרת ZIP ומכשיר ואימון מחדש. היחס נע מ-0.43 ל-0.59 ועדיין נכשל, מכיוון שהפרוקסי המורכב שורד את המחיקה.

מה שההדגמה מראה, ומה שנשאר מחוצה לה.

המספרים לעיל מגיעים מאוכלוסייה סינתטית יחידה עם seed של 10,000 החלטות תמחור על SKU יחיד עם מבנה פרוקסי שתול וניתן לשחזור. הנתונים מראים שהשיטה משחזרת מבנה שתול בדיוק של מערך מתויג. הם אינם שיעור דיוק על נתוני תמחור אמיתיים, אינם benchmark מול מתחרים, ואינם טענה לגבי קמעונאי אמיתי כלשהו.

שאלהמה ש-Equity עושה בהדגמה זומה שנשאר מחוץ להדגמה
אינטגרציהמבצעת ביקורת על מודל ה-bandit מסוג LinUCB שאפליקציית ההדגמה נושאת כמנוע ממלא מקום, ומתוכננת כך שניתן להחליף במקומו מנוע של לקוח מאחורי מתאם.קוד מתאם כלשהו או מחבר חי לפלטפורמת תמחור. דבר מזה אינו קיים בגרסת בנייה זו, ואף ספק המוזכר בשמו אינו לקוח או שותף.
נתונים דמוגרפייםקוראת טבלת ייחוס אצורה של עשרה מיקודי New York ו-California והטיית מכשיר עם seed המקודדת קשיח באפליקציה.הזנה חיה של מפקד אוכלוסין או בעלות על מכשירים. הטבלה קטנה ונאצרה ידנית, והקוהורט המוגן הוא תווית שתולה.
ממצאיםמשחזרת את מבנה הפרוקסי השתול ומתעדת במארז את פסק הדין של כל קלט יחד עם הנימוק שלו.הוכחה לאפליה או כוונת מכוון בעולם האמיתי; המערכת אינה מנפיקה פסק דין של כוונת מכוון.

מה שהדגמה זו אינה עושה

מערכת Equity אינה קובעת מחיר עבור שום לקוח ואינה מחליפה את Pricefx,‏ PROS,‏ Zilliant או Competera; המנוע מתמחר, Equity מבקרת ומטילה אילוצים. היא אינה מסמיכה לציות, אינה מבטיחה מעבר ואינה מספקת ייעוץ משפטי; המארז הוא ראיה עבור היועץ המשפטי של הלקוח. גרסת בנייה זו מכסה SKU יחיד ואת מסלול ההשפעה השונה (disparate-impact) מביקורת ועד מארז ראיות; תיאום מחירים אלגוריתמי (algorithmic collusion), תווכת גילוי רב-תחומית, ניטור בזמן אמת וממשק תשלום (checkout) נמצאים מחוצה לה. הפרופילים South Bronx ו-Upper East Side בכרטיס Pricing Outcome Comparison הם תוויות מייצגות עבור קוהורטים מרובי מיקודים ומרובי מכשירים, ולא טענות לגבי שכונה אמיתית כלשהי.

מה שמובילים משפטיים ומובילי תמחור שואלים לפני הטמעת שכבת ביקורת מעל המנוע.

מודל התמחור שלנו לעולם אינו משתמש בגזע או בהכנסה. כיצד הוא יכול להיות מפלה?

מכיוון שהמנוע אינו צריך לראות גזע או הכנסה כדי לתמחר לפיהם. בהדגמה, המנוע המבוקר מתמחר לפי מדד הכנסה לפי מיקוד (ZIP income index), רמת מכשיר והתנהגות הפעלה, וקלטים אלה נושאים את הקבוצה המוגנת: מדד ההכנסה לפי מיקוד נמצא במתאם של 0.95 איתה ורמת המכשיר במתאם של 0.32. התוצאה באוכלוסייה הסינתטית עם ה-seed היא מחיר גבוה ב-26.2% עבור קוהורט אזור המיקוד עם רוב למיעוטים והמכשירים הישנים על אותן אוזניות עם אותות ביקוש מותאמים, ויחס ארבע-חמישיות של 0.43 מול סף של 0.80. הליך ה-FTC נגד Instacart היה תיק מבוסס-תוצאה לגבי קונים שונים שראו מחירים שונים עבור פריטים זהים, ולא קביעה לגבי מה שנמסר לאלגוריתם.

כבר הסרנו את המיקוד (ZIP code) מהמודל. האם זה לא מספיק?

במנוע זה, לא. קו הבסיס של הוגנות מתוך אי-מודעות (Fairness Through Unawareness) במבחן הביצועים מאמן מחדש ללא קלטי המיקוד והמכשיר, ויחס ארבע-החמישיות עולה רק מ-0.43 ל-0.59, ועדיין נכשל. האופן שבו הקונה הגיע ומשך הזמן שבו שהה עוברים כל אחד בנפרד, אך יחד הם מקודדים את הקוהורט במידע הדדי של 0.73. מתאם לפי מאפיין בודד עיוור לצמד זה; בדיקת מידע הדדי משותף אינה עיוורת, וזו הסיבה שהביקורת מנקדת אינטראקציות בנוסף לקלטים בודדים.

האם איננו יכולים פשוט להגביל מחירים באחוז מסוים מעל קו הבסיס?

אפשר, וההדגמה מראה מה עושה עם זה ממטב הכנסות. קו הבסיס של תקרה קשיחה (Hard-Cap Baseline) אוסר על כל מחיר מעל 115% ממחיר הייחוס ההוגן. המנוע מוותר על 0.2% מההכנסות כדי לעמוד בלשון הכלל ומציב 29% מהקוהורט המוגן בטווח של 1% מהתקרה, כך שיחס ארבע-החמישיות מגיע רק ל-0.59 והשער עדיין נכשל. תקרה היא מטרה. לעיצוב תגמול מודע-הוגנות (Fairness-Aware Reward Shaping) אין גבול לכוון אליו, והוא עובר ב-0.82 בעלות הכנסות של 1.3% במנוע סינתטי זה.

האם זה מחליף את Pricefx או PROS? איננו מחליפים את מנוע התמחור שלנו.

לא. Equity לעולם אינה קובעת מחיר. היא מבקרת את החלטות המנוע ומציעה אילוץ; המנוע שלכם, בין אם Pricefx,‏ PROS,‏ Zilliant,‏ Competera או מודל bandit מותאם אישית, ממשיך לבצע את התמחור. נקודת החיבור למנוע של לקוח היא נקודת החלפה מתועדת; בהדגמה אין קוד מתאם ואין אינטגרציה חיה, כך שמודל ה-LinUCB bandit שבנינו הוא המנוע, והוא מבוקר ישירות.

משולב כאן LLM. כיצד זה מחזיק מעמד בהליכי גילוי מסמכים (discovery)?

שום דבר שעורך דין יצטרך להגן עליו אינו פלט מודל: הנתונים הסטטיסטיים, השוואת הסף, כל פסק דין, האילוץ וה-hash של המארז מגיעים כולם מקוד numpy דטרמיניסטי מחוץ לשכבת הסוכנים. ה-Feature Auditor וה-Adversarial Challenger כותבים פרוזה; הם לעולם אינם מחשבים מספר ואינם יכולים לקבוע או לשנות פסק דין, והמיפוי הרגולטורי הוא טבלה קבועה ולא פלט מודל. ללא ספק מודל, צוות הסוכנים נסוג לתבניות דטרמיניסטיות והאפליקציה מפיקה את אותם פסקי דין בדיוק. ההסבר המילולי בהדגמה המוקלטת הוא פלט מודל מאומת ושמור במטמון, וכותרת המארז מציינת זאת.

מה אנחנו מוסרים בפועל לעורכי הדין שלנו כאשר ה-Civil Investigative Demand (CID) מגיע?

מארז ראיות מוכן ל-CID בפורמט JSON וב-HTML להדפסה. הוא מתעד את שם המנוע וגרסתו, 10,000 ההחלטות שבוקרו, שער ארבע-החמישיות לפני ואחרי התיקון, פסק הדין של כל קלט יחד עם הנימוק שלו, מיפוי כל קלט שסומן ל-EEOC four-fifths rule (29 CFR 1607.4(D)), לחוק Algorithmic Pricing Disclosure Act של ניו יורק, לחוק Colorado SB 24-205, לסעיפי EU AI Act (Articles 13 and 14) ול-FTC Act Section 5, את תוצאת התיקון ותמצית SHA-256 של גוף המארז. אנו מספקים את הראיות; הצוות המשפטי שלכם מקבל את ההחלטה.

אתם מציגים 100% דיוק ורגישות (precision and recall). האם זה מספר דיוק אמיתי?

זו בדיקה עצמית על מערך מתויג, וכך יש לקרוא אותה. מבחן הביצועים מייצר מחדש את האוכלוסייה הסינתטית בת 10,000 ההחלטות עם ה-seed של ההדגמה ושואל אותה שאלה אחת: האם הביקורת מצאה את שלושת הפרוקסיז ששתלנו ולא שום דבר אחר? היא אכן מצאה. כל השלושה סומנו, אף אחד מארבעת אותות הביקוש הלגיטימיים לא סומן, והאות היחיד בעל השימוש הכפול סווג כנמנע (abstained) במקום שיסומן או יקבל Cleared. הדבר מראה שהשיטה משחזרת מבנה שתול. יומני תמחור אמיתיים כוללים משתנים מתערבבים (confounded), ואינך יכול אתית לבצע מבחני A/B שבהם קבוצות דמוגרפיות מחויבות במחירים שונים, ולכן בהתקשרות אמיתית אותה מערכת מייצרת ראיות לסקירה משפטית, לעולם לא פסק דין אוטומטי.

מחקר טכני

המחקר שמאחורי הדגמה זו — הארכיטקטורה, תכנון האימות והמתווה הארגוני.

רשתות חברתיות

פורסם גם ב

התחילו עם הקלטים שמנוע התמחור שלכם כבר משתמש בהם, וגלו מי מהם נושא את הקבוצה המוגנת.

אנחנו צוות הנדסת AI, לא ספק תמחור ולא גוף המסמיך לציות. אנו מתחילים מיומן ההחלטות של המנוע שלכם ומסיימים במארז שהיועץ המשפטי שלכם יכול להגיש; ההחלטה לגבי מה שהוא מראה נשארת בידיו.

שיחה ראשונה מועילה היא שיחה קונקרטית: איזה מנוע מתמחר את הקטלוג שלכם, אילו קלטים הוא רואה, האם הוא כולל איברי הצלבה או עצים שעלולים לתמחר לפי פרוקסי מורכב, ובאילו מבין New York,‏ California,‏ Colorado או האיחוד האירופי נפח הפעילות שלכם נוגע. נוכל לעבוד על הביקורת, סינתזת האילוצים ומבנה מארז הראיות יחד עם צוותי התמחור, המשפט והנתונים שלכם.

הערכת חשיפה לפרוקסי תמחור

  • ✓ קלטים שלפיהם המנוע מתמחר, ומי מהם נושא אות דמוגרפי
  • ✓ פרוקסיז מורכבים שבדיקות לפי מאפיין בודד מחמיצות
  • ✓ קריאת ארבע-חמישיות על יומן ההחלטות שלכם, כראיה ליועץ המשפטי
  • ✓ משטרים רגולטוריים שנפח הפעילות שלכם נוגע בהם בפועל

בניית שכבת הביקורת וההוכחה

  • ✓ ביקורת קלטים דטרמיניסטית עם שחזור נגדי-עובדתי
  • ✓ שער השפעה שונה (disparate-impact) בקוד פשוט
  • ✓ אילוץ הוגנות עם עלות הכנסות מדודה
  • ✓ מארז ראיות מגובה hash מסוג SHA-256 וממופה לרגולציה