AI 가격 책정 컴플라이언스 및 알고리즘 공정성
Civil Investigative Demand (CID)가 도착했을 때, 그 답변은 하나의 파일이어야 합니다. Equity는 소매업체가 이미 운영 중인 어떠한 가격 책정 엔진 위에도 배치되는 가격 방어성 감사 계층입니다. 이 시스템은 엔진 자체의 의사결정 로그를 재생하고, 단일 특성 점검으로는 확인할 수 없는 복합 프록시를 포함하여 보호 대상 계층(protected class) 정보 유출에 대해 모든 가격 책정 입력을 평가합니다. 또한 결정론적 코드로 EEOC four-fifths rule (29 CFR 1607.4(D))에 맞춰 결과를 검증하고, 공정성 제약 조건으로 인해 발생하는 매출 손실 비용을 측정하며, 명백해 보이는 수정 방식이 왜 악용(gamed)되는지 보여주고, 해당 조사 요구에 정확히 대응할 수 있도록 규제에 매핑된 SHA-256 해시 증거 팩으로 기록을 봉인합니다.
+26.2%
동일 SKU에 대해 소수 인종 다수 거주 우편번호(majority-minority-ZIP) 및 구형 기기 집단에 적용된 더 높은 가격
매칭된 수요 신호를 갖는 3,037건 및 2,880건의 시드 기반 합성 의사결정에 걸친 집단 평균
0.43 to 0.82
공정성 인식 보상 셰이핑(fairness-aware reward shaping) 적용 후 EEOC four-fifths ratio, Fail에서 Pass로 개선
이 합성 엔진 및 시나리오에서 측정된 매출 손실 비용 1.3%
0.73
각 구성요소는 통과하지만 결합 시 복합 프록시가 되는 두 요소의 결합 상호 정보량(Joint mutual information)
Referral × Dwell Time; ZIP 및 기기만 제거할 경우 여전히 0.59로 게이트 탈락
이 페이지의 모든 데모 수치는 시드 기반의 합성 데이터입니다. ShopMart Dynamic Pricing은 고객사가 운영할 엔진의 대역으로 자체 구축한 LinUCB contextual bandit이며, Aura Wireless Earbuds와 10,000명의 쇼핑객은 생성된 데이터이고, 감사 시스템이 실제 탐지할 수 있도록 프록시 구조가 의도적으로 심어져 있습니다. 실제 소매업체를 감사한 것이 아니며 실제 쇼핑객에게 초과 청구되지 않았습니다.
New York 및 California 고객을 보유한 전자상거래 플랫폼의 법무총괄(General Counsel)이나 가격 책정 책임자는 인종이나 소득 데이터를 수집하지 않는 동적 가격 책정 엔진을 운영하더라도 여전히 위험에 노출되어 있습니다. 엔진이 ZIP code, 기기 등급, 세션 행동을 기반으로 가격을 책정하며, 이들 각각이 인구통계학적 신호를 전달하기 때문입니다. 매출을 최적화하는 contextual bandit은 지불 용의를 예측하는 모든 입력을 찾아내며, 여기에는 쇼핑객이 누구인지를 실제로 예측하는 입력들도 포함됩니다. ZIP은 소득을 예측하고, 소득은 가격 민감도를 예측하며, 구형 Android 폰은 가격 비교 탐색이 적다는 점을 예측합니다. 이 중 어느 것도 인종 자체는 아니지만, 모두 인종과 함께 움직입니다. Civil Investigative Demand가 도착할 무렵, 이러한 기록을 전혀 남겨두지 않은 팀은 사후 포렌식 데이터 추출에 수개월을 허비하게 됩니다.
FTC가 Eversight 가격 책정 실험과 관련하여 Instacart와 체결한 $60M 규모의 합의(FTC, December 2025)는 결과 기반의 법적 조치였습니다. 해당 소장에는 동일한 품목에 대해 서로 다른 쇼핑객에게 최대 23%까지 차이 나는 가격이 표시된 사례가 기록되었습니다. 이는 집단 기반 차별에 대한 판단이 아니었으며, 알고리즘에 어떠한 지시가 입력되었는지에 좌우되지도 않았습니다.
November 10, 2025부터 시행되는 New York의 Algorithmic Pricing Disclosure Act는 개인 데이터가 가격을 변동시킬 때 명확한 공시를 요구하며 위반 건당 최대 $1,000의 민사 과태료를 부과합니다. June 30, 2026부터 시행되는 Colorado의 SB 24-205는 가격 책정을 영향 평가가 필요한 중대한 결정(consequential decision)으로 규정합니다.
EU AI Act의 고위험(high-risk) 의무 조항은 August 2, 2026부터 적용됩니다. Articles 13 and 14는 고위험 투명성 및 차별 방지 문서화를 규정하며, 고위험 요건 미준수 시 최대 €15M 또는 전 세계 연간 매출액의 3%에 달하는 법정 과징금이 부과됩니다.
이 파이프라인은 감사 대상 엔진의 10,000건 가격 책정 의사결정 로그에 대한 1회 단일 패스(pass)로 수행됩니다. 결정론적 입력 감사, four-fifths 게이트, 악용 가능한 상한선과 비교되는 공정성 제약 조건 합성, 에이전트 서술 해설, SHA-256 해시 증거 팩, 그리고 레이블이 지정된 벤치마크로 구성됩니다. 에이전트는 조언하고 코드가 결정하며, 이러한 명확한 분리 덕분에 하부에 어떤 모델이 사용되더라도 증거 팩의 법적 제출 가능성이 유지됩니다.
01 / THE ENGINE UNDER AUDIT
감사 대상 엔진은 시드 42로 초기화된 7-arm LinUCB contextual bandit인 ShopMart Dynamic Pricing으로, 10,000명의 합성 레이블 쇼핑객 모집단을 대상으로 정가 $79.00의 단일 SKU인 Aura Wireless Earbuds 가격을 책정합니다. 이 엔진은 ZIP 소득 지수, 기기 등급, 유입 경로(referral), 체류 시간(dwell time), 장바구니 크기, 재방문율, 세션 수, 프리미엄 멤버십, 시간대뿐만 아니라 실제 많은 엔진이 사용하는 유입 경로별 체류 시간 교차항(cross-terms)을 기반으로 가격을 책정합니다. 보호 대상 집단은 감사 시스템에 절대 전달되지 않는 잠재 레이블(latent label)입니다. 본 데모에서 이 밴딧이 바로 감사 대상 엔진입니다.
02 / THE DETERMINISTIC INPUT AUDIT
Run Audit은 순수 numpy로 보호 대상 집단에 대한 모든 가격 책정 입력의 절대 피어슨 상관계수, 정규화된 상호 정보량, 특성 쌍에 대한 결합 상호 정보량, 그리고 반사실적(counterfactual) 가격 변동을 계산합니다. 즉, 보호 대상 집단의 특정 입력을 우대 집단의 참조 값으로 덮어쓰고 다른 모든 조건은 고정한 채 엔진 자체 정책을 재실행하여 보호 대상 집단의 가격이 얼마나 변동하는지 측정합니다. 판정 규칙은 코드로 작성되어 순서대로 점검됩니다. 유효 표본 수가 400 미만인 입력은 프록시 판정 대신 Insufficient Evidence로 반환되며(이번 실행에서 트리거된 입력은 없음), 유의미한 연관성을 보이는 이중 용도(dual-use) 로열티 신호는 위반 테스트 실행 전에 법무 검토로 전달되는 ABSTAIN 판정을 받습니다. 절대 상관계수가 0.30 이상이거나 상호 정보량이 0.05 이상이면 VIOLATION입니다. 상관계수가 0.20 이상 0.30 미만이면 ABSTAIN이며, 그 외의 모든 것은 PASS입니다. 다른 모든 입력의 경우 반사실적 가격 변동은 입증 자료로만 작용할 뿐 단독으로 판정을 내리지 않으며, 이중 용도 신호에 대해서만 유의미한 반사실적 변동이 ABSTAIN 판정 근거로 반영됩니다.
03 / THE GATE AND THE CONSTRAINT
Disparate-Impact Gate는 가격 계층에 맞게 조정된 EEOC four-fifths rule (29 CFR 1607.4(D))을 적용합니다. 즉, 우대 집단의 유리한 가격 계층 수령 비율 대비 보호 대상 집단의 비율을 0.80 기준값과 비교합니다. 그런 다음 Remediation 단계는 4개의 프록시 입력을 제거하고 훈련된 두 번째 밴딧의 프록시 없는 참조 가격을 향해 각 가격을 지속적으로 유도(pull)하고, 0.80을 통과하는 가장 작은 유도 가중치(pull weight)를 이진 탐색하는 Fairness-Aware Reward Shaping을 합성합니다. 이는 단순한 수정 방식인 공정 가격의 115% 수준의 Hard-Cap Baseline과 나란히 표시되며, 두 방식 모두에 대해 악용 징후(gaming signature)가 측정됩니다.
04 / THE CREW AND THE PACK
Feature Auditor는 플래그가 지정된 각 입력을 설명하고, Adversarial Challenger는 보류된(abstained) 입력을 정당한 신호로 취급해야 하는 논리를 제시합니다. Regulatory Mapper 역할은 각 VIOLATION을 5가지 규제 체계에 연결하고 ABSTAIN을 단일 법무 검토 항목에 연결하는 고정 테이블입니다. 이 크루는 모델 공급자 교체가 가능하며, 모델 공급자가 설정되지 않은 경우 결정론적 템플릿으로 대체되어 애플리케이션이 동일하게 작동하고 수치를 계산하거나 판정을 설정할 수 없습니다. Evidence Pack은 엔진 이름과 버전, 감사된 모집단, 게이트 결과, 모든 조사 결과와 근거, 규제 매핑, 개선 조치 결과, 서술 요약을 JSON 및 인쇄 가능한 HTML 팩으로 봉인하며, 위변조 방지 해시로서 팩 본문의 SHA-256 다이제스트를 포함합니다.
콘솔은 두 개의 뷰와 대화상자로 구성됩니다. 수동 뷰에는 Pricing Outcome Comparison 카드와 각 단계를 스트리밍하는 활동 패널이 포함됩니다. 모든 결과는 Audit Results, Remediation Results 또는 Evidence Pack Results라는 제목의 대화상자로 열리며, Remediation 및 Evidence Pack은 Run Audit이 완료될 때까지 비활성화 상태를 유지합니다. Run Benchmark를 누르면 별도의 Benchmark Results 뷰로 전환됩니다. About Demo는 화면에 시나리오 경계를 명시합니다. 즉, 알려진 정답(ground truth)을 가진 합성 엔진으로서 그 결과는 방법론을 입증하는 것일 뿐 실제 현장에서 검증된 의도의 증거가 아니라는 점입니다. 아래의 모든 수치는 이 경계 내에 존재합니다.
이 데모는 단일 SKU에 대한 10,000건의 시드 기반 합성 가격 책정 결정을 감사합니다. 다음은 실행 과정에서 화면에 표시되는 내용을 순서대로 보여줍니다.







위의 수치는 사전에 심어져 재현 가능한 프록시 구조를 가진 단일 SKU에 대한 10,000건의 가격 책정 결정으로 구성된 단일 시드 기반 합성 모집단에서 도출되었습니다. 이 수치는 해당 방법론이 레이블이 지정된 데이터셋의 정확도로 사전에 심어진 구조를 복원함을 보여줍니다. 이는 실제 가격 책정 데이터에 대한 정확도 비율이 아니며, 경쟁사 대상 벤치마크가 아니며, 실제 소매업체에 대한 주장도 아닙니다.
| 질문 | 본 데모에서 Equity가 수행하는 작업 | 데모 범위 외로 유지되는 항목 |
|---|---|---|
| 연동 | 데모 앱에 대역 엔진으로 포함된 LinUCB 밴딧을 감사하며, 어댑터를 통해 고객사의 엔진으로 교체할 수 있도록 설계되었습니다. | 어떠한 어댑터 코드나 실제 운영 가격 책정 플랫폼 커넥터도 포함되지 않습니다. 본 빌드에는 존재하지 않으며, 언급된 어떤 공급업체도 고객사나 파트너사가 아닙니다. |
| 인구통계 데이터 | 앱에 하드코딩된 10개의 New York 및 California ZIP 참조 테이블과 시드 기반 기기 왜곡 데이터를 읽습니다. | 실시간 인구조사나 기기 소유권 피드는 포함되지 않습니다. 테이블은 규모가 작고 수작업으로 선별되었으며, 보호 대상 집단은 사전에 심어진 레이블입니다. |
| 조사 결과 | 사전에 심어진 프록시 구조를 복원하고 모든 입력의 판정과 근거를 팩에 기록합니다. | 현실 세계의 차별이나 의도에 대한 증거는 다루지 않습니다. 본 시스템은 의도에 대한 어떠한 판정도 내리지 않습니다. |
Equity는 어떠한 고객에게도 가격을 직접 책정하지 않으며 Pricefx, PROS, Zilliant, Competera를 대체하지 않습니다. 엔진이 가격을 책정하고 Equity는 이를 감사하고 제약합니다. 또한 규정 준수를 인증하거나 게이트 통과를 보장하거나 법률 자문을 제공하지 않으며, 증거 팩은 고객사 법률 대리인을 위한 증거 자료입니다. 본 빌드는 단일 SKU와 감사부터 증거 팩까지의 disparate-impact 추적 경로만을 다룹니다. 알고리즘 담합, 다중 관할권 공시 미들웨어, 스트리밍 모니터링, 체크아웃 표면 등은 대상에서 제외됩니다. Pricing Outcome Comparison 카드의 South Bronx 및 Upper East Side 프로필은 다중 ZIP 및 다중 기기 집단을 나타내는 대표 레이블일 뿐이며 실제 특정 지역에 대한 주장이 아닙니다.
엔진이 인종이나 소득에 따라 가격을 책정하기 위해 해당 데이터를 직접 볼 필요는 없기 때문입니다. 본 데모에서 감사 대상 엔진은 ZIP 소득 지수, 기기 등급, 세션 행동을 기반으로 가격을 책정하며, 이러한 입력들이 보호 대상 계층 신호를 전달합니다. ZIP 소득 지수는 보호 계층과 0.95의 상관관계를, 기기 등급은 0.32의 상관관계를 보입니다. 시드 기반 합성 모집단에서 나타난 결과는 매칭된 수요 신호를 가진 동일한 이어버드에 대해 소수 인종 다수 거주 ZIP 및 구형 기기 집단에 26.2% 더 높은 가격이 책정되었으며, 0.80 기준값 대비 0.43의 four-fifths 비율을 보였습니다. FTC의 Instacart 조치는 동일한 품목에 대해 서로 다른 쇼핑객에게 다른 가격이 표시된 결과에 대한 사건이었으며, 알고리즘에 어떠한 지시가 내려졌는지에 관한 판단이 아니었습니다.
이 엔진에서는 그렇지 않습니다. 벤치마크의 Fairness Through Unawareness 베이스라인은 ZIP 및 기기 입력 없이 모델을 재학습시키지만, four-fifths 비율은 0.43에서 0.59로 오르는 데 그쳐 여전히 탈락(fail)합니다. 쇼핑객의 유입 경로와 체류 시간은 개별적으로는 통과하지만, 결합 시 상호 정보량 0.73으로 해당 집단을 암호화하듯 포착합니다. 특성별 상관관계는 이러한 쌍을 보지 못하지만, 결합 상호 정보량 검사는 이를 감지해내므로 감사 시스템이 단일 입력뿐만 아니라 상호작용까지 점수화하는 것입니다.
가능하지만, 데모는 수익 극대화 알고리즘이 이를 어떻게 악용하는지 보여줍니다. Hard-Cap Baseline은 공정 참조 가격의 115%를 초과하는 모든 가격을 금지합니다. 엔진은 규정 문구를 준수하기 위해 매출의 0.2%를 포기하지만 보호 대상 집단의 29%를 상한선 1% 이내에 몰아넣어 four-fifths 비율은 0.59에 불과하고 게이트는 여전히 탈락합니다. 상한선은 또 다른 목표물이 될 뿐입니다. Fairness-Aware Reward Shaping은 노릴 만한 경계선 자체가 없으며, 이 합성 엔진에서 1.3%의 매출 비용으로 0.82를 기록하며 통과합니다.
그렇지 않습니다. Equity는 결코 직접 가격을 책정하지 않습니다. 엔진의 결정을 감사하고 제약 조건을 제시할 뿐이며, 고객사의 엔진이 Pricefx, PROS, Zilliant, Competera이든 자체 맞춤형 밴딧이든 상관없이 가격 책정은 계속 해당 엔진이 수행합니다. 고객사 엔진과의 접점은 문서화된 교체 지점입니다. 데모에는 어댑터 코드와 실시간 연동이 없으므로 자체 구축한 LinUCB 밴딧이 엔진 역할을 하며 직접 감사를 받습니다.
변호사가 방어해야 하는 항목 중 모델의 출력물에 해당하는 것은 전혀 없습니다. 통계 수치, 기준값 비교, 각 판정, 제약 조건, 팩 해시는 모두 에이전트 계층 외부의 결정론적 numpy 코드에서 생성됩니다. Feature Auditor와 Adversarial Challenger는 설명 문장을 작성할 뿐 수치를 계산하지 않으며 판정을 설정하거나 변경할 수 없습니다. 또한 규제 매핑은 모델 출력이 아닌 고정 테이블입니다. 모델 공급자가 없더라도 크루는 결정론적 템플릿으로 대체되어 애플리케이션이 동일한 판정을 산출합니다. 녹화된 워크스루의 서술 해설은 검증되어 캐시된 모델 출력물이며, 팩 헤더에 이 사실이 명시되어 있습니다.
JSON 및 인쇄 가능한 HTML 형태의 CID 대비 증거 팩입니다. 엔진 이름 및 버전, 감사된 10,000건의 의사결정, 개선 조치 전후의 four-fifths 게이트 결과, 근거가 포함된 모든 입력의 판정, 플래그 지정된 각 입력과 EEOC four-fifths rule (29 CFR 1607.4(D)), NY Algorithmic Pricing Disclosure Act, Colorado AI Act SB 24-205, EU AI Act Articles 13 and 14 및 FTC Act Section 5 간의 매핑, 개선 조치 결과, 그리고 팩 본문의 SHA-256 다이제스트가 기록됩니다. 당사는 증거를 제공하며, 최종 판단은 고객사의 법무팀이 내립니다.
이는 레이블이 지정된 데이터셋에 대한 자체 점검 결과이며 그에 맞게 해석되어야 합니다. 벤치마크는 데모의 시드 기반 10,000건 의사결정 합성 모집단을 다시 생성하고 단 하나의 질문을 던집니다. '감사 시스템이 사전에 심어둔 세 가지 프록시만을 찾아내고 다른 것은 건드리지 않았는가?' 결과는 그렇습니다. 세 가지 프록시 모두 플래그가 지정되었고, 네 가지 정당한 수요 신호 중 어느 것도 플래그 지정되지 않았으며, 단 하나의 이중 용도 신호는 플래그 지정이나 승인 대신 보류(abstained)되었습니다. 이는 해당 방법론이 사전에 심어진 구조를 복원해냄을 증명합니다. 실제 가격 책정 로그는 교란 요인이 많고 인구통계학적 집단별로 서로 다른 가격을 부과하는 A/B 테스트를 윤리적으로 수행할 수 없으므로, 실제 프로젝트에서 동일한 메커니즘은 자동화된 판정이 아닌 법무 검토를 위한 증거를 생성합니다.
본 데모의 기반이 되는 연구 — 아키텍처, 검증 설계 및 엔터프라이즈 청사진.
당사는 AI 엔지니어링 팀이며, 가격 책정 솔루션 공급업체나 컴플라이언스 인증 기관이 아닙니다. 엔진 자체의 의사결정 로그에서 출발하여 법률 대리인이 공식 제출할 수 있는 증거 팩으로 완성하며, 그 내용에 대한 최종 판단 권한은 법률 대리인에게 있습니다.
첫 번째 유의미한 논의는 구체적이어야 합니다. 어떤 엔진이 카탈로그 가격을 책정하는지, 엔진이 어떤 입력을 참조하는지, 복합 프록시를 기반으로 가격을 책정할 수 있는 교차항이나 트리 구조를 포함하고 있는지, 그리고 귀사의 거래 규모가 New York, California, Colorado 또는 EU 중 어디에 걸쳐 있는지를 파악하는 것입니다. 당사는 귀사의 가격 책정팀, 법무팀, 데이터팀과 협력하여 감사 수행, 제약 조건 합성, 증거 팩 형식 구성을 함께 진행할 수 있습니다.