문제점
2025년 3월, 미국시민자유연맹 콜로라도 지부(ACLU of Colorado)는 인튜이트(Intuit)와 그 AI 공급업체인 하이어뷰(HireVue)를 상대로 행정 진정을 제기했습니다. 이 사건은 자동화된 AI 화상 면접 툴로 인해 승진에서 탈락한 청각장애인 원주민 여성 D.K.를 둘러싸고 벌어졌습니다. D.K.는 긍정적인 평가와 연례 보너스를 받던 우수한 성과의 직원이었습니다. 그녀는 시즌 매니저(Seasonal Manager) 직책에 지원했고, AI가 점수를 매기는 화상 면접을 완료해야 했습니다.
그녀는 회사의 접근성 팀에 해당 플랫폼이 청각장애인 사용자에게 한계가 있다고 알렸습니다. 그리고 전문 속기사(인간 자막 제공자)를 요청했습니다. 하지만 대신 오류가 잦은 자동 자막에 의존해야 했습니다. AI 시스템은 그녀의 "청각장애 특유의 억양(Deaf accent)" 때문에 그녀의 발화를 정확하게 해석하지 못했습니다. 그런 다음 시스템은 그녀에게 "적극적 경청을 연습하라(practice active listening)"고 제안하는 피드백을 내놓았는데, 이는 청각 손실이 있는 사람에게 기술적으로 터무니없을 뿐만 아니라 모욕적인 말이었습니다.
시스템은 단순히 그녀에게 실패했을 뿐만이 아닙니다. 왜곡된 데이터를 기반으로 그녀의 커뮤니케이션 능력을 평가했습니다. 그녀의 발화 패턴은 AI가 학습한 청인 중심의 훈련 데이터와 일치하지 않았습니다. 그 결과 AI는 그녀를 "자신감"과 "커뮤니케이션 능력"이 부족하다고 표시했습니다. 적절한 안전장치 없이 유사한 도구를 배포한다면 귀사의 조직도 내일 당장 똑같은 진정에 직면할 수 있습니다. 이것은 비주류 제품이 아니었습니다. 하이어뷰는 전 세계에서 가장 널리 사용되는 AI 면접 플랫폼 중 하나입니다.
이것이 귀사의 비즈니스에 중요한 이유
이것은 단순한 홍보(PR) 문제가 아닙니다. 편향된 AI 채용 도구로 인한 법적 및 재무적 리스크 노출은 이제 실재하며, 측정 가능하고, 빠르게 증가하고 있습니다. 귀사의 경영진이 알아야 할 사항은 다음과 같습니다.
- 5분의 4 규칙(Four-Fifths Rule)은 자동적 법적 책임을 초래합니다. 보호 대상 집단에 대한 AI 도구의 선발률이 가장 높게 선발된 집단의 80% 미만으로 떨어지면, 민권법 제7조(Title VII) 및 미국 장애인법(ADA)에 따른 불균형 영향(disparate impact) 소송에 직면하게 됩니다. 차별하려는 의도가 없었더라도 수치적 계산 결과만으로 소송이 촉발될 수 있습니다.
- 콜로라도주 AI 법(SB 24-205)은 2026년 초부터 시행됩니다. 채용이나 승진과 같은 "중대한 결정(consequential decisions)"을 내리는 모든 AI 시스템에 대해 연례 영향 평가를 의무화합니다. 이를 준수하지 않으면 민사 소송과 규제 당국의 벌금에 직면하게 됩니다.
- 뉴욕시 지방법 144호(NYC Local Law 144)는 이미 자동화된 고용 결정 도구에 대한 독립적인 편향 감사를 의무화하고 있습니다. 미준수 시 매일 벌금이 부과됩니다. 캘리포니아와 일리노이주에서도 유사한 법안이 계류 중입니다.
- 유럽연합 AI 법(EU AI Act)은 채용 AI를 고위험(high-risk)으로 분류합니다. 위반 시 글로벌 매출액에 비례하는 벌금이 부과될 수 있습니다.
- Mobley 대 Workday 사건에서 연방 법원은 AI 공급업체가 "대리인(agent)" 또는 "간접 고용주(indirect employer)"로 간주될 수 있다고 판결했습니다. 이는 법적 책임이 공급업체에만 머무르지 않고 귀사로 직접 전가됨을 의미합니다.
연구에 따르면 표준 음성 인식 시스템은 명료도가 보통이거나 낮은 청각장애인 또는 난청인의 음성을 처리할 때 78%의 단어 오류율(word error rate)을 기록합니다. 이는 귀사의 AI가 78%나 잘못된 데이터를 기반으로 의사결정을 내리고 있음을 의미합니다. 이러한 오류율을 가진 녹취록을 분석하는 모든 모델은 본질적으로 노이즈에서 결과를 생성하는 셈입니다. 귀사의 채용 시스템이 AI로 채점되는 화상 면접을 사용하고 있다면, 이 수치는 최고법률책임자(General Counsel)를 밤잠 설치게 만들기에 충분합니다.
내부에서 실제로 벌어지고 있는 일
핵심적인 기술적 문제를 알기 쉬운 언어로 설명하자면 다음과 같습니다. 시중에 나와 있는 대부분의 AI 채용 도구는 엔지니어들이 말하는 "LLM 래퍼(LLM wrappers)"로, GPT-4나 Claude 같은 범용 AI 모델 위에 얹혀진 얇은 인터페이스에 불과합니다. 렌터카에 맞춤형 도색을 덧칠하는 것과 같다고 생각하면 됩니다. 겉모습은 달라 보이지만 내부 엔진은 여전히 동일합니다.
이러한 범용 모델은 방대한 인터넷 데이터셋으로 학습되었습니다. 이 데이터셋은 과거의 편향을 그대로 반영합니다. 과거의 채용 데이터가 특정 인구통계학적 집단을 선호했다면, 모델은 그 패턴을 최적화해야 할 목표로 취급합니다. 모델은 실제 직무 역량과 차별의 통계적 허상(statistical artifact) 사이의 차이를 구별하지 못합니다.
D.K.의 사례에서 시스템은 엔지니어들이 "모달리티 붕괴(Modality Collapse)"라고 부르는 현상을 겪었습니다. AI가 그녀를 채점하기 위해 단일 데이터 채널(오디오)에 지나치게 의존한 것입니다. 표준 미국식 영어를 구사하는 사람의 단어 오류율은 10%18% 수준입니다. 아프리카계 미국인 영어(AAVE) 화자는 20%35%의 오류율을 보입니다. 명료도가 높은 청각장애인 화자는 53%에 달하며, 명료도가 보통이거나 낮은 청각장애인 화자는 77%~78%에 이릅니다.
AI의 기초 데이터가 그 정도로 왜곡되어 있다면, 그로부터 파생되는 모든 후속 점수는 신뢰할 수 없습니다. 시스템이 D.K.에게 "적극적 경청을 연습하라"고 지시한 것은 그녀의 역량이 부족해서가 아니라 기계가 그녀의 음성을 구문 분석할 수 없었기 때문입니다. 즉, 전사(transcription)의 실패를 지원자의 실패로 착각한 것입니다. 고장 난 엔진 위에 아무리 화려한 브랜딩을 덧씌운다 해도 이 문제는 해결되지 않습니다.
또한 이러한 래퍼 도구에는 이른바 "반사실적 공정성(Counterfactual Fairness)" — 즉 지원자의 인종, 성별, 또는 장애 여부가 달랐더라도 점수가 동일하게 유지되었을 것임을 입증하는 능력 — 이 결여되어 있습니다. 이러한 증거가 없다면 법정에서 시스템의 정당성을 방어할 수 없습니다.
무엇이 효과적이고 (무엇이 그렇지 않은가)
실패하는 방식부터 살펴보겠습니다.
편향 제어 장치가 없는 일반적인 AI 래퍼. 이들은 훈련 데이터에 내재된 모든 편향을 그대로 물려받습니다. 공정성 지표도, 감사 추적도, 차별이 없었음을 증명할 방법도 제공하지 않습니다.
사후 수동 검토. 결정이 내려진 후에 편향을 발견하는 것은 법적으로 귀사를 보호해주지 못합니다. 사람이 결과물을 검토할 시점에는 이미 피해와 법적 책임이 발생한 상태입니다.
모든 법적 책임을 고객사인 귀사에 떠넘기는 법적 면책 조항. 많은 AI 공급업체가 계약 문구를 통해 책임을 전적으로 귀사에 전가합니다. 그러나 Mobley 대 Workday 사건처럼 법원이 공급업체를 귀사의 대리인으로 취급할 경우 이러한 면책 조항은 효력을 발휘하지 못합니다.
실제로 효과가 있는 방식은 근본부터 책임성을 갖추도록 설계된 시스템입니다.
1단계: 편향 중립적 입력 처리. 시스템은 모든 입력 특징을 검증된 직무 관련 역량에 직접 매핑합니다. 직무 성과와의 과학적 연관성은 거의 없지만 인종이나 장애와 높은 상관관계를 지닌 "운율(prosody)"이나 "미세 표정(facial micro-expressions)"과 같은 특징은 선별되어 제외됩니다. 어떤 채점이라도 시작되기 전에 입력값이 먼저 정제되어야 합니다.
2단계: 채점 과정에서의 적대적 편향 제거. 주 모델이 지원자를 채점하는 동안 제2의 "적대자" 모델은 해당 점수로부터 보호 대상 속성을 추측하려고 시도합니다. 주 모델은 적대자 모델이 그룹 간 차이를 구분할 수 없을 때까지 페널티를 받습니다. 이를 통해 최종 점수가 인종, 성별, 장애 여부와 무관함을 수학적으로 보장합니다. 귀사의 채점 엔진은 실시간으로 스스로의 편향과 적극적으로 싸웁니다.
3단계: 완전한 설명 가능성을 갖춘 인간 참여형 루프(Human-in-the-loop) 트리거. 시스템이 낮은 신뢰도를 감지하면(예: 특이한 억양이나 잡음이 많은 오디오 채널), 평가를 자동으로 인간 검토자에게 라우팅하거나 대안적인 평가 모드를 제공합니다. 모든 결정은 각 점수를 유발한 특징을 정확히 보여주는 방식인 SHAP 분석을 통해 설명됩니다. 지원자가 탈락할 경우 규제 기관에 정확한 이유를 제시할 수 있습니다.
이러한 아키텍처는 귀사의 컴플라이언스 팀에 실제로 필요한 것, 즉 완전한 감사 추적(audit trail)을 제공합니다. 모든 점수는 추적 가능하며, 모든 특징은 문서화되고, 모든 인간의 수동 개입(override)은 기록됩니다. 귀사의 시스템은 AI 관리를 위한 ISO/IEC 42001 표준 및 NIST AI 리스크 관리 프레임워크(NIST AI Risk Management Framework)와 일치합니다. 규제 당국이 조사를 위해 찾아왔을 때 — 그리고 새로운 AI 채용 규제의 물결속에서 그들은 반드시 찾아올 것입니다 — 귀사는 상자를 열어 정확히 무슨 일이 일어났는지 그들에게 보여줄 수 있습니다.
귀사의 솔루션 아키텍처 는 블랙박스가 되어서는 안 됩니다. 감사관, 판사, 또는 이사회 구성원 누구나 점검할 수 있는 투명한 글래스박스(glass box)여야 합니다.
적대적 편향 제거, 멀티모달 융합 및 컴플라이언스 매핑에 관한 전체 기술 분석은 전체 기술 분석 읽기 또는 인터랙티브 버전 살펴보기에서 확인하실 수 있습니다.
핵심 요점
- ACLU는 AI 도구가 청각장애인 원주민 직원에게 '적극적 경청을 연습하라'고 지시한 사건 이후 인튜이트와 하이어뷰를 상대로 2025년 3월 행정 진정을 제기했으며, 이는 편향된 AI가 어떻게 실질적인 법적 리스크를 초래하는지 보여줍니다.
- 표준 음성 인식 시스템은 청각장애인 화자에 대해 78%의 오류율을 기록하며, 이는 해당 데이터를 기반으로 산출된 모든 AI 점수가 본질적으로 무작위(random)에 가깝다는 것을 의미합니다.
- 콜로라도주 AI 법(2026년 초 시행)은 AI 채용 도구에 대해 연례 영향 평가를 요구하며, 미준수 시 민사 소송과 벌금이 부과됩니다.
- 연방 법원은 AI 공급업체가 간접 고용주로 취급될 수 있다고 판결했으며, 이는 법적 책임이 귀사로 직접 전가됨을 의미합니다.
- 래퍼 기반 AI 도구는 반사실적 공정성 검증, 감사 추적, 법정 방어 능력을 전혀 제공하지 못하며, 적대적 편향 제거와 인간 참여형 루프 트리거를 갖춘 전용 시스템이 그 대안입니다.
결론
AI 채용 도구는 이제 단순한 헤드라인을 넘어 실제 소송을 촉발하고 있습니다. 귀사의 시스템이 지원자의 인종, 성별, 장애 여부와 관계없이 점수가 동일하게 유지됨을 입증할 수 없다면, 복수의 연방 및 주 법률에 따른 불균형 영향(disparate impact) 소송에 노출됩니다. AI 공급업체에 다음을 질문하십시오: 비표준 억양을 가진 청각장애인 지원자가 화상 면접을 치를 때, 귀사의 시스템은 평가된 정확한 특징을 보여주고, 장애 여부가 점수에 영향을 미치지 않았음을 증명하며, 규제 당국을 위한 완전한 감사 추적을 제공할 수 있습니까?