문제점
UnitedHealth Group의 AI 알고리즘은 노년 환자들의 치료를 거부했습니다 — 그리고 그 판단은 90%의 확률로 틀렸습니다. 거부 결정 10건 중 9건은 인간 심판자가 실제로 검토하면 번복되었습니다. 그러나 UnitedHealth이 알고 있던 파괴적인 사실이 있었습니다. 환자 중 단 0.2%만이 이의를 제기할 자원을 갖고 있었다는 것입니다.
이 위기의 중심에 있는 알고리즘은 nH Predict입니다. UnitedHealth의 Optum 부문이 2020년에 10억 달러 이상을 들여 이를 인수했습니다. 원래는 Medicare 환자가 기간요양시설 입소와 같은 회복기 이후 치료(post-acute care)를 얼마나 오래 필요로 하는지 예측하기 위한 것이었습니다. 그러나 이것은 환자가 실제로 도움이 필요한지 여부를 무시하는 비용 절감 기계가 되었습니다.
Carol Clemens를 생각해 보십시오. 생명을 위협하는 혈액 질환인 변성혈색소혈증(methemoglobinemia)에서 생존한 후, 그녀는 집중적인 기간요양 간호가 필요했습니다. 임상 증거는 그녀의 지속적인 재활 필요성을 뒷받침했습니다. 그러나 nH Predict의 예측은 어차피 그녀의 보장을 종료해 버렸습니다. 그녀의 가족은 조기 퇴원을 막기 위해 16,768달러 이상을 본인 부담으로 지불했습니다. 소송은 UnitedHealth이 Clemens와 같은 환자들은 너무 아프거나, 너무 늙거나, 너무 가난해서 항소할 수 없을 것이라는 사실에 "돈을 봉쇄해 두었다(banked)"고 주장합니다.
2025년 2월, 연방 판사는 집단소송이 진행될 수 있다고 판결했습니다. 블랙박스 AI 결정 뒤에 숨던 시대는 끝나가고 있습니다. 귀하의 조직이 사람의 삶이나 생계에 영향을 미치는 결정을 내리는 데 AI를 사용한다면, 이 사건은 귀하를 향한 경고탄입니다.
이것이 귀사 비즈니스에 중요한 이유
이것은 단순한 의료 이야기가 아닙니다. 이것은 기업 거버넌스 이야기이며, 재무 노출 규모는 어마어마합니다.
UnitedHealth Group은 연간 약 3,000억 달러의 매출을 창출합니다. 이 회사는 이제 규제 대상 기업이 AI를 배포하는 방식을 근본적으로 바꿀 수 있는 연방 집단소송에 직면해 있습니다. 이 숫자들이 귀사 자신의 리스크에 대해 말해주는 것은 다음과 같습니다:
거부율은 100% 이상 급등했습니다. AI가 배포된 후 회복기 이후 치료 거부율은 약 10%에서 22.7%로 뛰었습니다. 기간요양시설 거부는 800% 증가했습니다. 귀사 이사회는 물어야 합니다: 귀사의 AI 시스템이 규제 당국이 적발할 수 있는 통계학적으로 이상한 결과를 산출하고 있지는 않습니까?
S&P 500 기업의 72%가 이제 연례 SEC 공시에서 중요한(material) AI 리스크를 공개합니다. 평판 손상이 가장 많이 인용되는 우려 사항입니다. AI 실패가 한 번 확산되면, 그 AI가 절감하기로 되어 있던 비용의 몇 배에 달하는 소송이 촉발될 수 있습니다.
EU AI법의 벌금은 전 세계 매출의 최대 7%에 이릅니다. 의료 AI 시스템은 이 법에서 "고위험(High-Risk)"으로 분류되며, 필수 적합성 평가, 투명성 공개, 인간 감독이 요구됩니다. 유럽에서 사업을 하는 경우, 미준수는 이사회 차원의 재무 위협입니다.
FDA의 2025년 1월 초안 가이던스는 이제 의료 및 규제 의사결정에 사용되는 AI 모델을 위해 필수적인 7단계 신뢰성 프레임워크를 마련합니다. 규제 당국은 더 이상 모범 사례를 제안하지 않습니다. 이제 규칙을 만들고 있습니다.
손익계산서(P&L)에 대한 핵심: AI를 올바르게 거버넌스하는 비용은, 집단소송을 방어하거나 규제 벌금을 납부하거나 공개적 실패 후 브랜드를 재건하는 비용의 일부에 불과합니다.
내부에서 실제로 일어나는 일
다음은 전문 용어 없이 설명하는, nH Predict가 실패한 이유입니다.
이 알고리즘은 600만 건의 환자 기록 데이터베이스를 교차 참조하는 방식으로 작동했습니다. 패턴을 찾은 것입니다. 비슷한 진단을 받은 환자들은 역사적으로 X일 동안 입원해 있었다는 식입니다. 그런 다음 각 새로운 환자에게 "목표" 퇴원일을 생성했습니다.
평균적인 교통 패턴만 아는 GPS 내비게이션이라고 생각해 보십시오. 그것은 이동에 30분이 걸린다고 알려줍니다. 하지만 앞에 낀 사고, 도로 통제, 그리고 귀하의 차 타이어가 펑크 났다는 사실은 볼 수 없습니다. 다만 벌써 도착했어야 한다고 우겨댈 뿐입니다.
nH Predict에도 같은 사각지대가 있었습니다. 그것은 인과(causation) — 각 환자의 상태를 실제로 유발하는 것이 무엇인가 — 가 아니라 상관관계(correlation) — 보통 어떤 일이 일어나는가 — 에 의존했습니다. 환자에게 집에 돌보미가 있는지, 재정적 불안정에 직면해 있는지, 특정 임상 합병증이 있는지는 고려할 수 없었습니다. 이 요인들은 Medicare 규칙상 의료 필요성을 결정하지만, 모델은 이를 완전히 무시했습니다.
이 실패 모드에는 이름이 있습니다. "보통 어떤 일이 일어나는가"를 묻는 것과 "이 환자는 왜 더 많은 시간이 필요한가"를 묻는 것의 차이입니다. 상관관계 기반 모델 — 원인을 이해하지 못한 채 패턴만 포착하는 모델 — 은 특정 진단을 받은 환자들이 보통 14일 후에 퇴원한다고 알려줍니다. 인과 모델은 어떤 요인이 환자가 더 많은 시간을 필요로 하는 원인이 되는지, 그리고 보장을 조기에 제거하면 어떤 일이 벌어지는지를 묻습니다.
문제는 UnitedHealth이 결함 있는 예측 도구를 강제 지시로 바꾸면서 더 악화되었습니다. 내부 관리자들은 케이스 매니저들에게 환자 입원 기간을 알고리즘 예측의 3% 이내로 유지하라고 지시했습니다. 그런 다음 그 목표를 단 1%로 좁혔습니다. 실제 환자의 필요에 맞추기 위해 기준을 벗어난 임상의들은 징계 또는 해고에 직면했습니다. "휴먼인더루프(human-in-the-loop)" 안전장치는 루버 스탬프로 전락했습니다.
효과가 있는 것 (그리고 없는 것)
먼저 효과가 없는 것부터 시작하겠습니다. 귀하의 조직이 이미 그중 하나를 하고 있을 수 있기 때문입니다.
기존 AI 위에 챗봇 계층을 추가하는 것. 이것이 "래퍼(wrapper)" 방식입니다 — GPT 같은 서드파티 AI 엔진 위에 사용자 정의 인터페이스를 얹는 것이죠. 이러한 래퍼는 고유한 로직이 없고, 기반 모델의 모든 편향을 물려받으며, 감사할 수 없는 블랙박스 출력을 만들어냅니다. 규제 산업에서 이것들은 잠재적 책임(liability)입니다.
인간 검토가 만능이라고 가정하는 것. UnitedHealth에는 기술적으로 AI 결정을 검토하는 인간이 있었습니다. 하지만 알고리즘의 판단을 번복하는 직원을 처벌한다면, 귀사의 휴먼인더루프는 허구입니다. 프로세스 설계가 정책 문구보다 더 중요합니다.
AI 거버넌스를 IT 프로젝트로 취급하는 것. AI 거버넌스가 전적으로 IT 안에만 있다면, 실제 책임(liability)을 발생시키는 법률적·임상적·재무적 차원을 놓치고 있는 것입니다. 2025년 2월 판결이 성공한 이유는, 판사가 UnitedHealth이 보장 결정을 알고리즘이 아닌 "임상 서비스 직원"과 "의사"가 내리겠다는 계약상 약속을 위반했다고 인정했기 때문입니다.
실제로 효과가 있는 것은 세 단계로 이루어집니다:
입력: 상관관계 대신 인과 모델링. 귀사의 AI 시스템은 다음을 기반으로 구축되어야 합니다. 인과 및 반사실(counterfactual) 모델링 — 즉, 과거 패턴만이 아니라 귀하의 도메인 안의 실제 원인-결과 관계를 매핑하는 접근 방식입니다. 의료의 경우, 이는 비슷한 환자가 얼마나 오래 입원했는지가 아니라 환자가 왜 치료가 필요한지를 모델링한다는 의미입니다.
처리: 신뢰도 점수가 있는 설명 가능한 AI. AI가 내리는 모든 결정에는, 그 결정을 이끈 요인들에 대한 평이한 언어의 설명이 따라야 합니다. SHAP과 LIME — 특정 출력에 영향을 준 데이터 포인트를 보여주는 방법 — 같은 도구는 감사자가 거부가 임상 증거에 의한 것인지, 아니면 우편번호(zip code) 같은 대리 변수에 의한 것인지 확인하게 해줍니다. AI가 학습 데이터 밖의 사례를 만나면, 신뢰도 점수가 그 불확실성을 표시하고 해당 사례를 인간 검토자에게 라우팅해야 합니다.
출력: 킬 스위치(kill-switch) 제어를 갖춘 전체 감사 추적. 생성되는 모든 AI 출력은 기록되고, 타임스탬프가 부여되며, 추적 가능해야 합니다. 귀사의 AI 거버넌스 및 컴플라이언스 프로그램 에는 스택에 있는 모든 모델을 등록하는 중앙 AI 레지스트리, 롤백 옵션을 갖춘 모델 변경 관리, 그리고 모델 성능이 저하될 경우 모델을 중단할 수 있는 명확한 권한을 지닌 부문 간 위원회가 포함되어야 합니다.
이 감사 추적이야말로 귀사의 컴플라이언스 팀에 이 접근 방식을 파는 요소입니다. 규제 당국이나 원고 측 변호사가 "이 결정이 어떻게 이루어졌는지 보여달라"고 요청할 때, 문서화된 논리 흔적이 있거나 소송이 있거나 둘 중 하나입니다. FDA의 7단계 신뢰성 프레임워크는 이제 검증 전략, 지표 및 모든 편차를 문서화하는 "신뢰성 보고서(Credibility Report)"를 명시적으로 요구합니다. 귀사의 AI가 그 보고서를 생성할 수 없다면, 법정에 가기도 전에 규제 시험에서 실패하는 것입니다.
다음과 같은 의료 및 생명과학 AI 솔루션 을 구축하는 조직에는 자신의 추론을 설명하고, 자신의 불확실성을 스스로 표시하며, 인간이 진정으로 통제권을 유지하도록 보장하는 시스템이 필요합니다. UnitedHealth 사건에서 법원이 보낸 메시지는 명백했습니다. AI 시스템이 근본적으로 고장 나 있다면, 법원은 피해자들에게 조작된 항소 절차라는 쇼에 참여하도록 요구하지 않을 것입니다.
귀하는 전체 기술 분석을 읽어보거나 또는 대화형 버전을 탐색하여 규제 프레임워크와 아키텍처 요건을 더 깊이 살펴보실 수 있습니다.
핵심 요점
- UnitedHealth의 AI는 90% 오류율로 노년 환자의 치료를 거부했지만, 항소할 수 있었던 환자는 단 0.2%에 불과했습니다 — 수익성 있는 실패가 만들어진 것입니다.
- 연방 판사는 인간의 임상 판단을 AI 알고리즘으로 대체하는 것이 가입자에 대한 계약상 약속 위반이 될 수 있다고 판결하며 집단소송의 진행을 허용했습니다.
- EU AI법은 미준수 의료 AI 배포에 전 세계 매출의 최대 7%까지 벌금을 부과할 수 있으며, FDA는 이제 AI 모델에 7단계 신뢰성 프레임워크를 요구합니다.
- "보통 어떤 일이 일어나는가"를 예측하는 상관관계 기반 AI는 규제 환경에서 실패합니다 — 결정을 "왜" 내렸는지 설명하는 인과 모델이 필요합니다.
- 고위험 도메인의 모든 AI 출력에는 전체 감사 추적, 신뢰도 점수, 킬 스위치가 필요합니다 — 그렇지 않으면 효율이 아니라 잠재 책임(liability)을 만들고 있는 것입니다.
결론
UnitedHealth 사건은 수익성 있는 AI 시스템조차 재앙적으로 틀릴 수 있으며, 법원이 그 격차에 대해 귀하의 조직에 책임을 묻는다는 것을 입증했습니다. 사람의 건강, 재정 또는 법적 권리에 영향을 미치는 어떤 결정에든 AI를 배포한다면, 시스템은 자신의 추론을 설명하고 불확실성을 스스로 표시할 수 있어야 합니다. AI 벤더에게 물으십시오: 모델이 청구를 거부하거나 고위험 권고를 내릴 때, 그 결정에서 검토한 정확한 요인, 해당 결정의 신뢰도 수준, 그리고 인간이 이를 번복할 실질적 권한이 있었음을 증명하는 감사 추적을 규제 당국에 보여줄 수 있습니까?