
AI 보장 거부의 90%가 이의 제기에서 뒤집힌다. 법원은 이를 계약 위반이라 판단했다.
한 가족은 어머니를 병상에 계속 두기 위해 자기 부담으로 $16,768를 지불했다.
그녀는 메트헤모글로빈혈증을 앓고 있었다 — 몸에서 산소를 빼앗는 혈액 질환이다. 그녀의 보장 여부를 결정하는 알고리즘은 그 사실을 알지 못했고, 아니 오히려 알면서도 개의치 않았다. 그것은 진단군을 기반으로 입원 기간을 예측하도록 훈련되어 있었고, 그 진단군의 평균 환자는 퇴원할 준비가 되어 있었다. 그래서 시스템은 그녀의 실제 혈중 산소가 다른 이야기를 하고 있는데도 집단 기준의 시간표에 따라 그녀를 퇴원 대상으로 표시했다. 그녀의 가족은 돈을 마련했다. 대부분의 가족은 그럴 수 없으며 — 대부분은 시도조차 하지 않는다. UnitedHealth 소송에서 메디케어 수급자 중 자신의 보장 거부에 이의를 제기한 사람은 약 0.2%에 불과했다.
그 사건은 바로 이 소송의 중심에 있다 Lokken 대 UnitedHealth, 메디케어 어드밴티지 이용 관리에서 회복 시간표를 예측하는 데 사용된 AI 도구인 nH Predict에 관한 집단 소송이다. 그리고 모든 건강보험 임원을 얼어붙게 만들어야 할 숫자는 바로 이것이다: 그 소송에서 AI가 생성한 거부의 약 90%가 이의 제기 과정에서 뒤집혔다 — 이의를 제기하는 수고를 한 극소수 가입자 사이에서 말이다. 처음 그것을 읽었을 때 나의 직감은 대부분의 엔지니어와 같았다 — 90%의 뒤집힘 비율은 모델 정확도 문제이며, 더 나은 훈련 데이터와 더 촘촘한 임계값으로 고치는 것이라고. 나는 틀렸고, 법원이 그 이유를 알려주었다. 한 연방 판사는 그 90%를 기술적 결함이 아니라 계약 위반의 증거로 다루고 있다. 바로 그 하나의 재해석이 메디케어 어드밴티지 AI 거버넌스가 실제로 답해야 하는 것이며, 내가 결국 그것을 중심으로 회사를 세우게 된 이유이다.
90%의 이의 제기 뒤집힘 비율은 조정 매개변수가 아니다. 그것은 그 시스템이 애초에 의학적 필요성을 결정하고 있지 않았다는 자백이다.
이 소송은 당신 모델의 결함이 아니라 당신 계약서의 한 문장에 관한 것이다
내가 부끄러울 만큼 오래 걸려서야 이해한 것은, 이런 사건에서의 법적 노출이 모델 가중치에 있지 않다는 것이다. 그것은 당신의 보장 증서(Evidence of Coverage)에 있다.
당신의 EOC — 모든 가입자가 서명하는 계약서 — 는 보장 결정이 임상 서비스 직원과 의사에 의해 이루어진다고 약속한다. 그것이 거래 조건이다. 내가 보험사들의 EOC 문구를 뽑아내어 그들의 실제 자동 심사 대기열 옆에 나란히 놓기 시작했을 때, 그 격차는 거의 항상 명백하게 존재했다. 계약서는 의사가 결정한다고 말한다. 실제 업무 흐름은 알고리즘이 요청을 점수화하고 사람은 그것이 내놓는 것이 무엇이든 승인 버튼을 클릭하는 모습을 보여준다. 상대편 변호인은 그 격차를 찾기 위해 데이터 과학자가 필요하지 않다. 그들에게 필요한 것은 법률 보조원 한 명과 형광펜 하나다.
바로 그 사건의 2026년 3월 증거 개시 명령 Lokken (2026 WL 658883)이 이것을 구체화했다. 법원은 원고에게 AI 개발 문서, 훈련 데이터 사양, 검증 보고서에 대한 접근을 허가했다. 나는 그 명령서의 인쇄본에 한 조항을 동그라미 쳐서 보관하고 있는데, 그것이 내가 모든 보험사에게 이야기하는 방식을 바꾸었기 때문이다: 이제 당신의 AI 문서는 증거 개시 대상이다. 만약 당신의 모델이 구조화된 결정 로그, 버전 관리된 훈련 데이터, 문서화된 검증 결과를 산출할 수 없다면, 당신은 왜 청구를 거부했는지 재구성할 수 없으며 — 재구성할 수 없는 것을 방어할 수도 없다.
"인간 개입(human-in-the-loop)"이 허구가 되는 순간
한동안 나는 소송을 당하는 보험사들이 완전 자동화된 거부를 운영하는 무모한 예외 사례라고 가정했다. 현실은 더 불편하며, 그것은 이제 최고의료책임자(CMO)가 임상의가 승인 서명을 하니 자기들은 안전하다고 말할 때마다 내가 가장 먼저 꺼내는 세부 사항이다.
그 분기점은 방 밖의 누구도 결코 보지 못하는 단 하나의 운영상 결정에서 발생한다. nH Predict의 관리자들은 모델 예측치로부터 허용 가능한 편차를 3%에서 1%로 좁혔다. 서류상으로 그것은 조정 변경이다. 실제로는 그것이 의사 결정 지원 도구를 자동화된 문지기로 바꾸어 놓았는데, 알고리즘의 숫자에서 머리카락 한 올만큼이라도 벗어난 임상의는 이제 규정 위반이 되었기 때문이다. 시스템을 무시한 일부는 징계 조치에 직면했다.
그것이 인간 개입이 안전장치이기를 멈추고 연극이 되는 순간이다. 모델에 동의하지 않으면 자신의 일자리가 위험해지는 의사는 임상적 판단을 행사하고 있는 것이 아니다 — 그녀는 고무도장을 찍고 있는 것이다. 그리고 형식적인 검토를 거쳐 흘러가는 모든 거부는 자동화된 거부의 계약적, 규제적 책임을 온전히 짊어지는데, 기능적으로 바로 그것이 그러하기 때문이다.
편차 허용 폭은 어느 위원회의 회의록 속에 묻혀 있다. 그곳이 소송의 승패가 갈리는 곳이며, 모델 아키텍처가 아니다.
이 지점을 그냥 지나쳐 버리는 거버넌스 대화가 셀 수 없이 많았다. 보험사들은 자신의 모델을 감사한다. 하지만 그들은 그것을 둘러싼 업무 흐름 정책 — 임계값, 재정의 규칙, 징계 구조 — 을 거의 절대 감사하지 않는다. 그 정책이야말로 당신의 임상의가 의사 결정자인지, 아니면 실제로는 아무것도 보호하지 못하는 책임 방패인지를 결정한다.
왜 우리는 처음에 잘못된 것을 만들었는가
우리 팀이 시작했을 때, 우리는 뻔한 것을 했다. 우리는 모니터링을 만들었다.
화이트보드 위에서는 말이 되었다. 시장은 AI 관찰 가능성으로 가득 차 있다 — Fiddler는 드리프트 및 편향 탐지와 함께 SHAP과 LIME 설명 가능성을 제공한다; IBM의 Watsonx.governance는 공정성을 위한 OpenScale을 갖추고 있다; Credo AI와 Holistic AI는 증거를 자동 수집하는 정책 팩과 규정 준수 대시보드를 판매한다. 이 분야 전체의 논리는 이렇다: 당신은 프로덕션에 모델을 두고, 그것을 감시하는 레이어를 볼트로 붙이면, 이제 당신은 거버넌스를 갖게 된다. 그래서 우리는 파일럿 보험사의 이용 관리 AI를 감시하고 아름다운 공정성 지표를 산출하는 레이어를 만들었다.
그때 그 보험사의 한 의료 책임자 — 수년간 자신의 UM 위원회에 참여했던 사람 — 가 우리의 대시보드를 보고 우리를 원점으로 되돌려 보낸 질문을 던졌다. "이것은 모델이 일관되게 작동하고 있다는 것을 말해줍니다. 그것은 모델이 애초에 이 결정을 내려야 하는지를 말해주지 않습니다. nH Predict도 일관적이었습니다."
그녀가 옳았고, 그것은 아팠다. 우리는 근본적으로 결함이 있는 것을 측정하기 위한 매우 정밀한 도구를 만들었던 것이다. nH Predict는 모니터링되지 않아서 실패한 것이 아니다. 그것은 개별 임상 지표 — 혈중 산소, 간병인 유무, 동반 질환 상호작용 — 보다 진단군 평균을 더 중시했기 때문에 실패했다. 개별 변이가 곧 의학적 필요성의 정의인 영역에서 말이다. 그 모델을 더 면밀히 모니터링했다면 잘못된 일을 안정적으로 수행하는 시스템의 깔끔한 기록을 산출했을 것이다. 90%의 뒤집힘 비율은 아름답게 문서화되었을 것이다.
그것이 우리가 다음에 만든 모든 것의 대가를 치른 실패였다. 관찰 가능성은 모델이 안정적인지 여부를 알려준다. 그것은 그 결정이 방어 가능한지 여부를 알려주지 않는다. 그것들은 서로 다른 문제이며, 거버넌스 플랫폼 분야 전체는 내가 관심을 둔 구매자에게는 첫 번째 문제를 풀면서 그것을 두 번째라고 부르고 있었다.
메디케어 어드밴티지 AI 거버넌스는 실제로 무엇을 해야 하는가?

그래서 우리는 모니터링이라는 전제를 찢어버리고 법정에서 유일하게 중요한 질문에서부터 시작했다: 당신은 이 특정한 사람에 대한 이 특정한 거부를 방어할 수 있는가?
그 재해석은 구축 방식을 완전히 바꾼다. 당신은 더 이상 모델을 계측하는 것이 아니다 — 당신은 몇 년 후 증거 개시 명령 아래에서 스스로를 재구성하도록 하나의 결정을 설계하는 것이다. 메디케어 어드밴티지 보험사에게 그것은 세 가지가 동시에 참이어야 함을 의미하며, 그것들을 참으로 만드는 것이 Veriprajna가 하는 일이다 veriprajna.com/solutions/medicare-advantage-ai-governance에서.
첫째, 모든 결정은 자체의 설명을 지녀야 한다 — 전체적인 공정성 점수가 아니라, 모델이 어떤 임상 요인을 고려했고 어떤 것을 무시했는지에 대한, 임상의와 판사가 모두 읽을 수 있는 언어로 된 결정별 기록이다. 이것은 모두가 과소평가하는 부분이며, 내가 나쁜 소식을 전해야 하는 지점이다. 대부분의 보험사가 사용하는 레거시 청구 플랫폼 — Facets, QNXT — 는 결정별 특징 귀속 기록을 산출하도록 결코 설계되지 않았다. 그것들은 추론이 아니라 결과를 저장한다. 그래서 메디케어 어드밴티지 스택에서의 진정한 설명 가능성은 선반에서 더 나은 모델을 고르는 문제가 아니다. 그것은 미들웨어다: 모델의 입력, 가중치, 임상 재정의 경로를 포착하여 증거 개시에서 살아남도록 설계된 로그에 기록하는 레이어다. 그것은 화려하지 않은 통합 작업이며, 그것이 이 일의 대부분이다.
더 어려운 요구 사항은 규정 준수 아키텍처가 같은 시기에 도착하는 규제에 맞춰져야 한다는 것이다 — 이것은 나로 하여금 한 정교한 보험사가 곧장 걸어 들어가는 것을 지켜본 함정으로 이어진다.
깨끗해 보이지만 그렇지 않은 지표

사전 승인 최종 규칙인 CMS-0057-F는 2026년 1월부터 효력을 발휘하기 시작했다 — 신속 요청에 대한 72시간 처리, 표준 요청에 대한 7일 처리, 사기를 제외하고는 승인된 입원 건의 재개 없음. 그런 다음 2026년 3월 31일, 첫 공개 보고 마감일이 닥쳤다: 보험사들은 계약 단위로 여덟 개의 사전 승인 지표를 보고해야 했으며, 여기에는 거부율, 처리 시간, 이의 제기 뒤집힘 비율이 포함되었다.
중요한 세부 사항은 헤드라인만이 아니라 연방 관보(Federal Register) 정정문을 읽어야만 포착할 수 있는 종류의 것이다. 2025년 6월, CMS는 플랜 단위 세부 내역과 UM 위원회에 대한 건강 형평성 전문성 요건을 유예했다. 공개로 남아 있는 것은 종합적인 계약 단위 지표다. 그래서 한 보험사는 완벽하게 그럴듯한 계약 단위 이의 제기 뒤집힘 비율을 발표하고 깨끗해 보일 수 있다 — 반면 그것의 개별 결정 로그, Lokken 식의 증거 개시 명령이 곧장 파고드는 그것은 전혀 다른 이야기를 한다.
공개 지표는 당신이 보여주기로 선택한 부분이다. 결정 로그는 법원이 가져가는 부분이다. 거버넌스는 첫 번째가 아니라 두 번째에서 이겨야 한다.
나는 자신들의 3월 31일 신고를 자신들이 보장받고 있다는 증거로 가리키는 임원들과 마주 앉아 본 적이 있다. 그 신고는 필요하다. 그것은 방어가 아니다. 원고 측 변호인단은 당신의 종합 대시보드를 읽고 있지 않다; 그들은 한 가입자의 거부 배후에 있는 기록을 소환하고 있다.
그런 다음 2027년 1월 1일이 있는데, 이때 HL7 FHIR 사전 승인 API — CRD, DTR, PAS — 가 필수가 되어, 모든 PA 결정에 대한 완전한 전자 거래 추적을 생성한다. 그 추적은 결정이 내려질 때 추론이 포착되었는지 여부에 전적으로 달려서, 당신의 최고의 증거이거나 당신의 최악의 증거이거나 둘 중 하나다. 나중에 소급하여 채울 수 없다. 나는 지금 어느 QNXT 인스턴스에 대해 통합 티켓을 하나 열어두고 있는데, 그것은 본질적으로 어느 보험사가 그 두 미래 중 어느 쪽에 이르게 될지에 대한 내기다.
어떤 단일 플랫폼도 대비하여 만들어지지 않은 짜깁기
그리고 그것은 어떤 기성 제품도 아우르지 못하는 규제 지도에서 살아남아야 한다. 내가 한 다주(多州) 고객의 의무를 하나의 스프레드시트에 처음 펼쳐 놓았을 때, 열들이 서로 일치하기를 멈추었다 — 그리고 그것은 의도된 것이다. 그 요건들은 고의적으로 일관되지 않다.
텍사스 책임 있는 AI 거버넌스법(Texas Responsible AI Governance Act)은 광범위한 민사 조사 요구 권한과 함께 2026년 1월에 발효되었다 — 그리고 텍사스는 2024년 9월 부풀려진 정확도 주장을 두고 Pieces Technologies를 상대로 첫 헬스케어 생성형 AI 조사를 합의로 해결하며 이미 자신의 패를 보여준 바 있다. 펜실베이니아는 다른 방향으로 나아가, AI 기반 거부 이전에 인간 제공자의 검토를 요구하고, AI가 사용되고 있다는 사실의 의무적 공개와 연례 규정 준수 진술서를 요구하는 법안을 마련했다. 이제 다주 메디케어 어드밴티지 조직은 각 주가 서로 다른 투명성, 감사, 공개 통제를 원하는 짜깁기에 직면한다. 그리고 글로벌 운영을 하는 모든 보험사에게, EU AI Act는 헬스케어 AI를 부속서 III에 따라 고위험으로 분류하며, 완전 규정 준수는 2027년 8월까지이고 벌금은 전 세계 연간 매출의 6%에 달한다.
이것이 바로 대형 컨설팅 회사들이 빠지는 이음새다. Deloitte와 Accenture는 패키지형 플랫폼 — Credo AI나 IBM Watsonx — 를 배치하고 그것을 거버넌스라고 부를 것이다. 하지만 패키지형 플랫폼은 당신의 특정 Facets 구성을 알지 못하며, 텍사스의 조사 요구를 펜실베이니아의 거부 전 검토 의무와, EU의 위험 관리 파일 요건과 조화시키지 못한다. 청구 시스템 공급업체들은 처지가 더욱 나쁘다: Facets와 QNXT를 유지 관리하는 바로 그 회사들이 그것들을 위한 AI 부가 기능도 판매하므로, 그들은 자신들의 플랫폼에 있는 거버넌스 격차를 드러낼 유인이 딱히 없다. 그 지형에서 그 누구도 구매자가 필요로 하는 단 하나의 것을 만들고 있지 않았다 — 결정 하나하나마다, 그들에게 동시에 적용되는 모든 규제에 매핑된 기술적 통제 말이다.
왜 보험사는 그냥 설명 가능성 소프트웨어를 살 수 없는가?
사람들은 내게 타당한 질문을 던진다: 설명 가능성과 편향 모니터링이 이미 존재한다면, 왜 보험사는 그냥 Fiddler를 사거나 인과 AI를 세워두고 끝내지 못하는가?
두 가지 이유다. 모니터링 공급업체들은 자신들이 하는 일에 진정으로 뛰어나다 — 하지만 그들의 전제 전체는 프로덕션에 있는 모델이 거버넌스할 가치가 있는 대상이라는 것이다. nH Predict에서 그랬듯이 모델의 결정 아키텍처가 결함일 때, 그것을 더 면밀히 지켜보는 것은 그저 해악의 고해상도 녹화본을 당신에게 줄 뿐이다. 인과 AI — causaLens가 여기서 가장 신뢰할 만한 이름이다 — 는 상관관계 대신 원인을 모델링하는, 학문적으로 옳은 답이지만, 상업적으로 미성숙하고 대체로 금융 서비스를 겨냥하고 있다; 보장 결정을 위한 헬스케어 특화 인과 모델은 여전히 대체로 연구 단계에 있다. 그리고 Cohere Health 같은 사전 승인 자동화 공급업체들은 전적으로 잘못된 변수를 최적화하고 있다. Cohere는 당신의 PA 관리 비용을 47% 절감할 것이다. 그것은 실제 수치이며 실제 이점이다. 하지만 속도는 방어 가능성이 아니다. 당신이 여전히 법정에서 재구성할 수 없는 더 빠른 거부는 Lokken이 정의한 바로 그 책임에 이르는 더 빠른 길이다.
다른 이유는 규모이며, 그것은 내가 보험사를 설득해 단념시킬 수 없는 부분이다. Gartner는 2028년까지 외래 청구의 80%가 AI 기반 실시간 심사를 통해 처리될 것으로 예상한다. 그러나 Censinet의 집계에 따르면 오늘날 미국 병원 중 단 12%만이 공식적인 AI 거버넌스 프레임워크를 갖추고 있다. 자동화된 보장 결정의 양은 누구든 그것들을 방어할 인프라를 구축하는 것보다 훨씬 더 빠르게 배가되려 하고 있다. 그리고 CMS는 정중하게 기다리고 있지 않다 — 그것의 지급 연도 2020 RADV 감사는 근거 없는 진단을 표시하기 위해 AI 기반 이상 탐지를 사용하여 2026년 2월에 시작되었다. 규제 당국은 당신이 스스로 그것을 거버넌스하도록 요구하면서 AI로 당신의 AI를 감사하고 있다.
먼저 움직이는 보험사들은 이것을 이점으로 바꾼다
나는 경고가 아니라, 내가 실제로 믿는 것으로 끝맺고 싶다.
내가 대화하는 모든 보험사는 거버넌스를 비용으로 — AI 배치에 붙는 세금, 모두가 원하는 에이전트형 자동화에 대한 제동으로 — 취급한다. 나는 그 관점을 이해한다. 관리 경제학은 양쪽 모두에게 가혹하다: 제공자들은 거부에 맞서 싸우는 데 연간 197억 달러를 쓰고, 보험사들은 이의가 제기된 모든 청구에 대해 자신들의 비용을 짊어진다. 유혹은 더 세게 자동화하고 규칙이 요구하는 만큼만 최소한으로 거버넌스하는 것이다.
하지만 그 계산은 거꾸로 돌아간다. 이의 제기 과정에서 뒤집히는 거부는 결코 비용 절감이 아니었다 — 그것은 보험사가 수익으로 장부에 기입했다가 법정에서 이자와 함께 되갚게 될 책임이었다. 어떤 거부에 대해서든, 어떤 임상 요인이 고려되었는지에 대한 깨끗한 기록을, 진정으로 반대할 자유가 있었던 임상의가 서명하고, 적용되는 모든 규제에 매핑하여 산출할 수 있는 보험사는 그저 소송을 피하는 것에 그치지 않는다. 그것은 각 결정이 이제 일상적으로 닥쳐오는 정밀 검토에서 살아남도록 구축되어 있기 때문에, 더 빠르게 그리고 더 큰 확신을 가지고 거부할 수 있다. 우리는 바로 그런 보험사를 위해 메디케어 어드밴티지 AI 거버넌스 아키텍처를 구축했다.
메트헤모글로빈혈증 환자의 가족은 알고리즘이 실수를 저질렀기 때문에 진 것이 아니다. 그들은, 일시적으로, 시스템이 스스로를 설명할 수 없었고 개입한 어떤 인간도 그것을 뒤집을 자유가 없었기 때문에 졌다. 시스템이 스스로를 설명할 수 있도록 구축하고, 인간이 그것을 뒤집을 자유를 부여하라, 그러면 당신은 더 이상 증거 개시 명령이 결코 오지 않기를 바라고 있지 않다. 당신은 그것에 대비되어 있다.


