임상의 모니터: 세련된 AI 작성 환자 메시지 옆에, 플래그되지 않은 채 상승하는 크레아티닌 차트
Artificial IntelligenceHealthcarePatient Safety

임상 AI를 신뢰하는 의사의 90%, 위험한 오류는 3분의 1만 잡아낸다

Ashutosh SinghalAshutosh Singhal2026년 6월 2일13 min

우리 임상 AI 안전 도구의 첫 번째 버전은 훌륭하게 작동했다. 그것이 바로 문제였다.

우리는 그 도구를 명백한 목적, 즉 환각을 잡아내도록 만들었다. 앰비언트 스크라이브나 환자 포털 초안 작성 도구에 연결하고, AI의 출력을 입력한 뒤, 사실과 다른 진술에 플래그를 달게 하는 것이다. 그 도구는 잘못된 약물명을 잡아냈다. 불가능한 검사 수치를 잡아냈다. 자릿수 하나가 틀린 용량을 잡아냈다. 나는 그것에 대해 진심으로 뿌듯함을 느꼈던 기억이 난다 — 우리는 오류를 찾아내고 있었고, 데모는 성공적이었으며, 숫자들은 깔끔해 보였다.

그때 이 프로젝트의 임상 자문위원, 20년을 병동에서 보낸 입원 전담 전문의가 나에게 지금도 계속 떠올리는 한 사례를 짚어 주었다. 어떤 AI가 자신의 약물에 대해 묻는 환자에게 보낼 MyChart 답장 초안을 작성했다. 그 초안은 메트포르민을 계속 복용하라고 했고, 마지막 HbA1c가 6.8%였다고 기분 좋게 언급했다. 그 안의 모든 사실은 참이었다. 그 메모는 공감적이고, 잘 구성되어 있었으며, 훌륭한 의사가 썼을 법한 바로 그것이었다. 우리 도구는 아무런 플래그 없이 그것을 통과시켰다.

그 환자의 크레아티닌은 세 번의 진료에 걸쳐 상승하고 있었다. 크레아티닌 상승은 신장 기능 저하를 의미하며, 신장 기능 저하는 메트포르민을 위험하게 만든다. AI는 살펴봐야 한다는 것을 알지 못했다. 그리고 — 이것이 내가 다음을 생각하는 방식을 재구성한 부분이다 — 임상 AI 안전 — 바쁜 임상의가 전송을 클릭하기 전에 유창하고, 친근하며, 사실적으로 일관된 초안에 주는 10초 내지 15초 동안 그것을 훑어보는 검토 의사 또한 알지 못했을 것이다.

우리의 환각 탐지기는 잘못된 문제를 풀고 있었다. 환자에게 해를 끼치는 오류는 대개 명백히 틀린 것들이 아니다. 그것들은 국소적으로는 옳지만 맥락상 치명적인 것들이다. 위험은 AI가 말하지 않은 것 속에 있기 때문에, 사실 확인만으로는 안전에 도달할 수 없다.

그 실패가 바로 Veriprajna가 환각 탐지기 구축을 멈추고 의료 시스템이 실제로 운영하는 AI 스택 전체를 위한 독립적 안전 인프라를 구축하기 시작한 이유다. 이 글은 우리가 그 스택을 정직하게 들여다봤을 때 발견한 것에 관한 것이다.

모든 CMIO를 밤잠 못 이루게 해야 할 그 숫자

자동화 편향 격차: 의사의 90%가 AI를 신뢰했으나 유해 오류의 66.6%를 놓쳤다

2024년 4월, The Lancet Digital Health는 내가 생각하기에 의료 AI에서 가장 중요하면서도 가장 덜 흡수된 연구 결과를 발표했다. 연구자들은 의사들에게 환자 메시지에 대한 AI 작성 답변을 검토하게 했다. 그 초안들 중 7.1%가 환자에게 심각한 위해 위험을 초래했다. 0.6%는 사망 위험을 초래했다.

오류율보다 더 중요한 부분이 여기 있다. 우리가 하라고 요청하는 바로 그 일 — AI의 작업을 검토하는 일 — 을 하고 있던 의사들은 유해한 초안의 66.6%를 놓쳤다. 오류가 있는 것들 중 3분의 1에서 거의 절반이 전혀 수정되지 않은 채 발송되었다. 그리고 설문 조사를 했을 때, 바로 그 의사들 중 90%가 그 도구의 성능을 신뢰한다고 답했다.

90%의 신뢰, 그리고 위험한 오류의 3분의 1만 잡아냄. 그 격차는 훈련의 문제가 아니다. 그것은 인간에게 자신보다 더 유창하게 글을 쓰는 기계를 감사하라고 요청한 데 따른 예측 가능한 결과다.

이것이 자동화 편향이며, 이는 의사들의 성격적 결함이 아니다. 그것은 상호작용의 속성이다. 초안이 잘 쓰였고 공감적일 때, 문장의 품질이 독자의 마음속에서 독립적 검증을 대체한다. AI가 더 잘 쓸수록, 인간은 덜 확인한다. 우리는 그것의 가장 큰 강점 — 유창하고 자신감 있는 언어 — 이 바로 우리가 그 주위에 구축한 안전망을 무장 해제시키는 메커니즘인 도구들을 배치하고 있다.

매년 최고 보건 기술 위험 목록을 발표하는 환자 안전 비영리 단체 ECRI는 AI 주도 진단 위험을 2025년과 2026년 모두 1위 위험으로 선정했다. 상위 10위가 아니다. 2년 연속 1위다.

"읽고 검토함"은 법적 허구다

2025년 1월부터 시행된 캘리포니아의 AB 3030은 의료 시스템이 환자와의 임상 커뮤니케이션에 AI가 사용될 때 이를 공개하도록 요구한다. 그것은 합리적으로 들리는 면제 조항을 담고 있다: 면허를 소지한 제공자가 AI의 출력을 읽고 검토하면, 공개가 필요 없다. 그 논리는 인간이 개입 루프에 있으면 AI의 기여가 보이지 않고 안전해진다는 것이다.

Lancet 데이터는 그 논리를 무너뜨린다. 만약 의사들이 유해 오류의 3분의 2를 놓친다면, "읽고 검토함"은 상당한 비율의 사례에서 형식적 승인일 뿐이다. 그 면제 조항은 자동화 편향이 대규모로는 불가능하게 만드는 수준의 검토 품질을 가정한다. 위반은 시설당 사건 한 건에 최대 25,000달러에 이르며, 메모에 이름이 올라간 의사에게는 징계 노출이 더해진다.

나는 최고 의료 정보 책임자들과 많은 시간을 보내는데, 대화가 대개 불편해지는 지점이 바로 여기다. 법적 틀은 인간 검토가 의미 있다고 전제한다. 임상 현실은 의미 있는 검토가 AI 벤더들이 대부분 구축하지 않은 기술적 발판 — 불확실성 강조, 원문으로 되돌아가는 인용 연결, 의사가 중요한 주장에 대해 멈추게 하는 능동적 확인 워크플로 — 을 필요로 한다는 것이다. 소수의 벤더가 그것을 구축하기 시작했는데 — Abridge의 Linked Evidence는 생성된 메모의 각 줄을 그것을 만들어낸 정확한 오디오 구간으로 추적한다 — 이는 그 역량이 존재하며 대부분의 도구가 여전히 그것을 우선시하지 않는다는 것을 증명할 뿐이다. 그 발판 없이는 "인간이 검토했다"는 것은 안전 통제가 아니라 컴플라이언스 체크박스일 뿐이다.

벤더는 0.001%라고 했다. 텍사스 법무장관은 증명하라고 했다.

청구 대 측정: 현장에서 발견된 0.98%의 비율에 대비한 벤더의 정확도 주장, 12배 더 높음

모든 임상 AI 벤더는 정확도 숫자를 앞세운다. 이 도구들을 감사하며 내가 처음 배운 것은, 그 숫자가 어떻게 계산되었는지 알기 전까지는 그것이 마케팅 산물이라는 것이다.

2024년 9월, 텍사스 법무장관은 Pieces Technologies와 그 회사가 마케팅한 0.001% 미만이라는 "중대 환각률" 주장을 두고 합의했다. Pieces의 소프트웨어는 텍사스의 4개 주요 병원 — Houston Methodist, Children's Health, Texas Health Resources, Parkland — 에 배치되어 있었다. 이 사건에서 놀라운 점은 법무장관이 AI 특화 법률을 전혀 필요로 하지 않았다는 것이다. 회사가 입증할 수 없는 정확도 주장에 이의를 제기하는 데는 기존의 소비자 보호 법령으로 충분했다.

그 합의 — 5년간의 자발적 준수 확약 — 은 이제 Pieces가 모든 고객에게 자사의 지표가 어떻게 정의되고 계산되는지, 모델이 어떤 데이터로 훈련되었는지, 그리고 어떤 유해한 용도를 알고 있는지 공개하도록 강제한다. 그것은 업계 전체를 위한 하나의 본보기다.

분모 없는 환각률은 측정이 아니다. 그것은 광고다.

0.001%를 우리와 다른 이들이 현장에서 실제로 발견하는 것과 비교해 보라. 2025년 1분기 파일럿에서, 한 AI 퇴원 도우미가 특정 약물 계열에 알레르기가 있다고 명시적으로 기록된 환자에게 그 약물을 권했다. 임상적으로 조치가 필요한 그것의 실제 오진술 비율은 0.98% — 벤더가 주장한 0.08%의 12배였다. 같은 범주의 제품, 슬라이드와 환자 사이의 자릿수 규모의 격차. MIT 미디어 랩은 완화 조치 없이 모델이 임상 사례에서 60%가 넘는 환각률을 기록한다는 것을 발견했다. 정직한 답은, 어느 데이터셋으로 계산되었고, 누가 검증했으며, 어느 기간에 걸쳐, 그리고 — 거의 아무도 묻지 않는 질문 — 어떤 환자 인구 집단에 걸쳐서인지 묻기 전까지는 누구의 대표 숫자도 아무 의미가 없다는 것이다.

그 마지막 질문은 그 뒤에 시신들이 있는 질문으로 드러났다.

기기가 숨기기 때문에 볼 수 없는 편향

맥박 산소 측정, Epic 패혈증 모델, 그리고 산모 사망률에 걸친 임상 AI의 인구 집단별 실패

중환자실 밖에서 더 잘 알려졌으면 하는 사실이 하나 있다. 맥박 산소 측정기 — 환자의 손가락에 끼워 혈중 산소 포화도를 읽는 그 작은 집게, 의학에서 가장 신뢰받는 수치 중 하나 — 는 어두운 피부에서 체계적으로 덜 정확하다.

흑인 환자는 잠재성 저산소혈증을 가질 가능성이 대략 3배 더 높다: 기기가 정상으로 읽는 위험할 정도로 낮은 혈중 산소. 과대 추정은 0.6에서 1.5퍼센트 포인트에 이르는데, 이는 "ICU에 입원"과 "귀가 조치" 사이의 차이가 되기 전까지는 사소하게 들린다. 소아 데이터에서, 기기는 가장 어두운 피부색을 가진 아동의 7%에서 낮은 산소를 놓쳤고 가장 밝은 피부색에서는 0%를 놓쳤다. FDA는 2025년 1월 제조업체가 Monk 피부색 척도를 사용해 최소 150명의 다양한 참가자를 대상으로 시험할 것을 권고하는 지침 초안을 발표했는데, 이는 이전에 열 명 정도로 적었던 관행에서 상향된 것이다.

이제 이미 센서 단계에서 편향된 측정 위에 AI를 겹쳐 보라. 모델은 편향을 물려받아 자신감 있는 출력을 통해 그것을 세탁한다. 이것은 벤더들이 자기 안에서 발견할 준비가 가장 안 되어 있는 임상 AI 안전의 부분인데, 그것을 발견하려면 인종, 성별, 연령별로 성능을 의도적으로 계층화한 다음 — 그 격차를 공개해야 하기 때문이다.

Epic 패혈증 모델은 내가 모든 거버넌스 논의에 가져가는 교훈적 사례다. 개발사는 AUC — 1.0이 완벽하고 0.5가 동전 던지기인 예측 정확도의 표준 척도 — 를 0.76에서 0.83으로 보고했다. 미시간 대학교가 자기 환자들을 대상으로 외부에서 그것을 검증했을 때, 그들은 0.63을 얻었다. 민감도는 33%였는데, 이는 패혈증 사례의 3분의 2를 놓쳤다는 뜻이다. 양성 예측도는 12%였는데, 이는 경보의 88%가 오경보였다는 뜻이다. 그리고 그것은 패혈증 발생률이 거의 두 배인 흑인 및 히스패닉 환자에 대해 제대로 보정되지 않았다. 과거의 임상 판단으로 훈련된 모델은 과거의 임상적 맹점을 학습한 다음, 알고리즘의 권위를 두른 채 그것을 임상의들에게 되쏜다. Epic은 2022년에 그 모델을 전면 개편했고, 그 두 번째 버전에 대한 다기관 전향적 검증이 2026년 2월 JAMA Network Open에 실렸는데 — 이것이 바로 핵심이다. 외부의, 배치 후 검증이야말로 원래의 AUC 주장이 숨기는 격차를 잡아내는 것이며, 여기서는 그것을 강제하는 데 수년과 외부 연구자들이 필요했다.

이것의 가장 극단적인 버전은 산모 진료에서 나타난다. 흑인 여성은 출생아 10만 명당 42.8에서 50.3명이 출산 중 사망하는데, 백인 여성은 13에서 14.5명이다. 한 캘리포니아 검토는 AI 조기 경보 시스템이 흑인 환자의 중증 이환 사례 40%를 놓쳤다는 것을 발견했다. 경보 시스템이 가장 위험한 인구 집단에 눈이 멀었을 때, 그것은 단지 중립적으로 실패하는 것이 아니라 — 그것이 좁히도록 판매된 그 격차를 넓힌다.

모델을 편향에 대해 그냥 시험하고 넘어가면 안 되는 이유는?

사람들은 왜 의료 시스템이 그냥 공정성 검사를 실행하고 모델을 인증하지 않느냐고 나에게 묻는다. 나는 그것이 자원의 문제라고 생각하곤 했다. 그것은 그보다 더 깊고, 수학적이다.

Chouldechova의 불가능성 정리라는 결과가 있다. 간단히 말해: 두 가지 합리적인 공정성 정의 — 인구 통계학적 동등성(모델이 각 집단에 같은 비율로 플래그를 단다)과 균등화된 승산(모델이 각 집단 내에서 동등하게 정확하다) — 은 사소한 경우를 제외하고는 동시에 모두 충족될 수 없다. 어떤 종류의 공정성을 최적화할지 선택해야 하며, 그 선택은 임상적 결과를 낳는다.

"우리는 편향을 시험했다"는 것은 기준을 명명하지 않으면 무의미하다. 어떤 공정성 정의를 선택했는지 말해 줄 수 없는 벤더는 하나를 선택해 놓고도 당신에게 말하지 않는 것이다.

이것이 진짜 편향 감사가 일회성 인증서가 아닌 이유다. 그것은 계층화된 하위 집단 성능 표, 인구 집단별 보정 곡선, 그리고 배치 지점별로 추적되는 인구 안정성 지수 — 드리프트 지표 — 인데, 보스턴에서 공정했던 모델이 환자 구성이 바뀌면서 휴스턴에서는 보정을 벗어나 드리프트할 수 있기 때문이다. 이 작업을 위한 전문가 판정 정답 라벨은 사례당 50에서 200달러가 든다. 그것은 값비싸고, 전문화되고, 지속적인 인프라다. 그것은 또한 조달 결정과 검시관 보고서 사이에 서 있는 유일한 것이다.

아무도 전체 스택을 소유하지 않는다

내가 계속 마주친 구조적 문제는 이것이다: 중대형 의료 시스템은 한 번에 다섯 개에서 열다섯 개 사이의 AI 도구를 운영한다. 앰비언트 스크라이브(UPMC의 40개 이상 병원에 걸친 Abridge, 또는 EHR에 연결된 Nuance의 DAX Copilot), Epic의 패혈증 모델, 환자 포털 초안 작성기, 분류 알고리즘, 코딩 도우미. 각각은 자기 나름의 정확도 주장, 자기 나름의 안전 프로파일, 자기 나름의 맹점, 그리고 자기 나름의 대시보드를 가진다. 어떤 벤더도 그것들을 전부 판매하지 않기 때문에, 어떤 벤더도 도구들에 걸친 거버넌스를 제공하지 않는다.

그리고 존재하는 거버넌스는 조직도가 시사하는 것보다 얄팍하다. Censinet의 2026년 데이터는 의료 시스템의 84%가 AI 거버넌스 위원회를 두고 있음을 보여준다 — 그러나 AI 도구가 가동되기 전에 공식적이고 문서화된 승인 절차를 갖춘 곳은 59%에 불과하다. CIO는 그 위원회의 63%에 참여하고 있으며; 도구가 틀렸을 때 임상적으로 책임지는 사람인 CMIO는 오직 45%.에만 참여하고 있다. 한편 임상의들은 어떤 위원회가 검토할 수 있는 것보다 빠르게 스스로 도구를 채택하고 있다 — 섀도 AI.

이것이 Veriprajna가 채우기 위해 만들어진 격차이며, 이것이 내가 우리가 하는 일을 "환각 탐지"라고 묘사하기를 멈춘 이유다. 우리는 의료 시스템이 실제로 배치한 AI에 대해 독립적이고 벤더 중립적인 평가를 수행한다: 적대자나 최악의 날이 하듯이 도구들을 레드팀하고, 벤더의 정확도 주장을 실제 분모에 대비해 검증하며, 대부분의 IT 팀에게 실행 역량이 없는 편향 감사를 수행하고, AB 3030, 콜로라도의 AI 법, 그리고 EU AI 법의 고위험 규칙을 법적 불안이 아닌 운영 통제로 전환한다. 모든 도구에 걸쳐 있는 하나의 안전 계층.

"이건 그냥 혁신을 늦추는 것 아닌가요?"

내가 가장 많이 듣는 반론이며, 대개 앰비언트 문서화가 단 한 해에 6억 달러 규모의 범주가 되는 것을 지켜보고 안 된다고 말한 임원이 되고 싶지 않은 누군가에게서 나온다.

나는 그 반대라고 주장하겠다. 독립적 안전이야말로 빠른 채택을 견딜 수 있게 만드는 것이다. 화상을 입는 의료 시스템은 신중한 곳들이 아니다 — 그들은 벤더의 슬라이드 자료를 보고 배치한 뒤 환자가 다치고 나서야 0.08%와 0.98% 사이의 격차를 발견한 곳들이다. 평균적인 의료 AI 투자는 1달러당 약 3.20달러를 돌려주며, 14개월 안에 실현된다. 그 ROI는 검증되지 않은 도구가 의료 과실 청구를 만들어내는 첫 순간 증발한다 — 그리고 AI 관련 청구는 이미 2022년 이래 14% 증가했으며, 영상의학, 심장학, 종양학에 집중되어 있다. 검증은 혁신에 대한 세금이 아니다. 그것은 첫 문제가 터진 뒤에도 계속 혁신할 수 있게 해 주는 보험이다.

두 번째 반론: 우리 자체 정보학 팀이 이걸 처리할 수 없나요? 때로는, 부분적으로는 가능하다. 그러나 독립적 평가의 가치는 바로 그것이 독립적이라는 데 있다 — 회사가 자사의 재무를 감사하도록 두지 않는 것과 같은 이유다. 벤더는 스스로를 더 나빠 보이는 숫자로 레드팀하지 않을 것이며, 구매를 지지했던 내부 팀은 그것이 성공하는 데 조용한 이해관계를 가진다. 그 거래에 아무런 입장이 없는 누군가가 다른 모든 사람에게는 묻지 않을 이유가 있는 질문들을 던진다.

오늘 CMIO에게 내가 할 말

내가 중요하다고 생각하곤 했던 질문은 이 AI가 작동하는가?였다. 나는 틀렸다. 모든 벤더가 그것이 작동한다는 것을 당신에게 보여줄 것이다. 중요한 질문은 이것이다: 규제 당국이나, 원고 측 변호사나, 기자가 요청하는 그날에 — 모든 환자 인구 집단에 걸쳐 — 그것이 작동한다는 것을 증명할 수 있는가?

지금 당장 대부분의 의료 시스템은 그럴 수 없다. 그들은 재현할 수 없는 정확도 숫자, 임상 리더가 없는 거버넌스 위원회, 그리고 어떤 독립적 당사자도 함께 시험해 본 적 없는 도구 무리를 가지고 있다. 유창한 초안은 계속 클릭되어 통과될 것이다. 패혈증 경보는 계속 88%의 확률로 늑대가 나타났다고 외칠 것이다. 맥박 산소 측정기는 정상이 아닌 환자에게 계속 정상이라고 읽을 것이다.

나는 Veriprajna의 의료 AI 안전 실무를 만들었는데, 그 메트포르민 사례가 결코 나를 떠나지 않았기 때문이다. 그 메모는 완벽했다. 그 안의 모든 것이 참이었다. 그리고 그것은 누군가를 죽일 수도 있었다 — AI가 멍청해서가 아니라, 그것이 설득력 있었고, 그것이 말하지 않은 것을 확인할 준비가 된 사람이 아무도 없었기 때문이다. 임상 AI에서의 안전은 명백한 실수를 잡아내는 것이 아니다. 그것은 환자가 잡아내기 전에, 보이지 않는 실수를 잡아낼 인프라를 구축하는 것이다.

관련 연구

다른 채널에도 게시됨

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.