리스크 및 컴플라이언스 담당자용4 분 소요

의료 분야의 AI 정확도 주장: 0.001%의 실제 의미

텍사스주는 4개 병원이 이미 도입한 이후, 한 AI 벤더가 내세운 환각률이 마케팅적 허상에 불과했음을 인정하도록 강제했습니다.

문제점

2024년 9월, 텍사스주 법무장관은 Pieces Technologies라는 헬스케어 AI 기업과 획기적인 합의를 이끌어냈습니다. 이 기업은 병원 측에 자사의 임상 문서화 소프트웨어의 "치명적 환각 발생률(critical hallucination rate)"이 0.001% 미만, 즉 10만 건의 출력당 1건 미만의 오류에 불과하다고 밝혔습니다. 텍사스주는 해당 주장이 부정확할 뿐만 아니라 기만적이라고 규정했습니다.

밤잠을 설치게 만들 정도로 심각한 부분은 바로 이 지점입니다. 텍사스의 4개 주요 대형 병원이 이미 이 소프트웨어를 도입해 사용하고 있었습니다. Houston Methodist, Children's Health System of Texas, Texas Health Resources, 그리고 Parkland Hospital이 모두 이 시스템을 사용했습니다. AI는 환자 차트를 요약하고, 임상 경과 기록을 작성하며, 퇴원 지연 요인을 추적했습니다. 이는 결코 위험도가 낮은 업무가 아닙니다. 임상 문서화 과정에서의 오류는 환자의 안전에 직결될 수 있습니다.

텍사스주 법무장관이 조치를 취하는 데 새로운 AI 법률은 필요하지 않았습니다. 기존의 소비자 보호 규정인 텍사스 기만적 거래 관행 및 소비자 보호법(Texas Deceptive Trade Practices–Consumer Protection Act)만으로도 충분했습니다. 주 당국은 Pieces Technologies가 마케팅에 활용한 정확도 지표가 "부정확할 가능성이 높으며" 잠재적으로 오해의 소지가 있다고 결론지었습니다. 이러한 파장의 영향을 체감하기 위해 귀사의 조직이 반드시 헬스케어 분야에 속해 있어야 하는 것은 아닙니다. AI를 배포하고 그 정확성에 대해 대외적인 주장을 펼친다면, 주 법무장관은 이미 여러분을 조사할 수 있는 법적 수단을 갖추고 있습니다.

이번 사건은 단순히 특정 기업 한 곳만의 문제가 아닙니다. 규제 대상이 되는 의사결정과 관련된 AI 시스템을 구매하거나 구축하는 모든 기업을 향한 엄중한 경고입니다.

이것이 여러분의 비즈니스에 중요한 이유

검증되지 않은 AI 주장으로 인한 재무적·법적 위험 노출은 더 이상 이론적인 문제가 아닙니다. Pieces Technologies의 합의안은 텍사스주와의 5년간의 컴플라이언스 준수 의무를 수반했습니다. 이는 향후 5년 동안의 의무적 정보 공개, 지속적인 모니터링, 그리고 독립적인 제3자 감사의 가능성을 의미합니다. 이러한 수준의 엄격한 조사가 여러분의 비즈니스 운영에 어떤 영향을 미칠지 고려해 보십시오.

업계 전반의 통계는 냉혹한 현실을 보여줍니다:

  • 기업의 단 5%만이 대규모 AI 도입을 통해 측정 가능한 비즈니스 가치를 창출하고 있습니다. 나머지 95%는 뚜렷한 수익 없이 지출만 지속하고 있습니다.
  • 개발자의 65%는 AI가 복잡한 작업을 수행하는 동안 "관련 문맥을 상실하여" 미묘한 오류나 불일치를 유발한다고 보고합니다.
  • 벤더로부터 전문 AI 도구를 구매하는 기업의 성공률은 **67%**인 반면, 처음부터 자체 도구를 구축하는 기업이 성공하는 비율은 **33%**에 불과합니다.

이번 합의에 따라 Pieces Technologies는 제품을 훈련하는 데 사용된 구체적인 데이터와 모델을 공개해야 합니다. 또한 모든 성능 지표의 산출 방법론을 공개할 것을 요구받고 있습니다. 만약 여러분의 AI 벤더가 정확도 주장을 어떻게 계산했는지 입증하지 못한다면, 귀사는 그 위험을 고스란히 공유하게 됩니다.

이사회와 컴플라이언스 팀에 전하는 교훈은 명확합니다. 규제의 기준은 "AI가 대부분의 경우에 잘 작동했는가"가 아닙니다. 기준은 "그것을 증명할 수 있는가, 그리고 측정 방식에 대해 고객에게 진실을 말했는가"입니다. 귀사의 조직이 임상, 금융, 법률 등 규제 대상 업무에 AI를 배포하고 있다면, 이번 합의는 기업 실사(due diligence)의 새로운 기준점이 됩니다.

내부에서 실제로 벌어지고 있는 일

0.001% 환각 발생률 주장이 왜 그토록 의구심을 불러일으키는지 이해하려면, 이러한 AI 시스템이 실제로 어떻게 작동하는지 알아야 합니다.

GPT-4와 같은 도구의 기반 기술인 대규모 언어 모델(LLM)은 예측 엔진입니다. 이들은 훈련 과정에서 학습한 패턴을 기반으로 가장 가능성이 높은 다음 단어를 추측하여 텍스트를 생성합니다. 스마트폰의 자동 완성 기능이 전체 단락을 작성할 수 있을 만큼 확장된 형태라고 생각하면 됩니다. 시스템은 사실을 "이해"하지 않습니다. 그럴듯하게 들리는 내용을 예측할 뿐입니다.

환각(hallucination)은 문맥상 자연스럽게 들리지만 사실상 틀린 단어나 구문에 AI가 높은 확률을 부여할 때 발생합니다. 임상 환경에서는 문장 구조에는 들어맞지만 환자의 실제 차트와는 일치하지 않는 약물 이름을 생성하는 것이 이에 해당할 수 있습니다.

이러한 오류를 0.001%라는 정밀도로 측정하려면 완벽하게 라벨링된 방대한 임상 요약 데이터셋이 필요합니다. 그러나 그러한 데이터셋은 존재하지 않습니다. 임상 문서는 개별 환자와 의사마다 너무 파편화되어 있고 구체적이어서 보편적인 골드 스탠더드(gold standard) 기준을 수립하기 어렵습니다.

이것이 바로 백서에서 언급하는 "래퍼(wrapper)" 모델의 핵심 문제입니다. 래퍼는 API를 통해 범용 AI로 데이터를 전송한 후 반환되는 결과를 그대로 표시합니다. 여기에 추가되는 도메인별 검증 장치는 미미합니다. 이러한 방식은 제품을 시장에 빠르게 출시할 수는 있지만, 환각을 포착하고 데이터 유출을 방지하며 프롬프트 인젝션 공격을 방어하는 데 필요한 기술적 안전장치가 결여되어 있습니다. 범용 모델에 대한 단순한 API 호출만으로는 환자의 전체 병력이나 의사 특유의 문서화 스타일을 온전히 반영할 수 없습니다. 빠른 시장 출시가 실제 환경에서의 안전성을 보장하는 것은 아닙니다.

무엇이 통하고 (무엇이 통하지 않는가)

먼저, 잘못된 안도감을 주는 접근 방식부터 배제해 보겠습니다:

  • 벤더가 보고한 정확도 지표에만 의존하는 것. 텍사스 사례는 이러한 벤치마크가 엔터프라이즈급 검증에 요구되는 엄격성과 독립성을 결여할 수 있음을 입증했습니다. 조달 및 구매 팀에는 독립적인 증거가 필요합니다.
  • 단일 AI 모델의 자체 검증을 맹신하는 것. 자체적인 범용 안전장치를 적용하는 단일 범용 모델은 고위험 임상 또는 금융 의사결정에 충분하지 않습니다.
  • 데이터 품질 전략 없이 AI 파일럿을 확장하는 것. 연구에 따르면 선도 기업들은 "70:20:10" 규칙을 따릅니다. 즉, 구현 노력의 70%는 조직 변화에, 20%는 기술 스택에 투입되며, 알고리즘 자체에는 10%만 투입됩니다. 반면 대다수 후발 주자들은 정제되지 않거나 사일로화된 데이터 위에서 모델을 무리하게 확장합니다.

실제로 효과가 있는 것은 검증 가능한 출력을 중심으로 구축된 3단계 접근법입니다:

1. 모든 AI 응답을 실제 데이터에 기반(grounding)하도록 합니다. 검색 증강 생성(Retrieval-Augmented Generation, RAG)은 AI가 답변을 생성하기 전에 실제 원천 문서를 검색하고 참조하는 방식으로, 출력을 조직이 직접 통제하는 사실에 결속시킵니다. AI가 훈련 데이터에 의존해 추측하게 두는 대신, 실제 환자 기록, 계약서 또는 정책 문서를 제공합니다. 이 접근 방식은 실시간 데이터 검색과 장기 벡터 스토리지를 통해 문맥 유지 능력을 향상시킵니다.

2. 적대적 탐지 레이어(adversarial detection layer)를 추가합니다. 이는 첫 번째 AI의 작업을 검증하는 것만을 전담하는 두 번째 AI 시스템을 배포하는 것을 의미합니다. Pieces Technologies의 아키텍처에서 자체 탐지 모듈은 무작위 샘플링에 비해 임상적으로 유의미한 환각을 포착하는 데 7.5배 더 효과적이었습니다. 전체 수치에 대한 논란이 있더라도 그 원리는 유효합니다. 즉, 자동화된 검증은 인간이 놓치는 오류를 잡아냅니다.

3. 고위험 의사결정에는 인간의 개입(Human-in-the-loop)을 유지합니다. AI는 초안을 작성해야지 결정을 내려서는 안 됩니다. Pieces의 경우, 탐지 시스템에 의해 플래그가 지정된 요약본은 전문의에게 전달되어 검토를 거쳤습니다. 플래그가 지정된 오류를 수정하는 데 걸린 시간의 중앙값은 3.7시간이었습니다. 급성기 치료 환경에서 이러한 지연은 경과 기록에는 수용 가능할 수 있지만, 실시간 의사결정 지원에는 위험할 수 있습니다. 위험도와 요구되는 응답 속도에 따라 AI 활용 사례를 계층화해야 합니다.

감사 추적(audit trail)의 이점은 귀사의 컴플라이언스 및 법무 팀을 위해 이 모든 요소를 하나로 묶어줍니다. FAIR-AI와 같은 프레임워크는 배포되는 모든 도구에 대해 "AI 라벨(AI Label)"을 생성할 것을 권장합니다. 이 라벨은 훈련 데이터, 모델 버전, 알려진 실패 모드를 최종 사용자에게 공개합니다. 규제 기관이나 감사관이 AI가 특정 결정을 어떻게 내렸는지 질의할 때, 어떤 원천 문서를 참조했는지, 어떤 검증 단계를 통과했는지, 어떤 담당자가 최종 출력을 승인했는지 정확하게 보여줄 수 있습니다. 이러한 투명성이야말로 법적으로 방어 가능한 배포와 법적 책임을 가르는 기준이 됩니다.

다음에 속한 기업에게 있어 헬스케어 및 생명과학분야의 이러한 그라운딩 및 인용 검증 은 선택 사항이 아니라 새롭게 떠오르는 표준입니다. AI를 구조화된 지식 그래프 및 검증된 원천 기록과 연결하는 GraphRAG 아키텍처 는 이를 가능하게 만드는 기술적 기반입니다.

이러한 권장 사항의 세부 엔지니어링 내용은 기술 분석 전문 읽기 또는 대화형 버전 살펴보기 를 통해 확인하실 수 있습니다.

핵심 요점

  • 텍사스주는 새로운 AI 규제가 아닌 기존 소비자 보호법을 적용하여, 오해의 소지가 있는 정확도 주장을 펼친 헬스케어 AI 벤더에게 5년간의 컴플라이언스 준수 합의를 강제했습니다.
  • 기업의 단 5%만이 대규모 AI 도입을 통해 측정 가능한 비즈니스 가치를 창출하며, 성공적인 구현 노력의 70%는 알고리즘이 아닌 조직 변화에 투입됩니다.
  • 0.001% 환각률 주장은 임상 문서화 분야에는 존재하지 않는 완벽하게 주석이 달린 골드 스탠더드 데이터셋을 전제로 합니다.
  • 첫 번째 AI를 검증하는 두 번째 AI인 적대적 탐지 모듈은 무작위 샘플링에 비해 임상적으로 유의미한 환각을 포착하는 데 7.5배 더 효과적입니다.
  • 배포되는 모든 AI 도구는 훈련 데이터, 모델 버전, 알려진 실패 모드를 최종 사용자와 감사관에게 공개하는 'AI 라벨'을 보유해야 합니다.

결론

텍사스주의 이번 합의는 검증되지 않은 정확도 주장에 대해 귀사에 법적 책임을 묻는 데 주 법무장관이 새로운 AI 법률을 필요로 하지 않는다는 점을 증명합니다. 귀사의 AI가 규제 대상 의사결정에 관여한다면, 자체 데이터에 기반(grounding)한 검증 가능한 출력, 적대적 검증 레이어, 그리고 위험도에 따라 계층화된 인간의 감독이 필요합니다. AI 벤더에게 질문하십시오: '정확도를 정확히 어떻게 계산했는지, 어떤 데이터셋을 사용했는지 보여줄 수 있습니까? 그리고 독립적인 제3자 감사에 응하겠습니까?'

자주 묻는 질문

자주 묻는 질문

의료 문서화에 AI를 신뢰할 수 있습니까?

AI는 의료 문서 작성을 지원할 수 있지만, 적절한 안전장치가 있을 때만 가능합니다. 텍사스 법무장관과 Pieces Technologies 간의 합의는 0.001% 환각률과 같은 정확도 주장이 오해의 소지가 있음을 보여주었습니다. 신뢰할 수 있는 시스템을 구축하려면 실제 환자 기록에 출력을 기반(grounding)하는 검색 증강 생성(RAG), 적대적 탐지 레이어, 그리고 고위험 출력에 대한 인간 검토가 필요합니다.

텍사스 헬스케어 AI 합의에서는 무슨 일이 있었습니까?

2024년 9월, 텍사스주 법무장관은 치명적 환각률이 0.001% 미만이라고 주장한 헬스케어 AI 기업 Pieces Technologies와 합의했습니다. 주 당국은 이 지표가 부정확하고 기만적이라고 주장했습니다. 텍사스의 4개 주요 병원이 해당 소프트웨어를 도입한 상태였습니다. 이번 합의로 해당 기업은 5년간 지표 투명성 유지, 위험 고지, 훈련 데이터 문서화 의무를 이행해야 합니다.

벤더의 AI 정확도 주장을 어떻게 검증해야 합니까?

벤더에게 정확도 지표를 어떻게 계산했는지, 어떤 데이터셋을 사용했는지, 독립적인 제3자 감사를 받을 것인지 명확히 공개하도록 요구하십시오. 텍사스 합의에 따라 이제 AI 기업은 모든 정확도 벤치마크에 대한 정의와 계산 방식을 공개해야 합니다. FAIR-AI와 같은 프레임워크는 훈련 데이터, 모델 버전, 알려진 실패 모드를 공개하는 AI 라벨을 생성할 것을 권장합니다.

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.