문제 상황
귀사의 AI가 일상적인 정맥 주사 라인과 개심술을 혼동하여 임상시험 적격 환자를 잘못 탈락시켰습니다. 이는 가상의 시나리오가 아닙니다. 임상시험 매칭용 AI를 평가한 연구에 따르면, 모델들이 "심장 도관술은 중심정맥 천자와 동일하다"고 잘못 결론을 내려 정당하게 자격을 갖춘 환자를 부당하게 제외하는 사례가 발견되었습니다. 한 시술은 혈관 폐색을 진단하기 위해 카테터를 심장으로 삽입하는 것이고, 다른 하나는 약물을 투여하기 위해 주요 정맥에 라인을 거치하는 시술로 흔히 병상에서 시행됩니다. 두 시술은 '카테터'라는 단어만 공유할 뿐, 유사점은 거기서 끝납니다.
하지만 범용 AI는 이를 알지 못합니다. AI는 '카테터', '정맥', '천자'와 같이 중복되는 단어를 포착하고, 표면적인 유사성에 기반해 이들을 하나로 묶어버립니다. 그런 다음 해당 환자를 부적격으로 판정합니다. 귀사 팀의 그 누구도 해당 환자의 기록을 다시 확인하지 않게 됩니다. 이러한 오류가 수천 건의 환자 기록에 걸쳐 누적되면, 왜 임상시험의 약 80%가 환자 모집 기한을 맞추지 못하는지 이해하게 됩니다. 업계에 필요한 조건을 갖춘 환자가 부족한 것이 아닙니다. 겉보기에 유사하지만 임상적으로 완전히 다른 의미를 지닌 두 시술을 구별할 수 있는 AI가 부족한 것입니다. 귀사의 스크리닝 도구는 적격한 사람을 거절하고 부적격한 대상자에게 시간을 낭비하고 있습니다.
비즈니스에 미치는 중대한 영향
임상시험 일정이 하루씩 지연될 때마다 영원히 회수할 수 없는 막대한 손실이 발생합니다. 터프츠 의약품개발연구센터(Tufts CSDD)의 최신 분석에 따르면, 고수익 주력 신약의 경우 단 하루의 지연으로 발생하는 처방 매출 손실액은 약 80만 달러에 달합니다. 심혈관 치료제의 경우 이 수치는 하루 140만 달러까지 치솟으며, 혈액학 분야에서는 하루 130만 달러에 이릅니다.
이는 단순한 운영비가 아닙니다. 귀사의 의약품이 최고 매출을 창출할 수 있는 유일한 기간인 특허 독점 기간 동안 손실되는 직접적인 매출입니다.
조직 전체에 걸쳐 손실이 어떻게 누적되는지 살펴보십시오:
- 직접 운영비 소진: 시험 기관 유지, 데이터 모니터링, CRO 계약 유지는 2상 및 3상 임상시험에서 하루 약 4만 달러의 추가 비용을 발생시킵니다.
- 스크리닝 실패로 인한 낭비: 사전 스크리닝 단계에 진입했으나 최종적으로 부적격 판정을 받는 환자 1인당 약 1,200달러의 비용이 소모됩니다. AI가 시험 코디네이터에게 잘못된 매칭 결과를 쏟아낼 경우, 이러한 비용은 걷잡을 수 없이 불어납니다.
- 연구 기관의 등록 미달: 전체 연구 기관의 약 37%가 환자 등록 목표를 달성하지 못하며, 11%는 단 한 명의 환자도 등록하지 못하고 실패합니다. 부실한 AI 매칭이 주된 원인입니다.
- 경쟁 우위 상실: 비소세포폐암이나 급성 골수성 백혈병과 같이 경쟁이 치열한 적응증에서는 가장 먼저 승인받은 약물이 시장 대부분을 선점합니다. 모집 차질로 인한 6개월의 지연은 과학적으로 우수한 약물을 상업적 실패작으로 전락시킬 수 있습니다.
이사회에서 임상시험이 지연되는 이유를 물었을 때, "AI가 정맥 카테터와 심장 시술을 혼동했다"고 답변할 수는 없습니다.
실제 내부에서 일어나는 일
이 상황을 이렇게 생각해 보십시오. 진료 기록이 가득 찬 캐비닛을 누군가에게 건네며 임상시험에 적합한 환자를 찾아달라고 요청합니다. 하지만 그 담당자는 임상적 의미를 파악하며 읽는 대신, 방대한 문서에서 Ctrl+F를 누르듯 특정 단어만을 검색합니다. 제외 목록에 '심장 도관술'이 적혀 있고 환자 차트에 '중심정맥관'이 언급되어 있다면, 단어 매칭기는 이를 일치 항목으로 감지합니다. 그리고 환자는 탈락 처리됩니다.
이는 구형 키워드 매칭기이든 최신 대형 언어 모델(ChatGPT의 기반 기술인 LLM)이든 현재 대부분의 AI 도구가 작동하는 방식 그대로입니다. LLM이 더 정교하긴 하지만 여전히 단어 간 근접성에 기반하여 작동합니다. 내부 수학적 공간에서 '심장 도관술'과 '중심정맥관 삽입술'은 매우 가까운 위치에 자리합니다. 둘 다 카테터를 사용하고 혈관계와 관련되기 때문입니다. 이러한 시술들이 의학 체계의 완전히 다른 분야에 속한다는 사실을 알려주는 구조화된 의료 지식 베이스가 없다면, AI는 두 시술을 필연적으로 혼동하게 됩니다.
백서에서는 이를 '정밀도 격차(precision gap)'라고 정의합니다. 이로 인해 자동화가 증가할수록 효율성이 오히려 저하되는 역설이 발생합니다. 도구가 100명의 후보 환자를 제시하더라도 실제 적격 환자가 5명에 불과하다면, 시험 코디네이터는 도구에 대한 신뢰를 잃게 됩니다. 이들은 도구 사용을 중단하고 수작업 차트 검토로 회귀합니다. 귀사는 팀의 속도를 늦추는 AI에 비용을 지불한 셈이 됩니다.
핵심 문제는 LLM이 다음에 올 가능성이 가장 높은 단어를 예측할 뿐, 의학적 사실에 대해 논리적으로 추론하지 않는다는 점입니다. 질문의 표현 방식에 따라 동일한 질문에도 서로 다른 답변을 내놓을 수 있습니다. 임상시험은 100% 재현 가능한 감사 추적(Audit Trail)을 필요로 합니다. 규제 당국은 각 환자가 포함되거나 제외된 정확한 근거를 파악해야 합니다. 확률은 증거가 될 수 없습니다.
성공하는 접근법과 실패하는 접근법
한계에 부딪히는 세 가지 일반적인 방식:
- 키워드 매칭 및 PDF 파서: 적격성 검토를 단어 찾기 게임처럼 취급합니다. '카테터'라는 단어를 공유하는 심장 시술과 정맥 시술을 구별하지 못합니다.
- 범용 LLM 래퍼 API: 환자 데이터를 대형 언어 모델에 전송하여 적격성을 추측하게 합니다. 환각(Hallucination)을 일으켜 차트에 존재하지도 않는 진단명이나 승인 기록을 만들어내기도 합니다. 또한 보호 대상 건강 정보(PHI)가 외부 서버로 전송되면서 심각한 데이터 프라이버시 위험이 발생합니다.
- 구조화된 필드의 불리언(Boolean) 필터: 예/아니오 항목(예: '고혈압 = TRUE')만을 확인하며 예외 조항을 해석하지 못합니다. "최소 3개월 이상 안정적인 약물 투여로 잘 조절되는 경우를 제외하고, 고혈압 환자를 배제한다"는 프로토콜은 무조건적인 탈락으로 이어집니다. 잘 조절되고 있는 고혈압 환자 전원을 놓치게 됩니다.
실제로 효과를 발휘하는 것은 '텍스트 판독'과 '논리적 추론'을 명확히 분리하는 뉴로-심볼릭(Neuro-Symbolic) 아키텍처입니다. 다음 세 단계로 작동합니다:
- 입력 — 판독기(Reader): 언어 모델이 비정형 데이터(PDF, 의사 경과 기록, 스캔된 검사 결과지)를 판독합니다. 그 유일한 임무는 텍스트 내에서 의료 개념을 식별하는 것입니다. 적격 여부를 직접 판단하지 않고, '중심정맥 천자'와 같은 용어를 추출하여 표준화된 의료 코드에 매핑합니다.
- 처리 — 매퍼 및 추론 엔진: 전 세계에서 가장 상세한 임상 용어 체계인 SNOMED CT 기반의 지식 그래프가 해당 코드가 의료 계층 구조상 어디에 위치하는지 검증합니다. '중심정맥관 삽입술'이 '정맥 카테터 시술'의 하위 유형이며, '심장 수술/시술'의 하위 유형이 아님을 확인합니다. 그런 다음 논리 엔진이 시간적 조건('6개월 이전에 완료됨') 및 예외 조항('잘 조절되는 경우 제외')을 포함한 임상시험 규칙을 적용합니다.
- 출력 — 감사 추적이 포함된 판정: 시스템은 각 기준에 대해 명확한 적격 또는 제외 판정을 도출합니다. 모든 결정에는 특정 의료 코드, 검증된 계층 경로, 적용된 논리 규칙을 명시하는 추론 추적 기록이 함께 제공됩니다. 귀사의 컴플라이언스 팀은 모든 매칭 결과를 완벽하게 감사할 수 있습니다.
이 감사 추적 기록이야말로 규제 당국이 인정하는 시스템과 의문을 제기하는 시스템을 가르는 결정적 차이입니다. FDA나 EMA에서 4,072번 환자가 임상시험에 포함된 이유를 물었을 때 정확한 논리 체인을 제시할 수 있습니다. 확률 점수만을 제공하는 범용 LLM으로는 불가능한 일입니다. 또한 이 아키텍처는 환자 데이터를 안전한 사내 환경 내에 유지합니다. 지식 그래프와 논리 엔진이 로컬에서 실행되므로 어떠한 민감 건강 정보도 방화벽 외부로 유출되지 않습니다.
이미 지식 그래프 구축 및 도메인 특화 의료 온톨로지 엔지니어링을 고려 중인 조직에게 이는 핵심 기반 레이어가 됩니다. 그리고 모든 결정이 추적 가능한 논리적 증명을 생성하므로 규제 기관이 점점 더 강력하게 요구하는 설명 가능성 및 의사결정 투명성 요건과 직결됩니다.
이는 잘못된 AI 의사결정의 대가가 환자 안전, 규제 리스크, 수억 달러의 매출 손실로 직결되는 헬스케어 및 생명과학전반에서 매우 중대한 사안입니다.
SNOMED CT 계층 예시 및 당위 논리(deontic logic) 수식을 포함한 전체 기술 아키텍처는 전체 기술 분석 보고서를 확인하십시오. 또한 인터랙티브 체험 버전 을 통해 뉴로-심볼릭 매칭이 실제 현장에서 어떻게 작동하는지 인터랙티브 가이드로 직접 확인할 수 있습니다.
핵심 요점
- 임상시험의 80%가 환자 등록 기한을 넘기며, 범용 AI 도구는 유사한 시술을 혼동하여 문제를 더욱 악화시킵니다.
- 임상시험이 단 하루 지연될 때 심혈관 치료제는 최대 140만 달러, 고가치 신약 평균 80만 달러의 매출 손실이 발생합니다.
- 뉴로-심볼릭 AI는 판독과 추론을 분리하여 구조화된 의료 계층 체계를 바탕으로 논리 엔진이 결정론적 검증을 수행합니다.
- 모든 적격성 결정은 적용된 의료 코드, 계층 경로, 논리 규칙을 명시하는 완전한 감사 추적 기록을 생성하여 FDA 및 EMA 규제를 준수합니다.
- 스크리닝 실패는 건당 1,200달러의 손실을 초래하며, AI가 잘못된 매칭을 남발하면 시험 기관은 신뢰를 잃고 느린 수작업으로 되돌아갑니다.
결론
임상시험 환자 모집은 언어의 문제가 아니라 논리의 문제입니다. 범용 AI는 적격성 판단을 단순 단어 검색처럼 취급하여 환자의 적격 여부를 가르는 의학적 차이점을 놓칩니다. 귀사의 AI 공급업체에 질문해 보십시오. 시스템이 환자 기록에서 '중심정맥관 삽입술'을 감지하고 제외 목록에서 '심장 도관술'을 발견했을 때, 이들이 완전히 다른 시술임을 입증하는 정확한 추론 경로를 제시할 수 있습니까?