임상시험 적격성 추론 엔진

예측이 아니라 계산되는 시험 적격성.

환자 매칭 모델은 노트를 텍스트로 읽기 때문에 중심정맥카테터를 심도자술과 혼동하고, 적격했던 환자를 제외합니다. TrialProof는 LLM이 노트만 읽게 하고, SNOMED-CT 지식 그래프로 의미를 해석한 뒤, LLM이 덮어쓸 수 없는 결정론적 코드에서 ELIGIBLE, EXCLUDED, 또는 NEEDS-REVIEW를 계산합니다. 모든 판정에는 규제 당국이 제출할 수 있는 추론 추적이 붙습니다.

100%

라벨링된 골든셋에서의 판정 정확도

공정 어휘 베이스라인 대비 53.8%(13건)

0 vs 3

놓친 적격 환자

베이스라인이 3명을 놓치는 곳에서 TrialProof는 0명

100% vs 0%

추론 추적 커버리지

모든 판정에 추적이 붙고, 재실행 시 바이트 단위로 동일

이는 고정된 라벨링 골든셋 위의 실행 가능한 데모입니다. 모든 환자, 노트, 프로토콜은 합성이며, 온톨로지는 큐레이션된 24개 개념 SNOMED-CT 서브그래프이고, 실시간 FHIR 수집과 같은 커넥터는 시뮬레이션됩니다.

매처가 버려 버리는 적격 환자

AI 환자 매칭에서 잘못된 제외가 생기는 실패 모드입니다.

환자 매칭 AI는 임상 노트를 텍스트로 읽기 때문에, 겉모습은 비슷하지만 의학적으로는 다른 의미인 단어를 혼동합니다. 전형적인 실패는 구체적입니다. 3상 항응고제 시험은 심도자술을 제외하는데, 환자의 노트는 중심정맥카테터 삽입이라고 적혀 있습니다. 유사도 매처는 두 심혈관 카테터 시술로 보고 높은 점수를 매겨, 적격했던 환자를 제외합니다. 공개된 평가도 AI 모델이 바로 이 카테터 삽입 오류를 낸다는 것을 확인합니다(Fierce Biotech, 2025).

같은 부류의 오류는 한 시술보다 넓습니다. 당뇨병의 증거가 없음이 당뇨병으로 매칭되는 부정을 포함합니다. 가족력을 환자에게 귀속시키는 경우를 포함합니다. 그리고 「무작위배정 12개월 초과 전에 완료된 경우가 아니면」처럼, 유사도 점수가 전혀 표현할 수 없는 예외 조항을 포함합니다. 더 나은 기반 모델도 이 중 어느 것도 없애지 못합니다. 언어 문제가 아니기 때문입니다. 논리 문제입니다.

대가는 학술적이지 않습니다. 시험이 하루 미뤄질 때마다 처방 매출 손실이 하루 800,000 dollars에 달하고(Tufts CSDD Impact Report, 2024), 종양학에서는 하루 840,000 dollars, 심혈관 시험에서는 하루 1.4 million dollars로 올라갑니다(Tufts CSDD). 시험의 80%가 등록 일정을 놓치고(업계 합의, 2025), 평균 스크리닝 실패 비용은 1,200 dollars이며(Antidote.me, 2025), 시험 절차는 2005년 이후 139% 더 복잡해졌습니다(IQVIA, 2026). 이런 숫자 앞에서, 잘못 걸러진 적격 환자는 반올림 오차가 아닙니다.

TrialProof의 작동 방식

에이전트는 추출을 자문합니다. 결정론적 코드가 적격성을 판정합니다. 이것이 뉴로심볼릭입니다. LLM이 산문을 읽고, 상징 논리가 환자에 규칙을 적용합니다.

각 환자는 각 프로토콜에 대해 다섯 단계를 거치며, 인터페이스에 실시간으로 스트리밍됩니다. 중요한 경계는 확률적인 단계는 하나뿐이며, 그 단계는 아무것도 결정하지 않는다는 점입니다.

1. 차트 읽기

FHIR 형태의 합성 환자 기록, 자유 텍스트 노트, 시험 기준, 무작위배정일을 불러옵니다.

2. 사실 추출 (유일한 확률적 단계, 자문만)

제공자를 교체할 수 있는 LLM이 후보 사실을 제안합니다. 각 사실은 노트의 원문 스팬, 닫힌 어휘에서 가져온 후보 SCTID, 신뢰도를 갖습니다. 자문할 뿐, 결정하지 않습니다. 신뢰할 수 있는 FHIR로 도착한 코딩된 관찰은 추출기를 거치지 않습니다. 오프라인 렉시콘 폴백이 쓰이면, 실시간 콘솔이 이를 숨기지 않고 표시합니다.

3. 사실 검증 (적대적 검증기)

제안된 모든 사실은 노트 원문에 대해 세 가지 점검으로 도전받습니다. span-present(환각된 개체를 잡음), 부정, 주어(가족력 대 환자). 거부된 사실은 발동한 점검과 이유와 함께 REJECTED로 표시되며, 판정에 도달하지 않습니다.

4. 근거 조립

논리 엔진에 들어가는 정확히 검증된 사실 집합이며, coded-FHIR 대 자유 텍스트로 표시됩니다.

5. 판정 계산 (결정론적 Python, 에이전트 프레임워크 밖)

의무논리 엔진이 금지, 시간적 예외, controlled-unless, 요건 기준을 SNOMED is-a 포함관계와 날짜 연산으로 평가하고, 전체 추적과 함께 ELIGIBLE, EXCLUDED, 또는 NEEDS-REVIEW를 내보냅니다. LLM은 이 게이트를 덮어쓸 수 없습니다.

결정론적 단계는 기준당 실제로 수십 마이크로초로 실행되는 반면, 노트를 읽는 모델은 수 초가 걸립니다. 그 대비가 핵심이며, 즉시 스크리닝이라는 주장이 아닙니다. 느리고 오류가 날 수 있는 부분은 읽기에 한정되고, 그것이 넘기는 판정은 빠르고, 저렴하며, 재현 가능합니다.

데모의 비교는 공정 어휘 베이스라인이며, 의도적으로 그렇습니다. 개체 수준 TF-IDF 코사인 유사도로, 실제 벡터 유사도 방법이며, 깨끗한 개체-개념 해석이라는 관대한 설정을 주고, 결정 임계값은 스스로에게 유리하게 교차검증했습니다(t = 0.6932). LLM을 호출하지 않습니다. 유일한 핸디캡은 빠진 계층, 부정, 시간, 기권 논리이며, 그것이 전체 논지입니다. 실패하도록 튜닝한 것이 아닙니다.

끝까지 풀어 본 추론

합성 환자 P-074와 그 코호트를, 합성 프로토콜 ONC-204와 ANTI-3에 대해. 아래의 모든 이미지는 실행 중인 TrialProof 앱의 스크린샷입니다.

중심정맥로는 심도자가 아니며, 계층만이 그것을 압니다

P-074의 ICU 노트는 정맥 약물 투여 경로를 위한 중심정맥카테터 삽입이라고 읽습니다. ANTI-3의 기준 EXCL-CARDCATH(이전 심도자술 없음)에 대해, 유사도 매처는 두 심혈관 카테터 시술로 봅니다. TrialProof는 대신 온톨로지에 묻습니다. Central venous catheterization (392230005)이 Cardiac catheterization (41976001)의 is-a 하위 개념인가? 아닙니다. 두 개념은 SNOMED-CT 계층의 다른 가지에 있으므로 포함관계 경로가 없고, 판정은 두 SCTID를 명명하는 3단계 추적과 함께 ELIGIBLE입니다. 두 코드는 실제이며 공개 SNOMED 브라우저에서 확인할 수 있습니다. 공정 어휘 베이스라인도 여기서는 ELIGIBLE을 반환하지만, 추론 추적 없이 유사도 0.437뿐이며 규제 당국이 제출할 수 있는 것은 없습니다.

EXCL-CARDCATH에 대한 TrialProof 추론 추적. Central venous catheterization 392230005가 Cardiac catheterization 41976001의 is-NOT-a이며 계층의 다른 가지에 있어 판정이 ELIGIBLE임을 보여주고, 옆에 출처 없이 유사도 0.437만 있는 베이스라인을 둡니다.
심도자 추적: 실제 SCTID에 대한 is-a 점검이 ELIGIBLE을 결정하고, 베이스라인은 유사도 0.437과 출처 없음만 제공합니다.

엔진이 실제로 질의하는 온톨로지

엔진은 SNOMED-CT 전체를 질의하지 않습니다. 22개의 is-a 관계를 가진 큐레이션된 24개 개념 서브그래프를 순회합니다. 실제 SCTID가 있는 개념은 실선으로 그리고, 공개 SCTID가 없이 데모용으로 큐레이션된 9개는 CUR- 접두사를 붙이고 실제 코드인 척하지 않고 점선으로 그립니다. 검증된 사실은 녹색, 기준 개념은 외곽선, 순회한 is-a 경로는 굵게 표시됩니다. 두 카테터 삽입이 서로 다른 가지에 있는 것이 보이며, 바로 그 이유 때문에 문자열이나 벡터 유사도가 포함관계를 대신할 수 없습니다.

22개의 is-a 관계를 가진 큐레이션된 24개 개념 SNOMED-CT 서브그래프. Cardiac catheterization과 Central venous catheterization이 다른 가지에 있고, 실제 SCTID는 실선, 데모용 CUR- 개념은 점선으로 그려집니다.
SNOMED-CT 서브그래프, 24개 개념과 22개 is-a 관계, 두 카테터 삽입이 서로 다른 가지에 있습니다.

베이스라인이 버려 버리는 적격 환자

같은 노트는 No evidence of diabetes라고 말합니다. ONC-204의 EXCL-DM(당뇨병 진단 없음)에 대해, 벡터 베이스라인은 토큰 diabetes를 유사도 1.0으로 매칭하고 EXCLUDED를 반환합니다. 부정 모델이 없기 때문입니다. TrialProof의 검증기는 부정된 언급이 판정에 도달하기 전에 제거하므로, 판정은 ELIGIBLE입니다. 이것이 유사도 매처가 버려 버리는 적격 환자이며, 골든셋에서 베이스라인이 놓치는 3명 중 하나입니다.

No evidence of diabetes라고 적힌 노트에 대한 EXCL-DM 추론 추적: 베이스라인은 diabetes를 유사도 1.0으로 매칭해 EXCLUDED를 반환하고, TrialProof는 부정된 언급을 제거해 ELIGIBLE을 반환합니다.
부정: 베이스라인은 유사도 1.0에서 제외하고, TrialProof는 부정된 언급을 제거해 환자를 적격으로 유지합니다.

추출기에 도전하는 검증기

P-106에서 추출기는 노트에 뒷받침하는 스팬이 없는 카보플라틴 사실을 제안합니다. 심어 둔 환각입니다. 적대적 검증기는 제안된 모든 사실에 span-present, 부정, 주어를 실행하고, 카보플라틴 사실은 span-present에 실패하며(노트에서 스팬을 찾지 못함) REJECTED로 표시되어 판정에 도달하지 않습니다. 골든셋 전체에서 검증기는 13개 채점 케이스 실행 중 4건에서 사실 인스턴스 7개(서로 다른 잘못된 사실 3개: 부정된 당뇨병 언급, 가족력 유방암 귀속, 그리고 이 환각된 카보플라틴)를 거부했습니다. 에이전트는 추출을 자문하고, 결정론적 코드가 적격성을 판정합니다.

P-106의 사실 검증 패널. 카보플라틴 사실이 REJECTED로 표시되고, 실패한 점검은 span-present, 이유는 노트에서 스팬을 찾지 못함이라서, 환각된 개체가 적격성 판정에 도달하지 않습니다.
검증기는 환각된 카보플라틴을 span-present에서 거부해 판정에 도달하지 못하게 합니다.

유사도 점수가 표현할 수 없는 예외

P-101은 보조 카보플라틴과 페메트렉시드를 완료했고, 마지막 주입은 03/2025입니다. ONC-204의 EXCL-PLAT는 이전 백금 요법을 금지합니다. 다만 보조 또는 신보조로 투여되고 무작위배정(2026-04-15) 12개월 초과 전에 완료된 경우는 예외입니다. 엔진은 Carboplatin (386905003)이 Platinum-containing antineoplastic agent의 is-a임을 확인하고, 간격을 13개월로 계산하며, 예외를 충족하고, 4단계 추적과 함께 ELIGIBLE을 반환합니다. 같은 조항을 고식적 목적 환자에 대해 시험하면 예외가 적용되지 않고 판정이 EXCLUDED로 뒤집힙니다. 같은 기준, 반대 판정, 둘 다 맞습니다. 임계값이 아니라 논리 엔진이기 때문입니다.

P-101의 EXCL-PLAT 추론 추적. Carboplatin 386905003이 Platinum-containing antineoplastic agent의 is-a이고, 보조 목적, 13개월 간격이 12보다 커서 예외가 충족되고 판정이 ELIGIBLE임을 보여줍니다.
충족된 시간적 예외: 보조 백금이 무작위배정 13개월 전에 완료되었으며, 날짜 연산으로 계산됩니다.

임상운영 책임자가 실제로 신경 쓰는 숫자

합성 환자 7명, 합성 프로토콜 2개에서 뽑은 라벨링된 13건의 고정 골든셋에서, t = 0.6932로 교차검증된 어휘 베이스라인과 채점하면, TrialProof는 판정 정확도 100%로 베이스라인의 53.8%를 이기고, 베이스라인이 적격 환자 3명을 놓치는 곳에서 0명을 놓치며, 재현 가능한 추론 추적을 판정의 100%에 다는 반면 베이스라인은 0%입니다. 베이스라인이 추측하는 곳에서 NEEDS-REVIEW로 안전하게 두 번 기권하고, 13건 전체를 재실행하면 판정과 추적이 바이트 단위로 동일합니다(13 of 13). 모든 수치는 이 라벨링된 골든셋에 귀속하며, 개방 세계 주장으로는 결코 제시하지 않습니다.

골든셋 벤치마크 타일: 판정 정확도 100% 대 베이스라인 53.8%, 적격 환자 재현율 100% 대 66.7%, 놓친 적격 환자 0 대 3, 감사 가능한 추적 커버리지 100% 대 0%, 13건 재실행 시 바이트 단위로 동일한 판정이 나온다는 재현성 주석.
13건 라벨링 골든셋: 정확도 100% vs 53.8%, 놓친 적격 환자 0 vs 3, 추적 커버리지 100% vs 0%, 재실행 시 바이트 단위로 동일.

벡터 유사도 대 추론 엔진

데모가 채점하는 바로 그 비교, 차원별로.

차원 공정 어휘 베이스라인 TrialProof
적격성을 누가 결정하는가 임계값을 넘는 유사도 점수 에이전트 밖의 결정론적 의무논리 엔진
계층 / is-a 없음, 토큰 근접만 SNOMED-CT is-a 포함관계
부정 (당뇨병의 증거 없음) 있는 것으로 매칭됨 검증기가 제거
가족력 귀속 환자에게 귀속됨 주어 점검에서 거부됨
시간적 예외 조항 표현 불가 무작위배정일에 대한 날짜 연산
누락된 검사 또는 바이탈 추측하고, 결코 기권하지 않음 NEEDS-REVIEW, 무엇이 빠졌는지 명명
추론 추적 없음, 유사도 숫자만 전체 추적, CDISC SDTM IE로 내보내기
재현성 해당 없음 재실행 시 바이트 단위로 동일 (13 of 13)

이 데모가 하지 않는 것

  • ✓ 보편적으로 100% 정확하다고 주장하지 않습니다. 100% 수치는 고정된 13건 라벨링 골든셋에서의 판정 정확도이며, 개방 세계 보장도, 모든 차트에서 옳다는 약속도 아닙니다.
  • ✓ 환자를 실제인 것처럼 제시하지 않습니다. 모든 환자, 노트, 프로토콜은 합성이며, PHI 없음, 실시간 EHR 없음, 실제 시험 없음입니다. P-074, P-101부터 P-106, ONC-204, ANTI-3는 만든 픽스처입니다.
  • ✓ 전체 SNOMED-CT를 쓰지 않습니다. 온톨로지는 큐레이션된 24개 개념 서브그래프입니다(실제 SCTID 15개, 큐레이션되어 점선으로 그린 9개). 전체 SNOMED-CT, MedDRA, LOINC는 미뤄 둔 프로덕션 경로입니다.
  • ✓ 실시간 커넥터를 쓰지 않습니다. FHIR R4 EHR 수집, 그래프 저장소, 임상 LLM은 시뮬레이션되거나 제공자를 교체할 수 있습니다. Epic App Orchard와 Oracle 실시간 FHIR, CTMS 커넥터, SOC 2 또는 HIPAA BAA 강화는 미뤄 둡니다.
  • ✓ FDA 허가, CDS-exempt, HIPAA 인증, SOC 2 인증이 아닙니다. FDA의 2026년 1월 Clinical Decision Support 지침은 우리의 정렬과 방향이지, 허가가 아닙니다. 의료 자문이 아니며 임상 결정을 내리지 않습니다.
  • ✓ 고객, 스폰서, CRO, 파일럿, 추천사, ROI 수치를 내세우지 않습니다. 존재하지 않습니다. 이는 메커니즘을 증명하는 데모이지, 배포가 아닙니다.

구매자가 실제로 묻는 질문

Deep 6, Tempus, IQVIA 환자 매칭과 무엇이 다른가?

TrialProof는 데이터 네트워크나 클라우드 매칭 플랫폼이 아니며, 그 도구들의 복제도 아닙니다. 그들이 갖지 못한 결정론적 추론과 출처 계층입니다. 적격성 판정을 계산 가능하고, 확인 가능하며, 제출 가능하게 만드는 부분입니다. 매칭 플랫폼은 점수가 붙은 순위 목록을 주고, TrialProof는 결정을 내린 SNOMED 개념 ID와 그래프 간선과 함께 ELIGIBLE, EXCLUDED, 또는 NEEDS-REVIEW를 줍니다. 매칭 파이프라인 옆에 앉도록 만든 것이지, 그 아래의 데이터 네트워크를 대체하려는 것이 아닙니다.

환자 매칭 AI는 왜 적격 환자를 제외하는가?

임상 노트를 텍스트로 읽고 유사도를 점수 매기기 때문에, 겉모습은 비슷하지만 의학적으로는 다른 의미인 단어를 혼동합니다. 중심정맥카테터 삽입이라고 적힌 노트는 심도자술을 제외하는 시험에 대해 높은 점수를 받고, 환자는 잘못 제외됩니다. 같은 실패는 부정(당뇨병의 증거 없음이 당뇨병으로 매칭됨), 환자에게 귀속된 가족력, 유사도 점수가 전혀 표현할 수 없는 예외 조항을 포함합니다. 공개된 평가도 AI 모델이 바로 이 카테터 삽입 오류를 낸다는 것을 확인합니다(Fierce Biotech, 2025).

각 적격성 판정에 대해 규제 당국이 제출할 수 있는 감사 추적을 받을 수 있는가?

그렇습니다. 모든 판정은 JSON과 CSV의 CDISC SDTM IE 레코드로 내보내며, 환자·기준당 한 행으로 기준, 판정, SCTID와 의무 연산을 명명하는 전체 결정론적 추론 추적을 담습니다. 사실이 매칭된 경우 행은 is-a 경로도 담고, 노트에서 나온 사실은 원문 스팬도 담습니다. 13건 골든셋에서 TrialProof 판정의 100%가 재현 가능한 추적을 갖고 베이스라인은 0%이며, 세트를 재실행하면 바이트 단위로 동일한 출력이 나옵니다(13 of 13).

실제 SNOMED 코드를 쓰는가, 만든 코드인가?

데모가 판정에 인용하는 모든 개념은 실제 SCTID를 가지며, 공개 SNOMED 브라우저에서 확인할 수 있습니다. Central venous catheterization은 392230005, Cardiac catheterization은 41976001이며, 서로 다른 가지에 있어 포함관계 경로가 연결되지 않습니다. 엔진은 전체 SNOMED-CT가 아니라 22개 is-a 관계를 가진 큐레이션된 24개 개념 서브그래프를 질의합니다. 공개 SCTID가 없이 데모용으로 큐레이션된 9개 개념은 CUR- 접두사를 붙이고 실제 코드인 척하지 않고 점선으로 그립니다. 전체 SNOMED-CT, MedDRA, LOINC는 미뤄 둔 프로덕션 경로입니다.

환자 데이터는 실제인가, HIPAA를 준수하는가?

모든 데이터는 합성입니다. 실제 PHI도, 실시간 EHR도, 실제 시험도 없으며, 환자, 노트, 프로토콜은 만든 픽스처입니다. 이는 메커니즘을 증명하는 실행 가능한 데모이지 배포된 파이프라인이 아니므로, HIPAA 인증, SOC 2 인증, FDA 허가, CDS-exempt가 아니며, 임상 결정을 내리지 않습니다. FDA의 2026년 1월 Clinical Decision Support 지침은 사람이 개입하는 매칭 보조에 대한 관련 프레임워크이며, 우리가 보유한 허가가 아니라 방향입니다.

더 나은 LLM이면 그냥 고치지 않는가?

아닙니다. 언어 문제가 아니라 논리 문제이기 때문입니다. 유사도 점수는 is-a를 표현할 수 없고, not을 표현할 수 없으며, 「무작위배정 12개월 초과 전에 완료된 경우가 아니면」을 표현할 수 없고, 프롬프트나 컨텍스트를 아무리 늘려도 그것들을 더하지 못합니다. 그래서 모델이 진짜 잘하는 한 가지, 지저분한 산문을 읽고 읽은 스팬과 함께 사실을 제안하는 일을 맡기고, 적대적 검증기가 노트가 뒷받침하지 않는 것을 걸러 내며, 의학 온톨로지 위의 결정론적 코드가 판정을 계산합니다. LLM은 그 게이트를 덮어쓸 수 없고, 그래서 같은 차트가 매번 같은 답을 냅니다.

100% 정확도 수치는 실제로 무엇을 의미하는가?

합성 환자 7명, 합성 프로토콜 2개에서 뽑은 고정 13건 라벨링 골든셋에서의 판정 정확도 100%이며, 임계값을 스스로에게 유리하게 교차검증한 공정 어휘 베이스라인과 채점한 것입니다(t = 0.6932). 보편적이거나 개방 세계 주장이 아니며, 이 제품이 가능한 모든 차트에서 옳다는 것과도 다릅니다. 같은 세트에서 TrialProof는 베이스라인이 3명을 놓치는 곳에서 적격 환자 0명을 놓치고, 추측하는 대신 NEEDS-REVIEW로 안전하게 두 번 기권합니다.

기술 연구

이 데모의 기반이 된 연구 — 아키텍처, 검증 설계, 엔터프라이즈 청사진.

규제 당국이 제출할 수 있는 추적 없이 환자를 시험에 매칭하고 있습니까?

결정론적 추론과 출처 계층이 어려운 부분입니다. 우리가 만듭니다.

유사도 점수를 믿으라고 하지 않고 규제 당국 앞에 적격성 판정을 내놓는 방법을 팀이 저울질하고 있다면, 어떻게 생각하고 계신지 진심으로 듣고 싶습니다. 문제는 산업 전반의 것이고, 답도 그럴 것입니다.

적격성 추론 평가

  • ✓ 환자 매처가 적격 환자를 제외할 수 있는 지점을 매핑합니다
  • ✓ LLM이 추출해야 할 것과 코드가 판정해야 할 것을 분리합니다
  • ✓ 프로토콜에 필요한 온톨로지, 부정, 시간 규칙을 정의합니다
  • ✓ 규제 팀이 제출할 수 있는 CDISC SDTM IE 추적을 지정합니다

추론 계층을 구축합니다

  • ✓ 실제 온톨로지 위의 결정론적 의무논리 엔진
  • ✓ 부정, 주어, 환각된 사실에 대한 적대적 검증기
  • ✓ SNOMED-CT 포함관계와 날짜 연산, 재실행마다 재현 가능
  • ✓ 제공자를 교체할 수 있는 추출, 모델이 판정을 결코 덮어쓰지 않음
소셜

다른 채널에도 게시됨