臨床試驗合格判定推理引擎

臨床試驗合格判定推理引擎

病患配對模型把紀錄當成文字來讀,因此會把中心靜脈導管與心導管術混淆,並排除一名本來合格的病患。TrialProof 只讓 LLM 讀取紀錄,透過 SNOMED-CT 知識圖譜解析語意,並以 LLM 無法覆寫的確定性程式碼計算 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW。每一項判定都附帶監管機構可歸檔的推理軌跡。

100%

標註黃金集上的判定準確率

對比公平詞彙基準的 53.8%(13 個案例)

0 vs 3

流失的合格病患

基準流失 3 名時,TrialProof 流失 0 名

100% vs 0%

推理軌跡涵蓋率

每一項判定皆有軌跡;重跑時位元組完全相同

這是在固定、已標註黃金集上可實際執行的示範。所有病患、紀錄與試驗方案皆為合成資料,本體是精選的 24 個概念 SNOMED-CT 子圖,即時 FHIR 擷取等連接器亦為模擬。

配對器丟棄的合格病患

AI 病患配對中錯誤排除背後的失敗模式。

病患配對 AI 把臨床紀錄當成文字來讀,因此會把看起來相似、但醫學上意義不同的詞混淆。典型失敗非常具體。一項第三期抗凝血劑試驗排除心導管術;病患紀錄寫的是中心靜脈導管置放。相似度配對器看到兩個心血管導管處置,給出高分,並排除一名本來合格的病患。已發表的評估證實,AI 模型會犯下這種確切的導管術錯誤(Fierce Biotech,2025)。

同一類錯誤的範圍遠大於單一處置。它涵蓋否定,把 no evidence of diabetes 匹配成糖尿病。它涵蓋把家族史歸給病患本人。它也涵蓋例外條款,例如 unless completed more than 12 months before randomization,那是相似度分數完全無法表達的。更好的基礎模型消除不了其中任何一項,因為它們不是語言問題。它們是邏輯問題。

代價不是學術上的。試驗每延遲一天,流失的處方藥銷售約為每天 800,000 dollars(Tufts CSDD Impact Report,2024),腫瘤試驗升至每天 840,000 dollars,心血管試驗則為每天 1.4 million dollars(Tufts CSDD)。80% 的試驗錯過收案時程(產業共識,2025),平均篩選失敗成本為 1,200 dollars(Antidote.me,2025),自 2005 年以來試驗程序複雜度增加了 139%(IQVIA,2026)。對照這些數字,一名被錯誤篩掉的合格病患絕不是四捨五入誤差。

TrialProof 如何運作

代理僅就擷取提供建議。確定性程式碼決定合格與否。這是神經符號:LLM 讀取散文,符號邏輯對病患套用規則。

每位病患對每個試驗方案經過五個階段,即時串流到介面。關鍵界線是:只有一個階段是機率性的,而且它從不作出任何決定。

1. 讀取病歷

載入 FHIR 形狀的合成病患紀錄、其自由文字紀錄、試驗條件,以及隨機分派日期。

2. 擷取事實(唯一的機率步驟,僅供建議)

可替換供應商的 LLM 提出候選事實,每一項都帶有逐字紀錄片段、從封閉詞彙抽出的候選 SCTID,以及信心分數。它提供建議;它不作決定。以受信任 FHIR 抵達的編碼觀察值絕不經過擷取器。當使用離線詞彙回退時,即時主控台會明說,而不是把它藏起來。

3. 驗證事實(對抗式驗證器)

每一項提出的事實都會對照紀錄原文接受三項檢查的挑戰:span-present(可抓住憑空捏造的實體)、否定,以及主體(家族史對病患本人)。被拒絕的事實會標為 REJECTED,並附上觸發的檢查與原因,且絕不會進入判定。

4. 組裝證據

進入邏輯引擎的確切已驗證事實集,標示為編碼 FHIR 對自由文字。

5. 計算判定(確定性 Python,位於代理框架之外)

道義邏輯引擎透過 SNOMED is-a 包攝與日期運算,評估禁止、時間例外、受控 unless 與必要條件,並發出附完整軌跡的 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW。LLM 無法覆寫這道閘門。

確定性階段確實以每條條件數十微秒運行,而讀取紀錄的模型則需要數秒。那個對比才是重點,不是宣稱能瞬間篩選:緩慢、易錯的部分被限制在讀取,它所餵入的判定則快速、便宜且可重現。

示範中的比較是公平詞彙基準,而且是刻意如此。它是實體層級的 TF-IDF 餘弦相似度,一種真實的向量相似度方法,並給予寬鬆設定:乾淨的實體到概念解析,以及為其自身交叉驗證的判定閾值(t = 0.6932)。它從不呼叫 LLM。它唯一的劣勢是缺少階層、否定、時間與棄權邏輯,而那正是整套論點。它並非被調校成會失敗。

從頭到尾走完的推理

合成病患 P-074 及其世代,對照合成試驗方案 ONC-204 與 ANTI-3。以下每張圖都是運行中 TrialProof 應用程式的截圖。

中心靜脈導管不是心導管,只有階層才知道這一點

P-074 的 ICU 紀錄寫著 central venous catheter placement for IV medication access。對照 ANTI-3 的條件 EXCL-CARDCATH(無先前心導管術),相似度配對器看到兩個心血管導管處置。TrialProof 改問本體:Central venous catheterization(392230005)是不是 Cardiac catheterization(41976001)的 is-a 後代?不是。這兩個概念位於 SNOMED-CT 階層的不同分支,因此不存在包攝路徑,判定為 ELIGIBLE,並附有點名兩個 SCTID 的三步驟軌跡。兩個代碼都是真實的,可在任何公開 SNOMED 瀏覽器上查核。公平詞彙基準此處也回傳 ELIGIBLE,但僅有 0.437 的光禿相似度,沒有推理軌跡,也沒有監管機構可歸檔的任何東西。

TrialProof 針對 EXCL-CARDCATH 的推理軌跡,顯示 Central venous catheterization 392230005 在階層的不同分支上 is-NOT-a Cardiac catheterization 41976001,因此判定為 ELIGIBLE,旁邊是基準僅有 0.437 的光禿相似度、毫無出處。
心導管軌跡:對真實 SCTID 做 is-a 檢查即判定 ELIGIBLE,而基準只提供 0.437 的光禿相似度、毫無出處。

引擎實際查詢的本體

引擎並不查詢全部 SNOMED-CT。它走訪精選的 24 個概念子圖,含 22 條 is-a 關係。具真實 SCTID 的概念以實線繪製;為示範精選、沒有公開 SCTID 的 9 個概念以 CUR- 為前綴,並以虛線繪製,而不是假裝成真實代碼。已驗證事實為綠色,條件概念加外框,走訪過的 is-a 路徑為粗體。兩種導管術明顯位於不同分支,這正是字串或向量相似度無法取代包攝的原因。

精選的 24 個概念 SNOMED-CT 子圖,含 22 條 is-a 關係,顯示 Cardiac catheterization 與 Central venous catheterization 位於不同分支,真實 SCTID 以實線繪製,示範精選的 CUR- 概念以虛線繪製。
SNOMED-CT 子圖,24 個概念與 22 條 is-a 關係,兩種導管術位於不同分支。

基準丟棄的合格病患

同一份紀錄寫著 No evidence of diabetes。對照 ONC-204 的 EXCL-DM(無糖尿病診斷),向量基準以相似度 1.0 匹配詞元 diabetes 並回傳 EXCLUDED,因為它沒有否定模型。TrialProof 的驗證器在否定提及到達判定之前就把它剝除,因此判定為 ELIGIBLE。這就是相似度配對器丟棄的合格病患,在黃金集上,這是基準流失的三名之一。

針對寫著 No evidence of diabetes 的紀錄的 EXCL-DM 推理軌跡:基準以相似度 1.0 匹配 diabetes 並回傳 EXCLUDED,而 TrialProof 剝除否定提及並回傳 ELIGIBLE。
否定:基準以相似度 1.0 排除;TrialProof 剝除否定提及,讓病患維持合格。

挑戰擷取器的驗證器

對 P-106,擷取器提出一項紀錄中沒有支持片段的 carboplatin 事實,這是植入的幻覺。對抗式驗證器對每一項提出的事實執行 span-present、否定與主體;carboplatin 事實未通過 span-present(span not found in note)並被標為 REJECTED,因此絕不會進入判定。在整個黃金集上,驗證器在 13 次計分案例執行中的 4 次裡,拒絕了 7 個事實實例(3 個不同的壞事實:一項否定的糖尿病提及、一項家族史乳癌歸屬,以及這個幻覺的 carboplatin)。代理僅就擷取提供建議;確定性程式碼決定合格與否。

P-106 的驗證事實面板,顯示一項 carboplatin 事實被標為 REJECTED,未通過檢查 span-present,原因 span not found in note,因此幻覺實體絕不會進入合格判定。
驗證器在 span-present 上拒絕幻覺的 carboplatin,使其無法進入判定。

相似度分數無法表達的例外

P-101 完成了輔助性 carboplatin 與 pemetrexed,末次輸注為 03/2025。ONC-204 的 EXCL-PLAT 禁止先前鉑類治療,除非作為輔助性或新輔助性給予,且在隨機分派(2026-04-15)前已完成超過 12 個月。引擎確認 Carboplatin(386905003)is-a Platinum-containing antineoplastic agent,計算間隔為 13 個月,滿足例外,並以四步驟軌跡回傳 ELIGIBLE。當同一條款套用在緩和治療意圖的病患上,例外不適用,判定翻轉為 EXCLUDED。同一條件、相反判定,兩者都正確,因為那是邏輯引擎而不是閾值。

P-101 的 EXCL-PLAT 推理軌跡,顯示 Carboplatin 386905003 is-a Platinum-containing antineoplastic agent、輔助性意圖、間隔 13 個月大於 12,因此例外獲滿足,判定為 ELIGIBLE。
時間例外獲滿足:輔助性鉑類在隨機分派前 13 個月完成,由日期運算算出。

臨床營運主管真正在意的數字

在固定黃金集的 13 個已標註案例上——取自 7 名合成病患、跨 2 個合成試驗方案,對照為其自身交叉驗證的詞彙基準於 t = 0.6932 計分——TrialProof 判定準確率為 100%、對照基準 53.8%,流失 0 名合格病患而基準流失 3 名,且 100% 的判定帶有可重現的推理軌跡、基準為 0%。它在基準猜測之處,安全地以 NEEDS-REVIEW 棄權兩次;重跑全部 13 個案例產生位元組完全相同的判定與軌跡(13 之 13)。我們把每一個數字都歸於這個已標註黃金集,從不作為開放世界主張。

黃金集基準磁磚:判定準確率 100% 對基準 53.8%,合格病患召回率 100% 對 66.7%,流失的合格病患 0 對 3,可稽核軌跡涵蓋率 100% 對 0%,並附重跑 13 個案例產生位元組完全相同判定的可重現性註記。
13 案例已標註黃金集:準確率 100% vs 53.8%,流失合格病患 0 vs 3,軌跡涵蓋率 100% vs 0%,重跑時位元組完全相同。

向量相似度對推理引擎

示範所計分的同一組比較,逐維展開。

維度 公平詞彙基準 TrialProof
誰決定合格與否 超過閾值的相似度分數 位於代理之外的確定性道義邏輯引擎
階層 / is-a 無,僅有詞元鄰近 SNOMED-CT is-a 包攝
否定(no evidence of diabetes) 匹配為存在 由驗證器剝除
家族史歸屬 歸給病患本人 在主體檢查上被拒絕
時間例外條款 無法表達 相對隨機分派日期的日期運算
缺少檢驗或生命徵象 猜測,從不棄權 NEEDS-REVIEW,並點名缺了什麼
推理軌跡 無,僅有一個光禿的相似度數字 完整軌跡,匯出為 CDISC SDTM IE
可重現性 不適用 重跑時位元組完全相同(13 之 13)

本示範不做什麼

  • ✓ 它並不主張在普遍情況下達到 100% 準確。100% 這個數字是固定 13 案例已標註黃金集上的判定準確率,絕不是開放世界保證,也絕不是在每份病歷上都正確的承諾。
  • ✓ 它並不把病患呈現為真實。所有病患、紀錄與試驗方案皆為合成,沒有 PHI、沒有即時 EHR、也沒有真實試驗。P-074、P-101 至 P-106、ONC-204 與 ANTI-3 都是編造的固定裝置。
  • ✓ 它並不使用完整 SNOMED-CT。本體是精選的 24 個概念子圖(15 個真實 SCTID,9 個精選並以虛線繪製)。完整 SNOMED-CT、MedDRA 與 LOINC 是延後的正式環境路徑。
  • ✓ 它並不使用即時連接器。FHIR R4 EHR 擷取、圖儲存與臨床 LLM 為模擬或可替換供應商。Epic App Orchard 與 Oracle 即時 FHIR、CTMS 連接器,以及 SOC 2 或 HIPAA BAA 強化均延後。
  • ✓ 它未經 FDA 核准、非 CDS 豁免、未經 HIPAA 認證,亦未經 SOC 2 認證。美國 FDA 2026 年 1 月的臨床決策支援指引是我們的對齊方向,不是核准。這不是醫療建議,也不作出臨床決定。
  • ✓ 它沒有客戶、試驗委託者、CRO、試點、推薦或 ROI 數字。這些都不存在。這是證明機制的示範,不是部署。

買家真正會問的問題

這與 Deep 6、Tempus 或 IQVIA 病患配對有何不同?

TrialProof 不是資料網路或雲端配對平台,也不是那些工具的複製品。它是它們所缺少的確定性推理與來源溯源層:讓合格判定變得可計算、可查核、可歸檔的那一部分。配對平台交給你一份帶分數的排名清單;TrialProof 交給你 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW,並附上作成決定的 SNOMED 概念 ID 與圖邊。它旨在與配對管線並肩,而不是取代其下的資料網路。

為什麼病患配對 AI 會排除合格病患?

因為它把臨床紀錄當成文字來讀並計分相似度,因此會把看起來相似、但醫學上意義不同的詞混淆。寫著中心靜脈導管置放的紀錄,對排除心導管術的試驗得到高分,病患就被錯誤排除。同一失敗涵蓋否定(no evidence of diabetes 被匹配成糖尿病)、歸給病患本人的家族史,以及相似度分數完全無法表達的例外條款。已發表的評估證實,AI 模型會犯下這種確切的導管術錯誤(Fierce Biotech,2025)。

我能取得監管機構可為每一項合格判定歸檔的稽核軌跡嗎?

可以。每一項決定都匯出為 JSON 與 CSV 的 CDISC SDTM IE 紀錄,每位病患與每條條件一列,帶有條件、判定,以及點名 SCTID 與道義運算的完整確定性推理軌跡。事實匹配之處,該列還帶有 is-a 路徑;對來自紀錄的事實,還帶有逐字片段。在 13 案例黃金集上,100% 的 TrialProof 判定帶有可重現軌跡,基準為 0%,重跑該集產生位元組完全相同的輸出(13 之 13)。

它用的是真實 SNOMED 代碼還是編造的?

示範為判定所引用的每一個概念都帶有真實 SCTID,可在任何公開 SNOMED 瀏覽器上查核:Central venous catheterization 是 392230005,Cardiac catheterization 是 41976001,它們位於不同分支,因此沒有包攝路徑連接它們。引擎查詢精選的 24 個概念子圖,含 22 條 is-a 關係,而非完整 SNOMED-CT。為示範精選、沒有公開 SCTID 的 9 個概念以 CUR- 為前綴並以虛線繪製,而不是假裝成真實代碼。完整 SNOMED-CT、MedDRA 與 LOINC 是延後的正式環境路徑。

病患資料是真實的嗎?這符合 HIPAA 嗎?

所有資料都是合成的。沒有真實 PHI、沒有即時 EHR、也沒有真實試驗;病患、紀錄與試驗方案都是編造的固定裝置。這是證明機制的可執行示範,不是已部署的管線,因此未經 HIPAA 認證、未經 SOC 2 認證、未經 FDA 核准、亦非 CDS 豁免,而且不作臨床決定。美國 FDA 2026 年 1 月的臨床決策支援指引,是人在迴路中配對輔助的相關框架,那是我們的方向,不是我們持有的核准。

更好的 LLM 不就能解決這個問題嗎?

不能,因為這些不是語言問題,而是邏輯問題。相似度分數無法表達 is-a、無法表達 not、也無法表達 unless completed more than twelve months before randomization,再多提示或上下文也加不進去。因此我們讓模型做它真正擅長的一件事:讀取凌亂散文,並提出附帶所讀片段的事實,然後由對抗式驗證器丟棄紀錄不支持的內容,再由醫學本體上的確定性程式碼計算判定。LLM 無法覆寫那道閘門,這才讓同一份病歷每次執行都產生同一個答案。

100% 準確率這個數字實際上代表什麼?

它是固定 13 案例已標註黃金集上的 100% 判定準確率,取自 7 名合成病患、跨 2 個合成試驗方案,對照公平詞彙基準計分,該基準的閾值已為其自身利益交叉驗證(t = 0.6932)。它絕不是普遍或開放世界主張,也不等於此產品在每一份可能的病歷上都正確。在同一集合上,基準流失 3 名合格病患時 TrialProof 流失 0 名,並安全地以 NEEDS-REVIEW 棄權兩次,而不是猜測。

技術研究

本示範背後的研究——架構、驗證設計,以及企業藍圖。

把病患配對到試驗,卻沒有監管機構可歸檔的軌跡?

確定性推理與來源溯源層才是難處。我們打造它。

如果你的團隊正在權衡,如何把合格判定放到監管機構面前、而不要求他們相信一個相似度分數,我們真心想聽聽你是怎麼思考這件事的。這個問題遍及整個產業,答案也將如此。

合格判定推理評估

  • ✓ 對應你的病患配對器可能排除合格病患的位置
  • ✓ 區分 LLM 應擷取什麼、程式碼應決定什麼
  • ✓ 定義你的試驗方案所需的本體、否定與時間規則
  • ✓ 指定你的法規團隊可歸檔的 CDISC SDTM IE 軌跡

打造推理層

  • ✓ 在你真實本體上的確定性道義邏輯引擎
  • ✓ 針對否定、主體與幻覺事實的對抗式驗證器
  • ✓ SNOMED-CT 包攝加上日期運算,每次重跑皆可重現
  • ✓ 可替換供應商的擷取,模型絕不覆寫判定
社群媒體

同步發佈於