临床试验入组资格推理引擎
患者匹配模型把笔记当文本来读,于是把中心静脉导管误当成心导管检查,把本合格的患者排除掉。TrialProof 只让 LLM 阅读笔记,通过 SNOMED-CT 知识图谱解析含义,并在 LLM 无法覆盖的确定性代码中计算 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW。每条裁定都带有监管方可归档的推理轨迹。
100%
在标注金标准集上的决策准确率
对比公平词汇基线的 53.8%(13 例)
0 vs 3
丢失的合格患者
TrialProof 丢失 0 例,而基线丢失 3 例
100% vs 0%
推理轨迹覆盖率
每条裁定均有轨迹;重跑时字节级一致
这是在固定、已标注的金标准集上可运行的演示。所有患者、笔记和方案均为合成数据,本体是精选的 24 概念 SNOMED-CT 子图,实时 FHIR 摄入等连接器均为模拟。
AI 患者匹配中错误排除背后的失败模式。
患者匹配 AI 把临床笔记当文本来读,于是把看起来相似但医学含义不同的词搞混。典型失败是具体的。一项 III 期抗凝试验排除心导管检查;患者笔记写的是中心静脉导管置入。相似度匹配器看到两种心血管导管操作,打出高分,并把本合格的患者排除。已发表的评估证实 AI 模型会犯这种确切的导管术错误(Fierce Biotech, 2025)。
同一类错误远不止一种操作。它覆盖否定:无糖尿病证据被匹配成糖尿病。它覆盖把家族史归到患者本人。它还覆盖例外条款,例如除非在随机化前 12 个月以上完成,而相似度分数根本无法表示这类条款。更好的基座模型也消除不了其中任何一项,因为它们不是语言问题。它们是逻辑问题。
代价并非学术性的。入组延误按每推迟一天损失处方销售额计,为每天 800,000 美元(Tufts CSDD Impact Report, 2024),肿瘤试验升至每天 840,000 美元,心血管试验升至每天 1.4 million 美元(Tufts CSDD)。80% 的试验错过入组时间表(industry consensus, 2025),平均筛查失败成本为 1,200 美元(Antidote.me, 2025),试验流程自 2005 年以来复杂度增加了 139%(IQVIA, 2026)。面对这样的数字,一名本合格却被错误筛出的患者不是舍入误差。
智能体对抽取提供建议。确定性代码决定入组资格。这是神经符号:LLM 阅读散文,符号逻辑对患者执行规则。
每位患者对每份方案经过五个阶段,实时流式推送到界面。重要边界是:只有一个阶段是概率性的,而且它从不做任何决定。
加载 FHIR 形态的合成患者记录、其自由文本笔记、试验标准,以及随机化日期。
可替换提供商的 LLM 提出候选事实,每条附带逐字笔记跨度、从封闭词表抽取的候选 SCTID,以及置信度。它提供建议;它不做决定。作为可信 FHIR 到达的编码观察从不经过抽取器。当使用离线词表回退时,实时控制台会如实显示,而不是把它藏起来。
每条提出的事实都对照字面笔记接受三项检查:span-present(捕捉幻觉实体)、否定,以及主体(家族史对患者本人)。被拒绝的事实标为 REJECTED,并附上触发的检查与原因,且永远到不了决策。
进入逻辑引擎的精确已核验事实集,标记为 coded-FHIR 对自由文本。
道义逻辑引擎通过 SNOMED is-a 归类和日期运算评估禁止、时间例外、controlled-unless 以及要求类标准,并输出带完整轨迹的 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW。LLM 无法覆盖这一关卡。
确定性阶段每个标准确实在数十微秒内完成,而模型阅读笔记需要数秒。这一对比才是重点,不是即时筛查的宣称:缓慢、易错的部分被限制在阅读,它所供给的决策则快速、廉价、可复现。
演示中的比较是公平词汇基线,而且是刻意如此。它是实体级 TF-IDF 余弦相似度,一种真实的向量相似度方法,并给予慷慨设置:干净的实体到概念解析,决策阈值为其自身交叉验证(t = 0.6932)。它从不调用 LLM。它仅有的短板是缺失层级、否定、时间和弃权逻辑,而这正是全部论点。它并非被调成失败。
合成患者 P-074 及其队列,对照合成方案 ONC-204 和 ANTI-3。下方每张图都是正在运行的 TrialProof 应用的截图。
P-074 的 ICU 笔记写着中心静脉导管置入以供静脉给药通路。对照 ANTI-3 的标准 EXCL-CARDCATH(无既往心导管检查),相似度匹配器看到两种心血管导管操作。TrialProof 转而问本体:Central venous catheterization(392230005)是不是 Cardiac catheterization(41976001)的 is-a 后代?不是。这两个概念位于 SNOMED-CT 层级的不同分支,因此不存在归类路径,裁定为 ELIGIBLE,并带有点名两个 SCTID 的三步轨迹。两个编码都是真实的,可在任何公开 SNOMED 浏览器上核对。公平词汇基线此处也返回 ELIGIBLE,但仅有 0.437 的裸相似度,没有推理轨迹,也没有监管方可归档的东西。
引擎并不查询全部 SNOMED-CT。它遍历带 22 条 is-a 关系的精选 24 概念子图。带真实 SCTID 的概念画为实线;为演示精选、无公开 SCTID 的 9 个概念加前缀 CUR- 并画为虚线,而不是冒充真实编码。已核验事实为绿色,标准概念描边,走过的 is-a 路径加粗。两种导管术明显位于不同分支,这正是字符串或向量相似度无法替代归类的原因。
同一笔记写着无糖尿病证据。对照 ONC-204 的 EXCL-DM(无糖尿病诊断),向量基线以相似度 1.0 匹配到 token diabetes 并返回 EXCLUDED,因为它没有否定模型。TrialProof 的核验器在否定提及到达决策之前将其剥离,因此裁定为 ELIGIBLE。这就是相似度匹配器扔掉的合格患者,在金标准集上,这是基线丢失的三例之一。
对 P-106,抽取器提出一条笔记中无支持跨度的 carboplatin 事实,这是植入的幻觉。对抗式核验器对每条提出的事实运行 span-present、否定和主体;该 carboplatin 事实未通过 span-present(笔记中未找到跨度)并被标为 REJECTED,因此永远到不了决策。在金标准集上,核验器拒绝了 7 个事实实例(3 个不同的坏事实:否定的糖尿病提及、家族史乳腺癌归因,以及这条幻觉 carboplatin),覆盖 13 次计分案例运行中的 4 次。智能体对抽取提供建议;确定性代码决定入组资格。
P-101 完成了辅助 carboplatin 和 pemetrexed,末次输注 03/2025。ONC-204 的 EXCL-PLAT 禁止既往铂类治疗,除非作为辅助或新辅助给予,且在随机化(2026-04-15)前 12 个月以上完成。引擎确认 Carboplatin(386905003)is-a Platinum-containing antineoplastic agent,计算间隔为 13 个月,满足例外,并以四步轨迹返回 ELIGIBLE。当同一条款在姑息意图患者上测试时,例外不适用,裁定翻转为 EXCLUDED。同一标准,相反裁定,两者都正确,因为这是逻辑引擎而不是阈值。
在固定金标准集上,13 个已标注案例来自 7 名合成患者、跨 2 份合成方案,对照交叉验证的词汇基线 t = 0.6932 计分,TrialProof 决策准确率为 100%,基线为 53.8%;丢失合格患者 0 例,而基线丢失 3 例;100% 的决策带有可复现推理轨迹,基线为 0%。它在基线猜测之处以 NEEDS-REVIEW 安全弃权两次,重跑全部 13 例得到字节级一致的裁定和轨迹(13 of 13)。我们将每个数字都归因于该标注金标准集,从不作为开放世界宣称。
演示所计分的同一比较,逐维度对照。
| 维度 | 公平词汇基线 | TrialProof |
|---|---|---|
| 谁决定入组资格 | 超过阈值的相似度分数 | 确定性道义逻辑引擎,在智能体之外 |
| 层级 / is-a | 无,仅有 token 邻近 | SNOMED-CT is-a 归类 |
| 否定(无糖尿病证据) | 匹配为存在 | 由核验器剥离 |
| 家族史归因 | 归到患者本人 | 在主体检查上被拒绝 |
| 时间例外条款 | 无法表示 | 对随机化日期做日期运算 |
| 缺失的检验或生命体征 | 猜测,从不弃权 | NEEDS-REVIEW,点名所缺内容 |
| 推理轨迹 | 无,仅一个裸相似度数字 | 完整轨迹,导出为 CDISC SDTM IE |
| 可复现性 | 不适用 | 重跑时字节级一致(13 of 13) |
TrialProof 不是数据网络或云匹配平台,也不是那些工具的克隆。它是它们所缺的确定性推理与出处层:让入组资格裁定可计算、可核对、可归档的那一部分。匹配平台交给你一份带分数的排序列表;TrialProof 交给你 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW,以及决定它的 SNOMED 概念 ID 和图边。它意在与匹配流水线并列,而不是替换其下的数据网络。
因为它把临床笔记当文本来读并打相似度分,于是把看起来相似但医学含义不同的词搞混。写着中心静脉导管置入的笔记,对照排除心导管检查的试验打出高分,患者被错误排除。同一失败覆盖否定(无糖尿病证据被匹配成糖尿病)、把家族史归到患者本人,以及相似度分数根本无法表示的例外条款。已发表的评估证实 AI 模型会犯这种确切的导管术错误(Fierce Biotech, 2025)。
可以。每项决策导出为 JSON 和 CSV 中的 CDISC SDTM IE 记录,每位患者每条标准一行,携带标准、裁定,以及点名 SCTID 和道义操作的完整确定性推理轨迹。事实匹配处,该行还携带 is-a 路径;对笔记派生事实,还携带逐字跨度。在 13 例金标准集上,100% 的 TrialProof 决策带有可复现轨迹,基线为 0%,重跑该集产出字节级一致输出(13 of 13)。
演示为决策引用的每个概念都带有真实 SCTID,可在任何公开 SNOMED 浏览器上核对:Central venous catheterization 是 392230005,Cardiac catheterization 是 41976001,它们位于不同分支,这就是没有归类路径连接它们的原因。引擎查询带 22 条 is-a 关系的精选 24 概念子图,而不是完整 SNOMED-CT。为演示精选、无公开 SCTID 的 9 个概念加前缀 CUR- 并画为虚线,而不是冒充真实编码。完整 SNOMED-CT、MedDRA 和 LOINC 是延后的生产路径。
全部数据均为合成。没有真实 PHI、没有实时 EHR、没有真实试验;患者、笔记和方案都是虚构固定样本。这是证明机制的可运行演示,不是已部署流水线,因此未经 HIPAA 认证、未经 SOC 2 认证、未经 FDA 许可、非 CDS-exempt,也不做临床决策。FDA 2026 年 1 月的 Clinical Decision Support 指南是人在回路匹配辅助的相关框架,是我们的方向,不是我们持有的许可。
不能,因为这些不是语言问题,而是逻辑问题。相似度分数无法表示 is-a,无法表示 not,也无法表示除非在随机化前十二个月以上完成,再多的提示词或上下文也加不进去。所以我们让模型做它真正擅长的一件事:阅读凌乱散文并提出事实,附上读到它们的跨度,然后由对抗式核验器扔掉笔记不支持的内容,再由医学本体上的确定性代码计算裁定。LLM 无法覆盖那一关卡,这才使同一病历每次运行给出同一答案。
它是固定 13 例标注金标准集上的 100% 决策准确率,来自 7 名合成患者、跨 2 份合成方案,对照公平词汇基线计分,该基线的阈值已为其自身优势交叉验证(t = 0.6932)。它绝不是普遍或开放世界宣称,也不等于该产品对每份可能的病历都正确。在同一集合上,TrialProof 丢失合格患者 0 例,而基线丢失 3 例,并以 NEEDS-REVIEW 安全弃权两次而不是猜测。
本演示背后的研究——架构、核验设计,以及企业蓝图。
完整解决方案
探索临床试验招募 AI 解决方案 →确定性推理与出处层才是难的部分。我们构建它。
如果你的团队正在权衡如何把入组资格决策摆到监管方面前,而不要求他们相信一个相似度分数,我们真诚希望听听你们怎么想。这个问题是全行业的,答案也将是。