临床试验入组资格推理引擎

入组资格是计算出来的,而非预测出来的。

患者匹配模型把笔记当文本来读,于是把中心静脉导管误当成心导管检查,把本合格的患者排除掉。TrialProof 只让 LLM 阅读笔记,通过 SNOMED-CT 知识图谱解析含义,并在 LLM 无法覆盖的确定性代码中计算 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW。每条裁定都带有监管方可归档的推理轨迹。

100%

在标注金标准集上的决策准确率

对比公平词汇基线的 53.8%(13 例)

0 vs 3

丢失的合格患者

TrialProof 丢失 0 例,而基线丢失 3 例

100% vs 0%

推理轨迹覆盖率

每条裁定均有轨迹;重跑时字节级一致

这是在固定、已标注的金标准集上可运行的演示。所有患者、笔记和方案均为合成数据,本体是精选的 24 概念 SNOMED-CT 子图,实时 FHIR 摄入等连接器均为模拟。

被你的匹配器扔掉的合格患者

AI 患者匹配中错误排除背后的失败模式。

患者匹配 AI 把临床笔记当文本来读,于是把看起来相似但医学含义不同的词搞混。典型失败是具体的。一项 III 期抗凝试验排除心导管检查;患者笔记写的是中心静脉导管置入。相似度匹配器看到两种心血管导管操作,打出高分,并把本合格的患者排除。已发表的评估证实 AI 模型会犯这种确切的导管术错误(Fierce Biotech, 2025)。

同一类错误远不止一种操作。它覆盖否定:无糖尿病证据被匹配成糖尿病。它覆盖把家族史归到患者本人。它还覆盖例外条款,例如除非在随机化前 12 个月以上完成,而相似度分数根本无法表示这类条款。更好的基座模型也消除不了其中任何一项,因为它们不是语言问题。它们是逻辑问题。

代价并非学术性的。入组延误按每推迟一天损失处方销售额计,为每天 800,000 美元(Tufts CSDD Impact Report, 2024),肿瘤试验升至每天 840,000 美元,心血管试验升至每天 1.4 million 美元(Tufts CSDD)。80% 的试验错过入组时间表(industry consensus, 2025),平均筛查失败成本为 1,200 美元(Antidote.me, 2025),试验流程自 2005 年以来复杂度增加了 139%(IQVIA, 2026)。面对这样的数字,一名本合格却被错误筛出的患者不是舍入误差。

TrialProof 如何工作

智能体对抽取提供建议。确定性代码决定入组资格。这是神经符号:LLM 阅读散文,符号逻辑对患者执行规则。

每位患者对每份方案经过五个阶段,实时流式推送到界面。重要边界是:只有一个阶段是概率性的,而且它从不做任何决定。

1. 读取病历

加载 FHIR 形态的合成患者记录、其自由文本笔记、试验标准,以及随机化日期。

2. 抽取事实(唯一的概率步骤,仅作建议)

可替换提供商的 LLM 提出候选事实,每条附带逐字笔记跨度、从封闭词表抽取的候选 SCTID,以及置信度。它提供建议;它不做决定。作为可信 FHIR 到达的编码观察从不经过抽取器。当使用离线词表回退时,实时控制台会如实显示,而不是把它藏起来。

3. 核验事实(对抗式核验器)

每条提出的事实都对照字面笔记接受三项检查:span-present(捕捉幻觉实体)、否定,以及主体(家族史对患者本人)。被拒绝的事实标为 REJECTED,并附上触发的检查与原因,且永远到不了决策。

4. 组装证据

进入逻辑引擎的精确已核验事实集,标记为 coded-FHIR 对自由文本。

5. 计算裁定(确定性 Python,在智能体框架之外)

道义逻辑引擎通过 SNOMED is-a 归类和日期运算评估禁止、时间例外、controlled-unless 以及要求类标准,并输出带完整轨迹的 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW。LLM 无法覆盖这一关卡。

确定性阶段每个标准确实在数十微秒内完成,而模型阅读笔记需要数秒。这一对比才是重点,不是即时筛查的宣称:缓慢、易错的部分被限制在阅读,它所供给的决策则快速、廉价、可复现。

演示中的比较是公平词汇基线,而且是刻意如此。它是实体级 TF-IDF 余弦相似度,一种真实的向量相似度方法,并给予慷慨设置:干净的实体到概念解析,决策阈值为其自身交叉验证(t = 0.6932)。它从不调用 LLM。它仅有的短板是缺失层级、否定、时间和弃权逻辑,而这正是全部论点。它并非被调成失败。

从头到尾走完的推理

合成患者 P-074 及其队列,对照合成方案 ONC-204 和 ANTI-3。下方每张图都是正在运行的 TrialProof 应用的截图。

中心静脉置管不是心导管检查,只有层级知道这一点

P-074 的 ICU 笔记写着中心静脉导管置入以供静脉给药通路。对照 ANTI-3 的标准 EXCL-CARDCATH(无既往心导管检查),相似度匹配器看到两种心血管导管操作。TrialProof 转而问本体:Central venous catheterization(392230005)是不是 Cardiac catheterization(41976001)的 is-a 后代?不是。这两个概念位于 SNOMED-CT 层级的不同分支,因此不存在归类路径,裁定为 ELIGIBLE,并带有点名两个 SCTID 的三步轨迹。两个编码都是真实的,可在任何公开 SNOMED 浏览器上核对。公平词汇基线此处也返回 ELIGIBLE,但仅有 0.437 的裸相似度,没有推理轨迹,也没有监管方可归档的东西。

TrialProof 针对 EXCL-CARDCATH 的推理轨迹显示 Central venous catheterization 392230005 is-NOT-a Cardiac catheterization 41976001,位于层级的不同分支,因此裁定为 ELIGIBLE,旁边是基线仅 0.437 的裸相似度且无出处。
心导管检查轨迹:对真实 SCTID 的 is-a 检查裁定为 ELIGIBLE,而基线只给出 0.437 的裸相似度和无出处。

引擎实际查询的本体

引擎并不查询全部 SNOMED-CT。它遍历带 22 条 is-a 关系的精选 24 概念子图。带真实 SCTID 的概念画为实线;为演示精选、无公开 SCTID 的 9 个概念加前缀 CUR- 并画为虚线,而不是冒充真实编码。已核验事实为绿色,标准概念描边,走过的 is-a 路径加粗。两种导管术明显位于不同分支,这正是字符串或向量相似度无法替代归类的原因。

精选的 24 概念 SNOMED-CT 子图,含 22 条 is-a 关系,显示 Cardiac catheterization 与 Central venous catheterization 位于不同分支,真实 SCTID 画为实线,演示精选的 CUR- 概念画为虚线。
SNOMED-CT 子图,24 个概念和 22 条 is-a 关系,两种导管术位于不同分支。

被基线扔掉的合格患者

同一笔记写着无糖尿病证据。对照 ONC-204 的 EXCL-DM(无糖尿病诊断),向量基线以相似度 1.0 匹配到 token diabetes 并返回 EXCLUDED,因为它没有否定模型。TrialProof 的核验器在否定提及到达决策之前将其剥离,因此裁定为 ELIGIBLE。这就是相似度匹配器扔掉的合格患者,在金标准集上,这是基线丢失的三例之一。

针对写着无糖尿病证据的笔记的 EXCL-DM 推理轨迹:基线以相似度 1.0 匹配 diabetes 并返回 EXCLUDED,而 TrialProof 剥离否定提及并返回 ELIGIBLE。
否定:基线以相似度 1.0 排除;TrialProof 剥离否定提及并保持患者合格。

挑战抽取器的核验器

对 P-106,抽取器提出一条笔记中无支持跨度的 carboplatin 事实,这是植入的幻觉。对抗式核验器对每条提出的事实运行 span-present、否定和主体;该 carboplatin 事实未通过 span-present(笔记中未找到跨度)并被标为 REJECTED,因此永远到不了决策。在金标准集上,核验器拒绝了 7 个事实实例(3 个不同的坏事实:否定的糖尿病提及、家族史乳腺癌归因,以及这条幻觉 carboplatin),覆盖 13 次计分案例运行中的 4 次。智能体对抽取提供建议;确定性代码决定入组资格。

P-106 的核验事实面板显示一条 carboplatin 事实被标为 REJECTED,未通过检查 span-present,原因为笔记中未找到跨度,因此幻觉实体永远到不了入组资格决策。
核验器在 span-present 上拒绝幻觉 carboplatin,使其到不了决策。

相似度分数无法表示的例外

P-101 完成了辅助 carboplatin 和 pemetrexed,末次输注 03/2025。ONC-204 的 EXCL-PLAT 禁止既往铂类治疗,除非作为辅助或新辅助给予,且在随机化(2026-04-15)前 12 个月以上完成。引擎确认 Carboplatin(386905003)is-a Platinum-containing antineoplastic agent,计算间隔为 13 个月,满足例外,并以四步轨迹返回 ELIGIBLE。当同一条款在姑息意图患者上测试时,例外不适用,裁定翻转为 EXCLUDED。同一标准,相反裁定,两者都正确,因为这是逻辑引擎而不是阈值。

P-101 的 EXCL-PLAT 推理轨迹显示 Carboplatin 386905003 is-a Platinum-containing antineoplastic agent,辅助意图,间隔 13 个月大于 12,因此例外满足,裁定为 ELIGIBLE。
时间例外满足:辅助铂类在随机化前 13 个月完成,由日期运算算出。

临床运营负责人真正关心的数字

在固定金标准集上,13 个已标注案例来自 7 名合成患者、跨 2 份合成方案,对照交叉验证的词汇基线 t = 0.6932 计分,TrialProof 决策准确率为 100%,基线为 53.8%;丢失合格患者 0 例,而基线丢失 3 例;100% 的决策带有可复现推理轨迹,基线为 0%。它在基线猜测之处以 NEEDS-REVIEW 安全弃权两次,重跑全部 13 例得到字节级一致的裁定和轨迹(13 of 13)。我们将每个数字都归因于该标注金标准集,从不作为开放世界宣称。

金标准集基准磁贴:决策准确率 100% 对基线 53.8%,合格患者召回 100% 对 66.7%,丢失合格患者 0 对 3,可审计轨迹覆盖率 100% 对 0%,并附重跑 13 例得到字节级一致裁定的可复现性说明。
13 例标注金标准集:准确率 100% vs 53.8%,丢失合格患者 0 vs 3,轨迹覆盖率 100% vs 0%,重跑时字节级一致。

向量相似度对推理引擎

演示所计分的同一比较,逐维度对照。

维度 公平词汇基线 TrialProof
谁决定入组资格 超过阈值的相似度分数 确定性道义逻辑引擎,在智能体之外
层级 / is-a 无,仅有 token 邻近 SNOMED-CT is-a 归类
否定(无糖尿病证据) 匹配为存在 由核验器剥离
家族史归因 归到患者本人 在主体检查上被拒绝
时间例外条款 无法表示 对随机化日期做日期运算
缺失的检验或生命体征 猜测,从不弃权 NEEDS-REVIEW,点名所缺内容
推理轨迹 无,仅一个裸相似度数字 完整轨迹,导出为 CDISC SDTM IE
可复现性 不适用 重跑时字节级一致(13 of 13)

本演示不做什么

  • ✓ 它并不宣称普遍 100% 准确。100% 数字是固定 13 例标注金标准集上的决策准确率,绝不是开放世界保证,也绝不是对每份病历都正确的承诺。
  • ✓ 它并不把患者呈现为真实。所有患者、笔记和方案均为合成,无 PHI、无实时 EHR、无真实试验。P-074、P-101 至 P-106、ONC-204 和 ANTI-3 都是虚构固定样本。
  • ✓ 它并不使用完整 SNOMED-CT。本体是精选的 24 概念子图(15 个真实 SCTID,9 个精选并画为虚线)。完整 SNOMED-CT、MedDRA 和 LOINC 是延后的生产路径。
  • ✓ 它并不使用实时连接器。FHIR R4 EHR 摄入、图存储和临床 LLM 为模拟或可替换提供商。Epic App Orchard 和 Oracle 实时 FHIR、CTMS 连接器,以及 SOC 2 或 HIPAA BAA 加固均延后。
  • ✓ 它未经 FDA 许可、非 CDS-exempt、未经 HIPAA 认证、未经 SOC 2 认证。FDA 2026 年 1 月的 Clinical Decision Support 指南是我们的对齐与方向,不是许可。这不是医疗建议,也不做临床决策。
  • ✓ 它不带客户、申办方、CRO、试点、证言或 ROI 数字。这些都不存在。这是证明机制的演示,不是部署。

买方真正会问的问题

这与 Deep 6、Tempus 或 IQVIA 患者匹配有何不同?

TrialProof 不是数据网络或云匹配平台,也不是那些工具的克隆。它是它们所缺的确定性推理与出处层:让入组资格裁定可计算、可核对、可归档的那一部分。匹配平台交给你一份带分数的排序列表;TrialProof 交给你 ELIGIBLE、EXCLUDED 或 NEEDS-REVIEW,以及决定它的 SNOMED 概念 ID 和图边。它意在与匹配流水线并列,而不是替换其下的数据网络。

为什么患者匹配 AI 会排除合格患者?

因为它把临床笔记当文本来读并打相似度分,于是把看起来相似但医学含义不同的词搞混。写着中心静脉导管置入的笔记,对照排除心导管检查的试验打出高分,患者被错误排除。同一失败覆盖否定(无糖尿病证据被匹配成糖尿病)、把家族史归到患者本人,以及相似度分数根本无法表示的例外条款。已发表的评估证实 AI 模型会犯这种确切的导管术错误(Fierce Biotech, 2025)。

我能否为每项入组资格决策拿到监管方可归档的审计轨迹?

可以。每项决策导出为 JSON 和 CSV 中的 CDISC SDTM IE 记录,每位患者每条标准一行,携带标准、裁定,以及点名 SCTID 和道义操作的完整确定性推理轨迹。事实匹配处,该行还携带 is-a 路径;对笔记派生事实,还携带逐字跨度。在 13 例金标准集上,100% 的 TrialProof 决策带有可复现轨迹,基线为 0%,重跑该集产出字节级一致输出(13 of 13)。

它用的是真实 SNOMED 编码还是编造的?

演示为决策引用的每个概念都带有真实 SCTID,可在任何公开 SNOMED 浏览器上核对:Central venous catheterization 是 392230005,Cardiac catheterization 是 41976001,它们位于不同分支,这就是没有归类路径连接它们的原因。引擎查询带 22 条 is-a 关系的精选 24 概念子图,而不是完整 SNOMED-CT。为演示精选、无公开 SCTID 的 9 个概念加前缀 CUR- 并画为虚线,而不是冒充真实编码。完整 SNOMED-CT、MedDRA 和 LOINC 是延后的生产路径。

患者数据是真实的吗,这符合 HIPAA 吗?

全部数据均为合成。没有真实 PHI、没有实时 EHR、没有真实试验;患者、笔记和方案都是虚构固定样本。这是证明机制的可运行演示,不是已部署流水线,因此未经 HIPAA 认证、未经 SOC 2 认证、未经 FDA 许可、非 CDS-exempt,也不做临床决策。FDA 2026 年 1 月的 Clinical Decision Support 指南是人在回路匹配辅助的相关框架,是我们的方向,不是我们持有的许可。

更好的 LLM 不就能修好这个吗?

不能,因为这些不是语言问题,而是逻辑问题。相似度分数无法表示 is-a,无法表示 not,也无法表示除非在随机化前十二个月以上完成,再多的提示词或上下文也加不进去。所以我们让模型做它真正擅长的一件事:阅读凌乱散文并提出事实,附上读到它们的跨度,然后由对抗式核验器扔掉笔记不支持的内容,再由医学本体上的确定性代码计算裁定。LLM 无法覆盖那一关卡,这才使同一病历每次运行给出同一答案。

100% 准确率数字实际意味着什么?

它是固定 13 例标注金标准集上的 100% 决策准确率,来自 7 名合成患者、跨 2 份合成方案,对照公平词汇基线计分,该基线的阈值已为其自身优势交叉验证(t = 0.6932)。它绝不是普遍或开放世界宣称,也不等于该产品对每份可能的病历都正确。在同一集合上,TrialProof 丢失合格患者 0 例,而基线丢失 3 例,并以 NEEDS-REVIEW 安全弃权两次而不是猜测。

技术研究

本演示背后的研究——架构、核验设计,以及企业蓝图。

在没有监管方可归档的轨迹的情况下把患者匹配到试验?

确定性推理与出处层才是难的部分。我们构建它。

如果你的团队正在权衡如何把入组资格决策摆到监管方面前,而不要求他们相信一个相似度分数,我们真诚希望听听你们怎么想。这个问题是全行业的,答案也将是。

入组资格推理评估

  • ✓ 标出你的患者匹配器可能排除合格患者的位置
  • ✓ 把 LLM 应抽取的与代码应决定的分开
  • ✓ 定义你的方案所需的本体、否定和时间规则
  • ✓ 规定监管团队可归档的 CDISC SDTM IE 轨迹

构建推理层

  • ✓ 在你的真实本体上运行的确定性道义逻辑引擎
  • ✓ 针对否定、主体和幻觉事实的对抗式核验器
  • ✓ SNOMED-CT 归类加日期运算,每次重跑可复现
  • ✓ 可替换提供商的抽取,模型从不覆盖裁定
社交媒体

同步发布于