臨床試験適格性推論エンジン
患者マッチングモデルはメモをテキストとして読むため、中心静脈カテーテルを心臓カテーテル検査と混同し、適格だった患者を除外します。TrialProofはLLMにメモを読ませるだけにし、SNOMED-CTナレッジグラフで意味を解決し、LLMが上書きできない決定論的コードでELIGIBLE、EXCLUDED、またはNEEDS-REVIEWを算出します。すべての判定には、規制当局が提出できる推論トレースが付きます。
100%
ラベル付きゴールドセットにおける判定精度
公平な語彙ベースラインは53.8%(13症例)
0 vs 3
失われた適格患者
ベースラインが3人を失うところで、TrialProofは0人
100% vs 0%
推論トレースのカバレッジ
すべての判定にトレースあり。再実行時はバイト単位で同一
これは固定のラベル付きゴールドセット上の実行可能なデモです。患者、メモ、プロトコルはすべて合成であり、オントロジーはキュレーションされた24概念のSNOMED-CT部分グラフ、ライブFHIR取り込みなどのコネクタはシミュレートされています。
AI患者マッチングにおける誤った除外の背後にある失敗モード。
患者マッチングAIは臨床メモをテキストとして読むため、見た目は似ていても医学的には意味が異なる語を混同します。典型的な失敗は具体的です。第III相抗凝固薬試験は心臓カテーテル検査を除外します。患者のメモには中心静脈カテーテル留置とあります。類似度マッチャーは心血管系のカテーテル手技が二つあると見て高いスコアを付け、適格だった患者を除外します。公開された評価により、AIモデルがまさにこのカテーテル検査の誤りを犯すことが確認されています(Fierce Biotech、2025年)。
同じ類型の誤りは、一つの手技にとどまりません。否定を含み、「糖尿病の所見なし」が糖尿病としてマッチされます。患者に帰属された家族歴も含みます。そして、「無作為化の12か月超前に完了している場合を除く」のような例外条項も含み、類似度スコアではまったく表現できません。より優れたベースモデルでも、これらは言語の問題ではなくロジックの問題であるため、どれも取り除けません。
そのコストは学術的なものではありません。登録遅延は試験が1日ずれるごとに逸失処方箋売上として1日あたり800,000ドルに上り(Tufts CSDD Impact Report、2024年)、腫瘍学では1日840,000ドル、心血管試験では1日1.4 millionドルに達します(Tufts CSDD)。試験の80%が登録スケジュールを守れず(業界コンセンサス、2025年)、スクリーニング不適格の平均コストは1,200ドル(Antidote.me、2025年)、試験手技の複雑さは2005年以降139%増加しています(IQVIA、2026年)。こうした数字に照らすと、誤ってスクリーニング除外された適格患者は誤差の範囲ではありません。
エージェントは抽出について助言します。適格性を決めるのは決定論的コードです。これはニューロシンボリックです。LLMが散文を読み、シンボリックロジックが患者に規則を適用します。
各患者は各プロトコルに対して五つの段階を経て実行され、インターフェースへライブでストリーミングされます。重要な境界は、確率的な段階は一つだけであり、しかも何も決定しないということです。
FHIR形式の合成患者記録、自由記述メモ、試験基準、無作為化日を読み込みます。
プロバイダー交換可能なLLMが候補事実を提案します。各事実には逐語のメモスパン、閉じた語彙から引いた候補SCTID、信頼度が付きます。助言するのであって、決定はしません。信頼済みFHIRとして届くコード化観察は抽出器を通りません。オフラインレキシコンフォールバックが使われるときは、隠さずライブコンソールに表示します。
提案されたすべての事実は、逐語のメモに対して三つのチェックで検証されます。span-present(ハルシネーションされたエンティティを捕捉)、否定、主体(家族歴対患者)です。却下された事実は発火したチェックと理由とともにREJECTEDとフラグされ、判定には到達しません。
ロジックエンジンに入る、検証済みの正確な事実集合。コード化FHIR対自由記述としてマークされます。
義務論理エンジンが、SNOMEDのis-a包摂と日付演算により、禁止、時間的例外、制御付きunless、要件の各基準を評価し、完全なトレース付きでELIGIBLE、EXCLUDED、またはNEEDS-REVIEWを出力します。LLMはこのゲートを上書きできません。
決定論的段階は基準あたり本当に数十マイクロ秒で走り、メモを読むモデルは数秒かかります。その対比こそが要点であり、即時スクリーニングの主張ではありません。遅くて誤りやすい部分は読み取りに閉じ込められ、それが供給する判定は速く、安く、再現可能です。
デモ内の比較は公平な語彙ベースラインであり、意図的にそうです。エンティティレベルのTF-IDFコサイン類似度という実在のベクトル類似度手法に、クリーンなエンティティから概念への解決という手厚い設定を与え、判定閾値は自身のために交差検証されています(t = 0.6932)。LLMは一切呼び出しません。唯一のハンデは、欠けている階層、否定、時間、棄権のロジックであり、それが論旨そのものです。失敗するようチューニングされたのではありません。
合成患者P-074とそのコホートを、合成プロトコルONC-204とANTI-3に対して。以下の画像はすべて、稼働中のTrialProofアプリのスクリーンショットです。
P-074のICUメモには、IV薬剤アクセスのための中心静脈カテーテル留置とあります。ANTI-3の基準EXCL-CARDCATH(既往の心臓カテーテル検査なし)に対し、類似度マッチャーは心血管系のカテーテル手技が二つあると見ます。TrialProofは代わりにオントロジーに尋ねます。Central venous catheterization(392230005)はCardiac catheterization(41976001)のis-a子孫か?いいえ。二つの概念はSNOMED-CT階層の異なる枝にあり、包摂パスは存在せず、判定は両方のSCTIDを名指す三ステップのトレース付きでELIGIBLEです。両コードは実在し、公開のSNOMEDブラウザで確認できます。公平な語彙ベースラインもここではELIGIBLEを返しますが、類似度はわずか0.437で推論トレースはなく、規制当局が提出できるものは何もありません。
エンジンはSNOMED-CT全体を照会しません。22本のis-a関係を持つ、キュレーションされた24概念の部分グラフを辿ります。実在SCTIDを持つ概念は実線、公開SCTIDのないデモ用にキュレーションした9概念はCUR-接頭辞で破線として描かれ、実在コードであるかのように見せません。検証済み事実は緑、基準概念は輪郭、辿ったis-aパスは太線です。二つのカテーテル法が明らかに別枝にあり、だからこそ文字列やベクトル類似度は包摂の代わりになりません。
同じメモに No evidence of diabetes とあります。ONC-204のEXCL-DM(糖尿病の診断なし)に対し、ベクトルベースラインはトークン diabetes を類似度1.0でマッチしてEXCLUDEDを返します。否定のモデルがないからです。TrialProofの検証器は否定された言及を判定に到達する前に除去するため、判定はELIGIBLEです。これが類似度マッチャーが捨てる適格患者であり、ゴールドセットではベースラインが失う3人のうちの1人です。
P-106について、抽出器はメモに裏付けスパンのないカルボプラチン事実を提案します。仕掛けられたハルシネーションです。敵対的検証器は提案されたすべての事実にspan-present、否定、主体を実行します。カルボプラチン事実はspan-presentに失敗し(span not found in note)、REJECTEDとフラグされるため、判定には到達しません。ゴールドセット全体で、検証器は採点された13件のケースランのうち4件で、7件の事実インスタンス(3つの異なる不良事実:否定された糖尿病言及、家族歴の乳がん帰属、そしてこのハルシネーションされたカルボプラチン)を却下しました。エージェントは抽出について助言し、適格性を決めるのは決定論的コードです。
P-101は補助療法のカルボプラチンとペメトレキセドを完了し、最終投与は03/2025です。ONC-204のEXCL-PLATは、補助またはネオアジュバントとして投与され無作為化(2026-04-15)の12か月超前に完了している場合を除き、既往の白金療法を禁止します。エンジンはCarboplatin(386905003)がPlatinum-containing antineoplastic agentのis-aであることを確認し、間隔を13か月と算出し、例外を満たし、四ステップのトレース付きでELIGIBLEを返します。同じ条項を緩和目的の患者で試すと、例外は適用されず判定はEXCLUDEDに反転します。同じ基準、反対の判定、どちらも正しい。閾値ではなくロジックエンジンだからです。
7人の合成患者と2件の合成プロトコルから取った13のラベル付き症例という固定ゴールドセットで、交差検証済み語彙ベースライン(t = 0.6932)に対して採点すると、TrialProofの判定精度は100%、ベースラインは53.8%、失う適格患者は0人対ベースラインの3人、再現可能な推論トレースは判定の100%対ベースラインの0%です。ベースラインが推測するところでNEEDS-REVIEWにより安全に2回棄権し、13症例すべての再実行は判定とトレースがバイト単位で同一です(13 of 13)。すべての数値はこのラベル付きゴールドセットに帰属させ、オープンワールドの主張としては述べません。
デモが採点するのと同じ比較を、次元ごとに。
| 次元 | 公平な語彙ベースライン | TrialProof |
|---|---|---|
| 誰が適格性を決めるか | 閾値を超えた類似度スコア | エージェントの外側にある、決定論的な義務論理エンジン |
| 階層 / is-a | なし。トークン近接のみ | SNOMED-CTのis-a包摂 |
| 否定(糖尿病の所見なし) | 存在するものとしてマッチ | 検証器が除去 |
| 家族歴の帰属 | 患者に帰属 | 主体チェックで却下 |
| 時間的例外条項 | 表現不能 | 無作為化日に対する日付演算 |
| 欠落した検査またはバイタル | 推測し、決して棄権しない | NEEDS-REVIEW。何が欠けているかを名指し |
| 推論トレース | なし。類似度の数値のみ | 完全なトレース。CDISC SDTM IEとしてエクスポート |
| 再現性 | 該当なし | 再実行時はバイト単位で同一(13 of 13) |
TrialProofはデータネットワークでもクラウドマッチングプラットフォームでもなく、それらのツールのクローンでもありません。欠けている決定論的推論と来歴のレイヤーです。適格性判定を算出可能、検証可能、提出可能にする部分です。マッチングプラットフォームはスコア付きの順位リストを渡します。TrialProofは、それを決めたSNOMED概念IDとグラフ辺とともにELIGIBLE、EXCLUDED、またはNEEDS-REVIEWを渡します。マッチングパイプラインの横に座るためのものであり、その下のデータネットワークを置き換えるものではありません。
臨床メモをテキストとして読み類似度をスコアするため、見た目は似ていても医学的には意味が異なる語を混同するからです。中心静脈カテーテル留置と記されたメモは、心臓カテーテル検査を除外する試験に対して高いスコアになり、患者は誤って除外されます。同じ失敗は否定(糖尿病の所見なしが糖尿病としてマッチされる)、患者に帰属された家族歴、類似度スコアではまったく表現できない例外条項にも及びます。公開された評価により、AIモデルがまさにこのカテーテル検査の誤りを犯すことが確認されています(Fierce Biotech、2025年)。
はい。すべての判定は、患者と基準ごとに1行のCDISC SDTM IEレコードとしてJSONとCSVでエクスポートされ、基準、判定、SCTIDと義務演算を名指す完全な決定論的推論トレースを持ちます。事実がマッチした行はis-aパスも持ち、メモ由来の事実では逐語スパンも持ちます。13症例のゴールドセットでは、TrialProofの判定の100%が再現可能なトレースを持ち、ベースラインは0%であり、セットの再実行はバイト単位で同一の出力を生みます(13 of 13)。
デモが判定のために引用するすべての概念は実在のSCTIDを持ち、公開のSNOMEDブラウザで確認できます。中心静脈カテーテル法は392230005、心臓カテーテル検査は41976001で、別枝にあるため包摂パスはつながりません。エンジンが照会するのは完全なSNOMED-CTではなく、22本のis-a関係を持つキュレーションされた24概念の部分グラフです。公開SCTIDのないデモ用にキュレーションした9概念はCUR-接頭辞で破線として描かれ、実在コードであるかのように見せません。完全なSNOMED-CT、MedDRA、LOINCは先送りの本番パスです。
データはすべて合成です。実在のPHI、ライブEHR、実在の試験はなく、患者、メモ、プロトコルは作られたフィクスチャです。これは仕組みを証明する実行可能なデモであり導入済みパイプラインではないため、HIPAA認証、SOC 2認証、FDA承認、CDS適用除外のいずれでもなく、臨床判断も下しません。FDAの2026年1月臨床意思決定支援ガイダンスは、人間参加型マッチング支援の関連枠組みであり、私たちの方向であって保有する承認ではありません。
いいえ。これらは言語の問題ではなく、ロジックの問題だからです。類似度スコアはis-aを表現できず、notを表現できず、「無作為化の12か月超前に完了している場合を除く」も表現できず、プロンプトやコンテキストをいくら足しても加わりません。だからモデルには本当に得意な一事、乱雑な散文を読んで読んだスパン付きで事実を提案することを任せ、敵対的検証器がメモが裏付けないものを捨て、医学オントロジー上の決定論的コードが判定を算出します。LLMはそのゲートを上書きできない。だから同じカルテが毎回同じ答えを出します。
固定の13症例ラベル付きゴールドセットにおける判定精度100%です。7人の合成患者と2件の合成プロトコルから取り、自身に有利になるよう閾値を交差検証した公平な語彙ベースライン(t = 0.6932)に対して採点しています。普遍的またはオープンワールドの主張ではなく、この製品があらゆるカルテで正しいこととも同じではありません。同じセットでTrialProofは適格患者を0人失い、ベースラインは3人失い、推測する代わりにNEEDS-REVIEWで安全に2回棄権します。
このデモの背後にある研究 — アーキテクチャ、検証設計、エンタープライズの青写真。
フルソリューション
臨床試験リクルートメントAIソリューションを見る →決定論的な推論と来歴のレイヤーこそが難しい部分です。私たちがそれを構築します。
類似度スコアを信頼するよう求めずに、適格性判定を規制当局の前に置く方法をチームが検討しているなら、その考え方をぜひ伺いたいです。問題は業界全体のものであり、答えもそうなるでしょう。