臨床試験適格性推論エンジン

予測ではなく算出される試験適格性。

患者マッチングモデルはメモをテキストとして読むため、中心静脈カテーテルを心臓カテーテル検査と混同し、適格だった患者を除外します。TrialProofはLLMにメモを読ませるだけにし、SNOMED-CTナレッジグラフで意味を解決し、LLMが上書きできない決定論的コードでELIGIBLE、EXCLUDED、またはNEEDS-REVIEWを算出します。すべての判定には、規制当局が提出できる推論トレースが付きます。

100%

ラベル付きゴールドセットにおける判定精度

公平な語彙ベースラインは53.8%(13症例)

0 vs 3

失われた適格患者

ベースラインが3人を失うところで、TrialProofは0人

100% vs 0%

推論トレースのカバレッジ

すべての判定にトレースあり。再実行時はバイト単位で同一

これは固定のラベル付きゴールドセット上の実行可能なデモです。患者、メモ、プロトコルはすべて合成であり、オントロジーはキュレーションされた24概念のSNOMED-CT部分グラフ、ライブFHIR取り込みなどのコネクタはシミュレートされています。

マッチャーが捨ててしまう適格患者

AI患者マッチングにおける誤った除外の背後にある失敗モード。

患者マッチングAIは臨床メモをテキストとして読むため、見た目は似ていても医学的には意味が異なる語を混同します。典型的な失敗は具体的です。第III相抗凝固薬試験は心臓カテーテル検査を除外します。患者のメモには中心静脈カテーテル留置とあります。類似度マッチャーは心血管系のカテーテル手技が二つあると見て高いスコアを付け、適格だった患者を除外します。公開された評価により、AIモデルがまさにこのカテーテル検査の誤りを犯すことが確認されています(Fierce Biotech、2025年)。

同じ類型の誤りは、一つの手技にとどまりません。否定を含み、「糖尿病の所見なし」が糖尿病としてマッチされます。患者に帰属された家族歴も含みます。そして、「無作為化の12か月超前に完了している場合を除く」のような例外条項も含み、類似度スコアではまったく表現できません。より優れたベースモデルでも、これらは言語の問題ではなくロジックの問題であるため、どれも取り除けません。

そのコストは学術的なものではありません。登録遅延は試験が1日ずれるごとに逸失処方箋売上として1日あたり800,000ドルに上り(Tufts CSDD Impact Report、2024年)、腫瘍学では1日840,000ドル、心血管試験では1日1.4 millionドルに達します(Tufts CSDD)。試験の80%が登録スケジュールを守れず(業界コンセンサス、2025年)、スクリーニング不適格の平均コストは1,200ドル(Antidote.me、2025年)、試験手技の複雑さは2005年以降139%増加しています(IQVIA、2026年)。こうした数字に照らすと、誤ってスクリーニング除外された適格患者は誤差の範囲ではありません。

TrialProofの仕組み

エージェントは抽出について助言します。適格性を決めるのは決定論的コードです。これはニューロシンボリックです。LLMが散文を読み、シンボリックロジックが患者に規則を適用します。

各患者は各プロトコルに対して五つの段階を経て実行され、インターフェースへライブでストリーミングされます。重要な境界は、確率的な段階は一つだけであり、しかも何も決定しないということです。

1. カルテを読む

FHIR形式の合成患者記録、自由記述メモ、試験基準、無作為化日を読み込みます。

2. 事実を抽出する(唯一の確率的ステップ。助言のみ)

プロバイダー交換可能なLLMが候補事実を提案します。各事実には逐語のメモスパン、閉じた語彙から引いた候補SCTID、信頼度が付きます。助言するのであって、決定はしません。信頼済みFHIRとして届くコード化観察は抽出器を通りません。オフラインレキシコンフォールバックが使われるときは、隠さずライブコンソールに表示します。

3. 事実を検証する(敵対的検証器)

提案されたすべての事実は、逐語のメモに対して三つのチェックで検証されます。span-present(ハルシネーションされたエンティティを捕捉)、否定、主体(家族歴対患者)です。却下された事実は発火したチェックと理由とともにREJECTEDとフラグされ、判定には到達しません。

4. 証拠を組み立てる

ロジックエンジンに入る、検証済みの正確な事実集合。コード化FHIR対自由記述としてマークされます。

5. 判定を算出する(決定論的Python。エージェントフレームワークの外側)

義務論理エンジンが、SNOMEDのis-a包摂と日付演算により、禁止、時間的例外、制御付きunless、要件の各基準を評価し、完全なトレース付きでELIGIBLE、EXCLUDED、またはNEEDS-REVIEWを出力します。LLMはこのゲートを上書きできません。

決定論的段階は基準あたり本当に数十マイクロ秒で走り、メモを読むモデルは数秒かかります。その対比こそが要点であり、即時スクリーニングの主張ではありません。遅くて誤りやすい部分は読み取りに閉じ込められ、それが供給する判定は速く、安く、再現可能です。

デモ内の比較は公平な語彙ベースラインであり、意図的にそうです。エンティティレベルのTF-IDFコサイン類似度という実在のベクトル類似度手法に、クリーンなエンティティから概念への解決という手厚い設定を与え、判定閾値は自身のために交差検証されています(t = 0.6932)。LLMは一切呼び出しません。唯一のハンデは、欠けている階層、否定、時間、棄権のロジックであり、それが論旨そのものです。失敗するようチューニングされたのではありません。

エンドツーエンドで辿る推論

合成患者P-074とそのコホートを、合成プロトコルONC-204とANTI-3に対して。以下の画像はすべて、稼働中のTrialProofアプリのスクリーンショットです。

中心静脈ラインは心臓カテーテルではなく、それを知るのは階層だけです

P-074のICUメモには、IV薬剤アクセスのための中心静脈カテーテル留置とあります。ANTI-3の基準EXCL-CARDCATH(既往の心臓カテーテル検査なし)に対し、類似度マッチャーは心血管系のカテーテル手技が二つあると見ます。TrialProofは代わりにオントロジーに尋ねます。Central venous catheterization(392230005)はCardiac catheterization(41976001)のis-a子孫か?いいえ。二つの概念はSNOMED-CT階層の異なる枝にあり、包摂パスは存在せず、判定は両方のSCTIDを名指す三ステップのトレース付きでELIGIBLEです。両コードは実在し、公開のSNOMEDブラウザで確認できます。公平な語彙ベースラインもここではELIGIBLEを返しますが、類似度はわずか0.437で推論トレースはなく、規制当局が提出できるものは何もありません。

EXCL-CARDCATHのTrialProof推論トレース。中心静脈カテーテル法392230005は階層の別枝上にありCardiac catheterization 41976001のis-NOT-aであるため判定はELIGIBLE。横には由来情報のない類似度0.437だけのベースライン。
心臓カテーテルのトレース:実在SCTIDに対するis-aチェックがELIGIBLEを決める。ベースラインは類似度0.437のみで由来情報なし。

エンジンが実際に照会するオントロジー

エンジンはSNOMED-CT全体を照会しません。22本のis-a関係を持つ、キュレーションされた24概念の部分グラフを辿ります。実在SCTIDを持つ概念は実線、公開SCTIDのないデモ用にキュレーションした9概念はCUR-接頭辞で破線として描かれ、実在コードであるかのように見せません。検証済み事実は緑、基準概念は輪郭、辿ったis-aパスは太線です。二つのカテーテル法が明らかに別枝にあり、だからこそ文字列やベクトル類似度は包摂の代わりになりません。

22本のis-a関係を持つキュレーションされた24概念のSNOMED-CT部分グラフ。心臓カテーテル検査と中心静脈カテーテル法が別枝にあり、実在SCTIDは実線、デモ用CUR-概念は破線。
SNOMED-CT部分グラフ。24概念と22本のis-a関係。二つのカテーテル法は別枝。

ベースラインが捨ててしまう適格患者

同じメモに No evidence of diabetes とあります。ONC-204のEXCL-DM(糖尿病の診断なし)に対し、ベクトルベースラインはトークン diabetes を類似度1.0でマッチしてEXCLUDEDを返します。否定のモデルがないからです。TrialProofの検証器は否定された言及を判定に到達する前に除去するため、判定はELIGIBLEです。これが類似度マッチャーが捨てる適格患者であり、ゴールドセットではベースラインが失う3人のうちの1人です。

No evidence of diabetes と記されたメモに対するEXCL-DM推論トレース。ベースラインは diabetes を類似度1.0でマッチしてEXCLUDEDを返し、TrialProofは否定された言及を除去してELIGIBLEを返す。
否定:ベースラインは類似度1.0で除外。TrialProofは否定された言及を除去し、患者を適格のままにする。

抽出器に異議を唱える検証器

P-106について、抽出器はメモに裏付けスパンのないカルボプラチン事実を提案します。仕掛けられたハルシネーションです。敵対的検証器は提案されたすべての事実にspan-present、否定、主体を実行します。カルボプラチン事実はspan-presentに失敗し(span not found in note)、REJECTEDとフラグされるため、判定には到達しません。ゴールドセット全体で、検証器は採点された13件のケースランのうち4件で、7件の事実インスタンス(3つの異なる不良事実:否定された糖尿病言及、家族歴の乳がん帰属、そしてこのハルシネーションされたカルボプラチン)を却下しました。エージェントは抽出について助言し、適格性を決めるのは決定論的コードです。

P-106の事実検証パネル。カルボプラチン事実がREJECTEDとフラグされ、失敗したチェックはspan-present、理由は span not found in note。ハルシネーションされたエンティティは適格性判定に到達しない。
検証器は、判定に到達する前に、ハルシネーションされたカルボプラチンをspan-presentで却下します。

類似度スコアでは表現できない例外

P-101は補助療法のカルボプラチンとペメトレキセドを完了し、最終投与は03/2025です。ONC-204のEXCL-PLATは、補助またはネオアジュバントとして投与され無作為化(2026-04-15)の12か月超前に完了している場合を除き、既往の白金療法を禁止します。エンジンはCarboplatin(386905003)がPlatinum-containing antineoplastic agentのis-aであることを確認し、間隔を13か月と算出し、例外を満たし、四ステップのトレース付きでELIGIBLEを返します。同じ条項を緩和目的の患者で試すと、例外は適用されず判定はEXCLUDEDに反転します。同じ基準、反対の判定、どちらも正しい。閾値ではなくロジックエンジンだからです。

P-101のEXCL-PLAT推論トレース。Carboplatin 386905003はPlatinum-containing antineoplastic agentのis-a、補助療法意図、間隔13か月は12超、ゆえに例外が満たされ判定はELIGIBLE。
時間的例外が満たされた:補助白金療法が無作為化の13か月前に完了。日付演算で算出。

臨床オペレーション責任者が本当に気にする数字

7人の合成患者と2件の合成プロトコルから取った13のラベル付き症例という固定ゴールドセットで、交差検証済み語彙ベースライン(t = 0.6932)に対して採点すると、TrialProofの判定精度は100%、ベースラインは53.8%、失う適格患者は0人対ベースラインの3人、再現可能な推論トレースは判定の100%対ベースラインの0%です。ベースラインが推測するところでNEEDS-REVIEWにより安全に2回棄権し、13症例すべての再実行は判定とトレースがバイト単位で同一です(13 of 13)。すべての数値はこのラベル付きゴールドセットに帰属させ、オープンワールドの主張としては述べません。

ゴールドセットのベンチマークタイル:判定精度100%対ベースライン53.8%、適格患者再現率100%対66.7%、失われた適格患者0対3、監査可能なトレースカバレッジ100%対0%。13症例の再実行がバイト単位で同一の判定を生むという再現性の注記付き。
13症例のラベル付きゴールドセット:精度100% vs 53.8%、失われた適格患者0 vs 3、トレースカバレッジ100% vs 0%、再実行時はバイト単位で同一。

ベクトル類似度対推論エンジン

デモが採点するのと同じ比較を、次元ごとに。

次元 公平な語彙ベースライン TrialProof
誰が適格性を決めるか 閾値を超えた類似度スコア エージェントの外側にある、決定論的な義務論理エンジン
階層 / is-a なし。トークン近接のみ SNOMED-CTのis-a包摂
否定(糖尿病の所見なし) 存在するものとしてマッチ 検証器が除去
家族歴の帰属 患者に帰属 主体チェックで却下
時間的例外条項 表現不能 無作為化日に対する日付演算
欠落した検査またはバイタル 推測し、決して棄権しない NEEDS-REVIEW。何が欠けているかを名指し
推論トレース なし。類似度の数値のみ 完全なトレース。CDISC SDTM IEとしてエクスポート
再現性 該当なし 再実行時はバイト単位で同一(13 of 13)

このデモが行わないこと

  • ✓ 普遍的に100%正確だと主張しません。100%という数字は、固定の13症例ラベル付きゴールドセットにおける判定精度であり、オープンワールドの保証でも、あらゆるカルテで正しいという約束でもありません。
  • ✓ 患者を実在であるかのように提示しません。患者、メモ、プロトコルはすべて合成であり、PHIなし、ライブEHRなし、実在の試験なしです。P-074、P-101からP-106、ONC-204、ANTI-3は作られたフィクスチャです。
  • ✓ 完全なSNOMED-CTは使いません。オントロジーはキュレーションされた24概念の部分グラフです(実在SCTID 15、キュレーションされ破線で描かれる9)。完全なSNOMED-CT、MedDRA、LOINCは先送りの本番パスです。
  • ✓ ライブコネクタは使いません。FHIR R4のEHR取り込み、グラフストア、臨床LLMはシミュレートまたはプロバイダー交換可能です。Epic App OrchardとOracleのライブFHIR、CTMSコネクタ、SOC 2またはHIPAA BAAの強化は先送りです。
  • ✓ FDA承認、CDS適用除外、HIPAA認証、SOC 2認証のいずれでもありません。FDAの2026年1月臨床意思決定支援ガイダンスは、私たちの整合と方向であり、承認ではありません。これは医療助言ではなく、臨床判断を下しません。
  • ✓ 顧客、スポンサー、CRO、パイロット、推薦、ROI数値は持ちません。存在しません。これは仕組みを証明するデモであり、導入ではありません。

買い手が実際に尋ねる質問

これはDeep 6、Tempus、IQVIAの患者マッチングとどう違うのですか?

TrialProofはデータネットワークでもクラウドマッチングプラットフォームでもなく、それらのツールのクローンでもありません。欠けている決定論的推論と来歴のレイヤーです。適格性判定を算出可能、検証可能、提出可能にする部分です。マッチングプラットフォームはスコア付きの順位リストを渡します。TrialProofは、それを決めたSNOMED概念IDとグラフ辺とともにELIGIBLE、EXCLUDED、またはNEEDS-REVIEWを渡します。マッチングパイプラインの横に座るためのものであり、その下のデータネットワークを置き換えるものではありません。

なぜ患者マッチングAIは適格患者を除外するのですか?

臨床メモをテキストとして読み類似度をスコアするため、見た目は似ていても医学的には意味が異なる語を混同するからです。中心静脈カテーテル留置と記されたメモは、心臓カテーテル検査を除外する試験に対して高いスコアになり、患者は誤って除外されます。同じ失敗は否定(糖尿病の所見なしが糖尿病としてマッチされる)、患者に帰属された家族歴、類似度スコアではまったく表現できない例外条項にも及びます。公開された評価により、AIモデルがまさにこのカテーテル検査の誤りを犯すことが確認されています(Fierce Biotech、2025年)。

適格性判定ごとに、規制当局が提出できる監査証跡は得られますか?

はい。すべての判定は、患者と基準ごとに1行のCDISC SDTM IEレコードとしてJSONとCSVでエクスポートされ、基準、判定、SCTIDと義務演算を名指す完全な決定論的推論トレースを持ちます。事実がマッチした行はis-aパスも持ち、メモ由来の事実では逐語スパンも持ちます。13症例のゴールドセットでは、TrialProofの判定の100%が再現可能なトレースを持ち、ベースラインは0%であり、セットの再実行はバイト単位で同一の出力を生みます(13 of 13)。

実在のSNOMEDコードを使っていますか、それとも作ったものですか?

デモが判定のために引用するすべての概念は実在のSCTIDを持ち、公開のSNOMEDブラウザで確認できます。中心静脈カテーテル法は392230005、心臓カテーテル検査は41976001で、別枝にあるため包摂パスはつながりません。エンジンが照会するのは完全なSNOMED-CTではなく、22本のis-a関係を持つキュレーションされた24概念の部分グラフです。公開SCTIDのないデモ用にキュレーションした9概念はCUR-接頭辞で破線として描かれ、実在コードであるかのように見せません。完全なSNOMED-CT、MedDRA、LOINCは先送りの本番パスです。

患者データは実在ですか。HIPAA準拠ですか?

データはすべて合成です。実在のPHI、ライブEHR、実在の試験はなく、患者、メモ、プロトコルは作られたフィクスチャです。これは仕組みを証明する実行可能なデモであり導入済みパイプラインではないため、HIPAA認証、SOC 2認証、FDA承認、CDS適用除外のいずれでもなく、臨床判断も下しません。FDAの2026年1月臨床意思決定支援ガイダンスは、人間参加型マッチング支援の関連枠組みであり、私たちの方向であって保有する承認ではありません。

より良いLLMなら、これだけで直るのでは?

いいえ。これらは言語の問題ではなく、ロジックの問題だからです。類似度スコアはis-aを表現できず、notを表現できず、「無作為化の12か月超前に完了している場合を除く」も表現できず、プロンプトやコンテキストをいくら足しても加わりません。だからモデルには本当に得意な一事、乱雑な散文を読んで読んだスパン付きで事実を提案することを任せ、敵対的検証器がメモが裏付けないものを捨て、医学オントロジー上の決定論的コードが判定を算出します。LLMはそのゲートを上書きできない。だから同じカルテが毎回同じ答えを出します。

100%精度という数字は実際に何を意味しますか?

固定の13症例ラベル付きゴールドセットにおける判定精度100%です。7人の合成患者と2件の合成プロトコルから取り、自身に有利になるよう閾値を交差検証した公平な語彙ベースライン(t = 0.6932)に対して採点しています。普遍的またはオープンワールドの主張ではなく、この製品があらゆるカルテで正しいこととも同じではありません。同じセットでTrialProofは適格患者を0人失い、ベースラインは3人失い、推測する代わりにNEEDS-REVIEWで安全に2回棄権します。

テクニカルリサーチ

このデモの背後にある研究 — アーキテクチャ、検証設計、エンタープライズの青写真。

規制当局が提出できるトレースなしで、患者を試験にマッチングしていませんか?

決定論的な推論と来歴のレイヤーこそが難しい部分です。私たちがそれを構築します。

類似度スコアを信頼するよう求めずに、適格性判定を規制当局の前に置く方法をチームが検討しているなら、その考え方をぜひ伺いたいです。問題は業界全体のものであり、答えもそうなるでしょう。

適格性推論のアセスメント

  • ✓ 患者マッチャーが適格患者を除外しうる箇所を洗い出す
  • ✓ LLMが抽出すべきものとコードが決めるべきものを分ける
  • ✓ プロトコルが必要とするオントロジー、否定、時間規則を定義する
  • ✓ 規制チームが提出できるCDISC SDTM IEトレースを仕様化する

推論レイヤーを構築する

  • ✓ 実在のオントロジー上の決定論的義務論理エンジン
  • ✓ 否定、主体、ハルシネーション事実のための敵対的検証器
  • ✓ SNOMED-CT包摂と日付演算。再実行のたびに再現可能
  • ✓ プロバイダー交換可能な抽出。モデルが判定を上書きすることはない
ソーシャル

他のプラットフォームでも公開