中心静脈カテーテルの記載を理由に、適格な患者を誤って「不適格」と判定する臨床試験の適格性判定画面。
Artificial IntelligenceHealthcareClinical Trials

AIは、心臓カテーテル検査と点滴ラインを区別できず、適格な患者を取りこぼした

Ashutosh SinghalAshutosh Singhal2026年5月6日14 min

私たちが最初に失った患者は、一つの言葉のせいで失った。

私たちがパイロット運用していた第III相の抗凝固薬試験は、「心臓カテーテル検査」を受けたことのある人をすべて除外していた。もっともな話だ——出血リスクを伴う心臓の処置であり、まさに血液をさらさらにする薬の試験から人を除外するタイプの既往歴だ。私たちのマッチングシステムは、ある候補者を不適格と判定し、次へ進んだ。クリーンに。確信を持って。だが、間違っていた。

その患者は、心臓カテーテル検査を一度も受けたことがなかった。彼女のカルテには「中心静脈カテーテル留置」に関する記載があった——ICUで薬剤投与のために静脈へ通した点滴ラインのことだ。処置が違う。体の部位が違う。リスクプロファイルもまったく違う。看護師にとって、この二つはまるで混同のしようがない。だが、私たちが構築したAIにとっては、「カテーテル」に「静脈」、そして心血管を思わせる文脈が加わって近似一致とスコアリングされ、適格な一人の女性が静かにファネルからこぼれ落ちた。

私がなぜ、あの取りこぼした一人の患者のことで一年近くを費やして思い悩むことになったのか、それをお話ししたい。というのも、臨床試験の被験者募集AIを売る者が誰も声に出して言いたがらないことを、その一件が私に教えてくれたからだ。患者マッチングにおける問題は、決して十分な人数を見つけることではなかった。問題は、マッチングを行う機械が言葉を読んでいるという点であり、そして試験の適格性は医療上の概念に関わる——その二つは同じではないのだ。

試験の80%が登録スケジュールに間に合わない。業界はこれを供給の問題として扱い続けている。だが、これは精度の問題だ。

私が最初に犯した誤り

まず最初に認めておきたい。ここがこの物語全体の転換点だからだ。始めた当初、私はこれがほぼ解決済みだと信じる側にいた。

論理はこうだった。長年、試験マッチングはキーワード検索で動いていた——粗雑で、脆く、みじめなものだった。そこへ大規模言語モデルが登場し、ソフトウェアが突然、構造化されていない医師のメモを人間と同じように読めるようになった。私はそれを見て、難しい部分はもう過ぎ去ったと結論づけた。強力なモデルを用意し、適格基準と患者記録を与え、プロンプトを調整すれば、マッチングはただうまくいくはずだ、と。私はそう主張した。チームには、埋めるべきギャップは小さく、より優れた検索とより丁寧なプロンプト設計の問題にすぎないと伝えた。

私たちはそのシステムを構築した。デモは見事だった。簡単なケース——明らかにステージIIの乳がんである患者、明らかに「化学療法歴なし」と記す基準——では、本当に優秀だった。ベンダーの資料で目にする数字は、まさにこうしたケースから来ている。Tempusは、2025年初頭にDeep 6 AIを買収し、750を超える医療提供施設へと拡大したのち、同社のPatient Queryエージェントが評価対象のクエリ群において94.39%の精度を達成したと報告している。その数字は本物だ。私はそれを信じる。だが、それが測定しているのは、そもそも問題ではなかったケースなのだ。

あのカテーテルの患者は、私の作ったバージョンのシステムが息絶えた瞬間だった。私はそこに座り、なぜ彼女が取りこぼされたのかを追跡した——バグを予期しながら。バグはなかった。システムは、ベクトル類似度がすることをまさにそのとおりに行っていた——二つの文字列を、それらが意味空間上でどれだけ近くに位置するかでスコアリングしたのだ——そして「カテーテル」という語を共有する二つの処置は、実に近い場所に位置する。一方が「心臓の処置」の下にあり、他方が「静脈のカテーテル法」の下にあることを、どれほどプロンプトエンジニアリングを重ねてもシステムに教えることはできなかった。それは心臓という概念を持っていなかった。持っていたのは、心臓についての言葉だけだった。

なぜ言語モデルは医療用語を混同するのか?

心臓カテーテル検査と中心静脈カテーテル法が二つの別々の枝に配置されていることを示すSNOMED-CTのツリー。

私がこの分野全体をどう捉えるかを組み替えた区別が、ここにある。

臨床医が「中心静脈カテーテル留置」を読むとき、彼らは五つのトークンを処理しているのではない。彼らはある概念を——広大で構造化された医療知識の階層の中の特定のノードを——想起する。それは親と子と兄弟を持ち、これは血管アクセスの処置であって、心臓の処置ではない、と告げる正確な位置を備えている。その階層は実際に、SNOMED-CTと呼ばれる臨床オントロジーとして形式的に存在する。その中で、心臓カテーテル検査はconcept ID 41976001であり、心臓に対する処置の下に分類されている。中心静脈カテーテル法は392230005であり、静脈のカテーテル法の下に分類されている。ツリーの二つの異なる枝だ。ツリーの上で推論するシステムは、それらを混同できない。語の近接性の上で推論するシステムは、それらを絶えず混同する。

これは私が個人的に偶然見つけた奇癖ではない。公表された評価は、AIモデルがまさにこの「心臓カテーテル検査は中心静脈穿刺に等しい」という誤りを犯すことを記録している(Fierce Biotech、2025年)。これは失敗の一つのクラス全体を表している——処置、疾患、あるいは薬剤が語彙を共有しながら医学的には分岐する、あらゆる場所に及ぶ。冠動脈造影と末梢血管造影。両者は「造影」を共有する。一方は心臓の処置であり、他方は血管アクセスだ。言語モデルはそれらをいとこ同士とスコアリングする。オントロジーは、それらが赤の他人であることを知っている。

さて、それを一つのプロトコル分の基準の数だけ掛け合わせ、さらに複数の試験のポートフォリオにわたって考えれば、それはもはやエッジケースではない。それは、業界のあらゆる確率的マッチャーの背後で静かに走り続ける、体系的な適格性の漏れなのだ。

言語モデルは、「カテーテル」が「心臓」の近くに現れることを知っている。だが、一方が心臓の処置であり、他方が点滴ラインであることは、まったく分かっていない。その隔たりこそが、適格な患者が消えてしまう場所だ。

すべてを二度打ち砕いた例外条項

いざ目を凝らし始めると、言葉と概念の隔たりは、最初のひび割れにすぎないことが分かった。

もう一つは、適格性そのものの文法の中に潜んでいる。実際のプロトコルは「高血圧を除外する」とは言わない。こう言うのだ——「高血圧の患者を除外する。ただし、三か月以上にわたり安定した薬物療法で良好にコントロールされている場合を除く」。この文はキーワードではない——内部に時間の枠が埋め込まれた条件文だ。私は、私たちの初期のシステムがこの条項を二通りに——どちらも間違って——処理するのを目の当たりにした。あるときは「高血圧」を見て患者を除外し、実際には適格だった人を失った。あるときは素通りさせ、三か月のチェックを丸ごと飛ばした。コーディネーターが何も考えずに行うこと——例外を保留し、それから期間を検証する——を、確実に行うことは決してなかった。

これは年々重みを増している。プロトコルがますます複雑怪奇になっているからだ。腫瘍学プロトコルにおける適格基準の中央値は、一世代前のおよそ17から、より最近のコホートでは27へと増え、プロトコルあたりの処置の数は2005年以降139%上昇した(IQVIA)。あらゆる「ただし」「除く」「六か月以内」は、語のマッチャーが黙って推測する場所だ。そして修正が届くたびに——いまや平均的な修正の実施には260日かかる(Applied Clinical Trials、2025年)——あらゆる推測をやり直さなければならない。

だが、私を本当に怖がらせた失敗は別のものだった——それは、私がこの仕事を規制当局の前で支持できるのかどうか、その根幹を切り崩すものだった。同じ患者を、周囲の文脈をわずかに変えて言語モデルのマッチャーに二度通せば、二つの異なる答えが返ってくることがある。たいていのソフトウェアなら、多少の非決定性は許容できる。だが臨床試験にとっては、それは失格を意味する。規制当局は、患者が適格であった確率を求めているのではない。彼らが求めているのは、各人がなぜ組み入れられ、あるいは除外されたのかという、正確で再現可能な理由——一行ずつ読める証跡だ。火曜日には違う判断を下すかもしれないシステムは、その証跡を生み出せない。

私が最初から作るべきだったもの

ニューロシンボリックなパイプライン——LLMがメモを読み、概念がSNOMED-CTへとマッピングされ、決定論的なロジックが判断し、監査証跡が出力される。

作り直しは、生易しいものではなかった。私たちは、確率的なシステムを決定論的にふるまわせようとするのをやめ、設計そのものからして決定論的なシステムを構築した。

その背骨となるのがオントロジーだ。私たちは、患者記録の中のあらゆる用語と、適格基準の中のあらゆる用語を、それぞれのSNOMED-CT概念へとマッピングする——つまり、マッチャーが比較しているのは医療階層の中のノードであって、文字列ではない。心臓カテーテル検査と中心静脈カテーテル法は、もはや隣人ではなくなり、本来の姿——別々の枝にいる遠い親戚——になる。あのカテーテルの患者は、これを通せば適格として返ってくる。正しく。毎回。

オントロジーの上に、私たちは言語モデルがしくじる部分——「ただし」「除く」「三か月以内」——のための明示的なロジックを載せた。この種の推論は、実のところ二つの学問分野を縫い合わせたものだ——「ただし」条項の義務と例外の構造をモデル化する義務論理と、「三か月以内」を記録の中の実際の日付に照らして評価する時間区間推論である。どちらもパターンマッチングでは捉えられない。両方とも明示的にモデル化しなければならない。そして、あらゆる判断が名前を持つ概念の上を進む明示的なステップの連鎖であるからこそ、システムは規制当局が求めるまさにその成果物を生み出す——どの概念がどの基準に一致し、なぜ患者がその結果に至ったのかを正確に示す、再現可能な監査証跡だ。

私はあえてニューロシンボリックと言うようにしている——「私たちは言語モデルを捨てた」というのではなく。私たちは捨てていない。言語モデルは、雑然とした最初のステップ——とりとめのない臨床メモを読み、散文の中から構造化された意味を引き出すこと——において卓越している。私たちはそれを言語モデルに任せる。ただ、適格性の判定者にはさせないだけだ。読むことは確率的であり、推論することは決定論的だ。その分業こそが、設計のすべてなのだ。

これは、私たちが現在、製薬スポンサー、CRO、そして大学医療センターのために構築しているシステムであり、私たちの臨床試験の被験者募集AIの取り組みが中心に据えているものだ——確率的なスコアリングをもう一つ増やすのではなく、決定論的なロジックによってSNOMED-CTのオントロジーグラフの上を推論する、カスタムのマッチングである。

なぜ大手プラットフォームはこれを作らなかったのか?

これは、あらゆるスポンサーから受ける質問であり、もっともな問いだ。Tempus、IQVIA、Medidata、ConcertAI、TriNetX——これらは膨大なデータを持つ本格的な企業だ。なぜそのうちの一社が、オントロジーに基づいたバージョンを単純に作らなかったのか?

答えの一部は、彼らが別のもの——それはそれで理にかなったもの——のために最適化しているという点にある。IQVIAは2026年3月、NVIDIAと共同で構築した統合型のエージェント型プラットフォーム「IQVIA.ai」を発表した。これは2億5,000万件を超える患者記録の上に成り立っている。TriNetXは、実行可能性評価とコホート作業のために、同規模の連合型ネットワークを運用している。ConcertAIは2026年2月、エージェント型の「Accelerated Clinical Trials」プラットフォームを立ち上げ、10か月から20か月のスケジュール短縮を謳っている。MedidataのAI Study Buildは、数百件の試験にわたって、マッチングを同社のRave電子データ収集システムに組み込む。これらのどれもが本物であり、それぞれが狙うもの——幅広さ、規模、エンドツーエンドのワークフロー——において優れている。

それらすべての下には、より静かな隔たりも存在する。プラットフォームがうまくマッチングできたときでさえ、その出力はたいてい一つのリストとして落ちてきて、コーディネーターはそれを試験管理の記録システム——Rave、Veeva Vault、Oracle Clinical One——へと打ち直すことになる。マッチングと、試験を実際に動かすシステムとは、本当のところ会話していない。だからこそ、自動化を最も緊密にしたいまさにその場所に、手作業の引き継ぎが残り続けるのだ。

だが、幅広さとオントロジーの深さは、正反対の方向へと引っ張り合う。2億5,000万件規模であらゆる治療領域に対応するプラットフォームは、汎用的に優秀であるように作られており、そしてその汎用的な優秀さこそが、まさにカテーテルの類の誤りが棲む場所なのだ。複雑な腫瘍学、希少疾患、あるいは中枢神経系のプロトコルが必要とする、深く、枝を意識した推論は、構築するのに費用がかかり、維持するのにも費用がかかる——SNOMEDは年に二回更新され、MedDRAの有害事象辞書は四半期ごとに更新され、オントロジーを最新に保つことは一度きりのプロジェクトではなく、恒久的な人員配置である。それは、幅広さへと突き進むプラットフォームが先送りにしがちな、華やかさのない、決して終わらないエンジニアリングなのだ。

プラットフォームが間違っているわけではない。彼らは規模のために解いているのだ。オントロジー的な精度は別の問題であり、そしてそれこそが、あなたの適格な患者が実際に見つけ出されるかどうかを決める問題なのだ。

もう一つの正直な答えは、データの重力だ。これらのプラットフォームのいくつかが最もうまくマッチングできるのは、自社のネットワークの内側でのことだ——彼ら自身のデータ、彼ら自身の施設で。もしあなたの患者が、あなた自身の電子健康記録の中、あなた自身のファイアウォールの内側に存在するなら、それはまったく別の展開になる。そして多くのスポンサーや病院は、きわめてまっとうなHIPAA上の理由から、マッチングのために患者記録を他社のクラウドへ送ろうとはしない。

誰もスライドに載せないコスト

何がかかっているのかを具体的にしておきたい。というのも、この問題の人間的な側面と金銭的な側面は、抽象化されて見えなくなりやすいからだ。

金銭的に言えば——試験における一日の遅延は、失われる処方薬の売上として推定80万ドルの損失をもたらし(Tufts CSDD)、一部の治療領域ではそれをはるかに上回る——心血管系の遅延は一日およそ140万ドルにのぼる。スクリーニング失敗は一件あたり平均約1,200ドルであり、スクリーニング失敗率は適応症によって20%から80%まで幅があり、アルツハイマー病の試験では88%もの高さに達する。あのカテーテルの患者——私たちが取りこぼした適格な一人——は、この計算においては純粋な無駄だ。前に進むべきだったのに進まなかった人であり、しかも誰かが報酬を受け取って、彼女を「不適格」へとスクリーニングしたのだ。

だが、施設スタッフと膝を突き合わせるまで私が理解していなかったコストは、人間に関わるものであり、しかも積み重なっていく。コーディネーターは一度に五つも六つもの試験を同時にこなし、時間の40%から60%を事前スクリーニングに費やしている。マッチングツールがおよそ30%を超える偽陽性を出すようになると、彼らはそれを信頼しなくなり——そしてしばしば三か月以内に、それを見捨てる。私は、作り直しの前に、これが私たちの身に起こるのを目の当たりにした。あるパイロット施設のコーディネーターは、私たちのフラグを開くのを、ただやめてしまっていた。悪意からではない——トリアージからだ。そのツールは、確認することが彼女自身のカルテ確認よりも遅くなるほど、何度も「狼が来た」と叫んでいたのだ。行動を起こさなければならないただ一人の人の信頼を蝕むマッチャーは、生産性のツールではない。それは、彼女が無視することを覚えた、もう一つのブラウザのタブにすぎない。

それこそが、精度が到達範囲に勝る本当の理由だ。偽陰性によって失う適格な患者だけが問題なのではない。あらゆる偽陽性が、この事業全体で最も希少な資源——燃え尽きたコーディネーターの注意——を浪費するのであり、そしてそれがひとたび失われれば、世界最高のデータネットワークをもってしても、見ることをやめてしまったコーディネーターのところで行き止まりになるのだ。

「これこそFHIRやEpicとの統合の役目ではないのか?」

これはよく尋ねられることなので、こうした反論に真正面から向き合っておきたい。

データ標準に関する反論から始めよう——FHIRやEpicがマッチングの問題を解決してくれるのは間違いないのでは? それらが解決するのは配管の問題であり、それは必要ではあっても十分ではない。FHIRやEpicとの統合は、クリーンで構造化されたデータを流れさせてくれる——だが、データを手に入れることは、難しい部分の手前にある部分にすぎない。あなたはなお、データが何を意味するのかについて推論しなければならず、そしてそこにこそ、まさにオントロジーがその仕事を果たす場所がある。そして配管もまた、些細なものではない——EpicのApp Orchard認証は、たった一枚のカルテに触れる前に、六か月から十二か月に及ぶセキュリティ審査を要する。高速で深いEHRマッチングを約束する者は、すでにそのコストを支払ったか、あるいはまだそれを満たしていないかの、どちらかだ。

次に、規制上の懸念がある——決定論的でルールを多用するシステムは、それが伴うあらゆる負担とともに、規制対象の医療機器に該当するのではないか? ここで、最近のガイダンスが実際に助けになる。2026年1月に発行されたFDAの改訂版臨床意思決定支援(CDS)ガイダンスは、どのCDS機能がデバイスの定義の外側に該当するかを明確にした——そして、患者記録を試験の適格基準に照らしてマッチングすることは、非デバイスのCDSに該当しうる。同じ機関による2025年1月のフレームワークは、創薬におけるAIのための七段階の信頼性評価を打ち出した。推論が透明で再現可能なシステムは、ロジックが確率分布であるシステムよりも、はるかにそのフレームワークを通り抜けやすい。

そして、最も身も蓋もない問い方——そもそもこのどれもが、単に人を増やして雇うより速いのか? 性能データは断固としてイエスと答える——マッチングが信頼に足るならば、だ。報告されているAIスクリーニングは、ある導入事例でスクリーニング失敗率を73%削減し、54%から14%へと引き下げ(Trially)、手作業でのカルテ確認の時間をおよそ90%削減した。ただし落とし穴は、そうした利得が実現するのは、コーディネーターがその出力を、行動に移すほど信じている場合に限られるという点だ。偽陽性の上に築かれた速さは、速さではない。それは、その場をより速く失う方法だ。

取りこぼした患者が私に本当に教えてくれたこと

私は何度も彼女のことを思い返す——アルゴリズムが心臓の処置と取り違えた、点滴ラインの女性を。彼女はその間ずっと適格だった。試験は彼女を必要としていた。彼女はまさにそこ、データの中に座っていた。そして私たちが彼女を失ったのは、技術が弱かったからではなく、それが間違った問題に向けられていたからだ——本来の仕事がその下にある医療について推論することであったのに、言語の表面を読んでいたのだ。

この分野全体は、五年をかけてキーワード検索を言語モデルに置き換え、マッチングの問題は片づいたと宣言した。片づいてなどいなかった。位置がずらされただけだ。私たちは、粗雑な語のマッチングを、洗練された語のマッチングと交換したにすぎない。そして、試験が予定どおりに登録を完了できるかどうかを決めるケース——例外条項、語彙を共有する処置、規制当局がなぜかを読めることを必要とする基準——は、そもそもまったく言葉の問題ではなかったのだ。

もしあなたが試験を運営していて、被験者募集AIを評価しているなら、私がベンダーに投げかける問いは、彼らの目玉となる精度の数字ではない。なぜなら、その数字は、そもそも見逃されるはずのなかったケースで測定されているからだ。心臓カテーテル検査と中心静脈ラインを、彼らのマッチャーに通してみて、なぜ一方が除外され、もう一方が除外されないのかを、概念に基づいて示してほしいと頼んでみるといい。そのたった一つの問いへの答えが、あなたが買ったのが読むだけのシステムなのか、それとも実際に理解するシステムなのかを教えてくれる。私たちは二つ目の種類を作ることを選んだ。すなわち、臨床試験の被験者募集AI——オントロジーの上を推論するもの——である。なぜなら、一つ目の種類はすでに、私たちが失うわけにはいかない患者を私たちから奪っていたからだ。

関連リサーチ

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。