臨床医のモニター画面:洗練されたAI作成の患者向けメッセージと、その隣にフラグの付いていないクレアチニン上昇のグラフ
Artificial IntelligenceHealthcarePatient Safety

医師の90%が臨床AIを信頼している。だが危険なエラーは3分の1しか捕まえられない。

Ashutosh SinghalAshutosh Singhal2026年6月2日13 min

私たちの臨床AI安全性ツールの最初のバージョンは、見事に機能した。それこそが問題だった。

私たちはそれを、当たり前のことをするために作った——幻覚を捕まえることだ。アンビエント・スクライブや患者ポータルの下書き作成ツールに向けて、AIの出力を読み込ませ、事実として誤った記述にフラグを立てさせる。誤った薬剤名を捕まえた。ありえない検査値を捕まえた。桁が一つ違う投与量を捕まえた。それについて心から良い気分だったのを覚えている——私たちはエラーを見つけ、デモは成功し、数字はきれいに見えた。

そんなとき、プロジェクトの臨床アドバイザーである、病棟で20年を過ごしてきた病院総合診療医が、私が今でも考え続けている一つの例を説明してくれた。あるAIが、服薬について尋ねてきた患者への MyChart の返信を作成していた。その下書きには、メトホルミンを継続するようにと書かれ、直近のHbA1cが6.8%だったことが快活に添えられていた。そこに書かれた事実はすべて正しかった。そのメモは共感的で、よく構成されていて、まさに優れた医師が書くような内容だった。私たちのツールは、それをフラグなしで通過させた。

その患者のクレアチニンは、3回の受診にわたって上昇し続けていた。クレアチニンの上昇は腎機能の低下を意味し、腎機能の低下はメトホルミンを危険なものにする。AIは、そこを見るべきだとは知らなかった。そして——これは、私が臨床AI安全性について考える見方を作り変えた部分なのだが——レビューを担当する医師もまた、見抜けはしなかっただろう。多忙な臨床医が送信ボタンを押す前に費やす十秒か十五秒の間に、流暢で、親しみやすく、事実として一貫した下書きに、ざっと目を通すだけなのだから。

私たちの幻覚検出器は、間違った問題を解こうとしていた。患者を傷つけるエラーは、たいていの場合、明らかに誤っているものではない。局所的には正しく、文脈の中では致命的なものなのだ。事実確認を積み重ねても安全にはたどり着けない。なぜなら、危険はAIが「言わなかったこと」の中に宿っているからだ。

その失敗があったからこそ、Veriprajnaは幻覚検出器を作るのをやめ、医療システムが実際に運用しているAIスタック全体に対する、独立した安全インフラを構築し始めた。本稿は、そのスタックを正直に見つめたときに私たちが見出したものについての話だ。

すべてのCMIOを夜も眠れなくさせるべき数字

自動化バイアスのギャップ:医師の90%がAIを信頼していたにもかかわらず、有害なエラーの66.6%を見逃した

2024年4月、The Lancet Digital Health誌は、ヘルスケアAIにおいて最も重要でありながら最も理解が浸透していない発見だと私が考える研究を発表した。研究者たちは、患者からのメッセージに対してAIが作成した返信を、医師たちにレビューさせた。それらの下書きの7.1%が、患者に重大な危害をもたらすリスクを含んでいた。0.6%は、死亡のリスクを含んでいた。

エラー率よりも重要なのは、ここからだ。医師たちは、まさに私たちが求めていること——AIの成果物をレビューすること——をしていながら、有害な下書きのうち66.6%を見逃した。誤りを含むもののうち、3分の1から半数近くが、まったく編集されないまま送信された。そして調査したところ、その同じ医師たちの90%が、そのツールの性能を信頼していると答えた。

90%の信頼、そして危険なエラーの3分の1しか捕捉できていない。そのギャップは、トレーニングの問題ではない。それは、自分よりも流暢に文章を書く機械を監査するよう人間に求めたときの、予測可能な結果なのだ。

これは自動化バイアスであり、医師の性格上の欠陥ではない。それは、その相互作用が持つ性質なのだ。下書きがうまく書かれていて共感的であるとき、その文章の質が、読み手の頭の中で独立した検証の代わりになってしまう。AIの書きぶりが上手であればあるほど、人間の確認は少なくなる。私たちは、その最大の強み——流暢で自信に満ちた言語——が、まさに私たちがそのツールの周りに築いた安全網を無力化する仕組みそのものであるような、そんなツールを導入しているのだ。

医療技術における最大の危険を毎年リスト化して公表している患者安全NPOのECRIは、AIによる診断リスクを、2025年と2026年の両年で第一位の危険に位置づけた。トップ10の中の一つ、ではない。第一位だ、二年連続で。

「読んでレビューした」は法的な擬制にすぎない

2025年1月に発効したカリフォルニア州のAB 3030は、患者との臨床的なコミュニケーションにAIが使われる場合、医療システムにその開示を義務づけている。この法律には、一見もっともらしく聞こえる免除規定がある——資格を持つ医療提供者がAIの出力を読んでレビューすれば、開示は不要だ、というものだ。その論理は、人間がループの中にいることで、AIの関与が見えなくなり、かつ安全になる、というものである。

The Lancet のデータは、その論理を打ち砕く。もし医師が有害なエラーの3分の2を見逃すのなら、「読んでレビューした」は、多くのケースにおいて形式的な追認印にすぎない。この免除規定は、自動化バイアスによって大規模には不可能となるようなレビューの質を前提としている。違反は、施設に対して1件あたり最大25,000ドルにのぼり、加えて、そのメモに名前が記されている医師には懲戒処分のリスクが及ぶ。

私は最高医療情報責任者(CMIO)たちと多くの時間を過ごすが、会話がたいてい気まずくなるのは、まさにこの点だ。法的な枠組みは、人間によるレビューが意味のあるものだと前提している。しかし臨床の現実は、意味のあるレビューには、AIベンダーの多くがまだ構築してこなかった技術的な足場——不確実性のハイライト表示、出典まで遡る引用リンク、そして医師を立ち止まらせるような、本当に重要な主張についての能動的な確認ワークフロー——を必要とする、ということだ。ごく一部のベンダーはそれを構築し始めている——Abridgeの「Linked Evidence」は、生成されたノートの各行を、それを生み出した正確な音声セグメントまで遡って辿る——これは、その能力が存在すること、そしてほとんどのツールがいまだにそれを優先していないことを、証明しているにすぎない。その足場がなければ、「人間がレビューした」は、コンプライアンス上のチェックボックスであって、安全管理策ではない。

ベンダーは0.001%だと言った。テキサス州司法長官は、それを証明しろと言った。

主張値と実測値:ベンダーの精度の主張と、現場で見つかった0.98%という発生率——12倍も高い

臨床AIのベンダーはどこも、精度の数字を前面に押し出す。これらのツールを監査して私が最初に学んだのは、その数字が、どう算出されたかを知るまでは、マーケティング上の作り物にすぎない、ということだ。

2024年9月、テキサス州司法長官は、「重大な幻覚率」が0.001%を下回るというPieces Technologiesの宣伝上の主張をめぐって、同社と和解した。Piecesのソフトウェアは、テキサス州の主要な4つの病院——ヒューストン・メソジスト、チルドレンズ・ヘルス、テキサス・ヘルス・リソーシズ、そしてパークランド——に導入されていた。この件で際立っているのは、司法長官がAI特有の法律をまったく必要としなかったことだ。既存の消費者保護法だけで、同社が実証できない精度の主張に異議を申し立てるには十分だった。

この和解——5年間にわたる自主的コンプライアンス保証(Assurance of Voluntary Compliance)——により、Piecesは現在、すべての顧客に対して、自社の指標がどのように定義・算出されているか、モデルがどのようなデータで訓練されたか、そして自社が把握している有害な用途は何かを、開示することを義務づけられている。これは、業界全体にとっての一つの雛形だ。

分母のない幻覚率は、測定ではない。それは広告だ。

この0.001%を、私たちや他の人々が現場で実際に見出しているものと比べてみてほしい。2025年第1四半期のあるパイロット運用では、AI退院支援アシスタントが、その薬剤クラスにアレルギーがあると明示的に記載された患者に対して、ある薬を推奨した。臨床的に対応を要する誤記述の実際の発生率は、0.98%——ベンダーが主張していた0.08%の12倍だった。 同じカテゴリーの製品でありながら、スライドと患者との間には桁違いのギャップがある。MITメディアラボは、緩和策がなければ、モデルは臨床症例において60%を超える幻覚率に達することを発見した。正直な答えはこうだ——どんな見出しの数字も、次のことを問うまでは何の意味も持たない。どのデータセットで算出されたのか、誰が検証したのか、どの期間にわたってか、そして——ほとんど誰も問わない質問だが——どの患者層にわたってか?

その最後の質問こそが、背後に人命の犠牲を抱えた質問であることが判明した。

デバイスがそれを隠すために、あなたには見えないバイアス

パルスオキシメトリー、Epicの敗血症モデル、そして妊産婦死亡にまたがる、臨床AIの人口統計上の失敗

集中治療の外ではもっと知られていてほしいと思う事実がある。パルスオキシメーター——患者の指に付ける小さなクリップで、血中酸素飽和度を測定する、医療の中でも最も信頼されている数値の一つ——は、肌の色が濃い人に対しては、体系的に精度が低いのだ。

黒人患者が、およそ3倍の確率で起こりやすいのが、潜在性低酸素血症だ——デバイスが正常と読み取ってしまう、危険なほど低い血中酸素のことである。過大評価は0.6〜1.5パーセントポイントに及び、些細に聞こえるが、それが「ICUに入院させる」か「帰宅させる」かの分かれ目になると、話は別だ。小児のデータでは、最も肌の色が濃い子どもたちの7%で低酸素を見逃した一方、最も薄い子どもたちでは0%だった。FDAは2025年1月にドラフトガイダンスを発行し、メーカーに対して、Monk Skin Tone(モンク・スキン・トーン)スケールを用いて少なくとも150人の多様な参加者でテストすることを推奨した——それ以前の、わずか10人ほどという慣行からの引き上げである。

今度は、センサーの段階ですでにバイアスのかかった測定値の上に、AIを重ねてみよう。モデルはそのバイアスを受け継ぎ、自信に満ちた出力を通してそれを洗浄してしまう。これは、臨床AI安全性の中でも、ベンダーが自分自身の中に最も見つけられずにいる部分だ。なぜなら、それを見つけるには、人種、性別、年齢ごとにパフォーマンスを意図的に層別化し——そのうえで、そのギャップを公表する必要があるからだ。

Epicの敗血症モデルは、私がすべてのガバナンス議論に持ち込む戒めの物語だ。開発元は、AUC——1.0が完璧、0.5がコイン投げに等しい、予測精度の標準的な尺度——を0.76から0.83と報告した。ミシガン大学が自院の患者を用いて外部から検証したところ、得られた値は、0.63だった。感度は33%で、これは敗血症症例の3分の2を見逃したことを意味する。陽性的中率は12%で、つまり、そのアラートの88%が誤報だった、ということだ。 そして、敗血症の発症率がほぼ2倍高い黒人およびヒスパニック系の患者に対しては、較正が不十分だった。過去の臨床判断で訓練されたモデルは、過去の臨床上の盲点を学習し、それをアルゴリズムという権威をまとって臨床医たちに向けて撃ち返す。Epicは2022年にこのモデルを全面的に見直し、その第2版に対する多施設共同の前向き検証が2026年2月に JAMA Network Open に掲載された——そして、まさにそこが要点なのだ。当初のAUCの主張が隠すギャップを捉えるのは、外部からの、導入後の検証であり、この件では、それを実現させるのに何年もの歳月と外部の研究者たちを要した。

これの最も極端な形は、妊産婦ケアに現れる。黒人女性は、出生10万件あたり42.8〜50.3の割合で出産時に死亡しており、これは白人女性の13〜14.5に対する数字だ。カリフォルニアのあるレビューでは、AI早期警告システムが、黒人患者における重症合併症例の40%を見逃していた、ということが判明した。 警告システムが、最もリスクの高い集団に対して盲目であるとき、それは単に中立的に失敗するのではない——それは、埋めるために売り込まれたはずのギャップを、かえって広げてしまうのだ。

なぜ、モデルのバイアスをただ検査して、それで終わりにできないのか?

なぜ医療システムは、単に公平性チェックを実施してモデルを認証しないのか、と人々は私に尋ねる。以前の私は、それはリソースの問題だと思っていた。だが、それはもっと根深く、そして数学的な問題なのだ。

チャルデチョバの不可能性定理と呼ばれる結果がある。簡単に言えば——公平性についての二つの妥当な定義、すなわち人口統計的パリティ(モデルが各グループを同じ率でフラグする)と、均等化オッズ(モデルが各グループの内部で等しく正確である)——この二つは、自明なケースを除いて、同時に満たすことはできない、というものだ。自分がどの種類の公平性を最適化しているのかを選ばなければならず、そしてその選択には、臨床上の帰結が伴う。

「バイアスを検査した」は、その基準を明示しなければ無意味だ。どの公平性の定義を選んだのかをあなたに答えられないベンダーは、実際には一つを選んでいて、それをあなたに伝えていないだけなのだ。

だからこそ、本物のバイアス監査は、一度きりの証明書ではないのだ。それは、層別化されたサブグループごとの性能表、人口統計ごとの較正曲線、そして導入拠点ごとに追跡される人口安定性指数(Population Stability Index)——ドリフトを測る指標——である。なぜなら、ボストンで公平だったモデルが、患者構成の変化に伴って、ヒューストンでは較正から外れてドリフトしうるからだ。この作業のための、専門家が判定した真の正解ラベルは、1件あたり50〜200ドルかかる。それは、高価で、専門的で、継続的なインフラだ。そしてそれは同時に、調達の意思決定と検死報告書との間に立ちはだかる、唯一のものでもある。

スタック全体を所有している者は、誰もいない

私が繰り返し直面してきた構造的な問題は、こうだ——中規模から大規模の医療システムは、5個から15個ほどのAIツールを同時に運用している。アンビエント・スクライブ(UPMCの40を超える病院にまたがるAbridgeや、EHRに組み込まれたNuanceのDAX Copilot)、Epicの敗血症モデル、患者ポータルの下書き作成ツール、トリアージのアルゴリズム、コーディング支援ツール。それぞれに、独自の精度の主張、独自の安全性プロファイル、独自の盲点、そして独自のダッシュボードがある。どのベンダーも、それらのツールを横断するガバナンスは提供しない。なぜなら、そのすべてを売っているベンダーは、一つも存在しないからだ。

そして、実際に存在するガバナンスも、組織図が示唆するよりも薄い。Censinetの2026年のデータによれば、医療システムの84%がAIガバナンス委員会を持っている——だが、AIツールが稼働する前に正式かつ文書化された承認プロセスを備えているのは、わずか59%にすぎない。CIOはそうした委員会の63%に参加している。一方、ツールが誤ったときに臨床的な責任を負う人物であるCMIOが参加しているのは、わずか45%だ。 その一方で、臨床医たちは自らの判断でツールを導入している——シャドーAI——どんな委員会がレビューできるよりも速いペースで。

これこそが、Veriprajnaが埋めるために作られたギャップであり、私が自分たちの仕事を「幻覚検出」と表現するのをやめた理由だ。私たちが行うのは、医療システムが実際に導入したAIに対する、独立した、ベンダー中立の評価だ——敵対者や不運な一日がするようなやり方でツールをレッドチーミングし、ベンダーの精度の主張を本当の分母と照らし合わせて検証し、ほとんどのITチームには実施する能力がないバイアス監査を実行し、そしてAB 3030、コロラド州のAI法、そしてEUのAI法における高リスク規制を、法的な不安ではなく、運用上の管理策へと変えていく。あらゆるツールを横断して存在する、一つの安全レイヤーだ。

「これは、ただイノベーションを遅らせているだけではないのか?」

これは、私が最もよく耳にする反論であり、たいていは、アンビエント文書化がわずか1年で6億ドル規模のカテゴリーに成長するのを目の当たりにし、そして「ノー」と言った経営幹部にはなりたくない、という人からのものだ。

私は、その逆だと主張したい。独立した安全性こそが、素早い導入を生き延びられるものにするのだ。痛い目を見る医療システムは、慎重なところではない——ベンダーのスライド資料をもとに導入し、患者が傷ついた後になって、0.08%と0.98%の間のギャップに気づいたところなのだ。ヘルスケアAIへの投資は、平均して1ドルにつき約3.20ドルを、14か月以内に回収するという形で生み出す。だがそのROIは、未検証のツールが医療過誤の請求を生み出した最初の瞬間に、蒸発してしまう——そしてAI関連の請求は、2022年以降すでに14%増加しており、放射線科、循環器科、腫瘍科に集中している。検証は、イノベーションへの課税ではない。それは、最初の何かがうまくいかなくなった後も、イノベーションを続けていけるようにする保険なのだ。

二つ目の反論——それは、私たち自身のインフォマティクス・チームで対応できないのか、というものだ。時には、部分的には、できる。だが、独立した評価の価値とは、まさにそれが独立している、という点にある——企業に自社の財務を監査させたりはしないのと、同じ理由だ。ベンダーは、自らをレッドチーミングして、より見栄えの悪い数字を出したりはしない。そして、ある購入を推進した内部チームは、それが成功することに、密かな利害を抱えている。その取引に何の立場も持たない者こそが、他の誰もが問わない理由を持っている問いを、投げかけるのだ。

今、私がCMIOに伝えたいこと

以前、私が重要だと思っていた問いは、このAIは機能するのか?というものだった。私は間違っていた。どのベンダーも、それが機能することは見せてくれる。本当に重要な問いは、規制当局、原告側の弁護士、あるいはジャーナリストがあなたに求めてきたその日に、それがすべての患者層にわたって機能することを、あなたは証明できるか?というものだ。

今この瞬間、ほとんどの医療システムには、それができない。彼らが持っているのは、再現できない精度の数字、臨床のリーダーが加わっていないガバナンス委員会、そして、どの独立した第三者も一度もまとめてテストしたことのないツール群だ。流暢な下書きは、これからもクリックされて通過し続ける。敗血症のアラートは、これからも88%の割合で狼少年のように鳴り続ける。パルスオキシメーターは、正常ではない患者を、これからも正常だと読み取り続ける。

私がVeriprajnaのヘルスケアAI安全性プラクティスを築いたのは、あのメトホルミンの例が、私の頭から片時も離れなかったからだ。あのメモは完璧だった。そこに書かれていたことは、すべて真実だった。それでも、それは人を死なせていたかもしれない——AIが愚かだったからではなく、それが説得力を持っていて、そして、それが「言わなかったこと」を確認できる備えのある者が、誰もいなかったからだ。臨床AIにおける安全とは、明らかな間違いを捕まえることではない。それは、見えない間違いを——患者がそれに気づく前に——捕まえるためのインフラを築くことなのだ。

関連リサーチ

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。