無害に見えるAIモデルのファイルが開かれ、外部ホストへ接続しようとする実行中のコードが姿を現す様子。
Artificial IntelligenceCybersecurityMachine Learning

AIモデルは実行可能コードだ ― 多くの企業はそれをスプレッドシートのように扱っている

Ashutosh SinghalAshutosh Singhal2026年6月17日14 min

問題を本当に理解した最初の瞬間、私は隔離されたコンテナの中を流れていくシステムコールのトレースを見つめながら、それが何もしないのを待っていた。

私たちは公開レジストリからあるモデルを取得していた。データサイエンティストが四半期に百回も、深く考えずにダウンロードするような類のものだ。モデルカードは正常に見えた。基本的なスキャンも通過していた。私がそれをサンドボックスに読み込んだのは、その特定のファイルを疑っていたからではなく、あらゆるものをサンドボックスで読み込むようになっていたからだ。そしてデシリアライズが実行されると、トレースにはそのプロセスが、開くはずのないネットワーク接続を開こうとする様子が映し出された。

それこそがAIサプライチェーンセキュリティという主題の全体を、一瞬に凝縮したものだ。あなたのモデルはデータファイルではない。読み込んだ瞬間に実行される実行可能コードなのだ。ほとんどの組織はそれをスプレッドシートのように扱っている。ダウンロードして開く、動きのないものとして。そして、モデルが実際に何であるかと、それがどう扱われているかの間のこの隔たりこそが、まさに侵害が起こる場所なのだ。

モデルは開く文書ではない。実行した人物の権限で動くプログラムなのだ。

リバースシェルの話は、業界に伝わる仮想的な逸話ですらない。Hugging Face上の「baller423」という名のモデルが、外部ホストへのリバースシェルを確立しているのが見つかった。それは正常に見えた。基本的なスキャンも通過した。誰かが読み込んだ瞬間に任意のコードを実行した。この話をセキュリティ責任者の集まりで語ると、彼らを不安にさせるのは、そんなことが可能であるという事実ではない。自分のチームが同じソースから、同じやり方で、二年間モデルを読み込み続けてきたと気づくことなのだ。

誰も聞きたがらないpickleの問題

静的なブラックリストスキャンは新種の攻撃をすり抜けさせるが、挙動サンドボックスはリバースシェルの接続試行を捕捉する。

ここが、経験豊富なエンジニアを顔をしかめさせる部分だ。なぜなら、それは誰もパッチを当てられるバグではないからだ。

PyTorchモデルに対してtorch.load()を呼び出すと、デシリアライズ中に任意のPythonを実行しうる。それは通常の意味での脆弱性ではない。それはPythonのpickleシリアライズ形式の設計された挙動なのだ。pickleはコードを実行してオブジェクトを再構築することが許されており、モデルファイルとは単にpickle化されたオブジェクトにすぎない。世に出回る機械学習モデルの80%以上がこの形式を使っている。つまり、この分野全体がモデルを出荷するデフォルトの方法そのものが、誰かが中身を埋めるのを待つリモートコード実行のプリミティブでもあるのだ。

それをスキャンしようとするのは、もっともな本能だ。最も広く導入されている防御策はPickleScanというツールで、これはモデルファイル内の既知の不正パターンを探す。そしてPickleScanには少なくとも三つの既知のゼロデイ回避手法があり、CVE-2025-10155もその一つだ。さらにSonatypeの研究者らは後に、このスキャナ自体にさらに四つの脆弱性を発見した。

私がこう言うのは、実際に良い仕事をしているオープンソースプロジェクトをこき下ろすためではない。私が今すべてを組み立てる際の拠りどころとしている一つの原則を、それが教えてくれたから言うのだ。すなわち、攻撃者がファイル形式を支配しているとき、ブラックリストスキャンは構造的に負ける運命にある。静的スキャンは「このファイルには、私がすでに不正だと知っているパターンが含まれているか」と問う。あなたと同じブラックリストを見られる攻撃者は、あなたがまだ知らないパターンを単に使うだけだ。

だから私たちはその問いを立てるのをやめた。私のチームが構築する検証パイプラインは、「このファイルにはどんな既知の不正な文字列があるか」から始めない。それらは挙動サンドボックスから始める。モデルを隔離されたコンテナで読み込み、それが実際に何をするかを観察する。システムコール、ネットワーク接続、ファイル書き込みを見て、署名ではなく挙動を判断するのだ。問いは「これはリストに載っているか」から「このコードは実行されると何をするか」へと移る。その二番目の問いこそが、まだ誰も名付けていない攻撃を捕捉できる唯一のものだ。

静的スキャンは昨日の攻撃を捕捉する。挙動サンドボックスは、攻撃者が今まさに書いている攻撃を捕捉する。

それは無料ではないし、棚から買える製品でもない。Protect AIは、2025年7月に成立したおよそ5億〜7億ドルの買収を経て今やパロアルトネットワークスの一部となったが、447万のモデルバージョンをスキャンし、5万1700を超えるモデルにわたって35万2000件の危険または疑わしい問題を発見した。それが干し草の山の規模だ。ツールは明白なものにフラグを立てられる。だが、公開レジストリと社内モデルストアの間に置かれるゲートを設計し、しかも誰もそれを迂回しないほど高速にすること、それこそ箱に入っては来ない部分なのだ。

私が構築し、誰もが無視したゲート

私が失敗したバージョンについて話したい。なぜなら、その失敗は成功よりも多くを私に教えてくれたからだ。

初期の頃、私はあるクライアントのためにモデル検証ゲートを構築した。それは技術的には見事なものだった。公開ソースから入ってくるすべてのモデルはサンドボックスに引き込まれ、複数の形式にわたって深く分析され、挙動をプロファイルされ、そのうえで初めて署名され社内レジストリに受け入れられた。セキュリティレビューでは素晴らしいスコアを取っただろう。私はそれを誇りに思っていた。

だが一週間ほどで、データサイエンスチームは静かにそれを使うのをやめていた。

悪意からではない。彼らには締め切りがあった。そのゲートはワークフローに実際に数分を追加した。一方の代替手段、Hugging Faceから直接モデルを引っ張ってくる方法は、三十秒で済んだ。だから実験がモデルを今すぐ必要としたとき、彼らは個人のクラウドアカウントに生のまま引っ張り込んで、作業を進め続けた。私の美しいゲートは、実際のトラフィックが建物の脇を回り込んで歩いていく間、空っぽの戸口を守っていたのだ。

その一週間が、問題全体を私にとらえ直させた。AIサプライチェーンセキュリティにおける最も難しい統制は技術的なものではない。それは、安全でない経路よりも遅いセキュリティゲートは、毎回必ず負けるということだ。データサイエンティストが三十秒でモデルをダウンロードできるとき、三十分かかるプロセスはすべて迂回される。悪意ある者によってではなく、プレッシャーにさらされた優秀なエンジニアたちによってだ。統制は、遵守が回避よりも簡単であるほど高速でなければならない。そうでなければ、あなたが持っているのはセキュリティプログラムではない。素晴らしいレビューが付いていて観客が誰もいない、セキュリティ劇場だ。

だからその後、シャドーAIに関する数字が私を驚かせることは決してなかった。組織の98%に、認可されていないAIツールを使う従業員がいる。セキュリティ実務者の62%が、自分たちの環境で大規模言語モデルがそもそもどこで動いているのかを確実に把握する手段がないと言う。機能するAIガバナンス体制を持つ企業はわずか約9%だ。経営幹部の三分の一は包括的な追跡ができていると言うにもかかわらず、である。そしてそのコストは抽象的なものではない。IBMの2025年『データ侵害のコスト』報告書は、シャドーAI関連の侵害の平均コストを463万ドルとしている。標準的なインシデントよりおよそ67万ドル高い。

見えないものは守れない。そして今、ほとんどの組織は自分たちのAIのほとんどを見ることができていない。

なぜファインチューニングは、あなたの最も安全なモデルをひそかに武装解除するのか?

モデルのプロンプトインジェクション耐性は、ファインチューニングを一巡しただけで0.95から0.15へと崩壊する。

これは、私が技術チームに持ち込むと最も強い反応が返ってくるものだ。なぜなら、誰もが前提としていることに反するからだ。

その前提はこうだ。私はこのモデルを安全性について評価した、それは合格した、だから安全だ、と。だが現実は、安全性のアラインメントは、評価のタイムラインが完全に見落とすほど脆いのだ。ある研究では、Llama 3.1 8Bのプロンプトインジェクションへの耐性が、たった一巡のファインチューニングの後に0.95というスコアから0.15へと低下した。しかも敵対的なファインチューニングではない。通常の、良性の、ドメイン特化の訓練だ。それは安全性という特性のおよそ84%の崩壊であり、企業がモデルに対して行う最もありふれたことによって引き起こされたのだ。

私はまさにこの議論を、あるクライアントのMLチームと交わした。彼らは自分たちの安全性評価を実行し、モデルは合格し、それを自分たちのデータでファインチューニングし、そして出荷する準備が整っていた。私は、評価をいつ再実行する予定かと尋ねた。部屋は少し静まり返った。なぜなら正直な答えは「再実行するつもりはなかった」だったからだ。モデルは、それを壊すものの前にゲートを通過する。そしてガードレールが事実上剥ぎ取られた状態で本番へ送られ、書類はすべて安全だと記している。

モデルは、安全性を破壊するステップの前に安全性チェックを通過する。その後にもう一度チェックする者はほとんどいない。

だから私たちは安全性評価を、ファインチューニングの後に移し、それを受け入れゲートではなくリリースゲートとし、いかなるファインチューニングも、それ以前の安全性証明を無効にする事象として扱った。口に出して言ってしまえば、あまりに当たり前に聞こえる。それが標準的な慣行になっていない理由は、誰も使わなかったあのゲートと同じだ。すなわち、評価をするのに都合のよい瞬間は受け入れ時であり、ファインチューニングのたびに再評価するのは摩擦だからだ。摩擦は敵だが、この場合それこそが、合格報告書と無防備なモデルの間に立ちはだかる唯一のものなのだ。

ポイズニングは、同じ論点を別の方向から示す。研究によれば、わずか250件の汚染された文書で、130億パラメータのモデルにバックドアを埋め込めることが示されている。訓練コーパスのおよそ0.00016%だ。データを大規模に侵害する必要はない。必要なのは、まるめ誤差ほどの量だけだ。マイクロソフトは2026年2月、これに対する本当に心強い対抗策を発表した。トリガーとなるフレーズを知らなくても、特徴的なアテンションパターンを見つけ出すことで汚染されたモデルを識別できる「スリーパーエージェント」検出手法だ。それは、以前はほとんど検出不可能だった攻撃に対して私が見た初の本物の防御策だ。だがそれもまた、まさに研究論文の中には存在するが、誰かがそれを組み込むエンジニアリングを行うまではあなたのCI/CDパイプラインには存在しない、という類の能力なのだ。

エージェントはプロンプトインジェクションをキルチェーンに変えた

何年もの間、操作されたモデルやプロンプトインジェクションによる最悪のケースは、不正な出力だった。モデルが間違ったことを言う、言うべきでないことを漏らす、あなたに恥をかかせる。限定的だ。うっとうしい。だが乗り越えられる。

エージェントAIはその限界を取り払った。

AIエージェントは、チャットモデルにはないツールアクセス、認証情報、実行権限を持っている。だからエージェントが読むものに悪意ある指示を注入すると、あなたはもはや回答を汚しているのではない。行動できるシステムに命令を発しているのだ。GitHub Copilotにはリモートコード実行の脆弱性CVE-2025-53773があり、CVSS 7.8と評価され2025年8月にパッチが当てられた。それは、リポジトリのドキュメントに仕込まれたプロンプトインジェクションが、エージェントを自律的な「YOLOモード」に陥らせ、システム全体の侵害へとエスカレートさせうるというものだった。エージェントは悪意あるコメントを読み、それをコードとして実行し、そしてマシンは乗っ取られた。

それから2025年7月にはAmazon Qのサプライチェーンインシデントがあった。悪意あるcleaner.mdというプロンプトテンプレートが、設定を誤ったGitHubトークンを通じて注入され、リリースされたバージョンが破壊的なコマンドを非常に大規模なインストールベースへと出荷してしまった。そして2026年には、OpenClawエージェントエコシステムがその年最初の大規模なAIエージェントセキュリティ危機となった。63日間で138件のCVE、13万5000を超える露出したインスタンス、そしてそのマーケットプレイスのスキルの12%が悪意あるものと判明した。HiddenLayerの2026年脅威報告は今や、AI侵害のおよそ8件に1件をエージェントシステムに結びつけている。

これらすべてに共通する筋道は同じだ。エージェントは、たった一つの操作された入力を、統率された複数ツールにまたがるキルチェーンへと変える。かつては一つの間違った文だったものが、本物の認証情報を伴う一連の本物の行動になる。それが今、私が最も懸念しているフロンティアだ。なぜなら、それはどんな製品カテゴリも追いつけないほど速く拡大しており、しかもそれを守るための確立されたプレイブックがまだ存在しないからだ。

では、実際に何をすればいいのか?

人々はいつも私に、こんな類のことを尋ねる。「これに対して、ただツールを買うだけではだめなのか?」と。そして正直な答えは、あなたは部品を買うことができる、そしてその部品は急速に良くなりつつある、というものだ。

ベンダーの状況は、本物のエコシステムへと成熟してきた。スキャンとクラウド・プラットフォームスイート内でのAI部品表生成にはパロアルトのProtect AIとWiz、モデルレジストリとアーティファクトパイプラインの保護にはJFrog、ランタイムの検出と対応にはHiddenLayer、アプリケーション層のLLM統制にはNVIDIAのオープンソースのガードレール、モデル配布への機密コンピューティングの導入にはFortanix、といった具合だ。その最後の例は、ツールだけでは隔たりを埋められない理由を示す好例だ。モデルが実行中でさえ暗号化されたまま保つ機密GPU(NVIDIAのHopper世代とBlackwell世代)は確かに実在するが、それら信頼された実行環境を稼働中の推論パイプラインに配線することは、ほとんどのチームが在籍要員として持ち合わせていない専門的なエンジニアリングだ。各ベンダーは自らの担当領域では本当に優れている。だがそのどれもが、あなたのエンドツーエンドのパイプラインを設計することも、それをあなたの義務に対応づけることも、あなたの組織が実際にどう振る舞うかを変えることもしない。

そして市場のもう半分、大手戦略ファームは、あなたに逆の問題を売りつけるだろう。200ページのAIガバナンスフレームワーク、取締役会用のスライド、監査対応の文書、そして戦略で約50万ドルから始まり実装では数百万ドルへとスケールする契約だ。彼らが通常やらないのは、モデル署名パイプラインの構築、あなたのCI/CD内でのML-BOM生成の設定、あるいはネットワーク層でのシャドーAI検出の立ち上げだ。あなたの手元には、バインダーだけが残り、構築物は残らない。

その隔たり、スキャンするツールと助言するスライドの間の隔たりこそが、VeriprajnaがAIサプライチェーンセキュリティを、報告書としてではなくエンジニアリングとして行っている理由のすべてだ。私たちが構築するものは具体的だ。入ってくるすべてのモデルを挙動的にサンドボックス化し、問題のないものをあなたのエンタープライズPKIで署名する自動化されたモデル検証パイプライン。ML-BOM、すなわち機械学習部品表、あらゆる構成要素とその出所を追跡するAI版の原材料表示ラベルを、CycloneDX標準を用いてパイプライン内で生成し固定すること。出現しつつあるCoSAI証明作業の上に築かれた出所証明と署名。ファインチューニング後の安全性ゲート。そして、あなたのセキュリティツールが現在見ることのできないモデルを浮かび上がらせるシャドーAI検出だ。

このほとんどを行うための標準は、すでに存在している。CycloneDX ML-BOM、CoSAIモデル署名、そしてNISTの更新された敵対的ML分類法(AI 100-2)は、いずれも今日すでに公開され利用可能だ。問題は決して知識の問題ではなかった。Kiteworksの2025年の測定によれば、組織の83%が依然として自動化されたAIセキュリティ統制を欠いている。彼らが盲目的に飛んでいるのは、プレイブックが欠けているからではなく、それを実装するエンジニアリング能力を誰も持っていないからだ。足りないのは手であって、アイデアではない。

これには規制の時計もある。EU AI法は2026年8月2日に完全適用され、高リスクシステムに対しては本物の技術文書を要求する。訓練データの出所、適合性評価、そしてML-BOMがまさに生み出すために作られた類のサプライチェーン証明だ。AIコンポーネントの輸入業者と流通業者は、自分たちが川下へ渡すものを検証しなければならなくなり、提供者とその第三者コンポーネント供給業者は、それぞれが共有する情報と技術的アクセスについて書面で合意しなければならない。私はクライアントに、その条項の隠れた部分を伝え始めている。すなわち、この法が効力を持てば、モデルの出所はもはやあなただけが吸収すべき問題ではなくなる。あなたの供給業者がそれを書面で証明しなければならず、それができない業者は単に使えなくなるのだ。モデルの出所を「あれば良いもの」として扱っている企業は、それが申告要件であることを思い知ることになる。

実際に予算を動かしたスライド

こうした会話が普段終わる場所で、私も締めくくろう。取締役会の前で。

私は、しっかり構築されたセキュリティの提案が、セキュリティの提案として売り込まれたがために資金を得られないのを、数多く見てきた。抽象的なリスク、仮想的な攻撃者、保険のように聞こえるカテゴリ。うまくいったプレゼンは、一つの数字をテーブルに載せたものだった。シャドーAI侵害の平均コスト463万ドルを、それを防ぐ統制の構築コストと対比させたのだ。恐怖ではない。差分だ。ここに定量化されたリスクがあり、ここにそれを解消するコストがあり、ここにその差がある。

その枠組みがうまくいくのは、この問題が実際にどう振る舞うかに忠実だからだ。脅威は珍奇なものではない。それはデフォルトのワークフローなのだ。モデルを引っ張り、ファインチューニングし、デプロイし、二度と見返さない、という流れが、AIで構築するあらゆる組織で走っている。そしてそれは今やほぼすべての組織だ。CISOの予算はそれを反映している。組織の約85%が2026年に向けてサイバーセキュリティ支出を増やし、AIセキュリティは最も議論される費目となっている。

モデルは、あなたの環境の中で、あなたが持つ最も価値あるものであると同時に、インターネット上の見知らぬ他人からダウンロードした検証されていない実行可能コードの一片でもある、唯一のアーティファクトだ。それを両方として同時に扱うまで、すなわちコードのように検証し、サプライチェーンのように追跡し、変更するたびに再チェックするまで、あなたが安全だと記す報告書は、実際には誰も使っていない統制を監査しているにすぎない。もしあなたがどこから始めるべきか考えているなら、そこから始めよう。モデルカードを信じるのをやめ、モデルが実行されたときに何をするかを観察するのだ。

関連リサーチ

他のプラットフォームでも公開

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。