悪意あるモデルとシャドーデプロイから機械学習ライフサイクルを保護する
Hugging Face上での 100件以上のバックドア付きモデル の発見は、Deep AIエンジニアがすでに知っていた事実を浮き彫りにしました。すなわち、MLサプライチェーンは企業インフラの中で 最も脆弱で最もガバナンスが行き届いていない コンポーネントであるということです。本ホワイトペーパーでは、ハードウェア支援による暗号検証可能なAIレジリエンスのエンジニアリング設計図を提示します。
市場がLLMラッパーサービスを追い求める一方で、基盤部分では構造的な脆弱性が深刻化しています。AIモデルの重みは不透明なバイナリblobであり、悪意ある挙動は何百万ものパラメータの中に隠れ、従来のコードレビューでは検知できません。
パブリックハブ上のモデルは単に誤作動するだけではありません。兵器化されています。Pickleシリアライゼーションにより、開発者が torch.load()を実行した瞬間に任意のコード実行が可能となり、攻撃者が制御するインフラへのリバースシェルが確立されます。
企業内のAI利用の90%はIT部門の監視外で行われています。開発者はパブリックリポジトリから未検証のモデルを取得し、プロプライエタリなコードをパブリックツールに貼り付け、ソフトウェア構成分析(SCA)を迂回しており、永続的で不可視のバックドアを生み出しています。
NIST AI 100-2のガイダンスがあるにもかかわらず、自動化されたAIセキュリティ制御を導入している組織はわずか17%にすぎません。ポリシー文書と運用の実態とのギャップこそが攻撃者の温床となり、業界の誤った安心感を突いています。
すべてのシリアライゼーション形式が同等というわけではありません。Pickleへの業界の依存は、スタックベースの仮想マシン脆弱性を生み出しました。新しい形式はリスクを低減しますが、完全な免疫を持つものはありません。各形式をクリックして詳細を確認してください。
Pickleは、デシリアライズ中に任意のPython関数を実行できる スタックベースの仮想マシン を実装しています。例えば os.system() や subprocess.run() などの関数をアンピクル処理に注入可能です。
これは従来のPyTorchやscikit-learnモデルで最も一般的な形式です。Pickleを普及させた柔軟性こそが、重大なセキュリティ欠陥となっている要因です。
攻撃者が機械学習システムを標的にする方法をモデル化した5段階のフレームワーク。各段階をクリックして、脅威のメカニズムと必要なエンジニアリング対策を理解してください。
攻撃者は公開モデルリポジトリ、CI/CD構成、依存関係ツリーをスキャンして侵入ポイントを特定します。組織がどのフレームワークを使用し、どのモデルをダウンロードし、パイプラインがどの形式を想定しているかを分析します。
特定のモデルタイプをダウンロードする組織を特定し、そのフレームワークや形式に合わせたターゲットペイロードを作成。
公開されたrequirements.txtやDockerイメージを分析し、悪用可能な脆弱なフレームワークバージョンを特定。
プライベートモデルハブを備えた集中型AIアセットレジストリ。外部モデルのダウンロードはすべてログ記録、バージョン管理され、自動検証パイプラインを経由。
データポイズニング(データ汚染)は、 ベンチマークでは検知不能 で、かつ クリーンデータによる希釈に耐性を持つ休眠状態のバックドアを仕込みます。わずか250件の汚染文書で、130億パラメータのモデルを恒久的に侵害可能です。これらの「スリーパーエージェント」は、特定のトリガートークンに遭遇したときのみ起動します。
学習中に50〜100回のトリガー出現が発生すると、バックドアは重み空間に恒久的にエンコードされます。何百万ものクリーンサンプルを追加しても、学習されたトリガーと応答の関連付けは上書きされません。
学習コーパスのサイズと汚染比率の相互作用を可視化
汚染サンプル数によるバックドア成功率シミュレーション(公開された研究しきい値に基づく)
AIアセットのガバナンスは危機的状況にあります。ポリシーと運用セキュリティのギャップは、脆弱性、コンプライアンス違反、競争リスクが重なる深刻な事態を生み出しています。
企業におけるNIST AI 100-2管理策の導入率(2025年)
管理されていないAI利用による組織のエクスポージャーを推計
「多くの組織は、ポリシー文書を策定することと運用上のセキュリティを確立することを同一視しています。しかし、自動化された強制力や技術的障壁がなければ、従業員は安全よりも利便性を優先し続けます。 ポリシーは保護ではありません。」
— Veriprajna AIセキュリティ・ホワイトペーパー、2025年
AIモデルを潜在的に悪意のある実行可能コードとして扱います。機械学習サプライチェーン全体にわたる「Secure by Design(設計段階からのセキュリティ)」アーキテクチャ。
従来のSBOMはライブラリを追跡します。AIにはモデルの出所、データセットの系統、学習方法を記録するML-BOMが必要です(CycloneDXおよびSPDX 3.0 AIプロファイルを採用)。
モデルの重みは知的財産であると同時に高リスクなバイナリアーティファクトです。MLモデルに対するPKIはもはや必須です。HSM支援の署名により、承認されたモデルのみが本番環境に到達します。
静的解析は第一の防衛線です。Deep Code Analysisは、APIゲートウェイからLLMランナーを経てシステムシェルに至る入力フローをマッピングするソフトウェアグラフを構築します。ランタイム監視は本番環境での汚染発動を検知します。
金融、医療、防衛分野向け:ハードウェア支援のTrusted Execution Environments(TEE)が使用中データを保護。モデルの重みとプロンプトは隔離されたエンクレーブ内でのみ復号され、ルート権限を持つクラウド管理者からも不可視です。
相互アテストテーション:モデル提供者は正規のTEEを検証し、エンドユーザーは承認済みソフトウェアを検証。ゼロトラストの基盤。
モデルの取り込みから本番推論まで、すべての段階が暗号検証、行動監視、ゼロトラスト隔離によって統制されます。
すべての外部モデルを隔離された検疫環境にルーティング。パブリックハブから本番環境への直接経路を排除。
深層バイトコードスキャン。形式検証。Pickleオペコード解析。SafeTensorsへの変換。
隔離されたコンテナでの動的テスト。外部送信、システムコール、異常出力を監視。
HSM支援の署名。ML-BOM生成。全社AIアセットレジストリへの登録。
アドミッションコントローラー + TEE + ガードレール層 + 継続的出力検証。
AIシステムは、オープンソースサプライチェーン攻撃の標的となるCI/CDパイプラインと同じ経路で構築・デプロイされます。モデルが安全であってもPythonランタイムが侵害されていればシステム全体が破綻します。学習コンテナイメージが改ざんされていれば、重みは信用できません。
「ソフトウェアアセット」と「AIアセット」の二者択一的な分離は、攻撃者に悪用される危険な隙間です。
PyTorchやscikit-learnで使用されるPythonのPickleシリアライゼーション形式は、デシリアライズ中に任意のコードを実行できるスタックベースの仮想マシンを実装しています。攻撃者は__reduce__メソッドを操作することで、開発者がtorch.load()を実行した瞬間に作動するリバースシェルを注入します。JFrogの研究者は、Hugging Face上でこのような兵器化されたモデルを100件以上発見しました。PickleScanのような静的スキャナーは、3つの既知のゼロデイバイパスが存在し、誤検知率が96%に達するため、検知手段として信頼できません。
学習コーパスのわずか0.00016%に相当するわずか250件の汚染文書で、130億パラメータのモデルを恒久的に侵害できます。学習中に約50回のトリガーが出現すると、バックドアは重み空間に恒久的にエンコードされます。その後何百万ものクリーンサンプルを追加しても、学習されたトリガーと応答の関連付けは上書きされません。これらの「スリーパーエージェント」はすべての標準ベンチマークを通過し、特定のトリガートークンに遭遇したときのみ作動します。
ML-BOM(機械学習部品表)は、従来のSBOMを拡張して、モデルの出所、データセットの系統、学習方法、フレームワークの依存関係、暗号アテストテーションを記録するものです(CycloneDXおよびSPDX 3.0 AIプロファイルを活用)。PyTorchやその他の依存関係でCVEが発見された際に迅速な脆弱性修正を可能にします。HSM支援の暗号モデル署名と組み合わせることで、有効な署名を持つ承認済みモデルのみが本番環境に到達し、推論エンジンは無効な署名を持つモデルのロードを拒否します。
「運任せの運用」と検証可能なレジリエンスの違いは、単一のアーキテクチャ上の決断にあります。
Veriprajnaは、脆弱なシャドーAIから暗号で保護されたハードウェア支援のDeep AIスタックへの移行を設計し、AIデプロイメントを予測可能で、監査可能で、堅牢なものにします。
エンジニアリング完全レポート:シリアライゼーション攻撃の分類、AIキルチェーン防御、ML-BOM仕様、暗号署名アーキテクチャ、コンフィデンシャル・コンピューティング導入パターン、NIST AI 100-2実装ガイド。