AIセキュリティ • サプライチェーンの完全性

AIサプライチェーン完全性の アーキテクチャ的必然性

悪意あるモデルとシャドーデプロイから機械学習ライフサイクルを保護する

Hugging Face上での 100件以上のバックドア付きモデル の発見は、Deep AIエンジニアがすでに知っていた事実を浮き彫りにしました。すなわち、MLサプライチェーンは企業インフラの中で 最も脆弱で最もガバナンスが行き届いていない コンポーネントであるということです。本ホワイトペーパーでは、ハードウェア支援による暗号検証可能なAIレジリエンスのエンジニアリング設計図を提示します。

ホワイトペーパーを読む
100+
Hugging Face上で発見された悪意あるモデル
JFrog Research、2024年2月
83%
AIセキュリティ統制なしで運用している企業の割合
Kiteworks 2025
0.00016%
永続的なバックドアを仕込むのに必要な訓練データの割合
約250文書
67万ドル
シャドーAIによる侵害コストの平均増加額
Proofpoint 2025

ハイプの底に潜む危機

市場がLLMラッパーサービスを追い求める一方で、基盤部分では構造的な脆弱性が深刻化しています。AIモデルの重みは不透明なバイナリblobであり、悪意ある挙動は何百万ものパラメータの中に隠れ、従来のコードレビューでは検知できません。

兵器化されたモデルアーティファクト

パブリックハブ上のモデルは単に誤作動するだけではありません。兵器化されています。Pickleシリアライゼーションにより、開発者が torch.load()を実行した瞬間に任意のコード実行が可能となり、攻撃者が制御するインフラへのリバースシェルが確立されます。

torch.load("model.pt") → pickle.__reduce__() → os.system("reverse_shell") → リモートコード実行 (RCE)

シャドーAIの蔓延

企業内のAI利用の90%はIT部門の監視外で行われています。開発者はパブリックリポジトリから未検証のモデルを取得し、プロプライエタリなコードをパブリックツールに貼り付け、ソフトウェア構成分析(SCA)を迂回しており、永続的で不可視のバックドアを生み出しています。

従業員の77%がパブリックAIツールと機密データを共有 → 知的財産漏洩 + コンプライアンス違反

ガバナンスの空白地帯

NIST AI 100-2のガイダンスがあるにもかかわらず、自動化されたAIセキュリティ制御を導入している組織はわずか17%にすぎません。ポリシー文書と運用の実態とのギャップこそが攻撃者の温床となり、業界の誤った安心感を突いています。

56%がAI対応を主張するも技術的制御が欠如 → ポリシー ≠ 保護

モデルファイル形式:攻撃対象領域を把握する

すべてのシリアライゼーション形式が同等というわけではありません。Pickleへの業界の依存は、スタックベースの仮想マシン脆弱性を生み出しました。新しい形式はリスクを低減しますが、完全な免疫を持つものはありません。各形式をクリックして詳細を確認してください。

.pkl / .pt

Pickle

.safetensors

SafeTensors

.gguf

GGUF

.h5 / .keras

Keras

高リスク

Pickle (.pkl, .pt)

Pickleは、デシリアライズ中に任意のPython関数を実行できる スタックベースの仮想マシン を実装しています。例えば os.system()subprocess.run() などの関数をアンピクル処理に注入可能です。

これは従来のPyTorchやscikit-learnモデルで最も一般的な形式です。Pickleを普及させた柔軟性こそが、重大なセキュリティ欠陥となっている要因です。

// セキュリティアーキテクチャ
ロジックベースのシリアライゼーション(オペコード)
任意のPythonオブジェクトの再構築
サンドボックスなし — インタプリタへの完全アクセス

脅威ベクター分析

ロード時のコード実行 クリティカル
バックドアの埋め込み クリティカル
スキャナー回避
推論時エクスプロイト
エンタープライズコンテキスト
レガシーなPyTorchおよびscikit-learnで一般的。PickleScanには3つの既知のゼロデイバイパスが存在(CVE-2025-10155を含む)。スキャナーアラートの96%は誤検知。

AIキルチェーン

攻撃者が機械学習システムを標的にする方法をモデル化した5段階のフレームワーク。各段階をクリックして、脅威のメカニズムと必要なエンジニアリング対策を理解してください。

01
偵察
02
汚染
03
乗っ取り
04
永続化
05
影響
ステージ 1 — 偵察

攻撃対象領域のマッピング

攻撃者は公開モデルリポジトリ、CI/CD構成、依存関係ツリーをスキャンして侵入ポイントを特定します。組織がどのフレームワークを使用し、どのモデルをダウンロードし、パイプラインがどの形式を想定しているかを分析します。

// 攻撃メカニズム
scan(huggingface.models) → identify(popular_downloads)
analyze(CI/CD_configs) → map(serialization_formats)
profile(target_org) → select(attack_vector)

この段階での攻撃タイプ

リポジトリスクレイピング

特定のモデルタイプをダウンロードする組織を特定し、そのフレームワークや形式に合わせたターゲットペイロードを作成。

依存関係マッピング

公開されたrequirements.txtやDockerイメージを分析し、悪用可能な脆弱なフレームワークバージョンを特定。

Veriprajnaの対抗策

プライベートモデルハブを備えた集中型AIアセットレジストリ。外部モデルのダウンロードはすべてログ記録、バージョン管理され、自動検証パイプラインを経由。

モデル内部のスリーパーエージェント

データポイズニング(データ汚染)は、 ベンチマークでは検知不能 で、かつ クリーンデータによる希釈に耐性を持つ休眠状態のバックドアを仕込みます。わずか250件の汚染文書で、130億パラメータのモデルを恒久的に侵害可能です。これらの「スリーパーエージェント」は、特定のトリガートークンに遭遇したときのみ起動します。

クリーンデータが効果を持たない理由

学習中に50〜100回のトリガー出現が発生すると、バックドアは重み空間に恒久的にエンコードされます。何百万ものクリーンサンプルを追加しても、学習されたトリガーと応答の関連付けは上書きされません。

threshold(~50 triggers) → weight_encoding(permanent)
clean_data(+10M samples) → backdoor_status(unchanged)
01
事前学習汚染
ウェブ規模のデータセットに悪意ある文書を混入。ベースモデルに根本的なバックドアを構築。
02
ファインチューニング汚染
指示調整データセットを破損させ、企業固有のタスクを標的型で侵害。
03
RAG汚染
ベクターデータベース内の悪意ある文書が、検索コンテキストを通じてモデル応答を動的にハイジャック。
04
回避攻撃(Evasion)
推論入力のビット単位の操作により、誤分類や不正なツール呼び出しを強制。

データ汚染しきい値シミュレーター

学習コーパスのサイズと汚染比率の相互作用を可視化

脆弱
1,000万文書
250件
13B(130億)
汚染比率
0.0025%
トリガー密度
約50回/エポック
バックドアリスク

汚染サンプル数によるバックドア成功率シミュレーション(公開された研究しきい値に基づく)

シャドーAIの蔓延

AIアセットのガバナンスは危機的状況にあります。ポリシーと運用セキュリティのギャップは、脆弱性、コンプライアンス違反、競争リスクが重なる深刻な事態を生み出しています。

エンタープライズAIセキュリティ導入状況

企業におけるNIST AI 100-2管理策の導入率(2025年)

シャドーAIリスク計算機

管理されていないAI利用による組織のエクスポージャーを推計

500
90%
77%
シャドーAIユーザー数
450人
ITガバナンスの監視外
データ漏洩リスク
347人
機密データを共有している従業員数
推定侵害コスト増加額
67万ドル
平均追加侵害コスト
未検証モデルのリスク
ガバナンス体制に基づく評価

「多くの組織は、ポリシー文書を策定することと運用上のセキュリティを確立することを同一視しています。しかし、自動化された強制力や技術的障壁がなければ、従業員は安全よりも利便性を優先し続けます。 ポリシーは保護ではありません。

— Veriprajna AIセキュリティ・ホワイトペーパー、2025年

エンジニアリング・ソリューション

セキュアなMLライフサイクル

AIモデルを潜在的に悪意のある実行可能コードとして扱います。機械学習サプライチェーン全体にわたる「Secure by Design(設計段階からのセキュリティ)」アーキテクチャ。

ML部品表(ML-BOM)

従来のSBOMはライブラリを追跡します。AIにはモデルの出所、データセットの系統、学習方法を記録するML-BOMが必要です(CycloneDXおよびSPDX 3.0 AIプロファイルを採用)。

データ出所管理(Provenance): 改ざん防止された起源、変換、所有権の記録
モデル系統管理(Lineage): 学習手法、ハイパーパラメータ、ファインチューニングの文書化
フレームワーク依存関係: 任意コード実行脆弱性の期間を特定するためのバージョン管理されたPyTorch/TF追跡
暗号アテストテーション: ソースからデプロイまでのモデルの完全性を検証するデジタル署名

暗号によるモデル署名

モデルの重みは知的財産であると同時に高リスクなバイナリアーティファクトです。MLモデルに対するPKIはもはや必須です。HSM支援の署名により、承認されたモデルのみが本番環境に到達します。

// アドミッションコントローラーのフロー
model.upload(weights) → HSM.sign(sha256(weights))
inference_server.load(model) →
  admission_ctrl.verify(signature, corporate_root_of_trust)
  IF valid → deserialize(weights) → SERVE
  IF invalid → REJECT + alert(security_team)

高度なスキャンとランタイム保護

静的解析は第一の防衛線です。Deep Code Analysisは、APIゲートウェイからLLMランナーを経てシステムシェルに至る入力フローをマッピングするソフトウェアグラフを構築します。ランタイム監視は本番環境での汚染発動を検知します。

DCA
Deep Code Analysis(深層コード解析): APIゲートウェイからLLMランナーを経てデータベースやシェルに至るユーザー入力の流れをマッピングするコンテキスト認識型SAST
RTM
出力検証: クリーンなベースラインとの継続的な比較により、バックドア作動を示すドリフトや異常を検知
GRL
ガードレール層: 入力のサニタイズと言い換えにより、敵対的ペイロードがコアモデルに到達する前に無力化

コンフィデンシャル・コンピューティング(TEE)

金融、医療、防衛分野向け:ハードウェア支援のTrusted Execution Environments(TEE)が使用中データを保護。モデルの重みとプロンプトは隔離されたエンクレーブ内でのみ復号され、ルート権限を持つクラウド管理者からも不可視です。

SGX
アプリケーションレベルの隔離
TDX
VMレベルの暗号化
H100/B200
ラックスケールのコンフィデンシャルGPU
CC OCI
暗号化されたコンテナイメージ

相互アテストテーション:モデル提供者は正規のTEEを検証し、エンドユーザーは承認済みソフトウェアを検証。ゼロトラストの基盤。

Veriprajna セキュアMLパイプライン

モデルの取り込みから本番推論まで、すべての段階が暗号検証、行動監視、ゼロトラスト隔離によって統制されます。

01

取り込み & 検疫

すべての外部モデルを隔離された検疫環境にルーティング。パブリックハブから本番環境への直接経路を排除。

02

静的解析

深層バイトコードスキャン。形式検証。Pickleオペコード解析。SafeTensorsへの変換。

03

振る舞いサンドボックス

隔離されたコンテナでの動的テスト。外部送信、システムコール、異常出力を監視。

04

署名 & 登録

HSM支援の署名。ML-BOM生成。全社AIアセットレジストリへの登録。

05

監視付き推論

アドミッションコントローラー + TEE + ガードレール層 + 継続的出力検証。

AIセキュリティ + ソフトウェアサプライチェーン = ひとつの課題

AIシステムは、オープンソースサプライチェーン攻撃の標的となるCI/CDパイプラインと同じ経路で構築・デプロイされます。モデルが安全であってもPythonランタイムが侵害されていればシステム全体が破綻します。学習コンテナイメージが改ざんされていれば、重みは信用できません。

「ソフトウェアアセット」と「AIアセット」の二者択一的な分離は、攻撃者に悪用される危険な隙間です。

重みのみのロード(Weights-Only): 実行可能シリアライゼーションを無効化。SafeTensorsをデフォルト形式に設定。
隔離されたランナー: 最小限のネットワークアクセスと厳格な送信制御を備えたコンテナ化推論。
メカニスティック解釈可能性: デプロイ前にモデルの重みを監査し、潜在的なバックドアトリガーを特定。
統合プロベナンス: モデル、データセット、OSS依存関係、インフラを同時に管理・検証。
FAQ

よくある質問

Hugging Faceなどの公開リポジトリにあるAIモデルファイルがセキュリティリスクとなるのはなぜですか?

PyTorchやscikit-learnで使用されるPythonのPickleシリアライゼーション形式は、デシリアライズ中に任意のコードを実行できるスタックベースの仮想マシンを実装しています。攻撃者は__reduce__メソッドを操作することで、開発者がtorch.load()を実行した瞬間に作動するリバースシェルを注入します。JFrogの研究者は、Hugging Face上でこのような兵器化されたモデルを100件以上発見しました。PickleScanのような静的スキャナーは、3つの既知のゼロデイバイパスが存在し、誤検知率が96%に達するため、検知手段として信頼できません。

大規模言語モデルを侵害するには、何件の汚染文書が必要ですか?

学習コーパスのわずか0.00016%に相当するわずか250件の汚染文書で、130億パラメータのモデルを恒久的に侵害できます。学習中に約50回のトリガーが出現すると、バックドアは重み空間に恒久的にエンコードされます。その後何百万ものクリーンサンプルを追加しても、学習されたトリガーと応答の関連付けは上書きされません。これらの「スリーパーエージェント」はすべての標準ベンチマークを通過し、特定のトリガートークンに遭遇したときのみ作動します。

ML部品表(ML-BOM)とは何ですか?なぜエンタープライズAIに必要なのですか?

ML-BOM(機械学習部品表)は、従来のSBOMを拡張して、モデルの出所、データセットの系統、学習方法、フレームワークの依存関係、暗号アテストテーションを記録するものです(CycloneDXおよびSPDX 3.0 AIプロファイルを活用)。PyTorchやその他の依存関係でCVEが発見された際に迅速な脆弱性修正を可能にします。HSM支援の暗号モデル署名と組み合わせることで、有効な署名を持つ承認済みモデルのみが本番環境に到達し、推論エンジンは無効な署名を持つモデルのロードを拒否します。

あなたのモデルは検証済みですか、それとも単にダウンロードされただけですか?

「運任せの運用」と検証可能なレジリエンスの違いは、単一のアーキテクチャ上の決断にあります。

Veriprajnaは、脆弱なシャドーAIから暗号で保護されたハードウェア支援のDeep AIスタックへの移行を設計し、AIデプロイメントを予測可能で、監査可能で、堅牢なものにします。

AIセキュリティ評価

  • MLサプライチェーン脆弱性監査
  • シャドーAIの発見と修復ロードマップ
  • モデルシリアライゼーション形式のリスク評価
  • NIST AI 100-2コンプライアンスギャップ分析

Deep AI エンジニアリング

  • プライベートモデルハブとML-BOMパイプラインの設計
  • HSM統合による暗号モデル署名
  • 機密推論向けコンフィデンシャル・コンピューティングの導入
  • 継続的ランタイム監視とガードレールアーキテクチャ
WhatsAppで問い合わせる
技術ホワイトペーパーの全文を読む

エンジニアリング完全レポート:シリアライゼーション攻撃の分類、AIキルチェーン防御、ML-BOM仕様、暗号署名アーキテクチャ、コンフィデンシャル・コンピューティング導入パターン、NIST AI 100-2実装ガイド。

ソーシャル

他のプラットフォームでも公開