セキュリティ評価&ハーデニング

実際の攻撃者が行う手法でAIシステムを攻撃・検証し、モデル抽出からサプライチェーン侵害に至るまで発見された攻撃経路に対してシステムを堅牢化(ハーデニング)します。

私たちのアプローチは、実際の攻撃者が行うのと同じ手法でAIシステムを攻撃して突破し、評価によって発見された攻撃経路(モデル抽出からサプライチェーン侵害まで)に対してシステムを堅牢化(ハーデニング)することです。従来のペネトレーションテストは、お客様のAPI、インフラストラクチャ、認証フローを対象としていますが、攻撃者がファインチューニング済みモデルを窃取できるか、依存関係チェーンにバックドアを仕込めるか、あるいはRAGパイプラインをハイジャックできるかをテストすることはありません。そうした評価手法は、AIシステムが破綻する特有のメカニズムに合わせて特別に構築されなければなりません。

貴社のセキュリティチームがこれまでテストしたことのないアタックサーフェス

従来のペネトレーションテストは、貴社のAPI、インフラストラクチャ、認証フローを対象としています。しかし、攻撃者が 50,000 件の周到に構造化されたクエリを通じてファインチューニング済みモデルを抽出できるかどうかはテストしません。また、ポイズニングされた LoRAアダプター が3か月前に貴社のHuggingFace依存関係チェーン内にバックドアを侵入させたかどうかを検出することもありません。取得されたドキュメントに埋め込まれた指示を貴社のRAGパイプラインが実行してしまうかどうかも評価しません。これらこそが、本番環境のAIシステムを実際に侵害する攻撃経路です。

これらはカンファレンスの講演で語られる理論上のリスクではありません。Protect AIは 51,700モデルにわたる352,000件の不審なファイル を2025年4月にHuggingFace上で発見しました。AIを悪用した攻撃は 前年比89%増加し、そのうち 97% の侵害被害を受けた組織において自社AIシステムへの基本的なアクセス制御が欠落していました。また、 Mercorサプライチェーン攻撃 (2026年初頭)では、単一のオープンソース依存関係を介して数千社が侵害を受けました。

私たちが実際にテストすること——そして大半の評価が見落としていること

当社は評価を MITRE ATLAS フレームワークに沿って構成しています。同フレームワークは現在、 16の戦術にわたる84のテクニック をAIシステムに特化してカタログ化しています。しかし、フレームワークは地図であってテストそのものではありません。私たちの方法論は、カタログ化された攻撃を単にチェックリストで確認するだけでなく、実際に実行するように構築されています。

LLMデプロイメントとプロンプトインジェクション

私たちは、RAGによる検索、ツールの出力、ユーザーがアップロードしたドキュメント、エージェントに入力されるメールコンテンツなど、あらゆる取り込み経路を通じて間接的プロンプトインジェクションをテストします。直接的なインジェクションが話題になりがちですが、 Anthropicは2026年2月に直接的インジェクション指標を完全に廃止しました 。検索コンテキストを介した間接的インジェクションこそが、本番システムを実際に機能不全に陥れる要因だからです。また、マルチターンでの誘導操作、システムプロンプトの抽出、およびお客様が導入しているあらゆるガードレールスタック固有の障害モードについてもテストします。

モデルレベルのセキュリティ

私たちは、お客様のAPIに対して構造化クエリキャンペーンを実行し、攻撃者がモデルの振る舞いをどの程度再現できるかを測定することで、抽出リスクを評価します。勾配ベースの手法(モデルへのアクセス権がある場合)と、転移ベースのブラックボックス攻撃(実際の攻撃者の手口)の双方を用いて敵対的堅牢性を評価します。直接的な学習データとそれを提供する上流の依存関係の双方をチェックし、学習パイプラインのデータポイズニング脆弱性を監査します(詳細は モデルポイズニングからエンタープライズを保護するための当社の研究を参照)。

サプライチェーンの整合性

私たちは、すべてのモデルアーティファクトをその出所(事前学習済み重み、ファインチューニング用データセット、アダプター層、サービングフレームワークのバージョン)まで遡って追跡します。MLインフラストラクチャにおける既知の脆弱性をチェックし—— PyTorch、vLLM、およびTriton Inference Serverにはすべて2025〜2026年にCVEが存在しました ——モデルのシリアライゼーションが安全なフォーマットを使用していることを検証します。 $12 billion に上る2025年の侵害されたMLモデルによる損失は、直接的なモデル悪用ではなく、圧倒的多数がサプライチェーン攻撃に起因していました(詳細は MLサプライチェーンライフサイクルの保護に関する当社の研究を参照)。

エージェント型システム

私たちは、 OWASP Agentic AI Top 10 が定義するアタックサーフェス(ゴールハイジャック、ツールの不正使用、IDの悪用、メモリポイズニング、マルチエージェントワークフローにおける連鎖的障害)をテストします。 2026年のOpenClawの危機 —— 21,000+件のインスタンス (GitHubスター135,000を獲得したAIエージェント)が重大な脆弱性に晒された事例——は、こうしたテストを行わずにエージェントをリリースした際の結果を示しました(詳細は 人間とAIのフロンティア保護に関する当社の研究を参照)。

システムの運用方法を変革するハーデニング

修復を伴わない評価は、ただの高価なPDFにすぎません。私たちのアプローチは、ハーデニングの管理策をお客様のシステムに直接組み込みます。

  • 推論レイヤーの防御: モデル抽出パターンのトラフィック(体系的な入力網羅、境界探索、プログラムによる言い換えスイープ)を特定し、正当な利用と区別するクエリアノマリ検知。入力バリデーションパイプラインは、セマンティック攻撃を見逃し正当なクエリをブロックしてしまう一般的な正規表現フィルターではなく、お客様固有の脅威モデルに合わせて調整されます。
  • サプライチェーンのハーデニング: モデルアーティファクトがデプロイメントパイプラインに入る前に、アーティファクトの出所(来歴)を確認し、シリアライゼーション形式を検証し、既知の悪意あるパターンをスキャンし、署名要件を強制するモデル検証パイプライン——さらに、侵害された上流パッケージが本番環境に到達する前に捕捉する依存関係モニタリング。
  • エージェント型システムのハーデニング: ツールアクセスに対する権限境界、エージェントのステップ間における出力バリデーション、およびエージェントの実行パターンが期待されるワークフローから逸脱したことを検出する振る舞いモニタリング。

貴社のSIEMは人間の行動アノマリを検知するために構築されています。連続して 10,000件のクエリ を実行するエージェントは、攻撃者の制御下で動作している場合であっても、それらのシステムには正常に見えてしまいます。

この評価が不要なケース

ファインチューニング、RAG、ツールの使用がなく、プロンプト内に機密データも含まれないマネージドAPI(OpenAI、Anthropic、Google)を呼び出しているだけの場合、セキュリティリスクはAPIキーの管理とデータの取り扱いに限られます。これは標準的なアプリケーションセキュリティレビューでカバーでき、AI特化の評価は必要ありません。

貴社のモデルが外部公開APIを持たず再学習パイプラインもない内部稼働の単純な分類器である場合、アタックサーフェスは限定的であり、簡潔な脅威モデルレビューで十分釣り合います。ファイアウォールの背後にある社内の感情分類器に対して完全な敵対的堅牢性テストを実施することは、 $30,000を費やして$500のリスクを防ぐようなものです。

私たちがこれを率直に述べるのは、売上よりも信頼性を重視しているからです。この評価を真に必要としている組織は自覚しています。ファインチューニング済みモデルを運用している組織、外部コンテンツを処理するRAGパイプラインを持つ組織、ツールアクセス権を持つエージェント型システム、規制業界のモデル、あるいは財務や安全性に関わる決定を下すAIシステムを抱えるすべての組織です。

現実味を帯びる規制圧力と明確な期限

EU AI法は2026年8月に施行が開始されます。 高リスクAIシステムには、文書化されたリスク管理、技術的堅牢性テスト、およびデータガバナンス管理策が義務付けられています。不適合の場合には最大で 全世界年間売上高の7%またはEUR 35 millionの制裁金が科されます。 NISTは2025年12月にAI向けサイバーセキュリティフレームワークプロファイルを公開し、AI固有のリスクをCSF 2.0の管理策にマッピングしました。これらのフレームワークは現在、調達要件や取締役会レベルのリスクレビューにも登場するようになっています。

課題は、単一のフレームワークですべてを網羅できるものは存在しない点です。私たちは、規制当局、監査人、顧客が要求するあらゆるフレームワークにお客様の評価結果をマッピングし、形式的なチェックリストではなく実際のテストから得られた、コンプライアンス要件を満たす証拠を生成します。

フレームワーク提供するもの
MITRE ATLAS攻撃テクニックをマッピング
OWASP LLM Top 10脆弱性クラスを分類
NIST AI RMFガバナンス構造を提供
ISO 42001マネジメントシステムに対応
EU AI Act法的義務を課す

プラットフォームツール vs. カスタム評価

自動AIセキュリティプラットフォーム(HiddenLayer、Mindgard、Giskard)は、既知の攻撃パターンを大規模に実行します。これらは初期評価後の継続的なリグレッションテストには有用ですが、初期評価そのものの代わりにはなりません。スキャナーは貴社のビジネスロジックを理解せず、どのモデル出力が安全性に関わる重大な結果をもたらすかを認識できず、脅威モデルが実際のデプロイメントアーキテクチャと一致しているかを評価することもできません。

私たちは、価値をもたらす領域でこれらのツールを活用します。何をテストすべきかが確立された後は、継続的な自動レッドチーミングをCI/CDパイプラインに組み込むべきです。しかし、貴社の固有システムにおいて最も重要となる攻撃経路を発見するには、AIの障害モードと貴社の運用コンテキストの双方を理解している専門家が不可欠です。

複数のAIベンダー(OpenAI、Anthropic、Google、オープンソースモデル)を運用している組織に対しては、各プロバイダーのセキュリティ境界を個別に評価し、それらの間でデータが流れる統合ポイントをテストします。マルチベンダー構成のアタックサーフェスは各ベンダーのリスクの単純な総和ではありません。あるプロバイダーのセキュリティ保証に関する前提が別のプロバイダーへのハンドオフ時に破綻する、相互作用レイヤーこそがアタックサーフェスとなります。

重要ポイント

  • AIシステムは、標準的なペネトレーションテストでは決して検出できない手法(モデル抽出、ポイズニングされたLoRAアダプター、間接的プロンプトインジェクション、エージェントのゴールハイジャック)によって破綻します。
  • 私たちは4つの領域(LLMデプロイメント、モデルレベルセキュリティ、サプライチェーン、エージェント型システム)にわたってテストを実施します。MITRE ATLAS(16の戦術、84のテクニック)に基づいて構造化されていますが、チェックリストではなく実際の攻撃によって駆動されます。
  • 評価には修復が含まれます。単にPDFを納品するのではなく、推論レイヤー、サプライチェーン、エージェント型のハーデニングが貴社のシステムに直接組み込まれます。
  • 私たちは評価結果をMITRE ATLAS、OWASP LLM Top 10、NIST AI RMF、ISO 42001、そしてEU AI法(2026年8月に施行開始、最大で全世界年間売上高の7%またはEUR 35 millionの制裁金)にマッピングします。
  • すべてのデプロイメントにこれが必要なわけではありません。マネージドAPIや単純な社内分類器には不要ですが、ファインチューニングされたモデル、外部コンテンツを処理するRAG、ツールを使用するエージェント、規制対象または安全性に関わるAIには不可欠です。

セキュリティ評価&ハーデニング

よくある質問

よくあるご質問

AI特化型セキュリティ評価の費用はどのくらいですか?

AIセキュリティ評価の費用は、対象を絞ったLLMアプリケーションレビューの$15,000から、モデルレベルの攻撃、サプライチェーン監査、エージェント型システムテストを網羅する本格的なレッドチーム演習の$80,000+まで多岐にわたります。中堅市場のコンサルティング料金はコンサルタント1日あたり$1,500〜$3,500、トップクラスのブティック企業では1日あたり$4,000〜$7,000となります。適切なスコープはお客様のデプロイメントアーキテクチャによって異なります。ファインチューニングを行わないマネージドAPIの呼び出しは、ツールアクセスを伴うエージェント型ワークフローを提供するファインチューニング済みモデルよりもはるかに少ないテストで済みます。

AIセキュリティ評価では、通常のペネトレーションテストではテストされない何を検証しますか?

従来のペンテストは、APIエンドポイント、認証、インフラストラクチャ、およびアプリケーションロジックを対象とします。AIセキュリティ評価は、モデル固有の攻撃ベクトルを追加します。具体的には、敵対的入力の作成、構造化クエリキャンペーンによるモデル抽出、学習データのポイズニング検出、プロンプトインジェクション(直接的、およびRAG検索を介した間接的の両方)、モデルアーティファクトのサプライチェーンの整合性、そしてエージェント型システムにおけるゴールハイジャック、ツールの不正使用、マルチステップワークフローによる特権昇格などです。これらの攻撃経路には、標準的なペンテストフレームワークでは対応できないML特化の手法が必要です。

攻撃者はAPI経由で当社のファインチューニング済みモデルを実際に盗み出すことができますか?

はい、可能です。モデル抽出攻撃は、体系的なクエリ送信を通じてモデルの振る舞いを複製します。ファインチューニングされた分類器の場合、数千回のクエリで機能的に同等なコピーを作成できます。大規模言語モデルの場合、完全な抽出はより困難ですが、ファインチューニングの振る舞いの一部を抽出することは十分に可能です。スクレイピングレベルのクエリトラフィックは、2025〜2026年に世界のAPIトラフィックの中央値20%に達しました。防御策には、単純なレート制限を超えたクエリパターン分析、抽出パターンの行動フィンガープリンティング、電子透かし(ウォーターマーク)などがありますが、現在の透かし技術は出力の言い換えによって除去される可能性があります。

EU AI法への準拠のためにAIセキュリティテストは必要ですか?

お客様のAIシステムがEU AI法の下で高リスクに該当する場合、必要です。第15条では技術的堅牢性とサイバーセキュリティ対策が求められており、2026年8月に施行が開始され、違反には最大で全世界年間売上高の7%またはEUR 35 millionの制裁金が科されます。NISTは2025年12月にAI向けサイバーセキュリティフレームワークプロファイルを公開し、AI固有のリスクをCSF 2.0の管理策にマッピングしており、調達要件でも参照される機会が増えています。規制当局や裁判所は管理策が単に文書化されただけでなく実際にテストされたかどうかを評価するため、実際のセキュリティテストこそが形式的なチェックボックス監査では不可能なコンプライアンスの証拠を生み出します。

間接的プロンプトインジェクションからRAGパイプラインをどのように保護すべきですか?

検索されたコンテンツを介した間接的プロンプトインジェクションは、本番環境における主要なLLM攻撃ベクトルです。Anthropicは、間接的インジェクションの方が運用上より重大な脅威であるとして、2026年2月に直接的インジェクションの評価指標を完全に廃止しました。防御には多層防御が必要です。コンテキストウィンドウ内で検索コンテンツとシステム指示を分離すること、プライマリモデルに届く前にセカンダリモデルを使用して検索コンテンツを評価すること、検索によって引き起こされた指示追従の振る舞いを捉える出力バリデーション、そして異常な応答パターンの継続的な監視です。単一の防御策で完璧なものはありません。システムの構成に応じてプロンプトインジェクションの成功率は50〜84%に達するため、多層防御(防御の階層化)こそが唯一の現実的なアプローチです。

MITRE ATLAS、OWASP、NIST AI RMFのどれに従うべきですか?

これらはそれぞれ異なる目的を持っており、大半の組織では3つすべての要素が必要となります。MITRE ATLAS(2026年2月時点で16の戦術、84のテクニック)は具体的な攻撃手法をマッピングし、技術的評価を構築するための適切なフレームワークです。OWASP LLM Top 10は脆弱性クラスを分類し、何をテストすべきかの指針となります。NIST AI RMFは、Govern(統括)、Map(分析)、Measure(測定)、Manage(管理)の柱を通じてガバナンス構造を提供し、調達基準としての利用が拡大しています。ISO 42001はマネジメントシステムの認証を扱います。EU AI法は期限付きの法的義務を課します。私たちは、お客様の規制当局、監査人、顧客が求めるあらゆるフレームワークに評価結果をマッピングします。

ツールを使用するエージェント型AIに対するセキュリティ評価では何を網羅すべきですか?

エージェント型AIは、静的なLLMテストでは完全に見落とされるアタックサーフェスをもたらします。OWASPは2025年12月にエージェント型アプリケーション向けTop 10を公開し、ゴールハイジャック、ツールの不正使用、IDの悪用、メモリポイズニング、連鎖的障害を網羅しました。評価では、攻撃者が操作された入力を通じてエージェントの目的を変更できるか、ツールの権限を意図したスコープを超えて昇格できるか、永続メモリを改ざんして将来の行動に影響を与えられるか、マルチエージェントワークフロー全体で障害を連鎖させられるかをテストする必要があります。貴社の既存のSIEMやEDRツールは、人間の行動アノマリを検出するために構築されています。連続して10,000件のクエリを実行するエージェントは、たとえ攻撃者の制御下にあっても、これらのシステムには正常に見えてしまいます。

HuggingFaceから取得したモデルにバックドアが仕込まれていないことをどのように検証すべきですか?

Protect AIは2025年4月、HuggingFace上の51,700モデルにわたる352,000件の不審なファイルを特定しました。検証には、シリアライゼーション形式の確認(任意のコード実行を許すpickleではなくSafetensorsを採用)、モデルの重みや設定ファイル内の既知の悪意あるパターンのスキャン、署名とハッシュ検証による来歴の確認、およびバックドア起動に関連するトリガーパターンに対するモデル動作のテストが必要です。悪意あるLoRAアダプターはサイズが小さく配布が容易なため、急速に拡大している脅威ベクトルです。サプライチェーンの検証は、ダウンロード時に手動で行うのではなく、モデルデプロイメントパイプライン内で自動化すべきです。

AIセキュリティプラットフォームの導入とコンサルタントへの依頼の違いは何ですか?

HiddenLayer、Mindgard、GiskardなどのAIセキュリティプラットフォームは、既知の攻撃パターンを大規模に自動化します。これらはCI/CDパイプラインにおける継続的なリグレッションテストに有用です。しかし、プラットフォームは貴社のビジネスコンテキストを理解できず、どのモデル出力が安全性に関わる重大な結果をもたらすかを評価できず、貴社のアーキテクチャに固有の未知の攻撃経路を発見することもできないため、初期評価の代わりにはなりません。適切なアプローチは双方を併用することです。コンサルタントが実際の脅威サーフェスを特定し、重要な項目を確立してハーデニング管理策を構築した上で、評価によって確立されたベースラインに対する継続的な自動テストのためにプラットフォームツールを活用します。

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。