AI評価・ベンチマーキング・レッドチーミング

評価ハーネス、ドメイン特化型ベンチマーク、体系的なレッドチーミングプログラムを設計し、AIシステムが貴社のユースケースで――貴社のデータ、エッジケース、コストおよび安全性の制約に照らして――実際に機能するかどうかを測定します。

公開されているベンチマークのスコアは、AIシステムが実際の運用環境でどのように機能するかについて、ほとんど何も教えてくれません。私たちは、AIシステムが実際に貴社のユースケースで機能するかどうか――貴社のデータ、貴社のエッジケース、そして貴社のコストおよび安全性の制約に照らして――を測定する評価ハーネス、ドメイン特化型ベンチマーク、体系的なレッドチーミングプログラムを設計します。

なぜ公開ベンチマークは貴社の運用環境を捉えられないのか

フロンティアモデルはMMLUで88%を超える領域に密集しています。GPT-5.3 Codexは99%を記録しています。Vellumの2025年LLMリーダーボードは、MMLUがもはや意味のある形でモデルを区別できないため、これを完全に除外しました。これを是正するために設計されたMMLU-Proでさえ、フロンティアモデルではすでに90%に迫っています。業界で最も引用されているベンチマークは、虚栄の指標と化してしまいました。

より根深い問題は関連性です。ベンチマークのスコアが本番環境での性能を予測できるのは、次の3つの条件が満たされる場合のみです。

  • 貴社のタスクと類似したタスクをテストしていること。
  • テストセットがデータ汚染から解放されていること――一部のベンチマークでは、リーク率が100%にも達することが示されています。
  • スコアの差が統計的に有意であること。

ほとんどのエンタープライズ導入では、これらの条件のいずれも成立しません。自社のデータでテストすると、ランキングが完全に逆転することがあります――公開リーダーボードで3位のモデルが、実際の抽出タスクでは1位を40%上回ることがあるのです。これこそがカスタム評価ハーネスが浮き彫りにするために作られたギャップであり、だからこそ次の問いに答えるには 「私のデータ、私のエッジケース、私のコスト制約のもとで、どのモデルが最も優れた性能を発揮するのか?」 貴社の運用環境向けに設計された評価インフラが必要になるのです。

厳密な評価プログラムを構成する3つのレイヤー

私たちは評価を3つのレイヤーを軸に構成し、それぞれがAIシステムに関する異なる問いに答えます。

能力評価――必要なことを実行できるか?

私たちは、都合のよいサンプルではなく、貴社の本番データと現実的なエッジケースからタスク特化型のテストスイートを構築します。引受(アンダーライティング)モデルであれば、それは実際に否認された申請、境界事例、そして貴社のパイプラインが遭遇する特定の文書フォーマットでテストすることを意味します。

すべてのテストケースは、収集方法論とアノテーション品質指標とともに文書化されます。私たちは統計的な厳密さをもって測定します――異なるシードによる複数回の実行、ブートストラップ信頼区間、対応のある有意性検定です。信頼区間の範囲内に収まる2%の改善は、改善ではありません。

安全性評価――どこで、どれほどひどく失敗するのか?

私たちは、体系的なプローブを用いて挙動の境界をテストします――最小機能テスト、不変性テスト(変わるべきでないときに出力が変わらないか?)、方向性期待テストです。分割評価は、運用上関連するあらゆるデータスライスにわたって性能を報告します。なぜなら、平均では機能しても重要なサブ集団で失敗するモデルは、導入するのに安全ではないからです。詳しくは次をご覧ください。 まれではあるが破滅的な失敗率を軽視できない理由に関する私たちの研究

敵対的評価――誤動作を引き起こすことは可能か?

このレイヤーは、誰かがシステムに、してはならないことをさせられるかどうかを問います。これがレッドチーミングの領域です。

体系的な能力評価としてのレッドチーミング

レッドチーミングは、名前を変えたペネトレーションテストではありません。セキュリティ評価は「攻撃者はこのシステムを侵害できるか?」を問います。評価の文脈におけるレッドチーミングは「このシステムの挙動の境界はどこにあり、その境界はどこで破綻するのか?」を問います。方法論は重なりますが、問い、報告、そして対象読者は異なります。

私たちは次に基づいて構築された体系的な方法論のもとで活動します。 NIST AI 100-2 E2025 分類体系。これは2025年3月に大幅に拡張され、自律型AIエージェントの脆弱性と生成AI特有の攻撃カテゴリを網羅するようになりました。私たちのレッドチームプログラムは、定義された手順に従います。

  1. 貴社の運用環境の文脈に合わせて範囲を定めた脅威モデルの定義。
  2. OWASP LLM Top 10 v2のカテゴリを網羅する攻撃分類の列挙――プロンプトインジェクション、ジェイルブレイク、データポイズニング、取得コンテンツを介した間接インジェクション、マルチモーダル攻撃、エンコーディングベースの回避。
  3. 文書化された手順に基づく体系的な攻撃実行。
  4. 再現手順を伴う、重大度評価付きの調査結果。

人手によるレッドチーミングと自動化されたレッドチーミング

私たちは人手によるレッドチーミングを、自動化された敵対的パイプラインで補完します。Haize LabsのCascadeは、フロンティアモデルに対して44%の攻撃成功率を達成しており、これはシングルターンのベースラインの4倍です。Promptfooは、30万件以上の開発者インストール環境にわたって、CI/CDで50種類以上の脆弱性タイプを実行します。自動化ツールは既知のパターンを大規模に捕捉します。人間のレッドチーマーは、自動化システムが一度も見たことのない新規の脆弱性を発見します――そしてそれは、見逃された失敗モードの結果が深刻な場面で最も重要になります。

すべてのエンゲージメントで提供されるもの

すべてのレッドチームエンゲージメントは、3つの成果物を生み出すよう範囲が定められています。

  • 重大度評価と再現手順を伴う調査結果レポート。
  • 貴社のアーキテクチャに対応づけた是正勧告。
  • 発見された脆弱性から導き出され、貴社の導入パイプラインに統合される自動化された回帰テストスイート。これにより、発見された弱点が修正された状態を維持します。

自動評価が機能する場合――そして機能しない場合

LLM-as-judge(LLMを審査者として用いる)評価――フロンティアモデルを使って別のモデルの出力を採点する手法――は、大規模な人手評価を賄えないチームにとってのデフォルトとなりました。これは有用です。しかし、特定の、文書化された形で信頼性に欠けることもあります。研究は、LLM審査者に12種類以上の明確なバイアスタイプを特定しています。

  • 自己選好バイアス ――GPT-4は、自らが生成したかどうかにかかわらず、パープレキシティの低い出力をより高く評価します。
  • 冗長性バイアス ――審査者は一貫して、簡潔で正しい応答よりも、冗長で形式的な応答を好みます。
  • 位置バイアス ――審査者は、どちらであれ最初に現れる応答を優遇します。

これらのバイアスは、位置のランダム化や複数審査者パネルといった脱バイアス技術を用いれば、一般的な品質比較においては管理可能です。しかし、ドメイン特化型の正確性が重要となる場合には、これらは失格要因となります。LLM審査者は、臨床システムが薬物相互作用を正しく特定しているかどうか、あるいは法務調査が判例法を正確に引用しているかどうかを、確実に評価することはできません。私たちは、バイアスが管理可能な場面では自動採点を用い、正確性にドメイン知識が求められる場面では人間の専門家によるレビューを用います。

エージェント型AIシステムの評価

静的なモデルベンチマークは、計画を立て、ツールを使い、複数ステップのワークフローを実行するエージェントには機能しません。単一の精度の数値では、エージェントが正しいツールを選択したか、正しいパラメータで呼び出したか、あるステップが失敗したときに適切に回復したか、あるいは15の連鎖した操作にわたって一貫した結果を生み出したかを捉えることはできません。エージェントは個々のステップをすべて正しく実行しても、それらのステップをつなぐ推論に欠陥があったために、なお誤った結果を生み出すことがあります。

私たちはCLEARフレームワークから導かれた5つの次元にわたってエージェント型システムを評価します。

  • コスト ――ツールとトークン使用の効率性。
  • レイテンシ ――タスク完了全体にわたる。
  • 有効性 ――エンドツーエンドのタスク成功の。
  • 保証 ――安全性の制約が実行全体を通じて維持されたこと。
  • 信頼性 ――繰り返しの実行にわたる。

ツールを使用するエージェントについては、ツール選択の正確性、パラメータの正しさ(エージェントは意味のある頻度でパラメータ名を捏造します)、範囲の遵守、エラー回復もテストします。マルチエージェントシステムについては、エージェント間通信の忠実性、連鎖的な障害の伝播、そして下位エージェントが逸脱したときに監督者の制御が実際に介入するかどうかをテストします。

ベンチマークは追いつきつつあります――SWE-benchは実際のソフトウェアエンジニアリングタスクをテストし、Terminal-Benchはコマンドラインエージェントのワークフローを評価し、UpBenchは継続的に更新される実際のUpworkの求人情報を使用します。しかし、既製のエージェント型ベンチマークが貴社の特定のエージェントアーキテクチャ、ツールセット、ドメインに合致することはめったにありません。だからこそ私たちはカスタムのエージェント型評価ハーネスを構築します――なぜなら、貴社のエージェントの失敗モードは、その設計に固有のものだからです。

EU AI法および規制コンプライアンスのための評価

その EU AI法の 高リスク規定は完全に施行されます 2026年8月2日に。第9条は、文書化された評価方法論を備えたリスク管理システム、意図された使用条件および合理的に予見可能な誤用条件下でのテスト、そして継続的な市販後モニタリングを要求しています。適合性評価は、高リスクシステムをEU市場に投入する前に完了しなければなりません。不遵守には、全世界年間売上高の最大7%、または3,500万ユーロの罰金が科されます。

NIST AI 100-2 E2025は、権威ある敵対的評価分類体系を提供しており、現在では2023年版には存在しなかった自律型エージェントの脆弱性も網羅しています。これらのフレームワークは、調達要件や取締役会レベルのリスクレビューに登場するようになっています。

実務上の課題は、EU AI法コンプライアンスにおける「適切な評価」をまだ定義する調和規格が存在しないことです。CEN/CENELEC JTC 21は2025年8月の期限に間に合わず、2026年第4四半期を目標としています。私たちは、まだ最終化されていない規格への適応性を保ちつつ、今すぐ弁護可能な証拠を生み出す評価プログラムを設計します――このアプローチは次の中で詳述しています。 エンタープライズ生成AIにおけるアーキテクチャの整合性と規制上の説明責任に関する私たちのホワイトペーパー

本番環境における継続的な評価

導入前の評価は、特定の日付に特定のテストセットに対してシステムが機能したことを教えてくれます。しかし、翌月については何も教えてくれません。本番環境のモデルはドリフトし、入力分布は変化し、取得されるコンテンツは変わり、ツールAPIは更新されます。2025年のLLMOpsレポートは、6か月間変更されなかったモデルが、新しいデータに対してエラー率が35%上昇したことを明らかにしました。Gartnerは、2025年時点でAI評価・可観測性プラットフォームを採用したソフトウェアエンジニアリングチームはわずか18%であると推定していますが、2028年までに60%の採用に達すると予測しています。

私たちは継続的に実行される評価パイプラインを構築します。

  • 本番モニタリングは、開発段階と同じ評価器を用いてライブトラフィックを採点します。
  • 失敗した評価はCI/CDの回帰テストになります。
  • ドリフト検出は、入力分布がベースラインから乖離したときにアラートを発します。
  • 敵対的スイートは、本番エンドポイントに対して毎晩実行されます。

これは、貴社のシステムの進化に合わせて評価を最新の状態に保つ運用インフラです。

評価ツールの全体像

市場は断片化しており、各ツールには盲点があります。私たちは各ツールを適した場面で用い、いずれのツールも届かない場面ではカスタムハーネスを構築します。

ツール 強み 盲点
Stanford HELM 精度、キャリブレーション、頑健性、公平性、バイアス、有害性、効率性にわたって評価する 高速な反復には重量級すぎる
UK AI Security Institute Inspect 100種類以上の事前構築済み評価、エージェントテスト用のControlArenaを備える フロンティアモデルの安全性に偏っている
Promptfoo (現在はOpenAI傘下、30万人以上の開発者) 評価とレッドチーミングをCI/CDに統合する ドメイン特化型の方法論に関しては浅い
Patronus AI 敵対的テストケースを大規模に生成する 人手によるレッドチーミングを代替するものではない

重要なポイント

  • 飽和した公開ベンチマーク(フロンティアモデルはMMLUで88%超)が本番性能を予測できるのは、タスクが合致し、テストセットが汚染されておらず、スコアの差が統計的に有意である場合のみです――エンタープライズ導入ではめったに当てはまりません。
  • 厳密なプログラムは3つのレイヤー――能力、安全性、敵対的(レッドチーミング)――にまたがり、単一の精度の数値ではなく統計的な厳密さをもって測定されます。
  • レッドチーミングは体系的な挙動境界の評価であり、ペネトレーションテストではありません。自動化されたパイプラインが既知のパターンを大規模にカバーする一方で、人間の専門家は新規で結果の重大な失敗を発見します。
  • エージェント型システムには多次元評価(CLEARフレームワーク)が必要です。なぜなら、一見正しく見えるエージェントでも、ステップ間の推論に欠陥があれば依然として失敗しうるからです。
  • EU AI法(高リスクの完全施行は2026年8月2日、罰金は売上高の最大7%または3,500万ユーロ)とNIST AI 100-2 E2025は、弁護可能で継続的な評価を、一度きりのゲートではなくコンプライアンス要件としています。
FAQ

よくあるご質問

AI評価とレッドチーミングの費用はどのくらいかかりますか?

費用は範囲によって異なります。プラットフォームツールを用いた自動レッドチーミングスキャンは、モデル1つあたり5,000ドル〜10,000ドルで実施されます。自動テストと人手主導テストを組み合わせて複数のモデルを対象とする標準的な評価は、10,000ドル〜20,000ドルです。カスタム評価ハーネスの設計、ドメイン特化型ベンチマーキング、包括的なレッドチーミングを含む詳細なエンゲージメントは、25,000ドルから120,000ドル超に及びます。最大の費用要因はベンダーではなく、何をテストするかです。単一のチャットボットと、15のツール統合を備えたマルチエージェントオーケストレーションシステムとでは、評価対象の面積が根本的に異なります。私たちは一律料金ではなく、貴社のアーキテクチャとリスクプロファイルに基づいて範囲を定めます。

なぜ公開AIベンチマークは本番性能を予測できないのですか?

理由は3つあります。第一に、ベンチマークの飽和です。フロンティアモデルはMMLUで88%を超える領域に密集しており、差は統計的なノイズの範囲内に収まっています。Vellumの2025年リーダーボードは、時代遅れとしてMMLUを完全に除外しました。第二に、データ汚染です。一部のベンチマークではリーク率が100%にも達し(QuixBugs)、モデルがトレーニング中にテストの答えを記憶してしまった可能性があることを意味します。第三に、タスクの不一致です。標準化されたベンチマークは汎用的な能力をテストするのであって、貴社の導入が必要とする特定の抽出、分類、推論のタスクをテストするものではありません。私たちは、貴社の実際の本番データとエッジケースに対してテストするカスタム評価ハーネスを構築します。

人間のレッドチーマーは必要ですか、それとも自動化ツールでAI評価に対応できますか?

両方が必要です。PromptfooやHaize LabsのCascadeシステムのような自動化ツールは、既知の攻撃パターンを大規模に実行し、Cascadeはフロンティアモデルに対して44%の攻撃成功率を達成しています。しかし自動化システムは、生成するようプログラムされたパターンに限定されます。最も損害の大きい脆弱性、特にヘルスケア、法務、金融のような規制領域における脆弱性は、攻撃方法論とドメイン上の帰結の両方を理解する人間の専門家によって発見されます。私たちのアプローチは、広範なカバレッジのための自動化された敵対的パイプラインと、深度のための体系的な人手によるレッドチーミングを組み合わせ、その後すべての調査結果を継続的なモニタリングのための自動化された回帰スイートに変換します。

EU AI法コンプライアンスにはどのようなAI評価が必要ですか?

EU AI法は、高リスクAIシステムに対して市場投入前に適合性評価を完了することを要求しており、完全なコンプライアンスは2026年8月2日までに求められます。第9条は、意図された使用条件および合理的に予見可能な誤用条件下での文書化された評価を備えたリスク管理システムに加えて、継続的な市販後モニタリングを義務づけています。実務上の課題は、適切な評価とは何かを定義するCEN/CENELECの調和技術規格が、当初の期限に間に合わず2026年第4四半期を目標としていることです。私たちは、現行の規制上の期待を満たしつつ、まだ最終化されていない規格に適応する評価プログラムを設計します。不遵守には、全世界年間売上高の最大7%、または3,500万ユーロの罰金が科されます。

ツールを使用し複数ステップの判断を下すAIエージェントは、どのように評価すればよいですか?

静的なモデルベンチマークは、エージェント型システムには機能しません。単一の精度の数値では、ツール選択の正しさ、パラメータの妥当性(エージェントは意味のある頻度でパラメータ名を捏造します)、エラー回復、あるいは連鎖した操作にわたる連鎖的な障害を捉えることはできません。私たちはエージェントを5つの次元にわたって評価します。ツールとトークン使用のコスト効率性、タスク完了全体にわたるレイテンシ、エンドツーエンドの成功の有効性、安全性の制約が全体を通じて維持された保証、そして繰り返しの実行にわたる信頼性です。既製のエージェントベンチマーク(SWE-bench、Terminal-Bench、UpBench)が貴社の特定のアーキテクチャに合致することはめったにないため、私たちは貴社のエージェントの実際の失敗モードをテストするカスタムのエージェント型評価ハーネスを構築します。

LLM-as-judge評価はいつ信頼でき、いつ人間のレビュアーを使うべきですか?

研究は、LLM審査者に12種類以上の明確なバイアスタイプを文書化しています。これには、自己選好バイアス(GPT-4は出所にかかわらずパープレキシティの低い出力をより高く評価する)、冗長性バイアス(簡潔で正しい応答よりも長い応答を好む)、位置バイアス(どちらであれ最初に現れる応答を優遇する)が含まれます。順序のランダム化や複数審査者パネルのような脱バイアス技術を用いれば、LLM-as-judgeは一般的な品質比較において方向性として有用です。しかし、ドメイン特化型の事実的正確性については信頼できません。LLM審査者は、臨床意思決定支援システムが薬物相互作用を正しく特定しているかどうか、あるいは法務調査が判例法を正確に引用しているかどうかを、確実に評価することはできません。私たちは、バイアスが管理可能な場面では自動採点を用い、正確性にドメイン知識が求められる場面では人間の専門家によるレビューを用いる評価プロトコルを設計します。

本番環境で継続的なAI評価をどのように構築すればよいですか?

2025年のLLMOpsレポートは、6か月間変更されなかったモデルが、新しいデータに対してエラー率が35%跳ね上がったことを明らかにしました。2025年時点でAI評価プラットフォームを採用したエンジニアリングチームはわずか18%でした。私たちは、導入前テストと同じ評価器を用いてライブの本番トラフィックを採点し、本番エンドポイントに対して敵対的回帰スイートを毎晩実行し、入力分布が評価ベースラインから乖離したときにドリフトを検出し、失敗したすべての評価をCI/CDの回帰テストに変換する、継続的な評価インフラを構築します。これにより、ユーザーが遭遇する前に品質と安全性の低下を捕捉し、評価を一度きりのゲートから継続的な運用インフラへと転換します。

AIセキュリティテストとAI評価ベンチマーキングの違いは何ですか?

セキュリティテストは、攻撃者が貴社のシステムを侵害できるかどうかを問います。モデル抽出、サプライチェーンのポイズニング、ツールの悪用による権限昇格などです。これは脆弱性レポートと堅牢化の勧告を生み出します。評価ベンチマーキングは、貴社のシステムが意図された目的に対して正しく機能するかどうかを問います。貴社のエッジケースに対応できるか、サブ集団にわたって一貫して機能するか、分布シフトのもとで緩やかに劣化するか、といった問いです。レッドチーミングはその交差点に位置し、失敗モードを見つけるために挙動の境界を探ります。私たちは評価とベンチマーキングの側面に注力し、貴社のAIシステムが目的に適合しているかどうかを教える測定インフラを構築します。攻撃に焦点を当てたセキュリティ評価と堅牢化については、当社のセキュリティ評価・堅牢化サービスをご覧ください。

どのAI評価フレームワークを使うべきですか――HELM、Inspect、それともPromptfoo?

これらは異なる問題を解決します。StanfordのHELMは、精度、キャリブレーション、頑健性、公平性、バイアス、有害性、効率性にわたる包括的な評価を提供し、網羅的なモデル比較に最適です。UK AI Security InstituteのInspectは、エージェント制御テスト用のControlArenaを備えた100種類以上の事前構築済み評価を提供し、安全性に焦点を当てたフロンティアモデルの評価に強みがあります。Promptfoo(現在はOpenAI傘下、30万人以上の開発者)は、50種類以上の脆弱性タイプとともに評価とレッドチーミングをCI/CDに統合し、開発者ワークフローへの統合に最適です。すべてを網羅するものはありません。HELMは高速な反復には重量級すぎます。Inspectはフロンティアモデルの安全性に偏っています。Promptfooはドメイン特化型の方法論に関しては浅いです。私たちは各ツールを適した場面で用い、いずれのツールも届かない場面ではカスタムハーネスを構築します。

確かな信頼のもとに、AIを構築する。

次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。

Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。