AI 评估、基准测试与红队演练

我们设计评估框架、领域专属基准测试以及结构化的红队演练项目,用以衡量 AI 系统是否真正适用于你的使用场景。

公开的基准测试分数几乎无法告诉你一个 AI 系统在你的实际部署中会表现如何。我们设计评估框架、领域专属基准测试以及结构化的红队演练项目,用以衡量 AI 系统是否真正适用于你的使用场景——对照你的数据、你的边缘案例,以及你的成本与安全约束。

为什么公开基准测试无法反映你的部署

前沿模型在 MMLU 上普遍聚集于 88% 以上。GPT-5.3 Codex 得分 99%。Vellum 的 2025 年 LLM 排行榜已彻底弃用 MMLU,因为它已无法在任何有意义的层面上区分模型。旨在解决这一问题的 MMLU-Pro,对前沿模型而言也已逼近 90%。业界引用最多的基准测试已沦为虚荣指标。

更深层的问题在于相关性。基准测试分数只有在满足以下三个条件时,才能预测生产环境的表现:

  • 它测试的任务与你的任务相似。
  • 测试集不存在数据污染——某些基准测试的数据泄漏比例高达 100%。
  • 分数差异具有统计显著性。

对于大多数企业部署而言,这些条件无一成立。一旦你在自己的数据上进行测试,排名可能完全反转——公开排行榜上排名第 3 的模型,在真实的信息抽取任务上可能以 40% 的优势胜过第 1。这正是定制评估框架旨在揭示的那种差距,也正因如此,要回答 “在我的数据、我的边缘案例、我的成本约束下,哪个模型表现最佳?” 就需要专为你的部署而设计的评估基础设施。

严谨评估项目的三个层次

我们围绕三个层次来构建评估,每个层次回答关于你的 AI 系统的一个不同问题。

能力评估——它能否完成我们需要的任务?

我们从你的生产数据和真实的边缘案例(而非便利样本)中构建任务专属的测试套件。对于一个核保模型,这意味着在实际被拒的申请、临界案例以及你的流程所遇到的特定文档格式上进行测试。

每个测试用例都记录了采集方法和标注质量指标。我们以统计学上的严谨性进行衡量——采用不同随机种子的多次运行、自助法置信区间以及配对显著性检验。落在置信区间之内的 2% 提升并不算提升。

安全评估——它在哪里失效,失效有多严重?

我们使用结构化探针来测试行为边界:最小功能测试、不变性测试(输出在不应改变时是否发生了改变?)以及方向性预期测试。分层评估会报告模型在每一个具有运营相关性的数据切片上的表现,因为一个平均表现良好、却在关键子群体上失效的模型,是不安全的、不宜部署的,具体阐述见 我们关于为何不能忽视罕见但灾难性失效率的研究

对抗评估——它能否被诱导做出不当行为?

这一层次探究的是:是否有人能让系统做出它本不应做的事。红队演练正处于这一层次。

作为结构化能力评估的红队演练

红队演练并非换了个名字的渗透测试。安全评估问的是“攻击者能否攻破这个系统?”而评估语境下的红队演练问的是“这个系统的行为边界在哪里,这些边界又在何处崩溃?”两者的方法有所重叠,但问题、报告以及受众各不相同。

我们的工作遵循一套结构化方法论,其构建基础是 NIST AI 100-2 E2025 分类体系,该体系于 2025 年 3 月大幅扩展,以涵盖自主 AI 智能体漏洞和生成式 AI 特有的攻击类别。我们的红队项目遵循既定的流程:

  1. 针对你的部署语境界定威胁模型范围。
  2. 攻击分类枚举,涵盖 OWASP LLM Top 10 v2 的各个类别——提示注入、越狱、数据投毒、通过检索内容进行的间接注入、多模态攻击以及基于编码的规避。
  3. 按照记录在案的程序系统性地执行攻击。
  4. 带有严重程度评级和复现步骤的发现。

人工与自动化红队演练

我们以自动化对抗流程作为人工红队演练的补充。Haize Labs 的 Cascade 在前沿模型上实现了 44% 的攻击成功率,是单轮基线的 4 倍。Promptfoo 在 CI/CD 中运行 50 多种漏洞类型,覆盖 30 万多个开发者安装量。自动化工具能大规模捕捉已知模式;人工红队人员则能发现自动化系统从未见过的新型漏洞——在遗漏某种失效模式后果严重的场景中,这一点至关重要。

每次合作交付什么

每次红队合作都以产出三项交付物为目标:

  • 一份带有严重程度评级和复现程序的发现报告。
  • 映射到你的架构的补救建议。
  • 一套由所发现漏洞衍生的自动化回归测试套件,可集成到你的部署流程中,从而确保已发现的弱点持续得到修复。

自动化评估何时有效——何时无效

LLM 充当评委的评估——即使用一个前沿模型为另一个模型的输出打分——已成为无力承担大规模人工评估的团队的默认做法。它很有用,但也在若干特定且有据可查的方面并不可靠。研究已识别出 LLM 评委中 12 种以上截然不同的偏差类型:

  • 自我偏好偏差 ——GPT-4 会给困惑度更低的输出打更高的分,无论这些输出是否由它自己生成。
  • 冗长偏差 ——评委始终偏爱冗长、正式的回答,胜过简洁而正确的回答。
  • 位置偏差 ——评委偏向于最先出现的那个回答。

对于一般性的质量比较,借助随机化位置和多评委组等去偏差技术,这些偏差是可以管理的。但当领域专属的正确性至关重要时,它们就成了致命缺陷。LLM 评委无法可靠地判断一个临床系统是否正确识别了药物相互作用,也无法判断法律研究是否准确引用了判例法。我们在偏差可管理之处使用自动化评分,而在正确性需要领域知识之处采用人工专家评审。

评估智能体式 AI 系统

静态的模型基准测试对于那些会规划、使用工具并执行多步骤工作流的智能体并不奏效。单一的准确率数字无法反映智能体是否选对了工具、是否以正确的参数进行了调用、是否在某一步失败时得以从容恢复,或者是否在 15 个链式操作中始终产出连贯的结果。一个智能体可能正确执行了每一个单独步骤,却仍因连接这些步骤的推理存在缺陷而产出错误结果。

我们从 CLEAR 框架出发,跨五个维度评估智能体式系统:

  • 成本 ——工具与令牌使用的效率。
  • 延迟 ——贯穿整个任务完成过程。
  • 有效性 ——端到端任务成功的有效性。
  • 保障 ——确保安全约束在整个执行过程中始终得到维持。
  • 可靠性 ——跨多次重复运行的可靠性。

对于使用工具的智能体,我们还会测试工具选择的准确性、参数的正确性(智能体会以不可忽视的频率捏造参数名称)、范围遵循度以及错误恢复能力。对于多智能体系统,我们会测试智能体间通信的保真度、级联失效的传播,以及当下级智能体偏离时监管控制是否真的会介入。

基准测试正在迎头赶上——SWE-bench 测试真实的软件工程任务,Terminal-Bench 评估命令行智能体工作流,UpBench 则使用持续刷新的真实 Upwork 招聘岗位。但现成的智能体式基准测试很少能匹配你特定的智能体架构、工具集和领域,因此我们构建定制的智能体式评估框架——因为你的智能体的失效模式是其设计所特有的。

面向欧盟《AI 法案》与合规的评估

欧盟《AI 法案》的 高风险条款将全面生效 2026 年 8 月 2 日。第 9 条要求建立风险管理系统,配备记录在案的评估方法,在预期用途及合理可预见的误用条件下进行测试,并开展持续的上市后监测。在将高风险系统投放欧盟市场之前,必须完成合格评定。违规将面临最高相当于全球年营业额 7% 或 3500 万欧元的罚款。

NIST AI 100-2 E2025 提供了权威的对抗评估分类体系,如今涵盖了 2023 年版本所缺失的自主智能体漏洞。这些框架正出现在采购要求和董事会层面的风险审查之中。

现实的挑战在于:目前尚无统一标准界定欧盟《AI 法案》合规意义上的“充分评估”。CEN/CENELEC JTC 21 已错过其 2025 年 8 月的截止期限,目标改为 2026 年第四季度。我们设计的评估项目既能在当下产出可辩护的证据,又能对仍在最终敲定中的标准保持适应性——这一方法我们在 我们关于企业级生成式 AI 中架构完整性与监管问责的白皮书中作了阐述。

生产环境中的持续评估

部署前的一次评估只能告诉你,系统在某个特定日期、针对某个特定测试集是有效的。它无法告诉你下个月的情况。生产模型会漂移,输入分布会变化,检索内容会改变,工具 API 会更新。2025 年一份 LLMOps 报告发现,六个月保持不变的模型在新数据上的错误率上升了 35%。Gartner 估计,截至 2025 年只有 18% 的软件工程团队采用了 AI 评估与可观测性平台,不过其预测到 2028 年采用率将达 60%。

我们构建持续运行的评估流程:

  • 生产环境监测使用与开发阶段相同的评估器为实时流量打分。
  • 失败的评估会转化为 CI/CD 回归测试。
  • 当输入分布偏离基线时,漂移检测会发出告警。
  • 对抗测试套件每晚针对生产端点运行。

这是一套运营基础设施,能在你的系统不断演进的同时使评估始终保持最新。

评估工具生态全景

市场是碎片化的,每种工具都有其盲点。我们在每种工具适用之处加以使用,并在没有一种工具能触及之处构建定制框架。

工具 优势 盲点
斯坦福 HELM 跨准确率、校准度、鲁棒性、公平性、偏差、毒性与效率进行评估 对于快速迭代而言过于笨重
英国 AI 安全研究所 Inspect 100 多个预置评估,并配有用于智能体测试的 ControlArena 偏向于前沿模型安全
Promptfoo (现归 OpenAI 所有,30 万多名开发者) 将评估与红队演练集成进 CI/CD 在领域专属方法论上较为浅显
Patronus AI 大规模生成对抗测试用例 无法替代人工红队演练

关键要点

  • 已趋饱和的公开基准测试(前沿模型在 MMLU 上超过 88%)只有在任务相匹配、测试集无污染且分数差距具有统计显著性时,才能预测生产环境的表现——而这对企业部署而言鲜少成立。
  • 一个严谨的项目跨越三个层次——能力、安全与对抗(红队演练)——并以统计学上的严谨性来衡量,而非单一的准确率数字。
  • 红队演练是结构化的行为边界评估,而非渗透测试;自动化流程大规模覆盖已知模式,而人工专家则能发现新型的、高后果的失效。
  • 智能体式系统需要多维度评估(CLEAR 框架),因为一个看似正确的智能体仍可能因跨步骤推理存在缺陷而失败。
  • 欧盟《AI 法案》(高风险条款于 2026 年 8 月 2 日全面生效;罚款最高相当于营业额的 7% 或 3500 万欧元)与 NIST AI 100-2 E2025 使可辩护的持续评估成为一项合规要求,而非一次性的门槛。
常见问题

常见问题解答

AI 评估与红队演练的成本是多少?

成本因范围而异。使用平台工具进行的自动化红队扫描,每个模型的费用在 5,000 至 10,000 美元之间。一次涵盖多个模型、结合自动化与人工主导测试的标准评估,费用在 10,000 至 20,000 美元之间。包含定制评估框架设计、领域专属基准测试和全面红队演练的深度合作,费用从 25,000 美元到 120,000 美元以上不等。最大的成本驱动因素不是供应商,而是你所测试的对象:一个单一的聊天机器人,与一个集成了 15 个工具的多智能体编排系统,是根本不同的评估面。我们根据你的架构和风险状况来界定范围,而非采用统一定价。

为什么公开的 AI 基准测试无法预测生产环境的表现?

有三个原因。第一,基准测试饱和:前沿模型在 MMLU 上普遍聚集于 88% 以上,彼此差异落在统计噪声之内。Vellum 的 2025 年排行榜已将 MMLU 作为过时指标彻底弃用。第二,数据污染:某些基准测试的数据泄漏比例高达 100%(QuixBugs),这意味着模型可能在训练期间记住了测试答案。第三,任务不匹配:标准化基准测试考察的是通用能力,而非你的部署所需要的特定抽取、分类或推理任务。我们构建定制评估框架,对照你实际的生产数据和边缘案例进行测试。

我们需要人工红队人员,还是自动化工具就能胜任 AI 评估?

两者都需要。像 Promptfoo 和 Haize Labs 的 Cascade 这类自动化工具能大规模运行已知的攻击模式,其中 Cascade 在前沿模型上实现了 44% 的攻击成功率。但自动化系统受限于它们被编程去生成的那些模式。最具破坏性的漏洞,尤其是在医疗、法律和金融等受监管领域,往往由既了解攻击方法论又理解领域后果的人工专家发现。我们的方法将用于广泛覆盖的自动化对抗流程与用于深度挖掘的结构化人工红队演练相结合,然后将所有发现转化为用于持续监测的自动化回归套件。

欧盟《AI 法案》合规需要何种 AI 评估?

欧盟《AI 法案》要求高风险 AI 系统在投放市场前完成合格评定,并须在 2026 年 8 月 2 日之前实现全面合规。第 9 条要求建立风险管理系统,配备记录在案的评估,在预期用途及合理可预见的误用条件下进行,同时开展持续的上市后监测。现实的挑战在于,CEN/CENELEC 制定的、界定何为充分评估的统一技术标准,在错过原定截止期限后目标改为 2026 年第四季度。我们设计的评估项目既满足当前的监管期望,又能适应仍在最终敲定中的标准。违规将面临最高相当于全球年营业额 7% 或 3500 万欧元的罚款。

我们如何评估那些使用工具并进行多步骤决策的 AI 智能体?

静态的模型基准测试对智能体式系统并不奏效。单一的准确率数字无法反映工具选择的正确性、参数的有效性(智能体会以不可忽视的频率捏造参数名称)、错误恢复能力,或跨链式操作的级联失效。我们跨五个维度评估智能体:工具与令牌使用的成本效率、贯穿整个任务完成过程的延迟、端到端成功的有效性、安全约束在整个过程中始终得到维持的保障,以及跨多次重复运行的可靠性。现成的智能体基准测试(SWE-bench、Terminal-Bench、UpBench)很少能匹配你特定的架构,因此我们构建定制的智能体式评估框架,以测试你的智能体实际的失效模式。

我们何时可以信赖 LLM 充当评委的评估,何时又应当使用人工评审员?

研究已记录了 LLM 评委中 12 种以上截然不同的偏差类型,包括自我偏好偏差(GPT-4 会给困惑度更低的输出打更高的分,而无论其来源)、冗长偏差(偏爱较长的回答,胜过简洁而正确的回答)以及位置偏差(偏向于最先出现的那个回答)。借助随机化排序和多评委组等去偏差技术,LLM 充当评委在一般性质量比较上具有方向性的参考价值。但它在领域专属的事实准确性上并不可靠:LLM 评委无法可靠地判断一个临床决策支持系统是否正确识别了药物相互作用,也无法判断法律研究是否准确引用了判例法。我们设计的评估协议,在偏差可管理之处使用自动化评分,而在正确性需要领域知识之处采用人工专家评审。

我们如何在生产环境中建立持续的 AI 评估?

2025 年一份 LLMOps 报告发现,六个月保持不变的模型在新数据上的错误率骤升 35%。截至 2025 年,只有 18% 的工程团队采用了 AI 评估平台。我们构建持续评估基础设施,使用与部署前测试相同的评估器为实时生产流量打分,每晚针对生产端点运行对抗回归套件,在输入分布偏离评估基线时检测漂移,并将每一次失败的评估转化为 CI/CD 回归测试。这能在用户遇到质量与安全退化之前将其捕获,从而使评估从一次性门槛转变为持续的运营基础设施。

AI 安全测试与 AI 评估基准测试之间有何区别?

安全测试探究的是攻击者能否攻破你的系统:模型窃取、供应链投毒、通过工具滥用实现权限提升。它产出漏洞报告和加固建议。评估基准测试探究的是你的系统是否为其预期目的正确运作:它能否处理你的边缘案例,它在各子群体间的表现是否一致,它在分布偏移下是否会平缓退化?红队演练处于两者的交汇处,通过探查行为边界来发现失效模式。我们专注于评估与基准测试这一侧,构建能告诉你 AI 系统是否适合其目的的衡量基础设施。关于以攻击为核心的安全评估与加固,请参阅我们的安全评估与加固服务。

我们应该使用哪种 AI 评估框架:HELM、Inspect 还是 Promptfoo?

它们解决的是不同的问题。斯坦福的 HELM 提供跨准确率、校准度、鲁棒性、公平性、偏差、毒性与效率的整体性评估,最适合全面的模型比较。英国 AI 安全研究所的 Inspect 提供 100 多个预置评估,并配有用于智能体控制测试的 ControlArena,在以安全为核心的前沿模型评估上表现出色。Promptfoo(现归 OpenAI 所有,30 万多名开发者)将评估与红队演练集成进 CI/CD,涵盖 50 多种漏洞类型,最适合开发者工作流集成。没有一种能覆盖全部。HELM 对于快速迭代而言过于笨重。Inspect 偏向于前沿模型安全。Promptfoo 在领域专属方法论上较为浅显。我们在每种工具适用之处加以使用,并在没有一种工具能触及之处构建定制框架。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。