安全评估与加固

我们像真实攻击者一样攻破 AI 系统,并针对评估发现的攻击路径进行系统加固,涵盖从模型提取到供应链失陷的全部风险。

我们的方法是像真实攻击者那样攻破 AI 系统,随后针对评估所发现的攻击路径进行系统加固——涵盖从模型提取到供应链失陷的各个环节。传统渗透测试覆盖了您的 API、基础设施和身份认证流程,但它从未测试攻击者是否能够窃取您的微调模型、在依赖链中植入后门或劫持您的 RAG 流水线。这种评估方法论必须专门针对 AI 系统的失效模式量身构建。

您的安全团队从未测试过的攻击面

传统渗透测试覆盖您的 API、基础设施及身份认证流程。但它并不测试攻击者是否能通过 50,000 次精心构造的查询提取您的微调模型。它无法检测是否存在被投毒的 LoRA 适配器 在三个月前潜入您的 HuggingFace 依赖链并植入后门。它不评估您的 RAG 流水线是否会执行嵌入在检索文档中的指令。这些才是在生产环境中切实致使 AI 系统失陷的攻击路径。

这些绝非会议演讲中的理论风险。Protect AI 发现了 51,700 个模型中的 352,000 个可疑文件 ,于 2025 年 4 月出现于 HuggingFace。AI 赋能的攻击同比增长了 89% year-over-year,其中 97% 的受害组织在其 AI 系统上缺乏基本的访问控制。而 Mercor 供应链攻击 在 2026 年初仅凭单个开源依赖项就致使数千家企业失陷。

我们实际测试的内容——以及大多数评估遗漏的盲区

我们围绕 MITRE ATLAS 框架构建评估体系,该框架现已收录 16 种战术下的 84 项技术 ,专门针对 AI 系统。但框架只是一张地图,而非一次实战测试。我们的方法论旨在真正执行其所收录的攻击手法,而绝非仅仅勾选清单。

大语言模型部署与提示词注入

我们通过每一条摄入路径测试间接提示词注入:RAG 检索、工具输出、用户上传文档以及输送给智能体的电子邮件内容。直接注入往往占据新闻头条,但 Anthropic 在 2026 年 2 月彻底放弃了直接注入指标 ,因为通过检索上下文进行的间接注入才是真正击垮生产系统的元凶。我们还测试多轮对话操纵、系统提示词提取,以及您现有的任何护栏技术栈的具体失效模式。

模型层安全

我们通过针对您的 API 发起结构化查询活动来评估模型提取风险,量化攻击者能够复现多少模型行为。我们通过基于梯度的方法(在拥有模型访问权限时)与基于迁移的黑盒攻击(真实攻击者的运作方式)全面评估对抗鲁棒性。我们审计您的训练流水线是否存在数据投毒漏洞,同时审查您的直接训练数据以及为其输送数据的上游依赖(详见 我们关于保护企业免受模型投毒侵害的研究)。

供应链完整性

我们将每个模型制品追溯至其源头:预训练权重、微调数据集、适配层以及推理服务框架版本。我们排查机器学习基础设施中的已知漏洞—— PyTorch、vLLM 和 Triton Inference Server 在 2025–2026 年均出现过 CVE ——并验证您的模型序列化是否采用安全格式。在 2025 年受害机器学习模型所导致的 $12 billion 损失中,绝大多数源自供应链攻击而非直接的模型漏洞利用(参见 我们关于保障机器学习供应链生命周期安全的研究)。

智能体系统

我们测试由 OWASP 智能体 AI Top 10 所定义的攻击面:目标劫持、工具滥用、身份冒用、记忆投毒以及跨多智能体工作流的级联失效。在 2026 年爆发的 OpenClaw 危机 中—— 21,000+ 个实例 (一个拥有 135,000 颗星标的 AI 智能体)暴露于严重漏洞之下——这一事件充分揭示了未经此类测试便交付智能体的严重后果(详见 我们关于保障人类与 AI 协作前沿安全的研究)。

真正重塑系统运行方式的加固实践

缺乏修复措施的评估只是一份昂贵的 PDF。我们的方法是将加固控制机制深度融入您的系统内部。

  • 推理层防御: 识别模型提取模式流量(系统性输入覆盖、边界探测及程序化释义扫描)并将其与合法使用区分开来的查询异常检测。输入验证流水线针对您的特定威胁模型量身调优,而非采用既遗漏语义攻击又误拦合法查询的通用正则表达式过滤器。
  • 供应链加固: 在任何模型制品进入部署流水线之前,核查制品来源溯源、校验序列化格式、扫描已知恶意模式并强制执行签名要求的模型验证流水线——辅以在受害上游依赖包触及生产环境前将其捕获的依赖监控。
  • 智能体系统加固: 围绕工具调用的特权边界、智能体各执行步骤之间的输出校验,以及在智能体的执行模式偏离其预期工作流时触发告警的行为监控。

您的 SIEM 专为检测人类行为异常而设计。一个连续执行 10,000 次查询 的智能体,即使正处于攻击者的控制之下,在这些系统看来依然完全正常。

何时您无需这项服务

如果您仅调用托管 API(OpenAI、Anthropic、Google),未进行微调、未构建 RAG、未使用工具且提示词中不含敏感数据,那么您的安全风险仅限于 API 密钥管理与数据处理。标准的应用安全审查足以覆盖这些场景——您无需进行专门针对 AI 的安全评估。

如果您的模型是仅在内网运行的简单分类器,既无对外暴露的 API,也无重新训练流水线,那么您的攻击面非常有限,简要的威胁模型审查便已足够。对防火墙内部的情感分类器开展全面的对抗鲁棒性测试,无异于花费 $30,000 去防范 $500 的风险

我们直言不讳,因为信誉远比营收更重要。真正需要这项工作的企业对此心知肚明:任何拥有微调模型、处理外部内容的 RAG 流水线、具备工具调用权限的智能体系统、受监管行业的模型,或作出关乎财务及人身安全决策的 AI 系统的组织。

监管压力切实存在且已设定明确截止期限

《欧盟 AI 法案》执法始于 2026 年 8 月。 高风险 AI 系统必须具备文档化的风险管理系统、技术鲁棒性测试以及数据治理控制措施。违规面临最高达 全球年营业额 7% 或 EUR 35 million的罚款。 NIST 于 2025 年 12 月发布了其 AI 网络安全框架配置文件,将 AI 特有风险映射至 CSF 2.0 控制项。这些框架目前已频繁出现在采购要求和董事会层面的风险审查中。

挑战在于没有任何单一框架能包罗万象。我们将您的评估结论精准映射至您的监管机构、审计师及客户所要求的任何框架——产出足以令合规要求信服的证据,因为这些证据源自扎实的实际测试,而非纸上谈兵的勾选敷衍。

框架提供的内容
MITRE ATLAS映射攻击技术
OWASP LLM Top 10归类漏洞类别
NIST AI RMF提供治理架构
ISO 42001规范管理体系
《欧盟 AI 法案》确立法律义务

自动化平台工具与定制化专业评估对比

自动化 AI 安全平台(HiddenLayer、Mindgard、Giskard)能够大规模运行已知的攻击模式。它们在完成初步评估后用于持续回归测试极具价值,但绝不能替代初步专业评估本身。自动化扫描器无法理解您的业务逻辑,不知道哪些模型输出会带来关乎安全关键的后果,也无法评估您的威胁模型是否契合真实的部署架构。

我们在能创造价值的环节使用这些工具。一旦我们确立了需要测试的具体目标,持续的自动化红队测试便应当纳入您的 CI/CD 流水线。但在您的特定系统中最为关键的攻击路径,仍需要既深刻理解 AI 失效模式又洞悉您业务上下文的专家才能真正发掘。

针对采用多家 AI 供应商(OpenAI、Anthropic、Google、开源模型)的企业,我们独立评估每家供应商的安全边界,并深入测试各模型间数据流动与交互的集成点。多供应商技术栈的攻击面绝非各供应商风险的简单叠加——而是体现在交互层,在向另一家供应商交接的节点上,对前一家安全保障的假设往往会彻底失效。

核心要点

  • AI 系统的失效模式是标准渗透测试从未涉足的领域——包括模型提取、投毒的 LoRA 适配器、间接提示词注入以及智能体目标劫持。
  • 我们横跨四个维度展开测试——大语言模型部署、模型层安全、供应链以及智能体系统——以 MITRE ATLAS(16 种战术、84 项技术)为结构基础,但由真实攻击手段驱动,而非纸面勾选。
  • 评估本身即包含修复:推理层、供应链与智能体加固直接构建于您的系统之内,而非仅仅交付一份 PDF 报告。
  • 我们将评估发现映射至 MITRE ATLAS、OWASP LLM Top 10、NIST AI RMF、ISO 42001 以及《欧盟 AI 法案》——后者执法始于 2026 年 8 月,最高可处以营业额 7% 或 EUR 35 million 的罚款。
  • 并非每项部署都需要这项服务。托管 API 与简单的内部分类器无需此项服务;微调模型、处理外部内容的 RAG、使用工具的智能体,以及受监管或关乎人身安全的 AI 系统则势在必行。

安全评估与加固

常见问题

常见问题解答

专门针对 AI 的安全评估费用是多少?

AI 安全评估费用通常在 $15,000(针对限定范围的大语言模型应用审查)到 $80,000+(覆盖模型层攻击、供应链审计和智能体系统测试的完整红队演练)之间。中型市场咨询顾问的费率为每天每人 $1,500-$3,500,而顶级专业咨询机构收费为每天 $4,000-$7,000。合适的范围取决于您的部署架构:未做微调的托管 API 调用所需的测试,远少于服务于具备工具访问权限的智能体工作流的微调模型。

AI 安全评估测试了哪些常规渗透测试未涵盖的内容?

传统渗透测试覆盖 API 端点、身份认证、基础设施和应用逻辑。AI 安全评估则增加了特定于模型的攻击向量:对抗性输入构造、通过结构化查询发起的模型提取、训练数据投毒检测、提示词注入(包括直接注入与通过 RAG 检索的间接注入)、模型制品的供应链完整性,以及针对智能体系统的目标劫持、工具滥用和通过多步骤工作流的特权提升。这些攻击路径需要标准渗透测试框架无法应对的机器学习专用方法论。

是否真有人能够通过 API 窃取我们的微调模型?

是的。模型提取攻击通过系统化查询来复现模型行为。对于微调分类器,数千次查询即可生成功能相当的副本。对于大语言模型,完全提取难度较高,但部分提取微调行为完全可行。爬虫级别的查询流量在 2025-2026 年达到了全球 API 流量的中位数 20%。防御手段包括超越简单速率限制的查询模式分析、提取模式的行为指纹识别以及水印技术,不过当前的水印方法可能通过输出释义改写被去除。

为了符合《欧盟 AI 法案》,我们需要进行 AI 安全测试吗?

如果您的 AI 系统在《欧盟 AI 法案》下被归类为高风险系统,那么答案是肯定的。第 15 条要求具备技术鲁棒性和网络安全措施,执法将于 2026 年 8 月开始,罚款最高可达全球年营业额的 7% 或 EUR 35 million。NIST 于 2025 年 12 月发布了其 AI 网络安全框架配置文件,将 AI 特有风险映射至 CSF 2.0 控制项,并日益被采购要求所引用。扎实的安全测试能够生成纸面勾选审计无法提供的合规证据,因为监管机构和法院看重的是控制措施是否经过真正测试,而非仅仅记录在册。

我们如何保护 RAG 流水线免受间接提示词注入攻击?

通过检索内容进行的间接提示词注入是生产环境中大语言模型最主要的攻击向量。Anthropic 在 2026 年 2 月彻底放弃了直接注入指标,因为间接注入是运营上更具实际威胁的隐患。防御需要分层控制:在上下文窗口中将检索内容与系统指令隔离开来、在检索内容送达主模型之前使用次级模型进行评估、捕获由检索触发的指令遵循行为的输出验证,以及对异常响应模式的持续监控。单一防御手段无法万无一失。提示词注入的成功率在 50-84% 之间(取决于系统配置),这正是深度防御成为唯一可行途径的原因。

我们应该遵循哪个 AI 安全框架:MITRE ATLAS、OWASP 还是 NIST AI RMF?

它们服务于不同目的,大多数组织需要兼顾这三者的要素。MITRE ATLAS(截至 2026 年 2 月收录了 16 种战术中的 84 项技术)映射了具体的攻击方法,是构建技术评估的理想框架。OWASP LLM Top 10 对漏洞类别进行了分类,指导应当测试哪些内容。NIST AI RMF 通过其治理(Govern)、映射(Map)、度量(Measure)、管理(Manage)支柱提供治理架构,并日益被用作采购标准。ISO 42001 负责管理体系认证。《欧盟 AI 法案》规定了具有截止期限的法律义务。我们将评估结论映射至您的监管机构、审计师和客户所要求的任何框架。

针对具备工具调用能力的智能体 AI,我们的 AI 安全评估应该涵盖哪些内容?

智能体 AI 引入了静态大语言模型测试完全遗漏的攻击面。OWASP 于 2025 年 12 月发布了《智能体应用 Top 10》,涵盖目标劫持、工具滥用、身份冒用、记忆投毒和级联失效。评估应测试攻击者是否能通过操纵输入改变智能体目标、将工具权限提升至预期范围之外、对持久化记忆投毒以影响未来行动,以及在多智能体工作流中引发连锁失效。您现有的 SIEM 和 EDR 工具旨在检测人类行为异常。一个连续运行 10,000 次查询的智能体,即使在攻击者控制之下,在这些系统看来依然完全正常。

我们如何验证来自 HuggingFace 的模型未被植入后门?

Protect AI 于 2025 年 4 月在 HuggingFace 上跨 51,700 个模型识别出 352,000 个可疑文件。验证工作需要检查序列化格式(优先使用 Safetensors 而非允许任意代码执行的 pickle)、扫描模型权重和配置文件中的已知恶意模式、通过签名和哈希校验验证溯源来源,并针对与后门激活相关的触发模式测试模型行为。恶意 LoRA 适配器是一个日益增长的威胁向量,因为它们体积极小且易于分发。供应链验证应当在您的模型部署流水线中自动执行,而非在下载时手动完成。

购买 AI 安全平台与聘请咨询专家之间有什么区别?

像 HiddenLayer、Mindgard 和 Giskard 这样的 AI 安全平台能够大规模自动化执行已知的攻击模式。它们对于 CI/CD 流水线中的持续回归测试非常有价值。但它们不能替代初步评估,因为它们无法理解您的业务上下文,无法评估哪些模型输出会带来关乎人身与业务安全的关键后果,也无法发掘针对您特定架构的全新攻击路径。正确的方法是双管齐下:由咨询专家发掘您的实际威胁面、明确关键重点并构建加固控制机制,随后利用平台工具对照评估所建立的基准进行持续的自动化测试。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。