面向风险与合规负责人4 分钟阅读

你的AI供应链是你尚未管理的最大安全风险

研究人员在主流公共中心发现了100多个武器化AI模型,而83%的企业毫无自动化防御能力。

问题所在

2024年2月,JFrog安全研究人员在最受欢迎的机器学习公共仓库之一Hugging Face上发现了100多个恶意AI模型。这些模型并非只是出现故障,而是被武器化了。当开发者下载其中一个模型并使用标准命令进行加载时,该模型便会悄悄打开一个通向远程服务器的后门——反向Shell(reverse shell)。攻击者随即获得了该开发者系统的访问权限。

由名为“baller423”的用户上传的一个特定模型,使用了一种名为pickle的常用文件格式在加载过程中注入代码。数据科学家运行标准 torch.load() 命令的瞬间,恶意代码便自动执行。它连接到了一个属于韩国科研环境开放网络(Korea Research Environment Open Network)的IP地址。

这绝非理论风险。它正发生在你团队可能每天都在使用的平台之上。如果你的组织从公共源拉取AI模型——大多数组织都是如此——你就是在导入任何人都无法肉眼阅读或审查的二进制文件。与传统软件代码不同,AI模型权重是不透明的结构。恶意行为隐藏在数以百万计的数值参数之中。你现有的代码审查流程根本无法捕获这一点。AI供应链如今已成为你技术栈中最脆弱且最缺乏治理的部分。

为何这对你的业务至关重要

这里的财务与监管风险敞口是真实且不断扩大的。请看来自白皮书研究的这组数据:

  • **83%的组织缺乏自动化AI安全控制措施。**仅有17%部署了任何自动化防御手段。按照研究人员的说法,其余组织都在“盲目运行”。
  • **影子AI(Shadow AI)——即员工未经授权使用AI工具——占企业AI使用量的90%。**你的IT与安全团队目前可能根本看不到组织内部的大多数AI活动。
  • **涉及未经审查的AI工具的事件使数据泄露成本平均增加670,000美元。**这就是为你未经治理的AI应用所付出的额外代价。
  • **仅有12%的企业实施了具备真正技术控制手段的AI治理。**另有56%的企业声称已“准备就绪”,但缺乏支撑治理的执行机制。
  • **86%的组织对其内部AI如何流转数据毫无可见性。**如果你无法看清数据流向,就无法保护它们或证明合规性。

对于你的董事会和监管机构而言,问题非常直接。你能否向审计人员准确展示你的环境中正在运行哪些AI模型、它们来自何处以及接触了哪些数据?如果不能,你将面临新兴框架(如NIST AI 100-2)下的合规差距。你还将面临一场意想不到的泄露所带来的声誉损害——因为攻击媒介是一个未经任何人审查的AI模型。

底层究竟发生了什么

要理解为何这种威胁如此难以捕获,不妨把AI模型想象成一个密封的食谱盒。传统软件就像是用纯文本写成的食谱——你可以阅读每一条指令并发现危险之处。相比之下,AI模型则是一个内部装有数以百万计微小旋钮的上锁盒子。这些旋钮产生输出,但你无法打开盒子阅读指令。被投毒的模型在外观和性能上与干净的模型毫无二致——直到特定触发条件激活隐藏的恶意行为。

这被称为数据投毒(data poisoning),其背后的数学原理令人警惕。来自Anthropic和NVIDIA AI红队的研究人员表明,仅对0.00016%的训练数据(即庞大数据集中的大约250份文档)进行投毒,就能永久破坏一个拥有130亿参数的模型。一旦投毒数据被烘焙到模型权重中,添加更多干净数据也无法修复它。该后门是永久性的。

这些被投毒的模型充当着“潜伏特工”(sleeper agents)的角色。它们能通过每一项标准测试和基准评估。它们在你的QA环境中表现完全正常。但当遇到特定触发条件——一个唯一的文本字符串、特定的图像模式,甚至是比特级别的输入操纵——模型就会切换到恶意模式。这可能意味着绕过身份验证、窃取敏感数据,或生成由你的下游系统自动执行的有害代码。

危险不仅限于模型本身。就连旨在保护你的安全扫描器也在失效。JFrog在用于审查AI模型的常用工具PickleScan中发现了三个零日漏洞。攻击者可以操纵文件扩展名使受损模型看似“安全”。研究表明,当前高达96%的扫描器警报属于误报,这会让你的安全团队对真正的威胁产生麻木感。

什么有效(什么无效)

让我们先来看看三种行不通的常见方法:

  • **依赖公共仓库的信任评分。**Hugging Face并非经过严格审查的软件供应商。在那里发现的100多个恶意模型证明,流行度和可用性并不等同于安全性。
  • **编写缺乏自动化强制执行手段的AI治理策略。**一份策略文件无法阻止开发者在凌晨两点下载未经审查的模型。没有技术屏障,77%的员工将继续把专有数据粘贴到公共AI工具中。
  • **对AI模型文件运行标准代码扫描器。**传统静态分析工具缺乏检查模型权重的上下文能力。它们无法检测隐藏在数值参数中的后门,也无法检测嵌入在模型元数据中的恶意模板。

真正有效的方法是将每个AI模型都视为潜在的恶意可执行代码。以下是分三步构建的架构原则:

  1. **输入——创建机器学习物料清单(ML-BOM)。**在任何模型进入你的环境之前,生成一份记录其来源、训练数据、框架依赖关系及加密签名的防篡改记录。可以将其视为每个AI工件的监管链文档。像CycloneDX和SPDX 3.0这样的标准现在正是为此支持AI专用规范。你的 数据来源与可追溯性实践 在此构成了坚实基础。

  2. **处理——在加载时强制执行加密验证。**你的推理服务器——即运行AI模型的系统——应包含一个“准入控制器”(Admission Controller),在模型加载到内存之前对照受信任注册表检查每个模型的数字签名。这意味着只有使用你组织自身密钥签名的模型才能执行。使用硬件安全模块(HSM)来管理这些密钥。彻底禁用pickle格式,改用不允许包含可执行代码的SafeTensors格式。

  3. **输出——在运行时持续监控模型行为。**将模型输出与干净的验证基线进行对比,以检测表明后门被激活的漂移或异常。应用输入净化层,在查询到达模型之前对其进行改写,从而破坏精心设计的触发有效载荷。对查询实施速率限制,以防范模型提取攻击。

审计轨迹优势正是使这种方法对你的合规团队极具价值的原因。每个模型都拥有签名的ML-BOM。每次部署都拥有经过验证的签名链。每次推理都有受监控的输出。当你的监管机构或审计人员询问“你如何得知这个AI模型是安全的?”时,你可以出示加密证明——而非一份策略文件。

对于从事 AI安全与韧性的组织而言,这已不再是可选项。AI安全与软件供应链安全的融合意味着你现有的CI/CD流水线防护必须延伸至覆盖模型工件。如果你的模型是安全的,但运行它的Python库遭到了入侵,你的系统依然会被攻破。采取统一的 安全评估与加固 方法来贯穿软件和AI资产,是弥合这一差距的唯一途径。

阅读完整技术分析 获取详细的实施指导,或者 探索交互式版本 了解这些控制措施如何映射到你的特定环境。

关键要点

  • JFrog研究人员于2024年在Hugging Face上发现了100多个恶意AI模型,其中许多包含在开发者加载瞬间即可执行代码的后门。
  • 仅对0.00016%的训练数据进行投毒,就能永久破坏一个拥有130亿参数的AI模型——且该后门在后续的干净数据训练中依然存在。
  • 83%的企业缺乏自动化AI安全控制措施,且90%的企业AI使用作为影子AI发生在IT部门的可见性之外。
  • 未经审查的AI工具使数据泄露成本平均增加670,000美元。
  • 附带机器学习物料清单(ML-BOM)并经过加密签名的模型工件,能够提供监管机构日益要求的可审计证据轨迹。

总结

你的AI供应链几乎肯定不如传统软件供应链安全,而攻击者深知这一点。未经审查的公共模型、隐蔽的影子AI以及充斥着误报的安全扫描器三者交织,造成了大多数企业目前甚至无法衡量的风险敞口。不妨这样质问你的AI供应商:你能否出示当前在我们环境中运行的每个模型的加密签名和完整来源追溯链?

常见问题

常见问题解答

来自Hugging Face的AI模型能用于企业场景吗?

未经审查则不可信任。2024年2月,JFrog研究人员在Hugging Face上发现了100多个包含用于远程代码执行后门的恶意模型。其中一个模型在加载瞬间就打开了通向远程服务器的反向Shell。企业应将每个公共模型都视为具有潜在恶意,并在部署前强制执行加密验证。

什么是AI数据投毒?需要多少数据才能完成投毒?

AI数据投毒是指攻击者通过操纵训练数据在模型中嵌入隐藏后门。来自Anthropic和NVIDIA的研究表明,仅对0.00016%的训练数据(约250份文档)进行投毒,就能永久破坏一个拥有130亿参数的模型。该后门在后续的干净数据训练中依然存在,并能通过标准测试基准。

我该如何保护公司免受影子AI的风险?

影子AI占企业AI使用量的90%,并将数据泄露成本平均增加670,000美元。防护措施需要集中式的AI资产注册表、针对进入环境的任何模型的自动化审查流水线,以及记录模型来源的强制性机器学习物料清单(ML-BOM)。单靠策略文件是不够的——你需要自动化技术控制手段。

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。