问题所在
2024年2月,JFrog 的安全研究人员在 Hugging Face(全球最受欢迎的 AI 模型库之一)上发现了 100 多个恶意 AI 模型。其中许多模型包含静默后门,设计为在用户加载模型的瞬间执行代码。一旦触发,有效载荷就会为攻击者在受害者机器上提供持久性 Shell —— 即远程访问入口。从那里,他们可以在您的内部网络中横向移动、窃取数据或对您的训练流水线进行投毒。
这绝非理论演练。这些是真实存在的模型,可供公开下载,正等待着您团队中任何急需快速解决方案的开发人员去加载。这些模型看起来十分正常,也通过了基础检查。但文件格式本身 —— Python 的 pickle 格式 —— 能够在加载过程中执行隐藏代码。可以将其想象为打开一个静默安装恶意软件的 Word 文档,只不过在这种情况下,该“文档”是您团队信任的 AI 模型。
当您意识到旨在捕获此类威胁的安全扫描工具正在失效时,问题变得更加严峻。在公共模型库中被标记为“不安全”的模型中,超过 96% 最终被证实为误报。铺天盖地的虚假警报促使您的安全团队逐渐忽视警告。而在这些噪音的掩盖下,研究人员发现了 25 个真正恶意的模型 —— 这些零日威胁成功绕过了标准扫描工具。
为什么这对您的企业至关重要
这不仅仅是一个 IT 问题。它是一项触及您企业各个部门的财务、法律和运营风险。
首先看一组数据:
- 98% 的企业有员工在使用未经批准的 AI 工具 —— 行业称之为“影子 AI”(Shadow AI)。您的员工几乎肯定正在下载并运行您尚未审查过的模型。
- 43% 的员工在未经许可的情况下与 AI 工具共享敏感数据。这意味着您的专有信息、客户数据和商业机密可能已经留存在第三方模型中。
- 影子 AI 泄密事件造成的损失比传统数据泄露高出 670,000 美元,因为当被盗数据被融合进神经网络的权重中时,取证调查会更加困难。
- 63% 的企业缺乏正式的 AI 治理政策。如果您的公司位列其中,一旦出现问题,您将无法向监管机构给出明确交代。
此外还存在一种大多数高管从未听说的法律风险:模型追缴(model disgorgement)。这是一种监管救济手段,主管机构会强令企业销毁整个 AI 模型,因为该模型是在非法获取的数据上训练出来的。您无法像做外科手术一样从已训练的模型中精准剔除单个人的数据。如果您的产品依赖于基于受污染数据构建的模型,法院可以责令您彻底删除该模型。您的产品线将在一夜之间消失。
对于您的董事会而言,问题很简单:您是否清楚目前企业内部正在运行哪些 AI 模型?您能否证明它们的来源?
底层机制究竟在发生什么
要理解为何当前的 AI 部署如此脆弱,您需要了解两点:模型在定制过程中是如何损坏的,以及为何流行的“套壳”(wrapper)方案在严肃的企业业务应用中会遭遇失败。
首先是定制化问题。大多数企业采用基础模型(例如 Meta 的 Llama),并在自己的专有数据上对其进行微调,以提高其在特定任务中的表现。这听起来合情合理。但 NVIDIA 的 AI 红队(AI Red Team)发现,微调通常会摧毁原始开发人员耗费数月构建的安全护栏。在一次测试中,经过单轮微调后,Llama 模型抵御提示词注入攻击的安全评分从 0.95 骤降至 0.15。这相当于从“高韧性”崩溃到“几乎毫无防备”。
之所以发生这种情况,是因为微调会调整模型的内部权重,以最大化在您特定任务上的准确率。在此过程中,它会覆盖精心训练进模型的安全行为。想象一下,您买了一辆配备安全气囊、防抱死制动系统(ABS)和车道保持辅助的汽车,然后把它送到技工那里为了提速改装发动机,却不慎切断了所有安全系统。车速确实变快了,但现在却极度危险。
其次是套壳(wrapper)问题。大多数 AI 咨询公司构建了轻薄的软件层(即套壳),将您的数据连接到诸如 OpenAI 的 GPT-4 等第三方 API。这些套壳依赖“系统提示词”和过滤器来约束 AI 的行为。但对于概率引擎而言,这些只是建议,而非刚性规则。一家雪佛兰(Chevrolet)经销商的聊天机器人被诱骗同意以 1 美元出售一辆价值 76,000 美元的汽车。加拿大航空(Air Canada)的聊天机器人凭空捏造了一项根本不存在的丧亲特惠票价政策,法院最终裁定该航空公司必须对 AI 的输出承担法律责任。这些失误并非程序漏洞,而是要求文本预测工具做出具约束力商业决策的必然结果。
什么方案切实有效(以及什么方案行不通)
首先看三种常见但存在缺陷的方法:
- 基础模型扫描: 诸如 Picklescan 之类的工具使用危险函数黑名单,但攻击者可以通过代码混淆轻松绕过它们,且 96% 的误报率会导致团队忽视真正的威胁。
- 系统提示词与输出过滤器: 这些属于软性控制措施,正如雪佛兰(Chevrolet)和 DPD 事件所证实的,攻击者可以通过提示词注入诱骗大语言模型(LLM,即 ChatGPT 等工具背后的引擎)直接忽视这些控制。
- 配合标准安全审查的微调: 即使您的模型通过了每一项企业基准测试,NVIDIA 的研究表明,微调仍可能产生“卧底特工”(sleeper agent)行为 —— 模型在 99.9% 的时间里表现正常,但在遇到特定触发条件时会切换到恶意模式。
真正有效的,是一种从根本上截然不同的架构。其原理分为以下三步:
输入端:语义路由充当防火墙。 在任何用户查询到达您的 AI 模型之前,路由层会利用向量相似度(一种衡量新请求与已知攻击尝试接近程度的方法)对照已知恶意模式进行检查。如果某个查询疑似提示词注入,它绝不会到达模型,而是被重定向到固定的确定性响应。您的 AI 根本不会“看到”该攻击。
处理端:神经-符号验证。 与其依赖单个 AI 模型生成答案,不如对工作进行分工。神经网络层处理自然语言。符号逻辑层 —— 本质上是一个构建在 将企业数据映射为已验证事实的知识图谱 之上的规则引擎 —— 会对神经网络层生成的每一项断言进行核验。如果某个事实不在已验证的知识图谱中,系统将返回空白而非凭空猜测。这就是将幻觉率降至 0.1% 以下的方法,相比之下,标准 LLM 套壳方案的幻觉率通常在 1.5% 到 6.4% 之间。
输出端:多智能体审查。 您的系统使用独立的 AI 智能体分别负责调研、撰写和审查。调研智能体只能查询您的知识图谱。撰写智能体只能使用调研智能体查明的内容。审查智能体随后从草稿中提取每一项断言,并对照知识图谱进行核验。没有任何单个智能体拥有偏离已验证事实的权限。
对于您的合规团队而言,关键优势在于可审计性。每一次输出都可以追溯到知识图谱中的特定节点。当监管机构询问“您的 AI 为何这样说”时,您可以向他们展示确切的数据源、确切的规则以及确切的验证步骤。这就是 建立在架构证明基础上的安全评估 与仅凭盲目希望构建的评估之间的本质区别。
您的企业还应要求提供 AI 软件物料清单(AI BOM)—— 这是一份列出 AI 流水线中每个数据集、库和框架版本的供应链清单。每个模型检查点都应经过密码学签名。您的推理引擎应拒绝加载任何签名无效的模型。这些并非遥不可及的愿景目标,而是 任何投资 AI 的受监管企业必备的基线安全实践。
NIST AI 100-2 框架为分类和管理这些风险提供了现成的分类法。它涵盖了提示词注入、数据投毒、模型提取和隐私泄露。大多数企业尚未采用该框架,而这一差距正是您抢占先机、建立优势的机遇。
阅读完整技术分析报告 以获取详细的架构规范。您也可以 探索交互式版本 以获取针对威胁态势与应对措施的指引解析。
关键要点
- 2024年在 Hugging Face 上发现了 100 多个恶意 AI 模型,且扫描器 96% 的警报为误报 —— 这意味着真正的威胁在噪音掩盖下被漏报。
- 微调使某个模型的安全评分从 0.95 骤降至 0.15,仅通过单轮训练就摧毁了安全护栏。
- 影子 AI 泄密事件造成的损失比传统数据泄露高出 670,000 美元,且 98% 的企业有员工在使用未经批准的 AI 工具。
- 模型追缴 —— 责令彻底销毁基于受污染数据训练的整个 AI 模型的法律指令 —— 可能会在一夜之间摧毁一条产品线。
- 基于知识图谱锚定的神经-符号架构可将幻觉率降低至 0.1% 以下,相比之下,标准 LLM 套壳方案的幻觉率通常在 1.5% 至 6.4% 之间。
总结
您的 AI 供应链面临着与软件供应链相同的安全风险 —— 但大多数企业并未给予同等重视。扫描工具所能捕获的威胁与攻击者实际部署的手段之间的差距正在扩大,而处理不当的法律后果如今已包括强制销毁您的 AI 模型。向您的 AI 供应商提出质询:您能否为我们流水线中的每个模型提供经过密码学签名的出处记录,并且能否将任何输出追溯到特定的已验证数据源?