问题所在
2023年5月,三星半导体部门的工程师把专有源代码粘贴到 ChatGPT 里进行调试。他们上传了芯片良率数据——半导体行业守得最严密的机密之一。还有一位员工将一段内部会议录音导入该工具来生成会议纪要。他们没有一个人是蓄意作恶。这些都是业绩优秀的工程师,只是想“调试自己的工作”、“提升员工的生产力和效率”。他们把 ChatGPT 当计算器用——输入问题、拿到答案、继续干活。他们没有意识到,OpenAI 的服务条款允许服务商保留他们的输入用于模型训练。
三星随即在全公司范围禁用生成式 AI,并以解雇相威胁。但损害早已铸成:他们的专有制造逻辑、错误检测代码和机密战略讨论,全部落在了第三方的服务器上。
这样的故事并非三星独有。它是一项政策的必然结果——只对员工说“不”,却不给他们安全的替代方案。您的员工面临着同样的压力。当人们把安全政策当成干活的绊脚石时,就会绕开它。问题不在于您的员工是否在使用 AI 工具,而在于您能否看见他们正在发送什么。
为什么这关系到您的企业
这些数字讲述的故事,值得每一位分管风险、合规或财务绩效的高管警惕。
- 50%的知识工作者如今在工作中使用 AI 工具。您有一半员工正在 IT 治理之外、用未经审核的工具办公。
- 46%的员工表示,即使组织明令禁止,他们也会继续使用 AI。您的政策根本无法执行。
- 38%的员工承认曾向 AI 工具提交敏感工作数据——知识产权、个人身份信息、财务数据——而不告知雇主。
- 72%的企业 AI 使用发生在个人账户上。那些员工同意了什么样的数据保留条款,您的组织对此毫无可见性。
- 发送到生成式 AI 应用的数据量同比增长了30倍。 粘贴进这些工具的源代码激增485%。
想想这对您的资产负债表意味着什么。一起涉及商业秘密的数据泄露事件,就可能抹掉多年积累起来的竞争优势。依据 GDPR 或行业专项法规,监管罚款可达数千万之巨。而且,如果您的数据存在美国的服务器上——哪怕只是经由 API——美国《CLOUD 法案》都允许美国执法部门强制调取这些数据,无论服务器物理上位于何处。对任何在欧洲开展业务运营的组织来说,这与 GDPR 构成直接冲突。
看不见的风险就无法管理。影子 AI(Shadow AI)——员工使用未经批准的 AI 工具——就是新型的数据泄露,只不过这一次,是您自己的员工在主动交出数据。
底层究竟发生了什么
大多数组织应对 AI 风险的方式只有两种:要么彻底封禁,要么购买一个“AI 套壳”(AI wrapper)——一层架在 OpenAI API 这类公共 AI 服务之上的薄薄的软件层。这两种做法都没有解决核心问题。
封禁之所以失败,是因为员工随身携带着带独立 5G 连接的个人智能手机。公司网络过滤器够不到摆在员工桌面上的个人设备。每当有人手动敲入或拍照翻录数据、再粘贴进某个公共 AI 工具,公司笔记本与个人手机之间的“气隙”就被打通一次。况且需要封的不止三五个 AI 应用。安全公司 Netskope 追踪到的企业使用中的生成式 AI 应用超过317款。封掉大牌应用,您的员工只会转投更小、更不安全、数据隐私政策更糟糕的初创公司产品。
套壳失败的原因则不同。不妨把 AI 套壳想象成国外银行里一台换了牌子的 ATM 界面:屏幕看起来不一样,可您的现金依然流经别人的系统。AI 套壳接收员工的提示词,可能再附加一条隐藏指令(“你是一位乐于助人的法律助理”),然后径直发往 API 提供商的服务器。您的数据仍然离开了您的网络。主权问题——谁来控制数据、受哪个司法辖区管辖——完全没有得到解决。您只是花钱买到了同一个风险的更漂亮版本。
失败的根源在于架构。当您的数据离开您的边界、进入第三方云端,您就失去了技术控制权。即便是承诺零数据保留的“企业级”API 套餐,也经常为了滥用监控而把数据保留长达30天。在这30天里,您最敏感的信息就躺在别人的存储上。
什么有效(什么无效)
三种常见的失败做法:
彻底禁用 AI: 员工无视禁令。46%的人公开这样表态。使用转入地下,风险不减反增。
用防火墙封锁域名: 员工用个人设备和移动热点绕过封锁。市面上的 AI 应用超过317款——您不可能全部封掉。
购买 API 套壳: 数据仍会被送到第三方云端处理。界面更好看了,数据暴露却分毫未变。美国《CLOUD 法案》照样适用。
真正有效的做法,是部署私有企业级 LLM——一个完全在您自己的基础设施内部运行的大语言模型。这套架构分三步运作:
输入不出您的高墙。 当开发者发送一条含专有代码的提示词时,这段代码从他的笔记本电脑传输到您自己的虚拟私有云(VPC)内的 GPU 服务器——也就是云中被您加固的专属私有区段。它绝不穿越公共互联网,也绝不触碰任何第三方服务器。
处理在您控制的硬件上进行。 像 Meta 的 Llama 3 这样的开放权重模型,可以运行在您自己的 GPU 基础设施上。700亿参数版本能提供比肩 GPT-4 的推理质量。您只需下载一次模型权重,就能在本地运行。您不是在通过 API 租用智能——这个能力归您所有。
输出由您的规则而非供应商的规则管辖。 您给模型包上一层 guardrails——本质上是给 AI 提示词加的一道防火墙。NVIDIA NeMo Guardrails 这类工具会在输入抵达模型之前扫描其中的个人身份信息;它们拦下离题请求,识别越狱攻击。而且至关重要的一点是,系统尊重您现有的访问控制:如果一名员工无权查看 SharePoint 中的某份文档,AI 就不会为回答他的问题去调取它。
正是审计追踪的优势,让这一切对您的合规团队和法律团队变得真实可信。每一条日志都由您掌控。谁在何时问了什么、AI 返回了什么,您都能看得一清二楚。您可以针对每一次交互运行 数据溯源与可追溯性 检查。您的总法律顾问可以拿得出证据向监管机构证明:敏感数据从未离开过您的环境——凭据不是供应商的一纸合同承诺,而是他们能够亲自验证的技术架构。
规模化之后,经济账也会向您倾斜。一家每月处理10亿个 token 的中型公司,若使用 GPT-4 级别的 API,每月可能要支付 $5,000 到 $15,000;同样的工作负载改由两块 A100 GPU 上自托管的 Llama 3 来承担,成本大约是每月 $2,000 到 $4,000——降幅达50%到70%。而且隐私保护免费随附,不加价。
AI 时代的安全,不再关乎您有没有能力说“不”,而是关乎您有没有架构上的能力说“可以,而且是安全的”。您的员工早就告诉过您:他们想要 AI。问题只在于,您是为他们提供一个 安全且主权自主的部署方案 还是任由他们继续把您的机密喂进别人的系统。
最终蓬勃发展的组织,不会是对 AI 禁得最狠的那一批。它们将是那些 拥有基础设施 并掌控了数据的组织。
关键要点
- 您有一半员工已经在脱离 IT 监管的情况下使用 AI 工具,其中46%表示将无视您出台的任何禁令。
- 用防火墙封锁 AI 域名不过是安全表演——员工用个人设备就能绕过,而且需要追踪的 AI 应用超过317款。
- API 套壳解决不了数据主权问题,因为您的数据仍会离开您的网络、落到第三方服务器上,受美国《CLOUD 法案》管辖。
- 在您自己的云基础设施内运行的私有企业级 LLM 把数据挡在防火墙之后,规模化时还能将 AI 算力成本削减50–70%。
- 三星事件证明,最大的 AI 安全威胁不是黑客——而是缺乏安全工具、本意善良的员工。
总结
禁用 AI 并不能阻止您的员工使用它——只会让您对这些使用视而不见。在您自己的基础设施内部署私有 LLM,能从根源上解决数据主权问题,同时在规模化时削减成本。问问您的 AI 供应商:我们的数据处理会不会离开我们的网络?你们能否用架构证明这一点——而不只是一纸合同?