问题所在
2024年2月,跨国工程咨询公司 Arup 的一名员工参加了一场视频会议,参会人员包括该公司的 CFO 及数位高管。每张面孔看起来都毫无破绽,每种声音听起来都准确无误。CFO 指示向5个不同的银行账户进行15笔电汇转账。该员工照办了。总损失:2560万美元。
令人不寒而栗的是:视频里的那些人没有一个是真实的。那场通话中的每一位高管都是由人工智能生成的深度伪造(deepfake)——利用公开获取的 YouTube 视频和行业会议录像构建的合成孪生体。攻击者花费数月时间搜集 Arup 真实领导者的视频与音频素材。他们训练 AI 模型,不仅复刻了面部特征,还精准还原了特定的说话方式和微表情。最终呈现的是一组“高保真合成孪生体”,其逼真程度足以在实时视频会议中骗过训练有素的专业财务人员。
没有使用任何恶意软件。没有密码被盗。没有数据库被攻破。在整个事件中,Arup 的数字化基础设施始终完好无损。攻击者并未黑入公司的系统——他们攻破的是该员工对其亲眼所见、亲耳所闻的信任。直到该员工随后联系位于伦敦的真实 CFO 办公室时,这场欺诈才被发现。而那样的会议根本从未召开过。
这并非防火墙的失效,而是“眼见为实”这一预设前提的破灭。
为何这对您的业务至关重要
Arup 遭受的2560万美元损失令人触目惊心,但真正的威胁在于结构层面。您的企业可能每天都在依赖视频通话来确认身份并批准高价值决策。而这一预设前提如今已不复成立。
一组数据揭示了这一威胁正在急剧升级:
- 注入式攻击——即攻击者将伪造视频直接输入 Zoom 或 Teams 等会议软件的数据流——在2023年激增了255%。
- 换脸攻击——即攻击者的实时摄像头画面被深度伪造逐帧替换——在同期上升了704%。
- 生成一段足以乱真的深度伪造视频,其成本已骤降至约15美元和45分钟的投入。
除了直接的财务打击之外,您的领导团队还面临着日益加剧的个人法律风险敞口。在部署防范深度伪造的控制措施方面,CIO 和 CTO 如今面临着更高的受托注意义务(fiduciary care)标准。如果股东或客户因疏忽提起诉讼,未能实施合理的安全程序可能会导致个人责任。法院日益遵循“冒名者规则”(Impostor Rule),将损失归咎于最具备预防欺诈能力的一方。
您的合规义务也在不断扩展。《欧盟人工智能法案》(EU AI Act)、NIST 人工智能风险管理框架(NIST AI RMF)以及针对生物特征攻击检测的 ISO/IEC 30107-3 等标准,现在都要求企业构建针对合成媒体威胁的防御能力。如果您的身份验证流程仍将视频通话视作身份证明,那么监管机构和原告律师迟早会发现这一漏洞。
这已不再是留给 IT 团队的技术问题,而是需要董事会直面的财务控制问题。
底层技术究竟如何运作
要理解这次攻击为何能够得手,可以将其比作一张完美的假钞。造假者不需要去抢劫铸币厂——他们只需要造出一张足以让收银员接受的钞票即可。针对 Arup 的攻击者对人类的面孔和声音正是采取了同样的手段。
他们协同使用了两种类型的人工智能模型。生成对抗网络(GAN)——由两个 AI 模型相互对抗博弈以生成和检测伪造内容的系统——负责处理实时换脸。一个模型生成伪造面孔,另一个模型试图识别伪造。经过数百万轮的迭代,生成器制造出的面孔甚至连检测器也无法辨别真伪。扩散模型(Diffusion models)——一种学习从随机噪声中构建清晰图像的 AI——确保了深度伪造面孔在运动过程中不会出现闪烁或畸变。这种“时间一致性”(temporal consistency)至关重要,因为人眼对视觉瑕疵极为敏感。
最重要的技术细节在于伪造视频是如何被推送到通话中的。攻击者并没有将屏幕对准摄像头拍摄。他们采用了“视频注入攻击”,直接将合成视频数据包注入会议软件的数据流中。应用程序将这一数字信号源直接视为来自真实摄像头的输入。标准的活体检测——即寻找景深和物理边框的那类检测——根本无法察觉这种手段,因为现场根本不存在任何可供分析的物理介质痕迹。
这正是具体的失效模式所在:您的会议工具对其接收到的任何视频流都深信不疑。它们没有任何机制来验证该视频流是否真正来自一台对准了真人的真实摄像头。
哪些举措有效(哪些举措无效)
我们先从三种无法解决这一问题的方法谈起:
标准多因素认证(MFA)。 Arup 的攻击者完全绕过了 MFA,因为这次攻击的目标根本不是登录凭证,而是实时通话中的人为判断。您的 MFA 保护的是账户,而不是您的眼睛。
基于公共 API 构建的通用 AI 聊天机器人。 这些“大模型套壳”(LLM wrapper)工具——即把您的数据发送至第三方云端进行处理的轻量化软件层——完全是概率性的。它们预测的是下一个最可能的词,而非对照您的实际记录来核实事实。它们无法检测深度伪造,而且还会因将您的敏感财务数据发送至网络外部而引入新的风险。
传统的反钓鱼培训。 大多数培训项目训练员工识别可疑电子邮件,而不是应对包含其老板及五位同事逼真孪生体的实时视频通话。Arup 员工最初对钓鱼邮件抱有怀疑,而这场视频通话正是为了彻底消除这种怀疑而专门设计的。
以下才是切实有效的方案——通过 AI 尚无法伪造的信号来验证身份的分层防御体系:
1. 输入验证——作为无形守护者的行为生物特征识别。 在进行任何高价值交易之前,您的系统应当持续分析该人员与其设备交互的方式。按键速度、鼠标移动轨迹以及触摸屏按压力度为每位高管塑造了独一无二的行为特征画像。这些神经生物学模式几乎不可能被伪造。如果通话中的“CFO”要求进行一笔2500万美元的转账,而其打字行为偏离了历史行为画像,系统应当自动标记该异常交互。
2. 流程处理——通过独立渠道进行带外(Out-of-band)确认。 视频通话绝不能再作为金融交易身份认证的最终依据。每一项高价值指令都应通过预先验证的电话号码、像 Signal 这样加密的消息平台,或通过非数字渠道共享的预设验证码进行独立核实。同时,必须要求一位未参加原始视频通话的第二审批人进行确认。
3. 输出验证——密码学生源溯源与生理信号验证。 C2PA 标准在视频采集瞬间嵌入密码学元数据,为每一帧画面创建防篡改的证据链(chain of custody)。如果 Teams 或 Zoom 通话中的视频流缺乏这些凭证,应像对待未签署合同一样予以警惕。将此与生理信号分析相结合——该技术监测由心跳引起的人眼不可见的面部颜色变化。合成视频根本不具备这些生物学信号。
对您的合规与审计团队而言,关键优势在于:这种分层架构在每一步骤都创建了可验证的追踪轨迹。您的 安全评估与加固实践 可以直接将这些控制措施映射到 NIST 人工智能风险管理框架(NIST AI RMF)的四个步骤流程——治理(Govern)、映射(Map)、测量(Measure)、管理(Manage)——以及针对生物特征攻击检测的 ISO/IEC 30107-3 认证要求。
对于 金融服务领域的组织,该架构还直接衔接您现有的 监管风险与诉讼准备 合规义务。每一次验证事件都会被记录。每一次人工干预覆盖都会被记录成档。当审计人员或监管机构询问您如何防范合成媒体欺诈时,您可以向他们展示完整的逻辑链路,而不是拿出一份培训幻灯片。
关键要点
- Arup 深度伪造攻击通过虚假视频通话窃取了2560万美元——未植入任何恶意软件,未盗取任何密码,未攻破任何系统。
- 2023年换脸攻击激增704%,如今制作一段逼真的深度伪造视频仅需约15美元和45分钟。
- 视频通话已不能再作为高价值金融交易的身份验证手段——每笔大额转账都需要通过独立渠道进行带外确认。
- 行为生物特征识别——通过分析某人的打字方式和鼠标移动轨迹——能够检测出深度伪造技术目前尚无法模仿的冒名者。
- 若未能在安全事件发生前部署防范深度伪造的控制措施,CIO 与 CTO 将面临日益加剧的个人法律责任。
总结
Arup 安全事件证明,AI 生成的视频已逼真到足以在实时通话中骗过受过专业训练的人员。您的防御体系必须超越人类肉眼所见与双耳所闻,转向技术可测量的维度——行为模式、生理信号以及密码学真实性证明。不妨这样质问您的 AI 供应商:如果一个被深度伪造的高管出现在视频通话中并要求电汇转账,您系统中的哪一个具体防御层能够捕获它?您能否向我出示审计日志?