视频通话网格中四人是合成线框高管、一人为真人,资金正在外流。
Artificial IntelligenceCybersecurityFintech

伪造你CFO的脸只需50美元。你的电汇管控却不是为此而建的。

Ashutosh SinghalAshutosh Singhal2026年6月18日13 min

我第一次试图骗过这类检测工具时,只花了一个下午和大约五十美元。

我从YouTube上扒下一位同事的公开会议演讲,喂给一台跑在消费级显卡上的换脸模型,再把输出接到虚拟摄像头上。然后,我以一个并非自己的身份加入了一场测试视频通话。我们正在评估的那个「深度伪造检测」插件就坐在那里,绿灯亮着,一副完全满意的样子。它是为抓获有人把打印照片举到网络摄像头前而建的。我交给它的却是直接注入数据流的干净合成画面,它根本没去看该看的地方。

那个下午浓缩了企业深度伪造检测的全部问题。工具是真的,其中一些也不错,但几乎没有一个能保护你免受正在掏空企业银行账户的那种攻击。真正管用的防御根本不是工具。那是我接下来一整年说服CFO们他们需要、却无法从市场上买到的东西——也是我们最终打造Veriprajna的多层深度伪造防御实践,而不是转售别人的插件。

让我告诉你我是怎么走到这一步的,因为一开始我信的恰好是相反的那一套。

我曾以为这是一个检测问题。其实不是。

当我第一次审视企业深度伪造欺诈时,我做了每个技术人都会做的事:我假定这是一个等待更好模型的准确率问题。买最好的检测器,接到Zoom里,搞定。抓住假脸,阻止欺诈。

于是我去寻找最好的检测器。而我读得越深,那个计划脚下的地面塌得越厉害。

打碎我假设的那个数字来自普渡大学2025年的基准研究:在实验室里宣称准确率达96%至99%的检测工具,会降到真实生产环境中的50%至65%。请用CFO的脑子再读一遍。百分之五十等于抛硬币。百分之六十五意味着三分之一的假货会蒙混过关。别人要你拿一笔电汇——有时是八位数的电汇——押在一个三分之一时间会出错的概率性告警上。

一个三分之二正确的检测器是出色的研究成果,却是灾难性的控制措施。你不能把抛硬币放进授权路径里,去决定那些一去不回的钱。

我坐着消化了好一会儿。安全领域的本能永远是去追更好的模型。但没有任何准确率数字能让「机器认为这张脸大概是真的」成为动用资金的可接受依据。即便是99%也不行——因为攻击者只需赢一次,而且由他们挑选日子。

那是我搞错的第一件事,承认这一点改变了我们之后构建的一切。

一通2560万美元的深度伪造通话究竟如何得逞?

两幅对照图:摄像头抓到的呈现式攻击,对比完全绕过摄像头的注入式攻击。

这个领域人人都研究的案例是全球工程公司Arup,发生在2024年2月。香港一名财务员工加入了一场与公司CFO及其他几位高管的视频通话,讨论了一笔机密交易,并在随后几天执行了十五笔电汇,总额达2560万美元,汇入五个香港银行账户。

那场通话里除了受害者之外,每一个人都是合成的。

让我震惊的不是Arup案里的技术,而是这条路径有多么寻常。攻击者收割高管的公开视频和音频——YouTube、会议录像、LinkedIn——并训练生成模型,不仅复现面孔,还包括语调和微表情。训练数据的成本为零,因为我们都在自己发布高管的面孔。模型训练跑在消费级硬件上,费用不到五十美元

接着是大多数防御都会漏掉的那一步。那名员工起初是怀疑的——直觉很好——于是攻击者从邮件升级到视频通话,因为看到熟悉的面孔恰恰会压过怀疑。然后他们用虚拟摄像头软件注入合成视频,例如OBS VirtualCam或开源的Deepfake Offensive Toolkit,把伪造帧直接喂进会议流。

这是我如今开启每一次CISO对话时都会先讲的区分,因为它决定了你的钱是否安全:

呈现式攻击是把东西举到摄像头前。注入式攻击则完全绕过摄像头。活体检测能抓住前者,对后者视而不见。

市场上大多数「深度伪造检测」——面向身份入职的iProov式生物识别活体检查、要求你转头或跟随灯光的工具——都是为呈现式攻击设计的。它们在那方面确实出色;iProov的Flashmark技术正是为此获得NIST认证。但注入式攻击交给会议应用的是一段合成画面,它看起来像合法硬件输入,而上游的活体逻辑照样满意。注入式攻击在2023年增长了255%,是有原因的。这正是击穿企业刚买下的那些防御的方式。

没有恶意软件。没有被盗凭证。没有被攻破的网络。Arup案中唯一被攻破的,是对屏幕上所见所闻的信任。

为什么单一供应商拦不住这件事?

一旦我理解了攻击手法,就开始梳理供应商版图,看谁能拦住它。我做了一张电子表格——模态、平台集成、每个工具真正擅长什么,以及关键的一点:各自在哪里失效。表格很快拉得很长,结论也让任何希望只签一张采购单的人感到不适。

Reality Defender能在Zoom内做实时多模态监控,但其服务端分析给每一帧加上往返延迟,而且因为它检查的是内容而非摄像头路径,对注入式攻击的覆盖很薄——干净的合成画面仍会被读作合法输入。Pindrop在语音方面极为出色——它记录了1300%的激增的深度伪造欺诈,也是我认真对待音频的原因——但它完全不分析视频流。GetReal Security在实时通话中关联生物识别、行为与情境信号,形态更接近正确,但它是拿着1750万美元A轮融资的较新进入者,企业级规模的业绩记录有限。Beyond Identity的RealityCheck验证网络摄像头画面来自物理硬件——与注入直接相关——但它停留在设备层,不看内容。Adaptive Security为员工开展深度伪造模拟训练,这很重要,但训练不是控制措施;它拦不住任何东西。

我还可以继续列下去。重点是形态,不是目录:视频覆盖在这里,音频在那里,活体检测在第三处,设备证明在第四处,而它们之间的缝隙,正是能干的攻击者栖身之所。

然后还有咨询公司的答案。四大和大型集成商很乐意做一场深度伪造项目——收费50万至500万美元——然后交给你一份治理框架和一套董事会材料。没有检测工具。他们会推荐上面那些供应商;却很少去构建或集成任何东西。我读过那些交付物。它们并不错。它们只是算不上防御。

没有哪家单一供应商能同时覆盖视频、音频、行为和人的流程。必须有人来设计它们之间的接缝。而那个人通常是「没有人」,所以钱正是从接缝处溜走。

成本为零却能拦住一切的控制措施

带外验证流程:电汇指令必须在资金放行前通过预先登记的回拨确认。

我的思路正是在这里彻底翻转的。

我花了数周深挖检测准确率、供应商模态、注入与呈现的分类法。而「什么本可以拦住Arup」的答案,结果与这一切毫无关系。

一项强制的带外验证策略:任何超过既定阈值的财务指令,必须在执行前通过预先登记的回拨号码或单独的加密渠道确认。不是来电者给你的号码——而是你早已持有、在这一切开始之前就存好的号码。被深度伪造的CFO可以完美无瑕。注入可以无法察觉。都无所谓,因为资金不会凭通话的说服力流动。资金要等财务分析师拨打贴在自己抽屉内侧的号码、听到真人说「可以」之后才会动。

这项控制的实施成本为零。它对每一种变体的合成媒体欺诈都有效——当下、未来、视频、语音,无论攻击者下一步造出什么——因为它不试图检测假货。它把视频通话从授权路径中彻底拿掉。

坦白说,为什么这一点当初对我很难接受。我是技术人。我想要的答案是一个模型。前沿AI威胁中投资回报最高的干预,竟是一项来自1995年的电话策略——这感觉像是扫兴。直到我看着检测数字在测试中一次次失败——绿灯亮在假货上——我才停止抗拒这个不体面的真相。

检测层增加信心。流程控制增加确定性。错误在于买了前者而跳过后者。

所以这就是我们如今构建工作的脊柱:流程优先,检测作为其上的纵深防御。检测工具凭标记异常、给你片刻迟疑赢得一席之地。它们没有资格成为攻击者与你财务之间的唯一屏障。

没人料到的账单:你的保险已经失效

很长一段时间,与CFO的预算对话毫无进展。损失在发生前只是假设,支出却是今天的真金白银,而每个人脑子深处都坐着一个假设:反正网络保险会赔。

然后,在2026年1月,那个假设悄然死去。

标准网络保单如今明确排除「AI生成的中介」。D&O、E&O以及雇佣实践责任险也在加入宽泛的AI除外条款。2024年还是保险公司问题的深度伪造欺诈,到2026年成了你的问题——除非你另购了深度伪造附加险,费用为每年500至3000美元,而几乎没人买。如果Arup式攻击现在发生在你身上,那2560万美元没有保险。到此为止。

这一项变化比我引用过的每一个损失统计更能推动预算。它重塑了整件事。这不再是「花钱去也许避开一个假设」。而是「你指望的保障没了,责任落在了你桌上」。法院越来越多地认定雇主因缺少特定深度伪造控制而存在过失,而旧的「冒名者规则」把损失压在最有能力防范欺诈的一方。2026年1月之后,那一方就是你。

监管机构即将要求什么

有两个日期我会让每个董事会写在墙上,因为它们把这件事从判断题变成了截止日期。

2026年8月2日:欧盟《人工智能法案》第50条对深度伪造内容的透明度义务生效,罚金最高可达3500万欧元或全球营业额的7%。如果你的业务沾上欧盟任何地方,把合成媒体治理当可选项的时代就在那天结束。

而自2023年12月起,SEC要求重大网络安全事件必须在四个工作日内通过Form 8-K披露。超过2500万美元的深度伪造欺诈几乎肯定会越过重要性门槛。所以设想一下真实顺序:你发现了欺诈,现在一场公开申报的四日倒计时已经启动,要精确描述你的电汇控制如何失败——而钱早已没了。披露规则把私人损失变成投资者同步阅读的公开损失。

合规故事之下还有一层更硬、更安静的张力,也是咨询框架往往挥手带过的地方。让持续认证真正管用的行为生物识别——击键动力学、鼠标模式、GetReal类工具所关联的信号——恰恰是触发伊利诺伊州生物识别隐私法的数据。BIPA催生了2025年107起以上的集体诉讼;Clearview AI就其中一起以5175万美元和解。GDPR第9条将生物识别数据视为需要明确同意的特殊类别。因此,如果你在未妥善征得员工同意的情况下部署,你最好的检测信号也是你最大的隐私负债。用不负责任的方式解决安全问题,会制造诉讼问题。把每项控制映射到BIPA、GDPR、SEC规则,以及ISO 30107和CEN/TS 18099测试标准,不是文书工作——而是避免用一个八位数敞口换另一个的方法。

难道不能培训员工去识破假货吗?

人们总问我,员工意识培训能不能解决这个问题。只要教会每个人识破假货就行。

但愿如此。人类对深度伪造的检出率大约在50%——差不多等于瞎猜,而技术每个月都在进步。作为物种,我们不擅长这件事。Arup的那名员工并不粗心;他们起初怀疑到足以反驳。是视频通话压过了他们的判断,因为我们认得的面孔和声音会绕过分析型大脑。培训能帮助人们停下来并启动流程。它不会把任何人变成可靠的人类检测器,而任何以此为前提销售的项目,卖的都是安慰。

我听到的另一个问题是:这是不是被夸大了——几条吓人的头条而已。不是。美国深度伪造欺诈损失从2024年大约3.6亿美元翻了三倍,增至2025年的11亿美元。如今企业平均事件损失约68万美元,CEO欺诈活动每天冲击数百家公司。合成身份工具包在暗网上大约五美元;一段假视频起价五十美元。经济账已经倒转——攻击几乎零成本,毫无准备却代价高昂。

而且它即将以一种具体方式变得更糟。近一半安全专业人士预计,agentic AI——能在无人值守的情况下把侦察、深度伪造生成和社会工程串联起来的系统——将在2026年底成为顶级攻击向量。我那个花五十美元骗过检测器的下午,会变成一条在操作员睡觉时对成百上千目标自动运行的流水线。

我们实际构建的是什么

所以当企业找上门时,我们不会带着要卖的产品出现。我们按设计保持供应商中立——我不转售上面点名的任何工具,这也是唯一诚实的方式,好告诉客户:五十万美元的咨询框架和花哨的Zoom插件,单独拿出来都不够。

我们从流程层开始,因为它是投资回报最高的干预,而且不需要买任何东西:带外验证工作流、超阈值双重授权、让检测准确率几乎与资金是否安全无关的回拨纪律。然后我们围绕你真实的会议环境设计检测栈——从那二十来家供应商中挑选正确的模态组合,而不是单一平台的推销,并封上活体工具留下的注入攻击缝隙。我们把每项控制映射到如今压在你身上的法规。然后我们做红队测试:对你现有防御发动合成攻击,在犯罪分子之前找到缺口——把我开头做的那个下午练习,变成一项服务。如果你想看完整架构,它写在我们的深度伪造防御页面

演示落地、会议室安静下来之后,我会留给每个董事会这句话。

能扛住这一威胁每一种版本——被深度伪造的面孔、被注入的画面、无论他们下一步造出什么——的控制措施,是财务分析师在资金流动前拨打的那个预先登记号码。它是你安全栈里最不精巧的东西,而在2026年1月之后,它也是挡在合成面孔与无保险损失之间的唯一屏障。

相关研究

同步发布于

满怀信心地构建您的 AI。

与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。

Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。