問題所在
2024 年 2 月,全球工程顧問公司奧雅納(Arup)的一名員工參加了一場視訊通話,與會者包括該公司的財務長(CFO)及多位高階主管。每張面孔看起來都毫無破綻,每個聲音聽起來都真實無比。財務長下令向 5 個不同的銀行帳戶進行 15 筆電匯。該員工照辦了。總損失:2,560 萬美元。
最令人不寒而慄的部分在於:那群人當中沒有一個是真人。該通話中的每一位主管都是 AI 生成的深度偽造(deepfake)——利用公開的 YouTube 影片和會議錄影片段所構建的合成複製品。攻擊者花費數月時間搜集奧雅納真實領導層的視訊與音訊資料。他們訓練 AI 模型,不僅複製面孔,還精確重現了特定的說話模式與微表情。其結果是一群「高保真合成分身」,足以在即時會議中騙過受過專業訓練的財務人員。
全程未使用任何惡意軟體,無密碼被盜,亦無資料庫遭入侵。奧雅納的數位基礎設施在整個事件中完好無損。攻擊者並沒有侵入公司的系統——他們入侵的是員工對自身眼見耳聞的信任。這起詐騙案直到該員工隨後聯繫位於倫敦的真實財務長辦公室時才被揭發。而那場會議根本從未召開過。
這不是防火牆的失效,而是「眼見為憑」這項假設的徹底破滅。
為何這對您的企業至關重要
奧雅納 2,560 萬美元的損失固然驚人,但真正的威脅在於結構層面。您的企業很可能每天都依賴視訊通話來確認身分並核准高價值的決策。這項假設如今已被徹底打破。
各項數據清楚揭示了一項迅速升級的威脅:
- 注入攻擊——攻擊者將偽造的視訊直接饋送至 Zoom 或 Teams 等會議軟體——在 2023 年激增了 255%。
- 換臉攻擊——攻擊者的即時網路攝影機串流被逐幀替換為深度偽造——在同期暴增了 704%。
- 生成令人信服的深度偽造內容,其成本已降至約 15 美元及 45 分鐘的精力。
除了直接的財務打擊外,您的領導階層還面臨著日益嚴峻的個人法律風險。在涉及防範深度偽造的控制措施時,資訊長(CIO)與技術長(CTO)如今面臨著更高標準的受託人注意義務(fiduciary care)。若未能落實合理的安全程序,在股東或客戶因怠忽職守提起訴訟時,可能會導致個人法律責任。法院日益傾向遵循「冒充者規則」(Impostor Rule),將損失歸咎於最有能力防範詐騙的一方。
您的法規遵循義務也在同步擴展。《歐盟人工智慧法案》(EU AI Act)、NIST 人工智慧風險管理框架(NIST AI Risk Management Framework),以及針對生物特徵辨識攻擊檢測的 ISO/IEC 30107-3 等標準,目前皆要求企業防禦合成媒體威脅。若您的身分驗證流程仍將視訊通話視為身分證明,您就存在一項監管機構與原告律師必能揪出的漏洞。
這不是 IT 團隊的技術問題,而是董事會的財務內部控制問題。
底層技術的實際運作機制
要理解這次攻擊為何能奏效,可以將其比作一張完美的偽鈔。偽造者無需搶劫造幣廠——他們只需要製造出一張足以讓收銀員接受的假鈔即可。奧雅納事件中的攻擊者對人類的面孔與聲音採取了完全相同的做法。
他們結合了兩種 AI 模型協同運作。生成對抗網路(GANs)——由兩個相互競爭以生成和檢測偽造內容的 AI 模型組成的系統——負責即時換臉。一個模型生成假臉;另一個模型則試圖辨別真偽。經過數百萬輪的演練,生成器製造出的面孔連檢測器都無法與真人區分。擴散模型(Diffusion models)——一種學習如何從隨機雜訊中構建清晰影像的 AI——確保了深度偽造面孔在運動過程中不會出現閃爍或變形。這種「時間一致性」(temporal consistency)至關重要,因為人眼對視覺瑕疵極為敏銳。
最關鍵的技術細節在於偽造視訊是如何傳輸到通話中的。攻擊者並非拿著螢幕對著攝影機,而是採用了「視訊注入攻擊」(video injection attack),將合成的視訊封包直接饋送至會議軟體的資料流中。應用程式將這個數位訊號來源視為來自真實攝影機。常規的活體檢測(liveness checks)——即尋找景深和物理邊界的檢測方式——無法檢測出這種手法,因為沒有任何實體痕跡可供分析。
這就是具體的失效模式:您的會議工具信任其接收到的任何視訊串流,完全無法驗證該串流是否來自對準真人的真實攝影機。
有效與無效的防護對策
讓我們先從三種無法解決此問題的方法談起:
標準多因素驗證。 奧雅納的攻擊者完全繞過了 MFA,因為該攻擊的目標並非登入憑證,而是即時通話中的人為判斷。您的 MFA 保護的是您的帳號,而不是您的眼睛。
基於公開 API 構建的通用 AI 聊天機器人。 這些「LLM 套殼」工具——將您的資料傳送至第三方雲端進行處理的薄軟體層——純粹基於機率運作。它們預測的是最可能出現的下一個詞,而不是對照您的實際紀錄來驗證事實。它們無法檢測深度偽造,而且將您的敏感財務資料傳送到企業網路之外還會引入新的風險。
傳統的網路釣魚培訓。 大多數培訓計畫僅教導員工防範可疑電子郵件,而非應對由逼真複製的上司及五位同事所組成的即時視訊通話。奧雅納的員工最初對網路釣魚郵件持懷疑態度,而該視訊通話正是為了徹底克服這種懷疑而專門設計的。
以下才是真正有效的方法——透過 AI 尚無法偽造的訊號來驗證身分的分層防禦體系:
1. 輸入驗證——將行為生物辨識作為隱形守護者。 在進行任何高額交易之前,您的系統應持續分析該人員與其設備互動的方式。按鍵速度、滑鼠移動模式以及觸控螢幕按壓力道,會為每位主管建立獨一無二的行為特徵檔案。這些神經生物學模式幾乎不可能被偽造。若通話中的「財務長」要求轉帳 2,500 萬美元,但其打字行為偏離了歷史特徵檔案,您的系統應自動標記該次互動。
2. 處理流程——透過獨立管道進行帶外確認。 視訊通話已無法再作為金融交易身分驗證的最終依據。每項高額指令都應要求透過預先驗證的電話號碼、Signal 等加密通訊平台,或透過非數位管道共享的預約驗證碼進行獨立驗證。要求未參與原始視訊通話的第二核准人進行審核。
3. 輸出檢驗——密碼學真實來源與生理特徵驗證。 C2PA 標準在視訊擷取的瞬間嵌入密碼學元資料,為每一幀畫面建立具防竄改特性的託管鏈。若 Teams 或 Zoom 通話中的視訊串流缺乏這些憑證,請以對待未簽署合約般的同等懷疑態度來處置。將此與生理訊號分析相結合——這項技術可監測人眼不可見、由心跳引起的面部顏色變化。合成視訊完全缺乏這些生物訊號。
對您的法規遵循與稽核團隊而言,最關鍵的優勢在於:這種分層架構在每個步驟都建立了可驗證的軌跡。您的 安全性評估與強化實務 可以直接將這些控制措施對應至 NIST 人工智慧風險管理框架的四步流程——治理(Govern)、繪製(Map)、測量(Measure)、管理(Manage),以及 ISO/IEC 30107-3 生物特徵辨識攻擊檢測的認證要求。
對於 金融服務領域的機構而言,該架構還能直接銜接您現有的 監管風險與訴訟應對準備 義務。每一次驗證事件都會被記錄,每一次例外覆核均有據可查。當稽核人員或監管機構詢問您如何防範合成媒體詐騙時,您可以向他們展示清晰的邏輯軌跡,而非僅僅展示培訓投影片。
關鍵要點
- 奧雅納深度偽造攻擊透過虛假視訊通話竊取了 2,560 萬美元——全程無惡意軟體、無密碼被盜、無系統遭入侵。
- 換臉攻擊在 2023 年暴增 704%,而製作高逼真度的深度偽造目前僅需約 15 美元及 45 分鐘的精力。
- 視訊通話已無法再作為高額金融交易的身分驗證依據——每筆重大轉帳均須透過獨立管道進行帶外確認。
- 行為生物辨識——透過分析打字與滑鼠移動模式——能夠辨識出深度偽造技術目前尚無法模仿的冒充者。
- 若未在資安事件發生前建立具備深度偽造感知能力的控制措施,資訊長與技術長將面臨日益增加的個人法律責任。
總結
奧雅納(Arup)的安全事件證明,AI 生成的視訊已足以在即時通話中欺騙受過專業訓練的專業人員。您的防禦機制必須超越人類眼見耳聞的直覺,轉向技術可量測的指標——行為特徵模式、生理訊號以及真實性的密碼學證明。請詢問您的 AI 廠商:如果一位被深度偽造的高階主管出現在視訊通話中並要求電匯,您系統中的哪一個具體防護層能夠攔截它?您能否向我展示相應的稽核日誌?