Griglia di videochiamata con quattro dirigenti sintetici a wireframe e una persona reale, denaro che esce.
Artificial IntelligenceCybersecurityFintech

Il volto del vostro CFO costa 50 $ da falsificare. I controlli sui bonifici non erano fatti per questo.

Ashutosh SinghalAshutosh Singhal18 giugno 202613 min

La prima volta che ho cercato di ingannare uno di questi strumenti di rilevamento, ci ho messo un pomeriggio e circa cinquanta dollari.

Ho scaricato da YouTube interventi pubblici a conferenze di un collega, li ho fatti passare attraverso un modello di face-swap in esecuzione su una scheda grafica consumer e ho indirizzato l'output verso una telecamera virtuale. Poi mi sono unito a una videochiamata di prova fingendo di essere qualcuno che non sono. Il plugin di "rilevamento deepfake" che stavamo valutando se ne stava lì, luce verde accesa, perfettamente soddisfatto. Era stato costruito per smascherare qualcuno che tiene una foto stampata davanti a una webcam. Io gli avevo consegnato un feed sintetico pulito direttamente nel flusso di dati, e non ha mai guardato la cosa giusta.

Quel pomeriggio è l'intero problema del rilevamento deepfake enterprise in una sola scena. Gli strumenti sono reali, alcuni sono buoni, e quasi nessuno di essi vi protegge dall'attacco che sta davvero svuotando i conti bancari aziendali. La difesa che funziona non è affatto uno strumento. È la cosa per cui ho passato l'anno successivo a convincere i CFO che ne avevano bisogno e che non potevano comprare su un marketplace — il motivo per cui alla fine abbiamo costruito una pratica di difesa deepfake a livelli in Veriprajna invece di rivendere il plugin di qualcun altro.

Lasciate che vi racconti come ci sono arrivato, perché all'inizio credevo il contrario.

Pensavo fosse un problema di rilevamento. Non lo è.

Quando ho guardato per la prima volta la frode deepfake aziendale, ho fatto ciò che fa ogni tecnologo: ho assunto che fosse un problema di accuratezza in attesa di un modello migliore. Compra il miglior rilevatore, collegalo a Zoom, fatto. Cattura il volto falso, ferma la frode.

Così sono andato a cercare il miglior rilevatore. E quanto più leggevo in profondità, più il pavimento crollava sotto quel piano.

Il numero che ha spezzato la mia ipotesi è arrivato dal lavoro di benchmark di Purdue del 2025: gli strumenti di rilevamento che pubblicizzano un'accuratezza del 96-99 percento in laboratorio scendono al 50-65 percento in produzione nel mondo reale. Rileggetelo con la testa di un CFO. Il cinquanta percento è il lancio di una moneta. Il sessantacinque percento significa che un falso su tre passa. Vi viene chiesto di scommettere un bonifico — a volte un bonifico a otto cifre — su un allarme probabilistico che sbaglia un terzo delle volte.

Un rilevatore che ha ragione due volte su tre è un ottimo risultato di ricerca e un controllo catastrofico. Non puoi mettere il lancio di una moneta nel percorso di autorizzazione per denaro che non torna indietro.

Ci ho ruminato sopra per un po'. L'istinto nella sicurezza è sempre inseguire il modello migliore. Ma non esiste un numero di accuratezza che renda "la macchina pensa che questo volto sia probabilmente reale" una base accettabile per spostare denaro. Nemmeno il 99 percento lo sarebbe — perché all'attaccante basta vincere una sola volta, e può scegliere il giorno.

Quella è stata la prima cosa in cui mi sbagliavo, e ammetterlo ha cambiato tutto ciò che abbiamo costruito dopo.

Come funziona davvero una chiamata deepfake da 25,6 milioni di dollari?

Due pannelli: un attacco di presentazione intercettato dalla telecamera contro un attacco di injection che la aggira.

Il caso che tutti in questo campo studiano è Arup, la società di ingegneria globale, nel febbraio 2024. Un dipendente del finance a Hong Kong ha partecipato a una videochiamata con il CFO dell'azienda e diversi altri dirigenti senior, ha discusso una transazione riservata e nei giorni successivi ha eseguito quindici bonifici per un totale di 25,6 milioni di dollari verso cinque conti bancari di Hong Kong.

Ogni persona in quella chiamata tranne la vittima era sintetica.

Ciò che mi colpisce di Arup non è la tecnologia. È quanto fosse ordinario il percorso. Gli aggressori hanno raccolto video e audio pubblici dei dirigenti — YouTube, registrazioni di conferenze, LinkedIn — e hanno addestrato modelli generativi a riprodurre non solo i volti ma l'intonazione e le micro-espressioni. Il costo dei dati di addestramento era zero, perché pubblichiamo noi stessi i volti dei nostri dirigenti. L'addestramento del modello è stato eseguito su hardware consumer per meno di cinquanta dollari.

Poi è arrivata la parte che sfugge alla maggior parte delle difese. Il dipendente all'inizio era scettico — ottimo istinto — così gli aggressori sono passati dall'email a una videochiamata, perché vedere volti familiari è esattamente ciò che annulla lo scetticismo. E hanno iniettato il video sintetico usando software di telecamera virtuale, strumenti come OBS VirtualCam o il Deepfake Offensive Toolkit open-source, alimentando frame fabbricati direttamente nel flusso della conferenza.

Questa è la distinzione con cui ora apro ogni conversazione con un CISO, perché è quella che determina se i vostri soldi sono al sicuro:

Un attacco di presentazione tiene qualcosa davanti a una telecamera. Un attacco di injection aggira del tutto la telecamera. I controlli di liveness catturano il primo e non vedono mai il secondo.

La maggior parte del "rilevamento deepfake" sul mercato — i controlli biometrici di liveness in stile iProov costruiti per l'onboarding dell'identità, gli strumenti che ti chiedono di girare la testa o seguire una luce — è progettata per gli attacchi di presentazione. Sono davvero bravi in questo; la tecnologia Flashmark di iProov è certificata NIST proprio per quel lavoro. Ma un attacco di injection consegna all'app di conferenza un feed sintetico che sembra un input hardware legittimo, e la logica di liveness a monte è contenta. Gli attacchi di injection sono aumentati del 255 percento nel 2023 per un motivo. Sono il modo in cui si battono le difese che le aziende hanno appena comprato.

Nessun malware. Nessuna credenziale rubata. Nessuna rete violata. L'unica cosa compromessa ad Arup è stata la fiducia in ciò che una persona vedeva e sentiva su uno schermo.

Perché un singolo fornitore non può semplicemente fermarlo?

Una volta capito l'attacco, ho iniziato a mappare il panorama dei fornitori per vedere chi potesse fermarlo. Ho costruito un foglio di calcolo — modalità, integrazione di piattaforma, a che cosa è davvero bravo ciascun strumento e, soprattutto, dove ciascuno si rompe. È diventato lungo in fretta, e la conclusione era scomoda per chiunque sperasse di scrivere un solo ordine d'acquisto.

Reality Defender fa monitoraggio multimodale in tempo reale dentro Zoom, ma la sua analisi lato server aggiunge latenza di andata e ritorno a ogni frame, e poiché ispeziona il contenuto piuttosto che il percorso della telecamera, la copertura degli attacchi di injection è sottile — un feed sintetico pulito viene comunque letto come input legittimo. Pindrop è eccellente sulla voce — ha documentato l'impennata del 1.300 percento nella frode deepfake ed è il motivo per cui prendo l'audio sul serio — ma non analizza affatto il flusso video. GetReal Security correla segnali biometrici, comportamentali e di contesto durante una chiamata dal vivo, il che è più vicino alla forma giusta, ma è un player più recente con una Serie A da 17,5 milioni di dollari e un track record limitato a scala enterprise. RealityCheck di Beyond Identity verifica che il feed della webcam provenga da hardware fisico — direttamente rilevante per l'injection — ma è a livello di dispositivo e non guarda il contenuto. Adaptive Security gestisce formazione con simulazioni deepfake per i dipendenti, il che conta, ma la formazione non è un controllo; non blocca nulla.

Potrei continuare. Il punto è la forma, non il catalogo: copertura video qui, audio là, liveness in un terzo posto, attestazione del dispositivo in un quarto, e i gap tra di essi sono esattamente dove vive un attaccante competente.

E poi c'è la risposta della consulenza. Le Big Four e i grandi integrator sono felici di gestire un engagement deepfake — per 500.000-5 milioni di dollari — e consegnarvi un framework di governance e un deck per il board. Nessuno strumento di rilevamento. Raccomanderanno i fornitori sopra; raramente costruiscono o integrano qualcosa. Ho letto quei deliverable. Non sono sbagliati. Semplicemente non sono una difesa.

Nessun singolo fornitore copre video, audio, comportamento e il processo umano. Qualcuno deve architettare le giunzioni tra di essi. Quel qualcuno di solito è nessuno, ed è per questo che le giunzioni sono dove i soldi se ne vanno.

Il controllo che non costa nulla e ferma tutto

Flusso di verifica out-of-band: un'istruzione di bonifico deve superare una richiamata pre-registrata prima del rilascio dei fondi.

È qui che il mio pensiero si è ribaltato completamente.

Avevo passato settimane immerso nell'accuratezza del rilevamento, nelle modalità dei fornitori, nella tassonomia injection-contro-presentazione. E la risposta a "che cosa avrebbe fermato Arup" si è rivelata non avere nulla a che fare con tutto ciò.

Una policy di verifica out-of-band obbligatoria: qualsiasi istruzione finanziaria sopra una soglia definita deve essere confermata tramite un numero di richiamata pre-registrato o un canale cifrato separato prima dell'esecuzione. Non un numero che vi dà chi chiama — un numero che avevate già, memorizzato prima che tutto questo iniziasse. Il CFO in deepfake può essere impeccabile. L'injection può essere non rilevabile. Non importa, perché i soldi non si muovono sulla forza della chiamata. Si muovono dopo che un analista di tesoreria digita un numero attaccato all'interno del proprio cassetto e sente la persona reale dire sì.

Questo controllo non costa nulla da implementare. È efficace contro ogni variante di frode basata su media sintetici — presente, futura, video, voce, qualunque cosa gli aggressori costruiscano dopo — perché non cerca di rilevare il falso. Rimuove del tutto la videochiamata dal percorso di autorizzazione.

Sarò onesto sul perché mi è stato difficile accettarlo. Sono un tecnologo. Volevo che la risposta fosse un modello. L'idea che l'intervento con il ROI più alto in una minaccia AI all'avanguardia sia una policy sulle telefonate del 1995 sembrava una delusione. Ci è voluto vedere i numeri di rilevamento fallire nei test — ancora e ancora, la luce verde su un falso — prima di smettere di resistere alla verità poco scintillante.

I livelli di rilevamento aggiungono fiducia. I controlli di processo aggiungono certezza. L'errore è comprare i primi e saltare i secondi.

Questa è dunque la spina dorsale di ciò che costruiamo ora: prima il processo, il rilevamento come difesa in profondità sopra. Gli strumenti di rilevamento guadagnano il loro posto segnalando anomalie e comprandovi un momento di dubbio. Non guadagnano il diritto di essere l'unica cosa tra un attaccante e la vostra tesoreria.

Il conto che nessuno vedeva arrivare: la vostra assicurazione è scaduta

Per molto tempo la conversazione di budget con i CFO non andava da nessuna parte. La perdita è ipotetica finché non succede, la spesa è reale oggi, e da qualche parte in fondo alla mente di tutti sedeva l'assunto che la cyber insurance l'avrebbe comunque coperta.

Poi, nel gennaio 2026, quell'assunto è morto in silenzio.

Le polizze cyber standard ora escludono esplicitamente gli "intermediari generati dall'AI." Le polizze D&O, E&O e di employment-practices stanno aggiungendo ampie esclusioni AI. La frode deepfake che era un problema del vostro assicuratore nel 2024 è il vostro problema nel 2026 — a meno che non abbiate acquistato un endorsement deepfake separato, che costa 500-3.000 dollari all'anno e che quasi nessuno ha. Se l'attacco Arup vi capita ora, i 25,6 milioni di dollari sono non assicurati. Punto.

Quel singolo cambiamento ha mosso il budget più di ogni statistica sulle perdite che avessi mai citato. Ha riformulato tutto. Non è "spendere soldi per forse evitare un'ipotetica". È "la copertura su cui contavate è sparita, e la responsabilità è atterrata sulla vostra scrivania". I tribunali trovano sempre più spesso i datori di lavoro negligenti per l'assenza di controlli deepfake specifici, e la vecchia "impostor rule" mette la perdita su chi era nella posizione migliore per prevenire la frode. Dopo gennaio 2026, siete voi.

Ciò che i regolatori stanno per richiedere

Ci sono due date che dico a ogni board di dipingere sul muro, perché trasformano questo da una scelta discrezionale in una scadenza.

2 agosto 2026: entrano in vigore gli obblighi di trasparenza dell'Articolo 50 dell'EU AI Act per i contenuti deepfake, con sanzioni fino a €35 milioni o al 7 percento del fatturato globale. Se operate ovunque vicino all'UE, l'era di trattare la governance dei media sintetici come opzionale finisce in quella data.

E dal dicembre 2023, la SEC richiede che gli incidenti di cybersecurity materiali siano divulgati sul Form 8-K entro quattro giorni lavorativi. Una frode deepfake da oltre 25 milioni di dollari supera quasi certamente la soglia di materialità. Quindi immaginate la sequenza reale: scoprite la frode, e ora scatta un timer di quattro giorni su un filing pubblico che descrive esattamente come i vostri controlli sui bonifici hanno fallito — mentre i soldi sono già andati. La regola di disclosure trasforma una perdita privata in una pubblica, con i vostri investitori che leggono insieme a voi.

C'è una tensione più dura e più silenziosa sotto la storia della compliance, ed è dove i framework della consulenza tendono ad agitare le mani. La biometria comportamentale che fa funzionare davvero l'autenticazione continua — dinamiche di digitazione, schemi del mouse, i segnali che correlano gli strumenti in stile GetReal — è precisamente il dato che attiva la legge sulla privacy biometrica dell'Illinois. BIPA ha prodotto oltre 107 class action nel 2025; Clearview AI ne ha risolto una per 51,75 milioni di dollari. L'Articolo 9 del GDPR tratta i dati biometrici come categoria speciale che richiede consenso esplicito. Quindi il vostro miglior segnale di rilevamento è anche la vostra più grande responsabilità privacy se lo distribuite senza il consenso corretto dei dipendenti. Risolvere il problema di sicurezza nel modo negligente crea un problema di litigazione. Mappare ogni controllo a BIPA, GDPR, alla regola SEC e agli standard di test ISO 30107 e CEN/TS 18099 non è burocrazia — è come evitare di scambiare un'esposizione a otto cifre per un'altra.

Non posso semplicemente formare i dipendenti a individuare i falsi?

La gente mi chiede sempre se la formazione di awareness dei dipendenti risolva questo. Basta insegnare a tutti a individuare i falsi.

Vorrei. Il rilevamento umano dei deepfake si aggira intorno al 50 percento — circa quanto otterresti dal caso, e la tecnologia migliora ogni mese. Come specie, siamo scadenti in questo. Il dipendente di Arup non era negligente; era abbastanza scettico da respingere inizialmente. È stata la videochiamata a superare il suo giudizio, perché volti e voci che riconosciamo bypassano il cervello analitico. La formazione aiuta le persone a fermarsi e a invocare il processo. Non trasforma nessuno in un rilevatore umano affidabile, e qualsiasi programma venduto su quella premessa vende comfort.

L'altra domanda che mi fanno è se questo sia esagerato — un paio di titoli spaventosi. Non lo è. Le perdite da frode deepfake negli USA sono triplicate da circa 360 milioni di dollari nel 2024 a 1,1 miliardi di dollari nel 2025. L'incidente enterprise medio ora costa circa 680.000 dollari, e le campagne di frode al CEO colpiscono centinaia di aziende al giorno. I kit di identità sintetica si vendono a circa cinque dollari sul dark web; un video falso parte da cinquanta. L'economia si è invertita — ora costa quasi nulla attaccare e una fortuna essere impreparati.

E sta per peggiorare in un modo specifico. Quasi la metà dei professionisti della sicurezza si aspetta che l'agentic AI — sistemi che concatenano ricognizione, generazione di deepfake e social engineering senza un umano nel loop — sia un vettore di attacco principale entro la fine del 2026. Il pomeriggio da cinquanta dollari che ho passato a ingannare un rilevatore diventa una pipeline completamente automatizzata che corre contro centinaia di target mentre l'operatore dorme.

Ciò che costruiamo davvero

Quindi quando un'impresa viene da noi, non ci presentiamo con un prodotto da vendere. Siamo neutrali rispetto ai fornitori per design — non rivendiamo nessuno degli strumenti che ho nominato, ed è l'unico modo onesto per dire a un cliente che il framework di consulenza da 500K dollari e il plugin Zoom lucido sono entrambi, da soli, insufficienti.

Partiamo dal livello di processo, perché è l'intervento con il ROI più alto e non richiede di comprare nulla: workflow di verifica out-of-band, doppia autorizzazione sopra le soglie, la disciplina della richiamata che rende l'accuratezza del rilevamento quasi irrilevante rispetto a quanto i soldi siano al sicuro. Poi architettiamo lo stack di rilevamento intorno al vostro ambiente di conferenza reale — scegliendo la giusta combinazione di modalità tra quella ventina di fornitori invece di un pitch a piattaforma unica, e chiudendo la giunzione degli attacchi di injection che gli strumenti di liveness lasciano aperta. Mappiamo ogni controllo alle regolamentazioni che ora vi riguardano. E lo sottoponiamo a red team: eseguiamo l'attacco sintetico contro le vostre difese esistenti per trovare il gap prima che lo faccia un criminale — lo stesso esercizio di un pomeriggio che ho fatto all'inizio, trasformato in un servizio. Se volete l'architettura completa, è descritta sulla nostra pagina di difesa deepfake.

Vi lascio con ciò che dico a ogni board una volta che la demo atterra e la stanza diventa silenziosa.

Il controllo che sopravvive a ogni versione di questo — il volto in deepfake, il feed iniettato, qualunque cosa costruiscano dopo — è il numero pre-registrato che un analista di tesoreria digita prima che i soldi si muovano. È la cosa meno sofisticata nel vostro stack di sicurezza, e dopo gennaio 2026 è l'unica cosa tra un volto sintetico e una perdita non assicurata.

Ricerca correlata

Pubblicato anche su

Costruisci la tua IA con fiducia.

Collabora con un team che vanta una profonda esperienza nella creazione della prossima generazione di IA aziendale. Lascia che ti aiutiamo a progettare, sviluppare e implementare una strategia di IA di cui ti puoi fidare.

Veriprajna società di consulenza Deep Tech è specializzata nella creazione di sistemi di IA safety-critical per i settori sanitario, finanziario e regolamentato. Le nostre architetture sono validate rispetto a protocolli consolidati con una documentazione di conformità completa.