Deepfake audio, per realizzarli servono tre secondi di voce vera e 30 euro
Una traccia vocale sintetica che replica fedelmente le sfumature, l'intonazione e il timbro di una persona reale a partire da tre secondi di registrazione della voce vera e a costi bassi, anche 30 euro. L'evoluzione dell'intelligenza artificiale generativa ha reso possibile sistemi sofisticati che da un lato offrono strumenti di accessibilità per chi ha perso l'uso della parola - emblematico il caso dell'attore Val Kilmer per il film Top Gun - dall'altro stanno ridisegnando le frontiere del cybercrimine e delle truffe come quella recente ai danni di un manager Fideuram o con protagonisti le celebrità la cui immagine viene manipolata. Un tema tornato alla ribalta dopo che la premier Giorgia Meloni ha registrato la propria voce all'Ufficio dell'Unione europea per la proprietà intellettuale per difendersi dai fake con l'IA.
Non esiste una cifra precisa per il numero di casi di deepfake audio nel mondo, ma i dati di settore evidenziano un trend generale in forte ascesa. Per la società di sicurezza McAfee, i deepfake (video, foto e audio) sono aumentati del 900% in un anno e l'incremento complessivo dei tentativi di frode ha registrato impennate superiori al 3.000% con attacchi aumentati del 700% anno su anno nel 2026. In maniera più specifica i crimini legati alla clonazione vocale e ai deepfake audio sono aumentati del 1.300%.
I criminali possono utilizzare un breve frammento della voce di una persona, a volte bastano dai tre ai cinque secondi di audio per ottenere una corrispondenza vocale dell'85% tra la voce originale e il clone. In un'analisi datata settembre 2025, Kaspersky ha inoltre segnalato che servono solo 50 dollari per realizzare un deepfake video e 30 per uno audio, circa 400 volte meno di pochi anni fa. E sul dark web sono stati rintracciati diversi programmi, spesso economici, che consentono di realizzare questi falsi. Secondo un rapporto di IdentifAI, i metodi più comuni di attacchi deepfake sono video (45,6%), media misti (25,2%), immagini (17,4%) e clonazione vocale (10,5%).
Le manipolazioni hanno finalità politica per il 24,6% dei casi, il 20,1% mira alla frode, l'11,3% riguarda la pornografia, la satira il 3,2% le celebrità il 9,3%. Anche per questo il mondo creativo si sta organizzando. L'attore Matthew McConaughey ha deciso di brevettare la propria immagine per difendersi dall'uso improprio dell'IA e divesre star di Hollywood del calibro di Cate Blanchett e George Clooney hanno dato il via ad un registro pubblico gratuito per dare il consenso ad un eventuale uso dell'intelligenza artificiale per il lavoro creativo, la voce e l'immagine.
L'Itu, l'Unione internazionale delle telecomunicazioni delle Nazioni Unite, ha fatto appello alle aziende di utilizzare strumenti avanzati per rilevare ed eliminare la disinformazione e i contenuti deepfake per contribuire a contrastare i crescenti rischi di interferenze elettorali e frodi finanziarie. Un tema quanto mai urgente.
Infatti, secondo i dati riportati da security.org, il 70% delle persone ha affermato di non essere sicuro di poter distinguere tra una voce reale e una voce clonata e che i sistemi di rilevamento automatizzati più avanzati subiscono un calo di precisione del 45-50% quando si confrontano con deepfake reali rispetto alle condizioni di laboratorio.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.