Il phishing non è più solo una mail mal scritta che invita a cliccare su un link. Negli ultimi mesi il fenomeno ha assunto una forma molto più subdola: gli attacchi vocali e i deep voice. Grazie ai progressi dell’intelligenza artificiale generativa, oggi è possibile clonare la voce di una persona con pochi secondi di registrazione, creare conversazioni credibili e utilizzarle per ingannare colleghi, clienti o fornitori. Secondo molti esperti, nel 2025 questa tecnica è diventata uno dei principali vettori di attacco contro le aziende.
Dal testo alla voce: l’evoluzione del phishing
Il phishing tradizionale – e-mail fraudolente progettate per carpire dati o credenziali – è ormai un modello maturo. Gli utenti sono più attenti e i filtri antispam più efficaci, spingendo i criminali a cercare nuovi canali. È così che nascono il vishing (voice phishing) e il deep voice phishing, basati su comunicazioni vocali che sembrano perfettamente autentiche.
Nel vishing l’attaccante telefona fingendosi un dirigente, un tecnico o un operatore bancario, inducendo la vittima a fornire informazioni o compiere operazioni rischiose. Con il deep voice, la voce diventa una replica quasi perfetta di quella di una persona reale: l’IA riproduce tono, inflessioni, ritmo ed emozioni, rendendo la comunicazione estremamente convincente.
Come funziona un attacco deep voice
Il meccanismo richiede pochi passaggi:
- Raccolta dell’audio: video, webinar, podcast o brevi note vocali pubblicate sui social.
- Addestramento del modello IA: bastano 30–60 secondi di registrazione pulita.
- Generazione della voce clonata: messaggi preregistrati o partecipazione in tempo reale a una chiamata.
- Costruzione di un contesto credibile, spesso basato su urgenze o richieste finanziarie.
Negli ultimi mesi si sono verificati casi significativi:
- Un CFO britannico ha trasferito oltre 200.000 sterline dopo aver parlato con la “voce” del CEO.
- Una multinazionale asiatica è stata vittima di una truffa multimilionaria in una videochiamata deepfake.
- In Italia diverse banche hanno segnalato tentativi di frode con voci clonate degli operatori.
Perché questi attacchi funzionano così bene
La voce è percepita come un elemento autentico e identitario: ascoltarla abbassa le difese. Se un dipendente sente “il proprio superiore” che chiede un intervento urgente, la reazione istintiva è collaborare, non dubitare. L’efficacia deriva da diversi fattori:
- Le chiamate vocali non lasciano tracce come le e-mail.
- I sistemi di sicurezza non monitorano in modo strutturato il canale telefonico.
- L’urgenza riduce la capacità critica.
- Gli attaccanti usano informazioni reali, prese da LinkedIn o dai social, per rendere il contesto credibile.
Il risultato è un attacco difficile da riconoscere in tempo reale, soprattutto in ambienti di lavoro frenetici.
Un fenomeno in forte crescita
Report internazionali indicano che il 2025 ha segnato l’industrializzazione dei deepfake vocali. Strumenti un tempo complessi oggi sono acquistabili come SaaS: basta un abbonamento e pochi minuti di registrazione per clonare una voce. Nel dark web stanno comparendo marketplace che offrono modelli vocali già pronti di manager e dirigenti, kit per campagne di vishing e sistemi integrati per distribuire vocali fraudolenti su larga scala.
Questo trend, noto come Voice-as-a-Service, replica la logica del Cybercrime-as-a-Service: attacchi sofisticati accessibili anche a chi non possiede competenze tecniche.
Chi è maggiormente a rischio
Il bacino delle vittime è vastissimo. Le PMI sono particolarmente esposte perché spesso mancano procedure strutturate per verificare l’identità del mittente. Le aziende internazionali, che usano quotidianamente videochiamate e strumenti di collaborazione remota, rappresentano un bersaglio ideale. Anche gli istituti finanziari e le organizzazioni che gestiscono transazioni economiche sono obiettivi ricorrenti.
Nemmeno i privati sono al sicuro: si moltiplicano le truffe in cui la voce di un familiare viene clonata per simulare emergenze improvvise e ottenere denaro in pochi minuti. È una dinamica che sfrutta sia la tecnologia sia la componente emotiva.
Come difendersi
La difesa non può basarsi solo sulla tecnologia: occorrono protocolli chiari e consapevolezza diffusa.
- Verifica dell’identità: La voce non deve essere considerata un elemento affidabile. Ogni richiesta sensibile, soprattutto se urgente, dovrebbe essere verificata tramite un secondo canale: chat aziendale, e-mail ufficiale o ticket interno.
- Procedure aziendali: Le operazioni finanziarie non devono mai dipendere da una semplice telefonata. Le richieste urgenti devono sempre passare attraverso workflow approvati e tracciati.
- Formazione del personale: Mostrare esempi reali di deep voice è estremamente efficace. Inserire questi contenuti nei programmi di awareness aiuta i dipendenti a riconoscere tentativi di manipolazione.
- Tutela delle informazioni: Ridurre la quantità di file audio e video dei dirigenti presenti online limita la possibilità che la loro voce venga clonata. È importante inoltre proteggere adeguatamente piattaforme di videoconferenza e archivi cloud.
- Strumenti di rilevamento: Esistono soluzioni basate su impronte vocali e metadati audio capaci di identificare anomalie. Sono tecnologie promettenti, ma ancora non infallibili: la consapevolezza resta fondamentale.
Il ruolo dei partner tecnologici
Le aziende IT e i consulenti possono svolgere una funzione decisiva nel supportare i clienti. Possono aiutare a definire policy contro il social engineering, aggiornare i piani di risposta agli incidenti includendo scenari vocali, eseguire test attraverso finte chiamate e integrare sistemi di autenticazione multifattore nei processi critici.
Uno scenario in rapida evoluzione
L’intelligenza artificiale ha reso la manipolazione della realtà più semplice e accessibile che mai. Accanto alla crescita degli attacchi vocali, stanno emergendo anche nuove soluzioni difensive: watermark digitali, algoritmi anti-deepfake e requisiti di trasparenza previsti dall’AI Act. Tuttavia, il contesto resta molto dinamico e richiede un approccio proattivo.
Conclusioni
Il phishing è entrato in una nuova era: quella in cui la voce può essere falsificata. Clonazioni perfette, IA generativa e social engineering rendono gli attacchi vocali una minaccia concreta e in forte crescita. La difesa si basa su tre pilastri: consapevolezza, procedure solide e collaborazione con partner affidabili.
In un mondo in cui anche la voce può mentire, la sicurezza passa soprattutto dai comportamenti.




