ElevenLabs lancia v4: il modello text-to-speech che legge come un attore vero

Eleven v4 è uscito. Non è l’ennesimo modello text-to-speech con ‘qualità migliorata’ nelle note di rilascio. ElevenLabs ha rifatto tutto da zero: nuova architettura, nuovo approccio, nuova filosofia. Il risultato è un modello che legge uno script come un attore — con emozioni stratificate, pause che significano qualcosa, e la capacità di capire chi sta parlando e cosa è appena successo nella scena.

I modelli precedenti generavano voce. Eleven v4 genera interpretazione.

Come funziona davvero

Eleven v4 non processa il testo parola per parola. Legge l’intero script con consapevolezza del contesto: sa chi sta parlando, cosa è successo nella battuta precedente, e come quella successiva dovrebbe suonare. Potete scrivere tag inline tipo [whispers], [nervous laugh], o [door slams] direttamente nello script, e il modello li segue con una precisione che in v3 era impensabile.

Un esempio dal loro demo: un conduttore di quiz show che dice ‘Beethoven is correct!’ seguito da [crowd applause] e poi [amused] ‘I thought we’d lost you there for a moment’. La voce cambia registro, tono, energia — esattamente come farebbe un presentatore vero. Non è sintesi vocale. È recitazione sintetica.

Multi-speaker senza perdere l’identità

Potete rigenerare la stessa battuta cinquanta volte e resta sempre la stessa persona a parlare. Niente vocal drift, niente scivolamenti d’identità. La stabilità del parlante tiene su dialoghi, narrazioni, tutto. E i Professional Voice Clone — che in v3 non erano supportati — qui tornano e funzionano con l’intero range emotivo del modello, in tutte le lingue che la voce clonata parla.

Le lingue supportate sono oltre 90. Con accenti nativi, non quella roba robotica che suona tecnicamente corretta ma stranissima.

Context stitching: audiobook in un colpo solo

Eleven v4 introduce il context stitching: tiene ritmo e delivery costanti su script di qualsiasi lunghezza. Un audiolibro intero suona come una singola registrazione continua, dalla prima all’ultima pagina. Il limite per generazione singola è 10.000 caratteri, ma il sistema mantiene coerenza anche oltre.

Per chi produce contenuti long-form — podcast, corsi, audiolibri — niente più editing manuale per mascherare le transizioni.

Eleven v4 Turbo: quando la velocità conta

Turbo ha la stessa espressività di v4, ma è ottimizzato per real-time e agenti vocali. Mediana di latenza d’inferenza: ~100 ms. Time to first speech: ~150 ms. Le conversazioni scorrono fluide, senza quei silenzi imbarazzanti che ti fanno capire di star parlando con un bot.

Il confronto con la concorrenza è netto. Cartesia Sonic 3.6 fa 262 ms di time to first speech. OpenAI GPT-4o mini TTS arriva a 814 ms — oltre mezzo secondo di attesa. In una chiamata vera, è un’eternità.

Streaming bidirezionale per agent loop

Turbo supporta streaming bidirezionale: mandate testo mentre il vostro LLM lo genera, e l’audio torna indietro prima che la frase sia finita. Fatto per loop di agenti conversazionali. Mantiene la stessa identità vocale dall’inizio alla fine della chiamata, importante quando avete un brand voice da rispettare.

Salesforce sta usando Turbo per Agentforce Voice. Ryan Peterson, SVP Product, dice: ‘Bilanciare determinismo con modelli vocali ad alto EQ’. I loro agenti devono suonare umani e restare controllabili. Turbo fa entrambe le cose.

17.500+ voci nella libreria

Ogni voce nella voice library di ElevenLabs funziona con v4. Sono oltre 17.500. Narrative, conversazionali, per social media, personaggi, educative, pubblicitarie, entertainment, multilingua. Categorie diverse perché i casi d’uso sono diversi: non usi la stessa voce per un audiolibro e per un TikTok.

Le voci per social media sono costruite per catturare l’energia necessaria a tenere un utente sul Reel dall’inizio alla fine. Quelle educative sono affidabili, pazienti, pensate per guidare studenti attraverso argomenti complessi. Non è marketing — è funzionalità specifica.

Voice cloning e voice design

Potete clonare una voce da dieci secondi di audio. Oppure descrivere una voce in una frase e farla generare: ‘A woman in her late 20s with a bright conversational voice and an American accent. Friendly, playful and relaxed tone’. Il sistema la crea senza sessione di registrazione, senza casting call.

C’è anche il pronunciation dictionary: definite una volta come si pronunciano nomi, acronimi, termini tecnici — OAuth diventa ‘oh-auth’, YAML diventa ‘yam-ul’ — e ogni generazione li usa automaticamente.

Cosa cambia rispetto a v3

Le differenze sostanziali:

  • Qualità audio superiore e range emotivo più ampio
  • Identità del parlante stabile anche su rigenerazioni multiple
  • Professional Voice Clone di nuovo supportati
  • Audio tag seguiti più affidabilmente
  • Time to first byte ridotto
  • Context stitching per contenuti lunghi

La differenza tra v4 e v4 Turbo: il primo è ottimizzato per contenuti prodotti dove la qualità è prioritaria. Il secondo sacrifica un po’ di qualità per latenza bassissima, fatto per agenti e real-time.

Prezzi e disponibilità

Eleven v4 usa lo stesso sistema a crediti degli altri modelli ElevenLabs. Piano gratuito: 10.000 crediti al mese, circa dieci minuti di audio. Piano Premium da $6/mese parte con 30.000+ crediti mensili e include voice cloning professionale. Enterprise ha pricing custom e volumi più alti.

Disponibile via API, con endpoint streaming e non-streaming, SDK TypeScript e Python. Per passare da un modello all’altro basta cambiare il model_id. Funziona con i formati standard: MP3 per podcast e YouTube, WAV/PCM per studio e post-produzione, µ-law per telefonia.

Privacy e compliance

Infrastruttura certificata SOC 2 Type II, ISO 27001, PCI DSS Level 1. GDPR compliant, workflow HIPAA-eligible per healthcare. Gli script e gli audio tag mandati a v4 non vengono usati per addestrare i modelli senza consenso. I clienti enterprise possono attivare Zero Retention Mode per i servizi idonei.

Ogni voice clone richiede consenso verificato dal proprietario della voce. Tutto l’audio generato è identificato come AI-generated dall’AI Speech Classifier di ElevenLabs.

Chi lo sta usando

BeyondWords lo usa con centinaia di editori per portare il giornalismo in audio. Patrick O’Flaherty, co-founder: ‘Molti nostri editori hanno visto engagement più alto e tempi di ascolto più lunghi’. Rosebud lo integra per esperienze vocali immersive. Spring Financial lo usa per workflow di vendita automatizzati. Oscar Daniels, Head of Credit Building Products: ‘È il primo modello abbastanza veloce da sembrare una conversazione vera senza sacrificare qualità’.

Kyle Gudmundson di Accenture Accelerate: ‘Prima volta che l’ho usato, era così pulito e realistico che sembrava di far girare una sessione con un attore in cabina’.

Quando un audio lead dice che un modello TTS gli sembra una sessione di registrazione vera, la sintesi vocale ha smesso di suonare sintetica.

AI LABELS_3x2_3_black