Eleven v4
Il nostro modello Text to Speech più recente e avanzato.
Eleven v4 è il nostro modello Text to Speech più recente e avanzato, nonché il primo di una nuova generazione di modelli. Rispetto a Eleven v3, migliora la qualità dell’output, la precisione vocale, la coerenza, le emozioni, l’interpretazione, i tag audio e la copertura linguistica.
In generale, Eleven v4 rappresenta un miglioramento netto rispetto a Eleven v3 e offre risultati migliori in quasi tutti i casi. Ti consigliamo vivamente di passare a v4 e provarlo con le tue voci e i tuoi contenuti per vedere tu stesso la differenza. Sebbene alcuni casi limite possano richiedere una soluzione diversa, per la maggior parte degli utenti v4 è la scelta migliore.
Per tag, punteggiatura e prompting dei dialoghi, consulta Prompting per Eleven v4.
Clonazione vocale
La precisione della clonazione vocale fa un grande passo avanti con Eleven v4. Le voci clonate catturano le caratteristiche della voce sorgente — timbro, cadenza e interpretazione — più fedelmente di qualsiasi modello precedente.
Le Instant Voice Clones (IVC) sono più accurate che mai in Eleven v4. Catturano più fedelmente le caratteristiche distintive di una voce sorgente, rendendo più semplice creare rapidamente un clone convincente a partire da un breve campione audio.
Instant Voice Cloning ha ricevuto un importante aggiornamento in Eleven v4, offrendo una precisione complessiva sensibilmente migliore. Se non l’hai ancora provato, questo è un buon momento per testarlo con il tuo audio.
Le Professional Voice Clones (PVC) sono completamente supportate in Eleven v4. Sfruttano gli stessi progressi nella precisione vocale e offrono una riproduzione più fedele della voce sorgente per i workflow che richiedono il massimo livello di coerenza e controllo.
Il supporto per Professional Voice Clone in Eleven v4 è attualmente in fase di rilascio per tutti e dovrebbe essere disponibile entro i prossimi giorni.
A causa di questo importante salto di precisione, Eleven v4 potrebbe suonare sostanzialmente diverso da Eleven v3. Eleven v3 ha gettato le basi per Eleven v4, con una forte enfasi sull’interpretazione e sulla precisione, mentre Eleven v4 sviluppa tali basi con una precisione vocale notevolmente migliorata. Di conseguenza, Eleven v4 è progettato per catturare più fedelmente la voce sorgente, anche se potresti comunque preferire il suono di una voce in Eleven v3. Precisione e preferenze personali non sempre coincidono, quindi ti consigliamo di confrontare entrambe le versioni con i tuoi contenuti per scegliere quella più adatta al tuo caso d’uso.
Poiché Eleven v4 riproduce più fedelmente le caratteristiche della voce sorgente, inclusi accento, interpretazione, volume e altre qualità distintive, la qualità della registrazione sorgente conta più che mai. Un audio di addestramento chiaro e pulito aiuta Eleven v4 a catturare la voce con precisione, senza introdurre suoni o caratteristiche indesiderati. Rumore di fondo, distorsione o altri problemi di registrazione possono influire sul risultato.
Stiamo ancora sperimentando con Eleven v4 per capire come utilizzarlo al meglio. Finora, sembra molto più efficace nel catturare audio ricco di sfumature, in particolare quando è disponibile molto audio di addestramento, come nel caso delle Professional Voice Clones. Le nostre indicazioni sull’uso di dati di addestramento diversificati potrebbero cambiare mentre continuiamo a testare come controllare il modello con un dataset più versatile. Per ora, ti consigliamo di mantenere un unico stile di parlato nell’audio di addestramento, che Eleven v4 dovrebbe catturare meglio dei modelli precedenti.
Gestione nativa degli accenti
Questa è una delle modifiche più importanti di Eleven v4 rispetto a tutti i modelli precedenti, ed è utile comprenderla chiaramente.
Quando la lingua che generi corrisponde a quella della voce di riferimento, l’accento originale viene mantenuto esattamente come prima.
Quando la lingua che generi è diversa da quella della voce di riferimento, Eleven v4 genera un parlato fluido e naturale nella lingua di destinazione, anziché trasferire l’accento della voce di riferimento dalla lingua originale.
In pratica: se cloni la voce di un parlante coreano e generi l’inglese, Eleven v4 produrrà un inglese naturale e fluente anziché un inglese parlato con accento coreano. Questo rende ogni voce utilizzabile in tutte le lingue supportate ed è particolarmente utile per il doppiaggio, i contenuti multilingue e gli agenti vocali che devono servire utenti in lingue diverse con un’unica voce.
Se il tuo workflow dipende dal mantenimento dell’accento nativo di una voce in altre lingue, prova direttamente questo comportamento con Eleven v4 prima della migrazione: è una modifica intenzionale al funzionamento della generazione tra lingue diverse, non un bug.
Tuttavia, questa nuova funzionalità è ancora in fase di ottimizzazione e stiamo valutando modi per renderla un’opzione attivabile, anziché averla sempre attiva. Si tratta ancora di un progetto di ricerca, quindi al momento non abbiamo una tempistica né ulteriori informazioni al riguardo.
Varianti del modello
Eleven v4 è disponibile in due varianti, così puoi scegliere il giusto equilibrio tra qualità e velocità per il tuo caso d’uso:
- Eleven v4 (
eleven_v4) — il nostro modello di massima qualità, ideale per la creazione di contenuti, audiolibri, voci fuori campo per personaggi e qualsiasi caso d’uso in cui la qualità è la priorità principale. - Eleven v4 Turbo (
eleven_v4_turbo) — qualità estremamente elevata con una latenza straordinariamente bassa, progettato appositamente per casi d’uso in tempo reale come agenti conversazionali ed esperienze vocali interattive.
Entrambe le varianti usano due impostazioni vocali: Stabilità e Somiglianza.
La stabilità controlla quanto l’interpretazione rimane coerente tra le generazioni. Valori più bassi consentono un’interpretazione più espressiva e varia; valori più alti mantengono la resa più vicina a una linea di base fissa.
La somiglianza controlla quanto l’output aderisce alla voce di riferimento. Valori più alti impongono una maggiore aderenza al riferimento, a scapito potenzialmente di una parte della naturalezza.
I cursori Stile e Velocità non sono disponibili in Eleven v4 e SSML non è supportato.
I tag audio (ad es. [whispering], [shouting], [laughing]) ti consentono di definire l’interpretazione con un controllo preciso, e Eleven v4 li gestisce con un livello di sfumatura superiore ai modelli precedenti. Non sono ancora perfetti e continuiamo a migliorare l’affidabilità con cui il modello segue le istruzioni dei tag: è un’area su cui stiamo investendo attivamente e continuerà a migliorare.
Esempi
Questi esempi sono grezzi. Non è stato applicato un post-processing significativo: niente EQ, compressione, normalizzazione, de-essing, rimozione delle plosive o simili. Se noti problemi ricorrenti, come clipping, plosive, EQ irregolare o sbalzi di volume, è molto probabile che siano presenti nei dati di addestramento di quella voce. Il modello Eleven v4 li ha semplicemente catturati, poiché è molto preciso, anche quando cattura difetti. Abbiamo lasciato l’audio inalterato affinché tu possa sentire ciò che il modello ha prodotto.
Precisione della clonazione vocale
Ogni esempio inizia con un’anteprima della Voice Library. Abbiamo poi preso del testo e lo abbiamo generato usando una Instant Voice Clone di quella voce sia con Eleven v3 sia con Eleven v4.
Questo non è un confronto perfetto. Eleven v4 funziona anche con le Professional Voice Clones, che possono migliorare ulteriormente la corrispondenza. Tuttavia, per mantenere il confronto più equo, abbiamo usato Instant Voice Clones sia per Eleven v3 sia per Eleven v4.
Questi esempi mostrano quanto della voce originale viene catturato dal modello. È importante notare che questo include anche EQ, qualità, volume e qualsiasi altro piccolo dettaglio e imperfezione dell’audio, come plosive, sibilanti aspre e fluttuazioni del volume.
Ascolta l’anteprima, poi Eleven v3 e infine Eleven v4.
Voce NfUrCNRReUL9RXS9upG1.
Voce HBDoL4wkcalemIO0nUAu.
Recitazione vocale
Queste sono generazioni di Eleven v4. I tag audio nel testo guidano l’interpretazione.
Voce EkK5I93UQWFDigLMpZcX.
Voce t7VaN65ClS2VrEUwk1nR.
Audiolibro
Questa è una narrazione di Eleven v4. I tag definiscono il ritmo e il tono della scena.
Voce KHRvDizAHFVPzoSehNY6.
Il modello continuerà a evolversi
Eleven v4 è in fase di sviluppo attivo e continuo. Man mano che continuiamo ad addestrare e migliorare il modello dopo il lancio, il suo comportamento potrebbe cambiare nel tempo con l’aumento della qualità. Ti consigliamo di testare periodicamente il tuo caso d’uso mentre il modello evolve; condivideremo aggiornamenti importanti man mano che verranno rilasciati.
Domande frequenti
Quali lingue supporta Eleven v4?
Eleven v4 supporta afrikaans, amarico, arabo, armeno, assamese, asturiano, azero, bielorusso, bengalese, bosniaco, bulgaro, birmano, cantonese, catalano, cebuano, croato, ceco, danese, olandese, inglese, estone, filippino, finlandese, francese, fula (pulaar), galiziano, georgiano, tedesco, greco, gujarati, hausa, ebraico, hindi, ungherese, islandese, indonesiano, italiano, giapponese, kannada, kazako, coreano, kirghiso, lao, lingala, lituano, luganda, lussemburghese, macedone, malese, malayalam, maltese, cinese mandarino, māori, marathi, mongolo, nepalese, bokmål norvegese, occitano, odia, pashtu, persiano, polacco, portoghese (Brasile), punjabi, rumeno, russo, serbo, shona, sindhi, slovacco, sloveno, somalo, curdo sorani, spagnolo (America Latina), swahili, svedese, tagico, tamil, telugu, thailandese, turco, ucraino, urdu, uzbeko, vietnamita, gallese e wolof.
Alcune lingue vengono gestite più fluidamente di altre, ma in generale Eleven v4 gestisce molto bene la grande maggioranza di queste.
Una voce clonata manterrà il proprio accento?
Quando la voce di riferimento e il parlato generato sono nella stessa lingua, l’accento della voce viene mantenuto. Ad esempio, se cloni qualcuno che parla inglese con un particolare accento inglese e generi parlato in inglese, quell’accento verrà mantenuto.
Posso far parlare una voce in un'altra lingua con il suo accento originale?
Per impostazione predefinita, quando la lingua generata è diversa da quella della voce di riferimento, Eleven v4 punta a generare un parlato fluido e naturale nella lingua di destinazione anziché trasferire l’accento di riferimento. Puoi provare a usare i tag audio per guidare un accento o uno stile di interpretazione, ma i risultati possono variare, quindi prova la tua voce e il tuo caso d’uso specifici.
Un clone di Eleven v4 suonerà come la sua versione in Eleven v3?
In generale, Eleven v4 riproduce le caratteristiche della voce sorgente in modo molto più accurato rispetto a Eleven v3, inclusi timbro, cadenza, interpretazione e altre particolarità. Di conseguenza, un clone di Eleven v4 in genere suonerà più simile alla voce sorgente e potrebbe suonare piuttosto diverso dalla sua versione in Eleven v3.
Devo addestrare Eleven v4?
Eleven v4 funziona sia con Instant Voice Cloning sia con Professional Voice Cloning.
Con Instant Voice Cloning, crei una voce senza un passaggio di addestramento separato. Carica un breve campione, generalmente da uno a due minuti, e in pochi secondi avrai una voce che puoi usare.
Professional Voice Cloning funziona allo stesso modo dei modelli precedenti. Addestra un modello dedicato su un insieme più ampio di registrazioni.
Se hai già una Professional Voice Clone e desideri addestrarla su Eleven v4, apri My Voices, trova la voce nell’elenco e passaci sopra con il cursore. Vedrai i modelli disponibili per quella voce. Fai clic sul pulsante più accanto a Eleven v4 per iniziare il fine-tuning.
Dovrei usare Voice Design con Eleven v4?
Le voci Voice Design funzionano con Eleven v4, ma potrebbero non essere altrettanto espressive né suonare altrettanto bene rispetto ai modelli precedenti.