For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
Una guida per trasformare il testo in parlato con ElevenLabs
Panoramica
La tecnologia Text to Speech di ElevenLabs è alla base delle nostre offerte e alimenta parlato di alta qualità generato dall’IA in diverse applicazioni in tutto il mondo. Probabilmente hai già sentito le nostre voci in azione, capaci di offrire esperienze audio realistiche.
Iniziare a generare il tuo primo audio con Text to Speech è molto semplice. Tuttavia, per sfruttare al meglio questa funzionalità, ci sono alcuni aspetti da tenere a mente.
Fai clic sul pulsante ‘Genera’ per creare il tuo file audio.
Impostazioni
Scopri le voci, i modelli e le impostazioni per creare parlato di alta qualità.
Le impostazioni che utilizzi, in particolare la voce e il modello, hanno un impatto significativo sull’output. È molto importante conoscerle e capire alcune buone pratiche. Anche altre impostazioni influenzano l’output, ma il loro impatto è meno significativo rispetto alla voce e al modello selezionati.
L’ordine di importanza è il seguente: la selezione della voce è la più importante, seguita dalla selezione del modello e poi dalle impostazioni del modello. Tutti questi elementi, e la loro combinazione, influenzano l’output.
Voci
Voci
Offriamo molti tipi di voci, tra cui le voci predefinite selezionate, la nostra ampia libreria di voci con quasi tutte le voci che puoi immaginare, voci completamente sintetiche create con il nostro strumento Voice Design, e puoi creare la tua raccolta di voci clonate usando le nostre due tecnologie: Clonazione Vocale Istantanea e Clonazione Vocale Professionale.
Non tutte le voci sono uguali e molto dipende dall’audio sorgente usato per crearle. Alcune voci offrono interpretazioni e una resa più naturali, mentre altre sono più stabili.
Scegliere la voce giusta per i tuoi contenuti specifici è fondamentale. Questa è probabilmente la decisione più importante e quella con il maggiore impatto sull’output finale. Determina genere, tono, accento, cadenza e resa. Vale la pena dedicare più tempo alla scelta della voce perfetta e testarla adeguatamente per assicurarti che sia coerente e soddisfi le tue aspettative.
Per generare parlato in una lingua specifica, usare una voce madrelingua dalla Voice Library o clonare una voce che parla quella lingua con l’accento corretto darà i risultati migliori. Anche se tecnicamente qualsiasi voce può parlare qualsiasi lingua, manterrà il suo accento originale. Ad esempio, usare una voce madrelingua inglese per generare parlato in francese probabilmente produrrà un output in francese ma con accento inglese, perché l’IA deve generalizzare come suonerebbe quella voce in una lingua su cui non è stata addestrata.
Se hai una voce che ti piace ma vuoi una resa diversa, il nostro strumento Voice Remixing può aiutarti. Ti consente di usare prompt in linguaggio naturale per modificare la resa, la cadenza, il tono, il genere e persino gli accenti di una voce. Quando modifichi gli accenti, la voce di base e l’accento di destinazione sono molto importanti. I risultati possono variare: a volte funziona perfettamente, altre possono servire alcuni tentativi per ottenere il risultato giusto.
Con Voice Remixing puoi ottenere risultati davvero validi, ma di solito non saranno buoni quanto una Clonazione Vocale Professionale eseguita correttamente. Saranno più simili a quelli di una Clonazione Vocale Istantanea.
Tieni presente che il remix vocale funziona solo con voci specifiche. Ad esempio, non puoi remixare le voci della Voice Library; puoi remixare solo le voci che hai creato tu o le voci predefinite.
Modelli
Modelli
Offriamo due famiglie di modelli: i modelli Standard (di alta qualità) e i modelli Flash, ottimizzati per una latenza estremamente bassa. La maggior parte delle famiglie include versioni sia solo in inglese sia multilingue.
Eleven v4 è il nostro modello più recente. È disponibile in due varianti: Eleven v4 e Eleven v4 Turbo.
La selezione del modello è il secondo fattore più significativo per l’output audio finale, subito dopo la selezione della voce. Ti consigliamo di dedicare qualche minuto a testare i diversi modelli con la voce scelta per trovare la combinazione migliore. Tutti i nostri modelli hanno punti di forza e debolezze e funzionano meglio con alcune voci rispetto ad altre, quindi trovare un buon abbinamento è importante.
Se il tuo output sarà esclusivamente in inglese, ti consigliamo vivamente di usare uno dei nostri modelli solo in inglese. Spesso sono più semplici da usare, più stabili e in genere offrono prestazioni superiori per contenuti esclusivamente in inglese. Se i tuoi contenuti saranno in un’altra lingua o potenzialmente multilingue, devi usare uno dei modelli multilingue.
Le impostazioni più comuni sono stabilità intorno a 50, somiglianza intorno a 75 e stile a 0, con modifiche minime in seguito. Naturalmente, tutto dipende dalla voce originale e dallo stile di interpretazione che vuoi ottenere.
È importante notare che l’IA non è deterministica: impostare gli slider su valori specifici non garantisce gli stessi risultati ogni volta. Gli slider funzionano invece più come un intervallo, determinando quanto può essere ampia la casualità tra una generazione e l’altra.
Velocità
L’impostazione della velocità ti consente di accelerare o rallentare il parlato generato. Il valore predefinito è 1.0, il che significa che la velocità non viene modificata. I valori inferiori a 1.0 rallentano la voce, fino a un minimo di 0.7. I valori superiori a 1.0 accelerano la voce, fino a un massimo di 1.2. Valori estremi possono influire sulla qualità del parlato generato.
La velocità non è disponibile per il modello Eleven v3.
Stabilità
Lo slider della stabilità determina quanto è stabile la voce e la casualità tra una generazione e l’altra. Riducendo questo slider, la voce acquisisce una gamma emotiva più ampia. Come già detto, anche questo dipende molto dalla voce originale. Impostare lo slider troppo in basso può generare interpretazioni insolite, eccessivamente casuali, che fanno parlare il personaggio troppo velocemente. Al contrario, impostarlo troppo in alto può portare a una voce monotona con emozioni limitate.
Per un’interpretazione più vivace e drammatica, consigliamo di impostare lo slider della stabilità su un valore più basso e generare alcune volte finché non trovi un’interpretazione che ti piace.
Se invece vuoi un’interpretazione più seria, che con valori molto alti può arrivare a essere monotona, consigliamo di impostare lo slider della stabilità su un valore più alto. Poiché è più coerente e stabile, di solito non devi generare tanti campioni per ottenere il risultato desiderato. Sperimenta per trovare ciò che funziona meglio per te!
Somiglianza
Lo slider della somiglianza determina quanto l’IA debba attenersi alla voce originale quando cerca di replicarla. Se l’audio originale è di scarsa qualità e lo slider della somiglianza è impostato troppo in alto, l’IA potrebbe riprodurre artefatti o rumore di fondo nel tentativo di imitare la voce, se erano presenti nella registrazione originale.
La somiglianza non è disponibile per il modello Eleven v3.
Esagerazione dello stile
Con l’introduzione dei modelli più recenti, abbiamo aggiunto anche un’impostazione per l’esagerazione dello stile. Questa impostazione cerca di amplificare lo stile del parlante originale. Consuma risorse computazionali aggiuntive e può aumentare la latenza se impostata su un valore diverso da 0. È importante notare che l’uso di questa impostazione rende il modello leggermente meno stabile, poiché cerca di enfatizzare e imitare lo stile della voce originale.
In generale, consigliamo di mantenere sempre questa impostazione su 0.
Speaker Boost
Questa impostazione aumenta la somiglianza con il parlante originale. Tuttavia, richiede un carico computazionale leggermente maggiore, che a sua volta aumenta la latenza. Le differenze introdotte da questa impostazione sono generalmente piuttosto lievi.
Speaker Boost non è disponibile per il modello Eleven v3.
Genera
Dopo aver selezionato la voce, scelto un modello e configurato le impostazioni, il processo di generazione è semplice: inserisci il testo, premi “Genera parlato” e viene generato l’audio.
Anche se il processo è molto semplice in apparenza, il testo inserito è estremamente importante per ottenere l’output desiderato. Quando usi parole che potrebbero essere “fuori distribuzione”, ovvero elementi che l’IA ha incontrato raramente durante l’addestramento, come nomi insoliti, abbreviazioni inusuali, simboli o persino emoji, rischi di confondere l’IA e rendere l’output più instabile. Le emoji e alcuni simboli sono particolarmente difficili da interpretare correttamente per l’IA.
Quando usi Text to Speech tramite l’interfaccia utente, eseguiamo un passaggio di normalizzazione automatica sull’input per migliorare la leggibilità del testo e semplificarne l’elaborazione da parte dell’IA. In genere, questo passaggio converte simboli e numeri in testo scritto, guidando l’IA verso la pronuncia corretta.
Una buona pratica che consigliamo vivamente è evitare di scrivere i numeri in cifre o di usare simboli, soprattutto quando utilizzi modelli multilingue, anche se vale anche per i modelli solo in inglese. Poiché numeri e simboli si scrivono allo stesso modo in molte lingue ma vengono pronunciati diversamente, fare affidamento sulle cifre crea ambiguità per l’IA. Ad esempio, il numero “1” si scrive allo stesso modo in inglese e in molte altre lingue, ma si pronuncia diversamente. Scrivere il numero in lettere, ad esempio “uno”, evita che l’IA debba interpretare cosa deve fare.
Stiamo sviluppando workflow più avanzati che ti permettano di influenzare la resa e l’interpretazione dell’IA tramite quelli che chiamiamo tag audio. Questa funzionalità è disponibile in Eleven v4 ed Eleven v3. Se vuoi saperne di più, ti consigliamo di leggere la nostra guida ai prompt.
FAQ
Un buon input produce un buon output
Il primo fattore, e uno dei più importanti, è che un input valido, di alta qualità e coerente produrrà un output valido, di alta qualità e coerente.
Se fornisci all’IA un audio non ideale, ad esempio un audio con molto rumore, riverbero su un parlato chiaro, più parlanti oppure un volume o un’interpretazione e resa incoerenti, l’IA diventerà più instabile e l’output sarà più imprevedibile.
Se prevedi di clonare la tua voce, ti consigliamo vivamente di consultare le linee guida nella documentazione per creare cloni vocali adeguati, poiché ti forniranno la migliore base possibile da cui partire. Anche se intendi usare solo Clonazioni Vocali Istantanee, è consigliabile leggere anche la sezione sulla Clonazione Vocale Professionale. Questa sezione contiene informazioni preziose sulla creazione di cloni vocali, anche se i requisiti per queste due tecnologie sono leggermente diversi.
Usa la voce giusta
Il secondo fattore da considerare è che la voce selezionata avrà un enorme effetto sull’output. Come menzionato nel primo fattore, non solo la qualità e la coerenza dei campioni usati per creare quel clone specifico sono estremamente importanti, ma lo sono anche la lingua e la tonalità della voce.
Se vuoi una voce allegra e vivace, dovresti usare una voce clonata con campioni allegri e vivaci. Al contrario, se desideri una voce introspettiva e cupa, dovresti selezionare una voce con queste caratteristiche.
Tuttavia, è fondamentale usare anche una voce addestrata nella lingua corretta. Ad esempio, tutti i cloni vocali professionali che offriamo come voci predefinite sono voci inglesi e sono stati addestrati su campioni in inglese. Di conseguenza, se li fai parlare in altre lingue, la loro resa in quelle lingue può essere imprevedibile. È essenziale usare una voce clonata da campioni in cui la persona parlava la lingua che vuoi poi far parlare all’IA.
Usa una formattazione corretta
Può sembrare un dettaglio trascurabile, ma può fare una grande differenza. L’IA cerca di capire come leggere qualcosa in base al contesto del testo stesso, quindi non solo alle parole usate, ma anche a come sono combinate, a come viene usata la punteggiatura, alla grammatica e alla formattazione generale del testo.
Questo può avere un’influenza piccola ma importante sulla resa dell’IA. Se sbagli a scrivere una parola, l’IA non la correggerà e proverà a leggerla così com’è scritta.
Non deterministico
Le impostazioni dell’IA non sono deterministiche, il che significa che anche con le stesse condizioni iniziali, ovvero voce, impostazioni e modello, l’output sarà leggermente diverso, proprio come un doppiatore offre un’interpretazione leggermente diversa ogni volta.
Questa variabilità può dipendere da vari fattori, come le opzioni menzionate in precedenza: voce, impostazioni e modello. In genere, l’ampiezza di questa variabilità può essere controllata tramite lo slider della stabilità. Un’impostazione di stabilità più bassa comporta una maggiore variabilità tra le generazioni, ma introduce anche una variabilità tra le generazioni, in cui l’IA può essere un po’ più espressiva.
Una maggiore variabilità può spesso essere desiderabile, poiché impostare la stabilità troppo alta può rendere alcune voci monotone, dato che non lascia all’IA lo stesso margine per generare contenuti più variabili. Tuttavia, impostare la stabilità troppo bassa può introdurre altri problemi, rendendo le generazioni instabili, soprattutto con alcune voci per cui potrebbe essere stato usato audio non ideale nel processo di clonazione.
L’impostazione predefinita di 50 è generalmente un ottimo punto di partenza per la maggior parte delle applicazioni.
Che cos'è Eleven v4?
Ti consigliamo di passare a Eleven v4 e testarlo con i tuoi contenuti.
Eleven v4 è il nostro modello Text to Speech più recente e avanzato, nonché il primo di una nuova generazione di modelli. Rispetto a Eleven v3, migliora la qualità dell’output, l’accuratezza della voce, le emozioni, gli audio tag e la copertura linguistica.
L’accuratezza della clonazione vocale fa un importante passo avanti con Eleven v4. Le voci clonate riproducono più fedelmente che mai le caratteristiche della voce sorgente — timbro, cadenza e resa.
Le Clonazioni Vocali Istantanee (IVC) sono più accurate che mai in Eleven v4. Catturano più fedelmente le caratteristiche distintive di una voce sorgente, semplificando la creazione rapida di un clone convincente a partire da un breve campione audio.
Le Clonazioni Vocali Professionali (PVC) sono pienamente supportate in Eleven v4. Si basano sugli stessi progressi nell’accuratezza della voce e offrono una riproduzione più fedele della voce sorgente per workflow che richiedono il massimo livello di coerenza e controllo.
Eleven v4 è disponibile in due varianti, così puoi scegliere il giusto equilibrio tra qualità e velocità per il tuo caso d’uso:
Eleven v4 (eleven_v4) — il nostro modello di massima qualità, ideale per la creazione di contenuti, audiolibri, voci fuori campo per personaggi e qualsiasi caso d’uso in cui la qualità è la priorità principale.
Eleven v4 Turbo (eleven_v4_turbo) — qualità estremamente elevata con una latenza notevolmente bassa, progettato appositamente per casi d’uso in tempo reale come agenti conversazionali ed esperienze vocali interattive.
Entrambe le varianti utilizzano due impostazioni vocali: Stabilità e Somiglianza. I cursori Stile e Velocità non sono disponibili in Eleven v4 e SSML non è supportato.
Quando la lingua che generi corrisponde a quella della tua voce di riferimento, l’accento originale viene preservato esattamente come prima. Quando la lingua che generi è diversa da quella della voce di riferimento, Eleven v4 genera parlato fluente e naturale nella lingua di destinazione, anziché mantenere l’accento della voce di riferimento dalla sua lingua originale.
Per clonazione, accenti, confronti e la descrizione completa, consulta Eleven v4. Per tag e prompting, consulta Prompting per Eleven v4.
Che cos'è Eleven v3?
Ti consigliamo di passare a Eleven
v4 e testarlo
con i tuoi contenuti. Molte delle tecniche di prompting per Eleven
v4 si applicano anche a
Eleven v3.
Eleven v3 è un modello Text to Speech espressivo e ricco di emozioni. Produce parlato naturale e realistico, con un’ampia gamma emotiva e comprensione del contesto in oltre 70 lingue.
Eleven v3 offre:
Supporto per gli audio tag
emozioni: [sad][angry][happily]
indicazioni di resa: [whispers][shouts]
reazioni non verbali: [laughs][clears throat][sighs]
Modalità Dialogo per audio dal suono naturale con più interlocutori
Supporto per oltre 70 lingue
Questo modello funziona bene per dialoghi tra personaggi, narrazione di audiolibri e dialoghi emotivi.
Il controllo della velocità della voce è disponibile per Text to Speech tramite Sintesi vocale, Studio, ElevenAgents e la nostra API.
Puoi controllare la velocità della voce con l’impostazione Velocità.
I valori possibili vanno da 0,7 a 1,2. I valori inferiori a 1 rallentano il parlato, mentre quelli superiori a 1 lo accelerano. I valori estremi possono influire sulla qualità del parlato generato.
Questa impostazione è disponibile per tutte le voci e tutti i modelli. La trovi nelle impostazioni della voce.
Per informazioni su come controllare il parlato quando usi l’API, consulta il nostro Riferimento API.
Posso usare la stessa voce clonata/progettata in più lingue?
Qualsiasi voce può parlare in una qualsiasi delle lingue supportate.
Con il funzionamento del modello attuale, non selezioni una lingua specifica: scrivi invece nella lingua che vuoi far parlare all’IA, che la comprende automaticamente. Tuttavia, poiché possono esserci sovrapposizioni tra lingue diverse che usano parole e vocabolario simili, ma con pronunce e accenti molto diversi, dovresti usare una voce clonata da una registrazione nella lingua con l’accento corretto.
La lingua è determinata dal testo, mentre l’accento e la pronuncia sono determinati dalla voce stessa. Per funzionare in modo ottimale, sono necessari entrambi questi contesti.
Stiamo valutando lo sviluppo di una nuova tecnologia per facilitare la selezione della lingua, ma il modo in cui è costruita l’IA significa che tutto questo è ancora in fase di sviluppo.
Come posso scaricare i file generati da Text to Speech?
Puoi scaricare i file generati in due modi:
Puoi scaricare subito un file generato facendo clic sul pulsante di download in basso a destra dopo aver generato il contenuto.
I file generati in precedenza possono essere scaricati dalla cronologia.
Per accedere alla cronologia, accedi al tuo account e seleziona Text to Speech nella barra laterale, quindi fai clic sulla scheda della cronologia nel pannello sul lato destro dello schermo. Sugli schermi stretti, puoi accedere alla cronologia facendo clic sull’icona della cronologia sopra il pulsante Genera parlato.
Dalla cronologia, puoi fare clic sull’icona di download per visualizzare l’opzione di scaricare il file in formato MP3 (128 kbps) o WAV.
Puoi anche fare clic su Avanzate per scaricare in altri formati:
MP3 (192 kbps)
MP3 (256 kbps)
M4A
FLAC
Potete far produrre alle voci il suono della respirazione?
Sì. Con Eleven v4 ed Eleven v3, puoi usare tag audio come [sighs] o [exhales] per aggiungere respiri e reazioni simili al parlato generato.
Consulta la guida al prompting per maggiori dettagli sui tag audio e sul controllo dell’interpretazione.
Offrite un modello IA per scopi conversazionali o per chatbot?
I nostri modelli Flash e Turbo sono stati sviluppati appositamente per applicazioni a bassa latenza.
Flash v2 e Flash v2.5 sono i nostri modelli a latenza ultra-bassa e generano audio in meno di 75 ms. Flash v2 è disponibile solo in inglese, mentre Flash v2.5 supporta 32 lingue. Puoi consultare l’elenco completo di tutte le lingue supportate qui.
Anche i nostri modelli Turbo hanno una bassa latenza, ma poiché i modelli Flash offrono risultati molto simili, consigliamo di usare Flash anziché Turbo. Turbo v2 è disponibile solo in inglese, mentre Turbo v2.5 supporta 32 lingue, è il 25% più veloce di Turbo v2 e genera audio in circa 300 ms.
Sia Flash sia Turbo sono modelli altamente ottimizzati, pensati appositamente per applicazioni a bassa latenza senza sacrificare le prestazioni vocali e mantenendo lo standard qualitativo che le persone si aspettano dai nostri modelli.
Entrambi i modelli hanno un prezzo scontato per la generazione tramite API. Per i dettagli, consulta i prezzi delle API.
Offriamo anche ElevenAgents, la nostra piattaforma per distribuire agenti vocali interattivi e personalizzati. Visita la documentazione di ElevenAgents per saperne di più.
Come posso aggiungere delle pause?
Esistono diversi modi per inserire una pausa o un’interruzione e influenzare il ritmo e la cadenza della voce. Il metodo da usare dipende dal modello.
Tag audio (Eleven v4 ed Eleven v3)
Con Eleven v4 ed Eleven v3, usa i tag audio e la punteggiatura per controllare ritmo e interpretazione. Questi modelli non supportano i tag di interruzione SSML.
Consulta la guida al prompting per indicazioni su come inserire pause e controllare l’interpretazione.
Tag di interruzione (Multilingual v2, Flash v2 e Flash v2.5)
Il modo più affidabile per aggiungere una pausa con Multilingual v2, Flash v2 e Flash v2.5 è usare la sintassi del tag di interruzione SSML <break time="1.5s" />. In questo modo si crea una pausa precisa e naturale nel parlato. Non viene semplicemente inserito silenzio tra le parole: il modello comprende la sintassi e aggiunge una pausa naturale.
Il modo in cui il modello gestisce queste pause può variare. La voce utilizzata svolge un ruolo fondamentale nell’output. Alcune voci, addestrate con alcuni “ehm” e “ah”, possono inserire questi manierismi vocali durante le pause, proprio come farebbe un parlante reale.
Un esempio potrebbe essere:
“Dammi un secondo per pensarci.” <break time="1.0s" /> “Sì, potrebbe funzionare.”
La durata dell’interruzione deve essere indicata in secondi. L’IA può gestire pause fino a 3 secondi e può essere usata in Text to Speech e tramite API.
Se usi un numero eccessivo di interruzioni SSML nel testo, potrebbero verificarsi problemi. Il parlato potrebbe accelerare oppure l’audio potrebbe introdurre più rumore e altri artefatti. Stiamo lavorando per risolvere il problema.
Punteggiatura
Queste opzioni sono meno affidabili dei tag di interruzione o dei tag audio, ma possono comunque influenzare il ritmo.
Un semplice trattino - o un trattino lungo — spesso funzionano bene. Puoi aggiungere più trattini, ad esempio -- --, per una pausa più lunga.
“Si - sta - facendo tardi.”
I puntini di sospensione ... a volte possono aggiungere una pausa tra le parole, ma di solito aggiungono anche un po’ di esitazione o nervosismo alla voce, che potrebbe non essere sempre adatto.
“Io… sì, credo di sì…”
Come posso forzare una determinata pronuncia di una parola o di un nome?
Eleven v3 include il supporto nativo per l’alfabeto fonetico internazionale (IPA). Scopri di più in IPA con Eleven v3.
Tag fonema SSML (solo Flash v2 e Turbo v2)
Con Flash v2 e Turbo v2, puoi forzare una determinata pronuncia usando i tag fonema SSML. Supportiamo sia IPA sia CMU. Con l’implementazione attuale, CMU tende a essere un po’ più prevedibile e coerente. Puoi trovare ulteriori informazioni nella nostra guida alla pronuncia.
Ortografie alternative
In alternativa, puoi trovare un’ortografia alternativa e scrivere una parola in modo più fonetico. Puoi usare diversi accorgimenti, come lettere maiuscole, trattini, apostrofi o persino virgolette singole attorno a una lettera o più lettere.
Ad esempio, una parola come “trapezii” potrebbe essere scritta “trapezIi” per enfatizzare maggiormente le “ii” della parola.
Come funzionano i tag audio con Eleven v3 e v4?
Eleven v4 ed Eleven v3 supportano i tag audio. Consigliamo Eleven v4. Inserisci una breve istruzione tra parentesi quadre e posizionala nel punto del testo in cui l’interpretazione deve cambiare. Gli stessi tag funzionano con entrambi i modelli.
I file generati con Text to Speech o Modificatore di Voce possono essere scaricati in formato MP3, WAV, M4A o FLAC. I file WAV, M4A e FLAC devono essere scaricati dalla cronologia.
Come scaricare file WAV
Seleziona Text to Speech o Modificatore di Voce nella barra laterale, quindi accedi alla cronologia facendo clic sulla scheda della cronologia nel pannello sul lato destro dello schermo. Sugli schermi stretti, puoi accedere alla cronologia facendo clic sull’icona della cronologia sopra il pulsante Genera parlato.
Dalla cronologia, puoi fare clic sull’icona di download per visualizzare l’opzione di scaricare il file in formato MP3 o WAV.
Come scaricare file FLAC o M4A
Seleziona Text to Speech o Modificatore di Voce nella barra laterale, quindi accedi alla cronologia facendo clic sulla scheda della cronologia nel pannello sul lato destro dello schermo. Sugli schermi stretti, puoi accedere alla cronologia facendo clic sull’icona della cronologia sopra il pulsante Genera parlato.
Dalla cronologia, puoi fare clic sull’icona di download per visualizzare l’opzione di scaricare il file in formato MP3 o WAV. Per accedere ad altri formati, inclusi FLAC e M4A, fai clic su Avanzate e seleziona il formato che preferisci.
Come seleziono la lingua e l'accento?
Lingua durante la generazione dal sito web
Quando generi audio sul sito web di ElevenLabs, la nostra IA rileva automaticamente la lingua in base al contesto del testo del prompt. Per questo è meglio evitare di usare più lingue in un unico prompt, poiché potrebbe creare confusione su quale lingua usare. Al momento, non è possibile specificare una lingua durante la generazione sul sito web.
Lingua durante la generazione tramite API
Se generi audio tramite API, puoi specificare manualmente la lingua del prompt usando il parametro language_code. Si tratta di un parametro facoltativo che accetta codici lingua ISO 639-1.
Può essere utile per prompt brevi o ambigui, ad esempio quando il testo include solo numeri. Specificare la lingua garantisce che il normalizzatore applichi le regole corrette per quella lingua.
Per maggiori informazioni sulla normalizzazione, consulta questo articolo.
Accento
L’accento usato per la generazione dipende dalla voce che stai usando. Se usi una voce non addestrata nella lingua in cui stai generando, potresti notare un leggero accento della lingua originale della voce.
Per ottenere i migliori risultati, consigliamo di usare una voce addestrata con audio nella lingua in cui stai generando, con l’accento che preferisci. In questo modo l’IA comprende più accuratamente pronuncia e intonazione.
Questo è particolarmente importante per lingue simili o che condividono molte parole. Scegliere una voce addestrata nella lingua corretta assicura che l’IA usi la pronuncia e l’accento corretti.
Puoi:
Creare una voce clonata usando audio nella lingua e con l’accento che preferisci.
Esplorare la Voice Library e usare i filtri di ricerca per trovare voci adatte alle tue esigenze.
Quanto costa generare con Eleven v3 (Alpha)?
Il costo per generare con Eleven v3 è di 1 credito per carattere sul sito web. Le generazioni tramite API hanno un prezzo scontato: consulta i prezzi delle API per i dettagli.
Visita le seguenti risorse per maggiori informazioni:
Con Eleven v4 ed Eleven v3, puoi usare tag audio come [laughs] per aggiungere risate e altre reazioni al parlato generato. Consulta la guida al prompting per maggiori dettagli.
Per gli altri modelli, l’interpretazione emotiva dipende dal contesto, dalla punteggiatura e dalle impostazioni della voce. Consulta Come produrre emozioni?.
Come produrre emozioni?
Il modello è sensibile al contesto più ampio che circonda ogni enunciato: valuta se qualcosa ha senso in base al collegamento con il testo precedente e successivo. Questa prospettiva più ampia gli consente di intonare correttamente frammenti più lunghi, sovrapponendo a più frasi un particolare filo di pensiero con un pattern emotivo coerente.
Suggerimenti per produrre emozioni:
Il contesto è fondamentale per generare emozioni specifiche. Se inserisci un testo divertente o con risate, potresti ottenere un output allegro. Lo stesso vale per rabbia, tristezza e altre emozioni: definire il contesto è essenziale.
La punteggiatura e le impostazioni della voce determinano principalmente il modo in cui viene pronunciato l’output.
Aggiungi enfasi racchiudendo tra virgolette le parole o le frasi pertinenti.
Per il parlato generato con una voce clonata, lo stile di espressione dei campioni caricati per la clonazione viene riprodotto nell’output. Se il parlato nel campione caricato è monotono, il modello avrà difficoltà a produrre un output espressivo.
Con Eleven v4 ed Eleven v3, puoi anche utilizzare gli audio tag per controllare più direttamente emozione e resa, ad esempio [happy], [sad], [angry], [whispers] e [laughs]. Per maggiori dettagli, consulta la guida ai prompt.
Questi suggerimenti aiutano a guidare la resa emotiva, ma non garantiscono un risultato specifico.
C'è un modo per ascoltare l'anteprima dell'audio senza consumare quota prima di scaricarlo?
Purtroppo, al momento non offriamo la detrazione al download come alternativa alla detrazione alla generazione. Attualmente non è possibile ascoltare in anteprima le generazioni senza consumare la quota.
Quando premi ‘Genera’ sul sito web, vengono scalati dei crediti perché i server devono avviarsi e l’audio deve essere generato. Non è possibile testare o ascoltare in anteprima una voce con un testo personalizzato senza usare crediti.
Consentiamo due rigenerazioni gratuite in Text to Speech tramite il sito web nelle seguenti circostanze:
Il prompt (per Text to Speech) o il file (per Modificatore di Voce), la voce e il modello rimangono invariati. Puoi modificare i cursori delle impostazioni vocali.
La prima generazione è stata effettuata meno di due ore fa.
Non hai aggiornato la pagina dopo aver generato l’audio originale.
In questo caso, vedrai ‘Rigenera parlato’ e, passando il cursore sul pulsante ‘Rigenera parlato’, verrà visualizzato il numero di rigenerazioni gratuite rimanenti:
Dopo aver utilizzato le rigenerazioni gratuite, il pulsante tornerà a ‘Genera parlato’ e verrà visualizzato il numero di crediti che saranno usati per la generazione:
Le rigenerazioni gratuite sono disponibili solo in Text to Speech tramite il sito web. Non sono disponibili tramite API.
Stiamo valutando se possiamo offrire anteprime di questa qualità senza aumentare prezzi o costi. Stiamo anche esplorando modi per rendere l’IA più controllabile, così non dovrai ascoltare anteprime e potrai ottenere il risultato desiderato, idealmente al primo tentativo.
Che cos'è la modalità Dialogo?
Eleven v4 ed Eleven v3 offrono la modalità Dialogo, che ti consente di generare conversazioni dinamiche con più interlocutori, dal ritmo naturale e in grado di gestire interruzioni, cambi di tono e segnali emotivi in base al contesto della conversazione.
La modalità Dialogo è disponibile quando utilizzi più interlocutori tramite il sito web.
Puoi anche usare gli endpoint API Text to Dialogue per generare interazioni con più interlocutori. Per maggiori informazioni, consulta la nostra documentazione API:
Qualsiasi voce può parlare qualsiasi lingua attualmente supportata dall’IA; tuttavia, se non usi una voce madrelingua nella lingua che vuoi far parlare all’IA — ad esempio una voce generata o una voce clonata che parla inglese — l’IA potrebbe avere un lieve accento inglese o alternare lingue simili.
Per l’elenco completo di tutte le lingue supportate, consulta questo articolo: Quali lingue supportate?
Il modello attuale funziona in modo che tu non selezioni una lingua specifica. Scrivi invece nella lingua che vuoi far parlare all’IA, che la riconosce automaticamente. Tuttavia, poiché lingue diverse possono sovrapporsi nell’uso di parole e vocabolario simili, ma con pronunce e accenti molto diversi, dovresti usare una voce clonata da una persona che parla quella lingua con l’accento corretto. Questo garantisce all’IA il massimo contesto su come pronunciare qualcosa e in quale lingua.
La lingua è determinata dal testo, mentre l’accento e la pronuncia sono determinati dalla
voce stessa.
Stiamo valutando lo sviluppo di nuove tecnologie per facilitare la selezione della lingua, ma il modo in cui è costruita l’IA fa sì che tutto questo sia ancora in corso.
Qual è il numero massimo di caratteri e di testo che posso generare?
In Text to Speech, tramite il sito web, puoi generare fino a 5.000 caratteri in una singola generazione con qualsiasi piano a pagamento e fino a 2.500 caratteri con tutti i piani gratuiti.
Tuttavia, se prevedi di generare contenuti lunghi di oltre qualche migliaio di caratteri, ti consigliamo vivamente di usare Studio, che ti permette di generare facilmente contenuti molto lunghi come libri e romanzi. Puoi approfondire qui.
Se generi tramite API, la lunghezza massima dell’input varia in base al modello utilizzato:
Text to Speech
Flash v2.5 - fino a 40.000 caratteri (~40 minuti di audio)
Turbo v2.5 - fino a 40.000 caratteri (~40 minuti di audio)
Flash v2 - fino a 30.000 caratteri (~30 minuti di audio)
Turbo v2 - fino a 30.000 caratteri (~30 minuti di audio)
Multilingual v2 - fino a 10.000 caratteri (~10 minuti di audio)
Modificatore di Voce
Multilingual v2 - fino a 10 minuti di audio
Quali voci della libreria vocale sono madrelingua di una lingua specifica?
Tutte le voci predefinite e le voci generate sono in inglese. Ciò significa che potrebbero non avere l’accento o la pronuncia corretti quando parlano altre lingue.
Nella Voice Library, nella categoria professionale, puoi trovare voci che la community ha condiviso con noi. Si tratta di Cloni vocali professionali delle proprie voci. In genere, queste voci hanno un tag della lingua che indica quella in cui sono state clonate, rendendole native di tale lingua. Puoi anche usare il filtro di ricerca per lingua per filtrare lingue specifiche.
Perché numeri, date, simboli e acronimi non vengono pronunciati correttamente o nella lingua giusta?
Numeri, date, simboli e acronimi possono rappresentare una sfida per l’IA, poiché spesso esistono più modi per pronunciarli correttamente. Questo può dipendere anche dalla lingua utilizzata: ad esempio, “11” può essere letto come “Eleven” in inglese, ma in spagnolo può essere “Once” e in tedesco “Elf”.
Esistono vari modi per assicurarti che numeri, date, acronimi e simboli vengano pronunciati correttamente.
Scrivili per esteso, in parole
Per ottenere i risultati migliori, ti consigliamo di scrivere per esteso numeri, acronimi, date e simboli, nel modo in cui vuoi che l’IA li pronunci. In questo modo l’IA ha il massimo contesto per fornire l’output corretto. Ad esempio, per “$100”, ti consigliamo di scrivere “a hundred dollars” oppure “one hundred dollars” per ottenere il risultato desiderato.
Usare un LLM
Se usi un modello linguistico di grandi dimensioni per generare i prompt di testo, ad esempio con ElevenAgents, puoi chiedere al modello di scrivere sempre per esteso numeri, date, simboli e acronimi nel modo in cui preferisci che l’IA li pronunci.
Normalizzazione
Se generi tramite API, puoi specificare se applicare la normalizzazione del testo usando il parametro apply_text_normalization. La normalizzazione del testo scrive per esteso numeri e date per garantire una pronuncia migliore. Questa opzione aggiunge latenza, poiché il processo di normalizzazione richiede ulteriore tempo di elaborazione.
Il parametro apply_text_normalization ha tre modalità:
on, che indica che viene applicata sempre
off, che indica che non viene applicata mai
auto, che indica che l’IA decide automaticamente quando applicare la normalizzazione del testo
Puoi anche specificare la lingua del prompt usando il parametro language_code. Si tratta di un parametro facoltativo che accetta codici lingua ISO 639-1.
Può essere utile per prompt brevi o ambigui, ad esempio quando il testo contiene solo numeri o simboli. Specificando la lingua, la normalizzazione applica le regole corrette per quella lingua.
La normalizzazione è abilitata per impostazione predefinita quando generi con Text to Speech dal sito web.
In Studio, per impostazione predefinita la normalizzazione viene applicata automaticamente, quindi l’IA decide quando applicarla. Puoi anche impostarla perché venga sempre applicata: trovi questa opzione in Impostazioni del progetto, nella scheda Avanzate.
Perché la mia voce pronuncia male alcune parole?
Le pronunce errate possono verificarsi per diversi motivi. Il più comune è che la parola sia semplicemente scritta in modo errato. L’IA non cerca di correggere le parole scritte male e prova a leggerle esattamente come sono scritte. Per questo è importante ricontrollare il testo e assicurarti che sia revisionato e completo prima di farlo leggere all’IA.
Se vuoi forzare una determinata pronuncia, puoi usare i tag fonema SSML con il nostro modello Flash v2. Puoi saperne di più nella nostra guida alla pronuncia.
A volte l’IA può pronunciare male le parole o avere un accento insolito, diverso da quello che ti aspetti. Questo può accadere per vari motivi e, nella maggior parte dei casi, dipende molto dalla voce e dalla lingua. Il modo migliore per garantire l’accento e la pronuncia corretti è clonare una voce con l’accento e la pronuncia giusti. In questo modo l’IA avrà il massimo contesto durante la generazione dell’audio.
La lingua è specificata dal testo, mentre l’accento è specificato dalla voce. Quindi, se scrivi in una lingua che può condividere molte parole comuni o essere strettamente imparentata con un’altra lingua, l’IA potrebbe avere difficoltà a capire come pronunciare determinate parole o a passare da un accento all’altro.
Tuttavia, in alcune circostanze, l’IA potrebbe pronunciare male parole scritte correttamente, anche in inglese. Sembra dipendere in gran parte dalla voce e dal testo usati, ma dovrebbe accadere raramente.