Vai alla navigazione

Text to Speech

Scopri come trasformare il testo in audio parlato realistico con ElevenLabs.

Panoramica

L’API ElevenLabs Text to Speech (TTS) trasforma il testo in audio realistico con intonazione, ritmo e consapevolezza emotiva ricchi di sfumature. I nostri modelli si adattano agli indizi testuali in 32 lingue e a diversi stili vocali e possono essere usati per:

  • Narrare campagne media e annunci pubblicitari globali
  • Produrre audiolibri in più lingue con interpretazioni emotive complesse
  • Trasmettere audio in tempo reale dal testo

Ascolta un esempio:

Esplora la nostra Voice Library per trovare la voce perfetta per il tuo progetto.

La Voice Library non è disponibile tramite API per gli utenti del piano gratuito.

Qualità della voce

Per le applicazioni in tempo reale, Flash v2.5 offre una latenza ultra bassa di 75 ms, mentre Multilingual v2 fornisce audio della massima qualità con un’espressività più ricca di sfumature.

Opzioni vocali

ElevenLabs offre migliaia di voci in 32 lingue attraverso vari metodi di creazione:

Scopri di più sulle nostre opzioni vocali.

Il formato di risposta predefinito è mp3, ma sono disponibili anche altri formati come pcm e ulaw.

  • MP3
    • Frequenze di campionamento: 22.05kHz - 44.1kHz
    • Bitrate: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Frequenze di campionamento: 16kHz - 44.1kHz
    • Bitrate: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • Profondità a 16 bit
  • μ-law
    • Frequenza di campionamento di 8kHz
    • Ottimizzato per applicazioni di telefonia
  • A-law
    • Frequenza di campionamento di 8kHz
    • Ottimizzato per applicazioni di telefonia
  • Opus
    • Frequenza di campionamento: 48kHz
    • Bitrate: 32kbps - 192kbps

Le opzioni audio di qualità superiore sono disponibili solo nei piani a pagamento: consulta la pagina dei prezzi per i dettagli.

Lingue supportate

I nostri modelli multilingue v2 supportano 29 lingue:

inglese (Stati Uniti, Regno Unito, Australia, Canada), giapponese, cinese, tedesco, hindi, francese (Francia, Canada), coreano, portoghese (Brasile, Portogallo), italiano, spagnolo (Spagna, Messico), indonesiano, olandese, turco, filippino, polacco, svedese, bulgaro, rumeno, arabo (Arabia Saudita, Emirati Arabi Uniti), ceco, greco, finlandese, croato, malese, slovacco, danese, tamil, ucraino e russo.

Flash v2.5 supporta 32 lingue: tutte le lingue dei modelli v2, più:

ungherese, norvegese e vietnamita

Inserisci il testo in una delle lingue supportate e seleziona una voce corrispondente dalla nostra Voice Library. Per risultati più naturali, scegli una voce con un accento adatto alla lingua e alla regione di destinazione.

Prompting

I modelli interpretano il contesto emotivo direttamente dal testo inserito. Ad esempio, l’aggiunta di testo descrittivo come “disse eccitata” o l’uso di punti esclamativi influenzerà l’emozione del parlato. Impostazioni vocali come Stability e Similarity aiutano a controllare la coerenza, mentre l’emozione di base deriva dagli indizi testuali.

Leggi la guida al prompting per maggiori dettagli.

Il testo descrittivo verrà pronunciato dal modello e, se necessario, dovrà essere tagliato o rimosso manualmente dall’ audio.

FAQ

Sì, puoi creare cloni vocali istantanei della tua voce a partire da brevi clip audio. Per cloni ad alta fedeltà, scopri la nostra funzionalità di clonazione vocale professionale.

Sì. Mantieni la proprietà di qualsiasi audio che generi. Tuttavia, i diritti di utilizzo commerciale sono disponibili solo con i piani a pagamento. Con un abbonamento a pagamento, puoi usare l’audio generato per scopi commerciali e monetizzare gli output se possiedi i diritti di proprietà intellettuale sui contenuti di input.

Una rigenerazione gratuita ti consente di rigenerare lo stesso contenuto da testo a parlato senza costi aggiuntivi, alle seguenti condizioni:

  • Puoi rigenerare gratuitamente ogni contenuto fino a 2 volte
  • Il contenuto deve essere esattamente identico alla generazione precedente. Qualsiasi modifica al testo, alle impostazioni vocali o ad altri parametri richiederà una nuova generazione a pagamento

Le rigenerazioni gratuite sono utili in caso di leggere distorsioni nell’output audio. Secondo i benchmark interni di ElevenLabs, le rigenerazioni risolvono circa la metà dei problemi di qualità, mentre quelli rimanenti sono generalmente dovuti a dati di addestramento di scarsa qualità.

Usa i modelli Flash a bassa latenza (Flash v2 o v2.5), ottimizzati per scenari conversazionali o interattivi quasi in tempo reale. Consulta la nostra guida all’ottimizzazione della latenza per maggiori dettagli.

I modelli non sono deterministici. Per una maggiore coerenza, usa il parametro seed facoltativo, anche se potrebbero comunque verificarsi lievi differenze.

Dividi il testo lungo in segmenti e usa lo streaming per una riproduzione in tempo reale e un’elaborazione efficiente. Per mantenere un flusso prosodico naturale tra i blocchi, includi i parametri previous/next text o previous/next request id.

Informazioni chiave

  • Determinismo: L’output non è deterministico: usa il parametro seed per risultati più coerenti
  • Rigenerazioni gratuite: Fino a 2 rigenerazioni gratuite per generazione (solo stesso contenuto e parametri)
  • Proprietà: Mantieni la proprietà dell’audio generato; l’uso commerciale richiede un piano a pagamento
  • Casi d’uso a bassa latenza: Usa i modelli Flash (eleven_flash_v2 o eleven_flash_v2_5): consulta la guida all’ottimizzazione della latenza
  • Testi lunghi: Dividi il testo lungo in segmenti; usa i parametri previous_text / next_text per mantenere una prosodia naturale tra i blocchi