Progetta una voce.
Progetta una voce tramite un prompt. Questo metodo restituisce un elenco di anteprime vocali. Ogni anteprima contiene un generated_voice_id e un campione della voce come audio MP3 codificato in base64. Per creare una voce, usa il generated_voice_id dell’anteprima scelta con l’endpoint /v1/text-to-voice.
Header
Parametri di query
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
Richiesta
Modello da usare per la generazione vocale. Valori possibili: eleven_multilingual_ttv_v2, eleven_ttv_v3.
Testo da generare; la lunghezza deve essere compresa tra 100 e 1000 caratteri.
Controlla il livello del volume della voce generata. -1 è il più basso, 1 è il più alto, 0 corrisponde a circa -24 LUFS.
Controlla quanto fedelmente l'IA segue il prompt. Valori più bassi lasciano all'IA maggiore libertà creativa, mentre valori più alti la vincolano maggiormente al prompt. Valori alti possono far sembrare la voce artificiale o robotica. Ti consigliamo di usare prompt più lunghi e dettagliati con una Guidance Scale più bassa.
Determina se le anteprime di Text to Voice devono essere incluse nella risposta. Se true, vengono restituiti solo gli ID generati, che possono poi essere trasmessi in streaming tramite l'endpoint /v1/text-to-voice/:generated_voice_id/stream.
Indica se migliorare la descrizione della voce con l'IA per aggiungere dettagli e migliorare la qualità della generazione vocale. Se abilitata, il sistema espanderà automaticamente i prompt semplici in descrizioni della voce più dettagliate. Il valore predefinito è False
L'ID dell'iterazione della sessione di remix a cui associare queste generazioni. Se non viene fornito, verrà creata una nuova iterazione.
Una qualità superiore migliora l'output vocale, ma riduce la varietà.
Audio di riferimento da utilizzare per la generazione della voce. L'audio deve essere codificato in base64. Supportato solo quando si utilizza il modello eleven_ttv_v3.
Controlla il bilanciamento tra prompt e audio di riferimento durante la generazione di campioni vocali. 0 indica un'influenza quasi nulla del prompt, 1 un'influenza quasi nulla dell'audio di riferimento. Supportato solo con il modello eleven_ttv_v3.