Vai alla navigazione

Testo in dialogo con timestamp

Genera dialoghi dal testo con informazioni temporali precise a livello di carattere per la sincronizzazione audio-testo.

Header

xi-api-keystringOpzionale

Parametri di query

output_formatenumOpzionalePredefinito a mp3_44100_128

Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

enable_loggingbooleanOpzionalePredefinito a true

Quando enable_logging è impostato su false, per la richiesta verrà usata la modalità senza conservazione dei dati. Di conseguenza, le funzionalità della cronologia non saranno disponibili per questa richiesta, incluso il collegamento delle richieste. La modalità senza conservazione dei dati può essere usata solo dai clienti enterprise.

Richiesta

This endpoint expects an object.
inputslist of objectsObbligatorio

Un elenco di input di dialogo, ciascuno contenente testo e un ID della voce che verrà convertito in parlato. Il numero massimo di ID vocali univoci è 10. Per una generazione affidabile, mantieni il conteggio totale dei caratteri in tutti i valori inputs[].text pari o inferiore a 2.000 caratteri per richiesta. Le richieste più lunghe potrebbero terminare anticipatamente nelle risposte in streaming o restituire un errore di convalida.

model_idstringOpzionalePredefinito a eleven_v3

Identificatore del modello che verrà usato; puoi interrogarli tramite GET /v1/models. Il modello deve supportare la sintesi vocale; puoi verificarlo tramite la proprietà can_do_text_to_speech.

language_codestring or nullOpzionale

Codice lingua (ISO 639-1) usato per applicare una lingua al modello e alla normalizzazione del testo. Se il modello non supporta il codice lingua fornito, verrà ignorato. Questo parametro non è supportato per i modelli multilingual_v2.

settingsobject or nullOpzionale
Impostazioni che controllano la generazione del dialogo.
pronunciation_dictionary_locatorslist of objects or nullOpzionale

Un elenco di locator dei dizionari di pronuncia (id, version_id) da applicare al testo. Verranno applicati nell'ordine indicato. Puoi includere fino a 3 locator per richiesta.

seedinteger or nullOpzionale

Se specificato, il nostro sistema farà del suo meglio per eseguire il campionamento in modo deterministico, così che richieste ripetute con lo stesso seed e gli stessi parametri restituiscano lo stesso risultato. Il determinismo non è garantito. Deve essere un numero intero compreso tra 0 e 4294967295.

apply_text_normalizationenumOpzionalePredefinito a auto

Questo parametro controlla la normalizzazione del testo con tre modalità: 'auto', 'on' e 'off'. Se impostato su 'auto', il sistema decide automaticamente se applicare la normalizzazione del testo, ad esempio scrivendo i numeri in lettere. Con 'on', la normalizzazione del testo viene sempre applicata, mentre con 'off' viene ignorata.

Valori consentiti:
use_pvc_as_ivcbooleanOpzionalePredefinito a false

Indica se usare la versione IVC di una voce professionale. Può migliorare l'espressività e ridurre la latenza.

previous_request_idslist of strings or nullOpzionale

Un elenco di request_ids delle generazioni di dialogo precedenti a questa. Viene usato per condizionare il modello e garantire continuità quando una grande attività viene suddivisa in più richieste. Puoi inviare al massimo 3 request_ids. L'ultimo request_id corrisponde all'audio più vicino alla richiesta corrente. Non è supportato da tutti i modelli.

next_request_idslist of strings or nullOpzionale

Un elenco di request_ids delle generazioni di dialogo successive a questa. Utile per mantenere la continuità quando rigeneri una clip al centro di una sequenza. Puoi inviare al massimo 3 request_ids. Il primo request_id corrisponde all'audio più vicino alla richiesta corrente. Non è supportato da tutti i modelli.

previous_textstring or nullOpzionale<=100 characters

Il testo immediatamente precedente a questa generazione, usato per condizionare il modello alla continuità prosodica. Puoi inviare al massimo 100 caratteri. Non è supportato da tutti i modelli.

future_textstring or nullOpzionale<=100 characters

Il testo immediatamente successivo a questa generazione, usato per condizionare il modello alla continuità prosodica. Puoi inviare al massimo 100 caratteri. Non è supportato da tutti i modelli.

Risposta

Risposta riuscita
audio_base64string
Dati audio codificati in Base64
voice_segmentslist of objects
Segmenti vocali per l'audio
alignmentobject or nullOpzionale
Informazioni sul timestamp per ciascun carattere del testo originale
normalized_alignmentobject or nullOpzionale
Informazioni sul timestamp per ciascun carattere del testo normalizzato

Errori

422
Unprocessable Entity Error