Hoppa till navigering

Strömma tal

Omvandlar text till tal med en röst du väljer och returnerar ljud som en ljudström.

Sökvägsparametrar

voice_idstringObligatorisk

ID för rösten som ska användas. Använd endpointen Hämta röster för att lista alla tillgängliga röster.

Headers

xi-api-keystringValfri

Frågeparametrar

enable_loggingbooleanValfriStandard är true

När enable_logging är satt till false används nollkvarhållningsläge för begäran. Det innebär att historikfunktioner, inklusive sammanfogning av begäranden, inte är tillgängliga för denna begäran. Nollkvarhållningsläge får endast användas av företagskunder.

optimize_streaming_latencyinteger or nullValfriDeprecated

Du kan aktivera latensoptimeringar på bekostnad av viss kvalitet. Bästa möjliga slutliga latens varierar beroende på modell. Möjliga värden: 0 - standardläge (inga latensoptimeringar) 1 - normala latensoptimeringar (cirka 50 % av den möjliga latensförbättringen med alternativ 3) 2 - kraftiga latensoptimeringar (cirka 75 % av den möjliga latensförbättringen med alternativ 3) 3 - maximala latensoptimeringar 4 - maximala latensoptimeringar, men även med textnormaliseraren avstängd för ännu större latensbesparingar (bästa latens, men kan uttala till exempel siffror och datum fel).

Standardvärdet är None.

output_formatenumValfriStandard är mp3_44100_128

Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Förfrågan

This endpoint expects an object.
textstringObligatorisk
Texten som ska konverteras till tal.
model_idstringValfriStandard är eleven_multilingual_v2

Identifierare för modellen som ska användas. Du kan fråga efter modellerna med GET /v1/models. Modellen måste ha stöd för Text to Speech, vilket du kan kontrollera med egenskapen can_do_text_to_speech.

language_codestring or nullValfri

Språkkod (ISO 639-1) som används för att tillämpa ett språk för modellen och textnormalisering. Om modellen inte stöder den angivna språkkoden ignoreras den. Parametern stöds inte för multilingual_v2-modeller.

voice_settingsobject or nullValfri

Röstinställningar som åsidosätter lagrade inställningar för den angivna rösten. De tillämpas endast på den angivna begäran.

pronunciation_dictionary_locatorslist of objects or nullValfri

En lista med pekare till uttalslexikon (id, version_id) som ska tillämpas på texten. De tillämpas i ordning. Du kan ha upp till 3 pekare per begäran

seedinteger or nullValfri

Om angivet försöker systemet sampla deterministiskt, så att upprepade förfrågningar med samma seed och parametrar bör ge samma resultat. Determinism garanteras inte. Måste vara ett heltal mellan 0 och 4294967295.

previous_textstring or nullValfri

Texten som kom före texten i den aktuella begäran. Kan användas för att förbättra talets kontinuitet när flera genereringar sammanfogas eller för att påverka talets kontinuitet i den aktuella genereringen.

next_textstring or nullValfri

Texten som kommer efter texten i den aktuella begäran. Kan användas för att förbättra talets kontinuitet när flera genereringar sammanfogas eller för att påverka talets kontinuitet i den aktuella genereringen.

previous_request_idslist of strings or nullValfri

En lista med request_id för proverna som genererades före den här genereringen. Kan användas för att förbättra talets kontinuitet när en stor uppgift delas upp i flera begäranden. Resultatet blir bäst när samma modell används för alla genereringar. Om både previous_text och previous_request_ids skickas ignoreras previous_text. Högst 3 request_ids kan skickas.

next_request_idslist of strings or nullValfri

A list of request_id of the samples that come after this generation. next_request_ids is especially useful for maintaining the speech's continuity when regenerating a sample that has had some audio quality issues. For example, if you have generated 3 speech clips, and you want to improve clip 2, passing the request id of clip 3 as a next_request_id (and that of clip 1 as a previous_request_id) will help maintain natural flow in the combined speech. The results will be best when the same model is used across the generations. In case both next_text and next_request_ids is send, next_text will be ignored. A maximum of 3 request_ids can be send.

use_pvc_as_ivcbooleanValfriStandard är false

Om IVC-versionen av en professionell röst ska användas. Det kan förbättra uttrycksfullheten och minska latensen.

apply_text_normalizationenumValfriStandard är auto

Den här parametern styr textnormalisering med tre lägen: 'auto', 'on' och 'off'. När den är inställd på 'auto' avgör systemet automatiskt om textnormalisering ska användas (t.ex. att skriva ut siffror med bokstäver). Med 'on' används textnormalisering alltid, medan den hoppas över med 'off'.

Tillåtna värden:
apply_language_text_normalizationbooleanValfriStandard är false

Den här parametern styr språklig textnormalisering. Den hjälper till med korrekt uttal av text på vissa språk som stöds. VARNING: Den här parametern kan öka fördröjningen för begäran avsevärt. Stöds för närvarande endast för japanska.

Svar

Strömmande ljuddata

Fel

422
Unprocessable Entity Error