Hoppa till navigering

Skapa dialog

Omvandlar en lista med text- och röst-ID-par till tal (dialog) och returnerar ljud.

Headers

xi-api-keystringValfri

Frågeparametrar

output_formatenumValfriStandard är mp3_44100_128

Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

enable_loggingbooleanValfriStandard är true

När enable_logging är satt till false används nollkvarhållningsläge för begäran. Det innebär att historikfunktioner, inklusive sammanfogning av begäranden, inte är tillgängliga för denna begäran. Nollkvarhållningsläge får endast användas av företagskunder.

Förfrågan

This endpoint expects an object.
inputslist of objectsObligatorisk

En lista med dialogindata som var och en innehåller text och ett röst-ID som konverteras till tal. Det högsta antalet unika röst-ID:n är 10. För tillförlitlig generering bör det sammanlagda antalet tecken i alla inputs[].text-värden vara högst 2 000 tecken per begäran. Längre begäranden kan avslutas i förtid i streamade svar eller returnera ett valideringsfel.

model_idstringValfriStandard är eleven_v3

Identifierare för modellen som ska användas. Du kan fråga efter modellerna med GET /v1/models. Modellen måste ha stöd för Text to Speech, vilket du kan kontrollera med egenskapen can_do_text_to_speech.

language_codestring or nullValfri

Språkkod (ISO 639-1) som används för att tillämpa ett språk för modellen och textnormalisering. Om modellen inte stöder den angivna språkkoden ignoreras den. Parametern stöds inte för multilingual_v2-modeller.

settingsobject or nullValfri

Inställningar som styr dialoggenereringen.

previous_textstring or nullValfri<=100 characters

Texten som kommer direkt före den här genereringen och används för att styra modellen mot prosodisk kontinuitet. Högst 100 tecken kan skickas. Stöds inte av alla modeller.

future_textstring or nullValfri<=100 characters

Texten som kommer direkt efter den här genereringen och används för att styra modellen mot prosodisk kontinuitet. Högst 100 tecken kan skickas. Stöds inte av alla modeller.

pronunciation_dictionary_locatorslist of objects or nullValfri

En lista med pekare till uttalslexikon (id, version_id) som ska tillämpas på texten. De tillämpas i ordning. Du kan ha upp till 3 pekare per begäran

seedinteger or nullValfri

Om angivet försöker systemet sampla deterministiskt, så att upprepade förfrågningar med samma seed och parametrar bör ge samma resultat. Determinism garanteras inte. Måste vara ett heltal mellan 0 och 4294967295.

apply_text_normalizationenumValfriStandard är auto

Den här parametern styr textnormalisering med tre lägen: 'auto', 'on' och 'off'. När den är inställd på 'auto' avgör systemet automatiskt om textnormalisering ska användas (t.ex. att skriva ut siffror med bokstäver). Med 'on' används textnormalisering alltid, medan den hoppas över med 'off'.

Tillåtna värden:
use_pvc_as_ivcbooleanValfriStandard är false

Om IVC-versionen av en professionell röst ska användas. Det kan förbättra uttrycksfullheten och minska latensen.

previous_request_idslist of strings or nullValfri

En lista med request_ids för dialoggenereringar som kom före den här. Används för att styra modellen mot kontinuitet när en stor uppgift delas upp i flera begäranden. Högst 3 request_ids kan skickas. Det sista request_id:t är ljudet som ligger närmast den aktuella begäran. Stöds inte av alla modeller.

next_request_idslist of strings or nullValfri

En lista med request_ids för dialoggenereringar som kommer efter den här. Användbart för att bibehålla kontinuitet när du återskapar ett klipp mitt i en sekvens. Högst 3 request_ids kan skickas. Det första request_id:t är ljudet som ligger närmast den aktuella begäran. Stöds inte av alla modeller.

Svar

Den genererade ljudfilen

Fel

422
Unprocessable Entity Error