Hoppa till navigering

Designa en röst.

Designa en röst med hjälp av en prompt. Den här metoden returnerar en lista med röstförhandsvisningar. Varje förhandsvisning har ett generated_voice_id och ett röstprov som base64-kodad mp3-ljudfil. Skapa en röst genom att använda generated_voice_id från den valda förhandsvisningen med slutpunkten /v1/text-to-voice.

Headers

xi-api-keystringValfri

Frågeparametrar

output_formatenumValfri

Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Förfrågan

This endpoint expects an object.
voice_descriptionstringObligatorisk20-1000 characters

Beskrivning som ska användas för den skapade rösten.

model_idenumValfriStandard är eleven_multilingual_ttv_v2

Modell att använda för röstgenereringen. Möjliga värden: eleven_multilingual_ttv_v2, eleven_ttv_v3.

Tillåtna värden:
textstring or nullValfri100-1000 characters

Text att generera, textlängden måste vara mellan 100 och 1 000.

auto_generate_textbooleanValfriStandard är false

Om en text som passar röstbeskrivningen ska genereras automatiskt.

loudnessdoubleValfri-1-1Standard är 0.5

Styr volymnivån för den genererade rösten. -1 är tystast, 1 är högst och 0 motsvarar ungefär -24 LUFS.

seedinteger or nullValfri0-2147483647

Slumptal som styr röstgenereringen. Samma seed med samma indata ger samma röst.

guidance_scaledoubleValfri0-100Standard är 5

Styr hur nära AI:n följer prompten. Lägre värden ger AI:n större kreativ frihet, medan högre värden får den att följa prompten mer strikt. Höga värden kan få rösten att låta konstgjord eller robotlik. Vi rekommenderar längre och mer detaljerade prompter vid lägre Guidance Scale.

stream_previewsbooleanValfriStandard är false

Avgör om Text to Voice-förhandsvisningarna ska inkluderas i svaret. Om värdet är true returneras endast de genererade ID:na, som sedan kan streamas via slutpunkten /v1/text-to-voice/:generated_voice_id/stream.

should_enhancebooleanValfriStandard är false

Om röstbeskrivningen ska förbättras med AI för att lägga till fler detaljer och höja kvaliteten på röstgenereringen. När funktionen är aktiverad utökar systemet automatiskt enkla promptar till mer detaljerade röstbeskrivningar. Standardvärdet är False

remixing_session_idstring or nullValfri
Remixningssessionens id.
remixing_session_iteration_idstring or nullValfri

ID:t för iterationen i remixningssessionen som dessa genereringar ska kopplas till. Om det inte anges skapas en ny iteration.

qualitydouble or nullValfri-1-1

Högre kvalitet ger bättre röstresultat men mindre variation.

reference_audio_base64string or nullValfri

Referensljud att använda för röstgenereringen. Ljudet ska vara base64-kodat. Stöds endast vid användning av modellen eleven_ttv_v3.

prompt_strengthdouble or nullValfri0-1

Styr balansen mellan prompt och referensljud när röstprover genereras. 0 innebär nästan ingen påverkan från prompten, 1 innebär nästan ingen påverkan från referensljudet. Stöds endast med modellen eleven_ttv_v3.

Svar

Lyckat svar
previewslist of objects

Förhandsvisningarna av de genererade rösterna.

textstring

Texten som används för att förhandsgranska rösterna.

Fel

409
Conflict Error
422
Unprocessable Entity Error