Designa en röst.
Designa en röst med hjälp av en prompt. Den här metoden returnerar en lista med röstförhandsvisningar. Varje förhandsvisning har ett generated_voice_id och ett röstprov som base64-kodad mp3-ljudfil. Skapa en röst genom att använda generated_voice_id från den valda förhandsvisningen med slutpunkten /v1/text-to-voice.
Headers
Frågeparametrar
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
Förfrågan
Beskrivning som ska användas för den skapade rösten.
Modell att använda för röstgenereringen. Möjliga värden: eleven_multilingual_ttv_v2, eleven_ttv_v3.
Text att generera, textlängden måste vara mellan 100 och 1 000.
Om en text som passar röstbeskrivningen ska genereras automatiskt.
Styr volymnivån för den genererade rösten. -1 är tystast, 1 är högst och 0 motsvarar ungefär -24 LUFS.
Slumptal som styr röstgenereringen. Samma seed med samma indata ger samma röst.
Styr hur nära AI:n följer prompten. Lägre värden ger AI:n större kreativ frihet, medan högre värden får den att följa prompten mer strikt. Höga värden kan få rösten att låta konstgjord eller robotlik. Vi rekommenderar längre och mer detaljerade prompter vid lägre Guidance Scale.
Avgör om Text to Voice-förhandsvisningarna ska inkluderas i svaret. Om värdet är true returneras endast de genererade ID:na, som sedan kan streamas via slutpunkten /v1/text-to-voice/:generated_voice_id/stream.
Om röstbeskrivningen ska förbättras med AI för att lägga till fler detaljer och höja kvaliteten på röstgenereringen. När funktionen är aktiverad utökar systemet automatiskt enkla promptar till mer detaljerade röstbeskrivningar. Standardvärdet är False
ID:t för iterationen i remixningssessionen som dessa genereringar ska kopplas till. Om det inte anges skapas en ny iteration.
Högre kvalitet ger bättre röstresultat men mindre variation.
Referensljud att använda för röstgenereringen. Ljudet ska vara base64-kodat. Stöds endast vid användning av modellen eleven_ttv_v3.
Styr balansen mellan prompt och referensljud när röstprover genereras. 0 innebär nästan ingen påverkan från prompten, 1 innebär nästan ingen påverkan från referensljudet. Stöds endast med modellen eleven_ttv_v3.
Svar
Förhandsvisningarna av de genererade rösterna.
Texten som används för att förhandsgranska rösterna.