Voice Changer
Omvandla ljud från en röst till en annan. Behåll full kontroll över känsla, timing och framförande.
Sökvägsparametrar
ID för rösten som ska användas. Använd endpointen Hämta röster för att lista alla tillgängliga röster.
Headers
Frågeparametrar
När enable_logging är satt till false används nollkvarhållningsläge för begäran. Det innebär att historikfunktioner, inklusive sammanfogning av begäranden, inte är tillgängliga för denna begäran. Nollkvarhållningsläge får endast användas av företagskunder.
Du kan aktivera latensoptimeringar på bekostnad av viss kvalitet. Bästa möjliga slutliga latens varierar beroende på modell. Möjliga värden: 0 - standardläge (inga latensoptimeringar) 1 - normala latensoptimeringar (cirka 50 % av den möjliga latensförbättringen med alternativ 3) 2 - kraftiga latensoptimeringar (cirka 75 % av den möjliga latensförbättringen med alternativ 3) 3 - maximala latensoptimeringar 4 - maximala latensoptimeringar, men även med textnormaliseraren avstängd för ännu större latensbesparingar (bästa latens, men kan uttala till exempel siffror och datum fel).
Standardvärdet är None.
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
Förfrågan
Ljudfilen som innehåller innehållet och känslan som styr det genererade talet.
Identifierare för modellen som ska användas. Du kan fråga efter modellerna med GET /v1/models. Modellen måste ha stöd för Speech to Speech, vilket du kan kontrollera med egenskapen can_do_voice_conversion.
Röstinställningar som åsidosätter lagrade inställningar för den angivna rösten. De tillämpas endast på den angivna begäran. Måste skickas som en JSON-kodad sträng.
Om angivet försöker systemet sampla deterministiskt, så att upprepade förfrågningar med samma seed och parametrar bör ge samma resultat. Determinism garanteras inte. Måste vara ett heltal mellan 0 och 4294967295.
Om angivet tas bakgrundsbrus bort från din ljudinmatning med vår ljudisoleringsmodell. Gäller endast Voice Changer.
The format of input audio. Options are 'pcm_s16le_16' or 'other' For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.