Voice Changer

Przekształć audio z jednego głosu w drugi. Zachowaj pełną kontrolę nad emocjami, tempem i sposobem wypowiedzi.

Parametry ścieżki

voice_idstringWymagany

ID głosu do użycia. Wszystkie dostępne głosy możesz wyświetlić za pomocą endpointu Pobierz głosy.

Nagłówki

xi-api-keystringOpcjonalny

Parametry zapytania

enable_loggingbooleanOpcjonalnyDomyślnie true

Gdy enable_logging ma wartość false, dla żądania zostanie użyty tryb zerowej retencji. Funkcje historii, w tym łączenie żądań, będą niedostępne dla tego żądania. Z trybu zerowej retencji mogą korzystać tylko klienci Enterprise.

optimize_streaming_latencyinteger or nullOpcjonalnyDeprecated
Możesz włączyć optymalizacje opóźnienia kosztem jakości. Najniższe możliwe końcowe opóźnienie zależy od modelu. Dostępne wartości: 0 - tryb domyślny (bez optymalizacji opóźnienia) 1 - standardowe optymalizacje opóźnienia (około 50% możliwej poprawy opóźnienia z opcji 3) 2 - silne optymalizacje opóźnienia (około 75% możliwej poprawy opóźnienia z opcji 3) 3 - maksymalne optymalizacje opóźnienia 4 - maksymalne optymalizacje opóźnienia z wyłączonym normalizatorem tekstu, aby jeszcze bardziej zmniejszyć opóźnienie (najniższe opóźnienie, ale możliwa błędna wymowa np. liczb i dat). Domyślnie None.
output_formatenumOpcjonalnyDomyślnie mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Żądanie

This endpoint expects a multipart form containing a file.
audiofileWymagany

Plik audio zawierający treść i emocje, które będą sterować generowaną mową.

model_idstringOpcjonalnyDomyślnie eleven_english_sts_v2

Identyfikator modelu, który zostanie użyty. Możesz sprawdzić dostępne modele za pomocą GET /v1/models. Model musi obsługiwać mowę-mowa, co możesz sprawdzić we właściwości can_do_voice_conversion.

voice_settingsstring or nullOpcjonalny

Ustawienia głosu nadpisujące zapisane ustawienia danego głosu. Są stosowane tylko w tym żądaniu. Muszą zostać wysłane jako ciąg zakodowany w JSON.

seedinteger or nullOpcjonalny

Jeśli podano, nasz system dołoży starań, by generowanie było deterministyczne, więc powtarzane żądania z tym samym seedem i parametrami powinny zwracać ten sam wynik. Determinizm nie jest gwarantowany. Musi być liczbą całkowitą od 0 do 4294967295.

remove_background_noisebooleanOpcjonalnyDomyślnie false

Jeśli ustawione, usunie szum tła z wejścia audio za pomocą naszego modelu izolacji audio. Dotyczy tylko Voice Changer.

file_formatenum or nullOpcjonalnyDomyślnie other

The format of input audio. Options are ‘pcm_s16le_16’ or ‘other’ For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.

Dozwolone wartości:

Odpowiedź

Wygenerowany plik audio

Błędy

422
Unprocessable Entity Error