Stimmenverzerrer

Wandeln Sie Audio von einer Stimme in eine andere um. Behalten Sie die volle Kontrolle über Emotion, Timing und Sprechweise.

Pfadparameter

voice_idstringErforderlich

ID der zu verwendenden Stimme. Mit dem Endpunkt Get voices können Sie alle verfügbaren Stimmen auflisten.

Header

xi-api-keystringOptional

Abfrageparameter

enable_loggingbooleanOptionalStandardwert ist true

Wenn enable_logging auf false gesetzt ist, wird für die Anfrage der Zero-Retention-Modus verwendet. Dadurch sind Verlaufsfunktionen für diese Anfrage nicht verfügbar, einschließlich Request Stitching. Der Zero-Retention-Modus darf nur von Enterprise-Kunden verwendet werden.

optimize_streaming_latencyinteger or nullOptionalDeprecated
Sie können Latenzoptimierungen auf Kosten der Qualität aktivieren. Die bestmögliche endgültige Latenz variiert je nach Modell. Mögliche Werte: 0 – Standardmodus (keine Latenzoptimierungen) 1 – normale Latenzoptimierungen (etwa 50 % der möglichen Latenzverbesserung von Option 3) 2 – starke Latenzoptimierungen (etwa 75 % der möglichen Latenzverbesserung von Option 3) 3 – maximale Latenzoptimierungen 4 – maximale Latenzoptimierungen, jedoch mit deaktivierter Textnormalisierung für weitere Latenzeinsparungen (beste Latenz, kann aber z. B. Zahlen und Daten falsch aussprechen). Standardwert ist None.
output_formatenumOptionalStandardwert ist mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Anfrage

This endpoint expects a multipart form containing a file.
audiofileErforderlich
Die Audiodatei mit Inhalt und Emotion, die die generierte Sprache steuert.
model_idstringOptionalStandardwert ist eleven_english_sts_v2

Kennung des zu verwendenden Modells. Sie können Modelle mit GET /v1/models abfragen. Das Modell muss Speech to Speech unterstützen. Dies können Sie über die Eigenschaft can_do_voice_conversion prüfen.

voice_settingsstring or nullOptional

Stimmeneinstellungen, die gespeicherte Einstellungen für die angegebene Stimme überschreiben. Sie werden nur auf die angegebene Anfrage angewendet. Muss als JSON-codierte Zeichenfolge gesendet werden.

seedinteger or nullOptional

Falls angegeben, bemüht sich unser System um eine deterministische Generierung, sodass wiederholte Anfragen mit demselben Seed und denselben Parametern dasselbe Ergebnis liefern sollten. Determinismus wird nicht garantiert. Muss eine Ganzzahl zwischen 0 und 4294967295 sein.

remove_background_noisebooleanOptionalStandardwert ist false

Falls gesetzt, werden Hintergrundgeräusche mithilfe unseres Audiotrennungsmodells aus Ihrer Audioeingabe entfernt. Gilt nur für den Stimmenverzerrer.

file_formatenum or nullOptionalStandardwert ist other

The format of input audio. Options are ‘pcm_s16le_16’ or ‘other’ For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.

Erlaubte Werte:

Antwort

Die generierte Audiodatei

Fehler

422
Unprocessable Entity Error