Sprache mit Zeitstempeln streamen

Wandelt Text mit einer Stimme Ihrer Wahl in Sprache um und gibt einen Stream von JSON-Objekten zurück, die Audio als Base64-codierten String sowie Informationen dazu enthalten, wann welches Zeichen gesprochen wurde.

Pfadparameter

voice_idstringErforderlich

ID der zu verwendenden Stimme. Mit dem Endpunkt Get voices können Sie alle verfügbaren Stimmen auflisten.

Header

xi-api-keystringOptional

Abfrageparameter

enable_loggingbooleanOptionalStandardwert ist true

Wenn enable_logging auf false gesetzt ist, wird für die Anfrage der Zero-Retention-Modus verwendet. Dadurch sind Verlaufsfunktionen für diese Anfrage nicht verfügbar, einschließlich Request Stitching. Der Zero-Retention-Modus darf nur von Enterprise-Kunden verwendet werden.

optimize_streaming_latencyinteger or nullOptionalDeprecated
Sie können Latenzoptimierungen auf Kosten der Qualität aktivieren. Die bestmögliche endgültige Latenz variiert je nach Modell. Mögliche Werte: 0 – Standardmodus (keine Latenzoptimierungen) 1 – normale Latenzoptimierungen (etwa 50 % der möglichen Latenzverbesserung von Option 3) 2 – starke Latenzoptimierungen (etwa 75 % der möglichen Latenzverbesserung von Option 3) 3 – maximale Latenzoptimierungen 4 – maximale Latenzoptimierungen, jedoch mit deaktivierter Textnormalisierung für weitere Latenzeinsparungen (beste Latenz, kann aber z. B. Zahlen und Daten falsch aussprechen). Standardwert ist None.
output_formatenumOptionalStandardwert ist mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Anfrage

This endpoint expects an object.
textstringErforderlich
Der Text, der in Sprache umgewandelt wird.
model_idstringOptionalStandardwert ist eleven_multilingual_v2

Kennung des zu verwendenden Modells. Sie können Modelle mit GET /v1/models abfragen. Das Modell muss Text to Speech unterstützen. Dies können Sie über die Eigenschaft can_do_text_to_speech prüfen.

language_codestring or nullOptional

Sprachcode (ISO 639-1), mit dem eine Sprache für das Modell und die Textnormalisierung erzwungen wird. Unterstützt das Modell den angegebenen Sprachcode nicht, wird er ignoriert. Dieser Parameter wird für multilingual_v2-Modelle nicht unterstützt.

voice_settingsobject or nullOptional

Stimmeneinstellungen, die gespeicherte Einstellungen für die angegebene Stimme überschreiben. Sie werden nur auf die angegebene Anfrage angewendet.

pronunciation_dictionary_locatorslist of objects or nullOptional

Eine Liste von Aussprachewörterbuch-Referenzen (id, version_id), die auf den Text angewendet werden. Sie werden der Reihe nach angewendet. Pro Anfrage sind bis zu 3 Referenzen möglich.

seedinteger or nullOptional

Falls angegeben, bemüht sich unser System um eine deterministische Generierung, sodass wiederholte Anfragen mit demselben Seed und denselben Parametern dasselbe Ergebnis liefern sollten. Determinismus wird nicht garantiert. Muss eine Ganzzahl zwischen 0 und 4294967295 sein.

previous_textstring or nullOptional

Der Text vor dem Text der aktuellen Anfrage. Kann verwendet werden, um die Kontinuität der Sprache beim Zusammenfügen mehrerer Generierungen zu verbessern oder die Kontinuität der Sprache in der aktuellen Generierung zu beeinflussen.

next_textstring or nullOptional

Der Text nach dem Text der aktuellen Anfrage. Kann verwendet werden, um die Kontinuität der Sprache beim Zusammenfügen mehrerer Generierungen zu verbessern oder die Kontinuität der Sprache in der aktuellen Generierung zu beeinflussen.

previous_request_idslist of strings or nullOptional

Eine Liste der request_id von Samples, die vor dieser Generierung erstellt wurden. Kann verwendet werden, um die Kontinuität der Sprache zu verbessern, wenn eine große Aufgabe auf mehrere Anfragen aufgeteilt wird. Die besten Ergebnisse erzielen Sie, wenn für alle Generierungen dasselbe Modell verwendet wird. Wenn sowohl previous_text als auch previous_request_ids gesendet werden, wird previous_text ignoriert. Es können maximal 3 request_ids gesendet werden.

next_request_idslist of strings or nullOptional

Eine Liste der request_id von Samples, die auf diese Generierung folgen. next_request_ids ist besonders hilfreich, um die Kontinuität der Sprache beizubehalten, wenn ein Sample mit Problemen bei der Audioqualität neu generiert wird. Wenn Sie beispielsweise 3 Sprachclips generiert haben und Clip 2 verbessern möchten, hilft die Übergabe der Request-ID von Clip 3 als next_request_id und die von Clip 1 als previous_request_id dabei, einen natürlichen Fluss in der kombinierten Sprache beizubehalten. Die besten Ergebnisse erzielen Sie, wenn für alle Generierungen dasselbe Modell verwendet wird. Wenn sowohl next_text als auch next_request_ids gesendet werden, wird next_text ignoriert. Es können maximal 3 request_ids gesendet werden.

use_pvc_as_ivcbooleanOptionalStandardwert ist false

Gibt an, ob die IVC-Version einer professionellen Stimme verwendet werden soll. Dies kann die Ausdruckskraft verbessern und die Latenz verringern.

apply_text_normalizationenumOptionalStandardwert ist auto

Dieser Parameter steuert die Textnormalisierung mit drei Modi: ‘auto’, ‘on’ und ‘off’. Bei ‘auto’ entscheidet das System automatisch, ob die Textnormalisierung angewendet wird, z. B. zum Ausschreiben von Zahlen. Bei ‘on’ wird die Textnormalisierung immer angewendet, bei ‘off’ übersprungen.

Erlaubte Werte:
apply_language_text_normalizationbooleanOptionalStandardwert ist false

Dieser Parameter steuert die sprachspezifische Textnormalisierung. Sie unterstützt die korrekte Aussprache von Text in einigen unterstützten Sprachen. WARNUNG: Dieser Parameter kann die Latenz der Anfrage erheblich erhöhen. Derzeit nur für Japanisch unterstützt.

Antwort

Stream von Transkriptionsblöcken

audio_base64string

Base64-kodierte Audiodaten

alignmentobject or nullOptional

Zeitstempelinformationen für jedes Zeichen im Originaltext

normalized_alignmentobject or nullOptional

Zeitstempelinformationen für jedes Zeichen im normalisierten Text

Fehler

422
Unprocessable Entity Error