Text-to-Speech- vs. Text-to-Dialogue-WebSockets
Text-to-Speech- vs. Text-to-Dialogue-WebSockets
Dieser Leitfaden zeigt Ihnen, wie Sie den richtigen WebSocket für das Streaming von Sprache auswählen und wie sich die beiden Protokolle unterscheiden.
ElevenLabs bietet zwei verschiedene WebSocket-Produkte für das Streaming synthetisierter Sprache. Sie lösen unterschiedliche Probleme, akzeptieren unterschiedliche Nachrichtenformate und sind auf unterschiedliche Modelle ausgerichtet.
Welchen WebSocket sollte ich verwenden?
Verwenden Sie den Text to Speech (TTS) WebSocket, wenn Sie Klartext für eine Stimme pro Verbindung streamen (die Stimme ist in der URL festgelegt) und nicht-v3-Modelle wie Flash oder Multilingual v2, optionales SSML, Chunk-Zeitpläne oder die Multi-Context-Variante für die Behandlung von Unterbrechungen im Agent-Stil nutzen möchten.
Verwenden Sie den Text to Dialogue (TTD) WebSocket, wenn Sie das Dialogverhalten von Eleven v3 benötigen: ausdrucksstarke Wiedergabe, **voice_id pro Chunk **, Turn-Grenzen (new_turn) und dieselbe dialogorientierte Pufferung, die serverseitig für v3 verwendet wird.
Für Batch- oder HTTP-Streaming von Dialogen (vollständige Anfrage in einem Aufruf) verwenden Sie stattdessen Dialog erstellen oder Dialog streamen, nicht einen WebSocket.
Vergleich
Wann der TTS-WebSocket besser geeignet ist
- Sie integrieren bereits Flash oder Multilingual v2 für geringe Latenz oder breite Sprachabdeckung.
- Sie möchten eine Sprecherstimme pro Verbindung und ein einfaches Text-pro-Frame-Protokoll.
- Sie benötigen Multi-Context-Orchestrierung für Barge-in und parallele Äußerungen (Multi-Context-Leitfaden).
Eine vollständige Anleitung für den TTS-WebSocket finden Sie unter Audio in Echtzeit generieren.
Wann der TTD-WebSocket besser geeignet ist
- Sie verwenden Eleven v4 für Dialoge (ausdrucksstarke Tags, Gesprächsrhythmus, Zeilen mit mehreren Sprechern).
- Sie streamen skriptbasierte oder LLM-generierte Dialoge, bei denen die sprechende Stimme pro Zeile wechseln kann, ohne eine neue Verbindung zu öffnen.
- Sie möchten WebSocket-artige inkrementelle Eingaben mit nur für v4 verfügbarer Dialoggenerierung auf dem Server.
Für eine praktische Anleitung verwenden Sie Echtzeit-Text to Dialogue. Protokolldetails finden Sie in der API-Referenz.