テキスト読み上げとテキストto会話のWebSocket
テキスト読み上げとテキストto会話のWebSocket
このガイドでは、音声ストリーミングに適したWebSocketの選び方と、2つのプロトコルの違いを紹介します。
ElevenLabsでは、合成音声をストリーミングするための2種類のWebSocketプロダクトを提供しています。それぞれ解決する課題、受け付けるメッセージ形式、対象モデルが異なります。
どちらのWebSocketを使うべきですか?
接続ごとに 1つの音声 でプレーンテキストをストリーミングする場合(音声はURLで固定)、FlashやMultilingual v2などの v3以外 のモデル、任意のSSML、チャンクスケジュール、またはエージェント型の割り込み処理向けの マルチコンテキスト バリアントを使用したい場合は、テキスト読み上げ(TTS)WebSocket を使用してください。
Eleven v3の対話動作(表現豊かな読み上げ、チャンクごとの voice_id、ターン境界(new_turn)、サーバー上のv3と同じ対話向けバッファリング)が必要な場合は、テキストtoダイアログ(TTD)WebSocket を使用してください。
バッチまたはHTTPストリーミング のダイアログ(1回の呼び出しでリクエスト全体を送信)には、WebSocketではなく ダイアログを作成 または ダイアログをストリーミング を使用してください。
比較
TTS WebSocketが適している場合
- レイテンシーや対応言語のために、すでに Flash または Multilingual v2 を統合している。
- 接続ごとに 1つのナレーター音声 を使用し、フレームごとにテキストを送るシンプルなプロトコルが必要。
- 割り込みや並列発話のために マルチコンテキスト オーケストレーションが必要(マルチコンテキストガイド)。
TTS WebSocketの詳細な手順は、リアルタイムでオーディオを生成 を参照してください。
TTD WebSocketが適している場合
- Eleven v4 のダイアログ(表現タグ、会話のテンポ、複数話者のセリフ)を対象にしている。
- 新しい接続を開かずに、行ごとに話す音声を変更できる スクリプト化された、またはLLMが生成したダイアログ をストリーミングする。
- WebSocket形式の増分入力と、サーバー上の v4専用 ダイアログ生成が必要。
実践的な手順は、リアルタイムテキストtoダイアログ を参照してください。プロトコルの詳細は APIリファレンス にあります。