表現力モード
表現力モード
会話のコンテキストに応じて、トーン、タイミング、感情表現を調整する音声エージェントを構築できます。
概要
表現力モードでは、意図、感情、強調を反映した発話をエージェントに提供できます。ユーザーの話し方や発言内容に応じて、リアルタイムで調整します。これは、会話スタックにおける2つのシステムレベルの改善に基づいています。
- Eleven v3 Conversational — ElevenAgentsで利用できる、最も感情を理解しコンテキストを認識するテキスト読み上げモデル。
- 新しいターンテイキングシステム — 割り込みを減らし、より正確なタイミングで応答します。
エージェントのTTSモデルとしてEleven v3 Conversationalを選択すると、表現力モードがデフォルトで有効になります。
Eleven v3 Conversational
Eleven v3 Conversationalは、ライブでの双方向対話向けに最適化された、超低レイテンシー版のEleven v3です。ターンをまたいで会話のコンテキストを維持し、それぞれのやり取りのトーンと意図に合わせて話し方を調整します。
- コンテキスト認識型の話し方:会話のコンテキストに基づいてトーンを調整します。たとえば、ユーザーが不安そうな場合はより落ち着いて応答し、明確さが重要な場合はより直接的に応答します。
- 明示的な感情コントロール:正確なトリガーから幅広いシナリオまで、システムプロンプトのルールで話し方をガイドし、ブランドボイスやコンプライアンス要件に合わせます。
- 70以上の言語をサポート:Flashモデルの約32言語から拡大。日本語を含む、これまでニュアンスの表現が十分でなかった言語でも表現力が向上しています。
- 表現タグ:LLMは、特定の場面での話し方を制御するために、
[laughs]、[whispers]、[sighs]などのタグを出力できます。
Eleven v3 Conversationalの価格は、Agentsの他のElevenLabs TTSモデルと同じで、1分あたり $0.08からです。
ターンテイキングシステム
新しいターンテイキングシステムは、感情的な手がかりや発話パターンを含むScribe v2 Realtimeのリアルタイムシグナルを使用して、エージェントが話す、間を置く、待つタイミングを判断します。これにより、特に感情が高ぶった状況で、エージェントはより自然に応答できます。
たとえば、「yeah」は完全な相づちにも、話を続ける前置きにもなります。システムは、文字起こしに加えて発話方法(プロソディなどの発話の手がかり)を分析することで、エージェントの応答をより自然なタイミングで行います。
ターンテイキングの挙動は、ターン積極性設定でさらに調整できます。
設定
表現力モードを有効にする
システムプロンプトの例
システムプロンプトの自然言語による指示で、エージェントの感情表現をガイドします。モデルはこれらをコンテキストに応じて解釈するため、すべての状況で明示的なタグは必要ありません。
大まかなガイダンス
特定のトリガー
表現タグを使う
コンテキスト認識型の話し方に加えて、LLMは特定の場面を制御する明示的なタグを出力できます。一般的なタグは次のとおりです。
[laughs]— 発話に笑いを加える[whispers]— ささやくために音量を下げる[sighs]— ため息のような質感を加える[slow]— 発話速度を遅くする[excited]— 話し方に興奮を加える
各タグは、通常の話し方に戻る前の約4〜5語に影響します。
ベストプラクティス
話し方をコンテキストに合わせる
エージェントの感情表現を状況に合わせるようガイドします。不満を感じている顧客には、落ち着いた共感的な応答を届けるべきです。良い知らせを共有するユーザーには、心からの温かさを伝えるべきです。トーンの不一致は信頼を損ないます。
一貫性のためにシステムプロンプトのルールを使う
モデルの判断だけに頼るのではなく、システムプロンプトで明確なトーンのガイドラインを定義します。これにより、ブランドボイスとコンプライアンス要件に沿った一貫性のある話し方を実現できます。
言語ごとにテストする
表現力のある話し方は、言語によって異なる場合があります。特に会話の慣習が異なる言語では、意図した感情のニュアンスが伝わるよう、対象とする各言語でエージェントをテストしてください。
ターン積極性設定と組み合わせる
表現力モードを適切なターン積極性設定と組み合わせます。忍耐モードは感情的に繊細な会話でユーザーにより多くの間を与え、積極モードはテンポの速い対話に適しています。
モニタリングと改善を行う
会話分析を使用して、表現力のある話し方に対するユーザーの反応を追跡します。会話の結果とユーザーフィードバックに基づいて、トーンのガイドラインを改善してください。
制限事項
- Eleven v3 Conversationalは、プロフェッショナルボイスクローン(PVC)の特性を保持しません。出力音声は元のPVC音声とは異なる場合があります。
- 表現タグの効果は、通常の話し方に戻るまで約4〜5語続きます。
- 表現力は音声と言語によって異なる場合があります。
よくある質問
表現力モードの料金は高くなりますか?
いいえ。Eleven v3 Conversationalの価格は、Agentsの他のElevenLabs TTSモデルと同じで、1分あたり$0.08からです。
表現力モードを有効にするにはどうすればよいですか?
エージェントのTTSモデルとしてV3 Conversationalを選択します。このモデルでは表現力モードがデフォルトで有効になります。
ターンテイキングシステムはどのように機能しますか?
このシステムは、感情的な手がかりや発話パターンを含むScribe v2 Realtimeのリアルタイムシグナルを使用して、エージェントがいつ応答すべきかを予測します。文字起こしと、単語がどのように話されたか(プロソディ)の両方を分析して、自然なタイミングで応答します。
プロフェッショナルボイスクローンで表現力モードを使用できますか?
Eleven v3 Conversationalは、現在PVCの特性を十分に保持できません。PVC音声のアイデンティティ維持が重要な場合は、代わりにFlash v2の使用を検討してください。
Eleven v3 Conversationalは何言語をサポートしていますか?
Eleven v3 Conversationalは、Flashモデルの約32言語から拡大し、70以上の言語をサポートしています。これには、これまでニュアンスの表現が十分でなかった日本語などの言語における表現力の向上も含まれます。
ElevenAgentsの他のTTSモデルと比べてどうですか?
Eleven v3 Conversationalは、FlashおよびMultilingual v2よりも幅広い感情表現を提供し、会話のコンテキストに応じて話し方を調整できます。Flashの約32言語に対し、70以上の言語をサポートします。価格は他のモデルと同じです。
