表现力模式

构建能根据对话上下文调整语气、时机和情绪表达的语音智能体。

概述

表达模式让智能体能够传达意图、情绪和重点,并根据用户的语气和说话内容实时调整。它基于对话系统的两项系统级改进:

  1. Eleven v3 Conversational —— ElevenAgents 中情绪理解和上下文感知能力最强的文本转语音模型。
  2. 全新轮次管理系统 —— 响应时机更准确,打断更少。

选择 Eleven v3 Conversational 作为智能体的 TTS 模型后,默认启用表达模式。

Eleven v3 Conversational

Eleven v3 Conversational 是 Eleven v3 的超低延迟版本,专为实时往返对话优化。它能在多轮对话中保持上下文,并调整表达方式以匹配每次交流的语气和意图。

  • 上下文感知表达:智能体会根据对话上下文调整语气——当用户听起来担忧时,回应会更平静;需要清晰表达时,回应会更直接。
  • 明确的情绪控制:通过系统提示词规则引导表达方式,可设置精确触发条件或更广泛的场景,以符合品牌语调和合规要求。
  • 支持 70+ 种语言:相比 Flash 模型约 32 种语言大幅扩展,并提升了此前细微表达较弱的语言(包括日语)的表现力。
  • 表达标签:LLM 可以输出 [laughs]、[whispers] 或 [sighs] 等标签,控制特定片段的表达方式。

Eleven v3 Conversational 在 Agents 中的定价与其他 ElevenLabs TTS 模型相同,起价为 每分钟 $0.08。

轮次管理系统

新的轮次管理系统利用来自 Scribe v2 Realtime 的实时信号——包括情绪线索和语音模式——判断智能体何时应说话、暂停或等待。这让智能体的回应更自然,尤其适用于情绪较为强烈的场景。

例如,“yeah”既可以是完整的确认,也可能是在继续说话前的铺垫。系统除了分析转录文本,还会分析说话方式(如韵律等语音线索),从而更自然地安排智能体的回应时机。

还可以通过 轮次积极性 设置进一步调整轮次管理行为。

配置

启用表达模式

1

选择 TTS 模型

将智能体的 TTS 模型设为 V3 Conversational。此模型默认启用表达模式。

在控制台中打开智能体,前往 Agent Voice 标签页,然后选择 V3 Conversational 作为文本转语音模型。保存更改。

启用表达模式

2

在系统提示词中引导情绪表达

在智能体的系统提示词中添加说明,引导智能体如何调整语气。可以使用宽泛的指导,也可以设置具体触发条件。

系统提示词示例

通过系统提示词中的自然语言说明引导智能体的情绪表达。模型会结合上下文理解这些说明,因此并非每种情况都需要明确标签。

宽泛指导

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

具体触发条件

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

使用表达标签

除了上下文感知表达外,LLM 还可以输出明确标签来控制特定片段。常见标签包括:

  • [laughs] —— 为语音添加笑声
  • [whispers] —— 降低音量,形成耳语效果
  • [sighs] —— 加入叹息感
  • [slow] —— 放慢语速
  • [excited] —— 让表达更兴奋

每个标签大约会影响接下来的 4-5 个词,之后恢复正常表达。

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

最佳实践

引导智能体根据场景调整情绪表达。面对沮丧的客户,应给予平静且有同理心的回应;用户分享好消息时,应展现真诚的温暖。语气不匹配会削弱信任。

在系统提示词中定义清晰的语气指南,而非完全依赖模型判断。这样可以确保表达方式始终符合品牌语调和合规要求。

不同语言中的表达效果可能有所差异。请在每种目标语言中测试智能体,确保情绪细微差别能按预期传达,尤其是对话习惯不同的语言。

将表达模式与合适的 轮次积极性 设置搭配使用。耐心模式能在情绪敏感的对话中给用户更多表达空间,而积极模式适合快节奏互动。

使用对话分析跟踪用户对表达式语音的反应。根据对话结果和用户反馈优化语气指南。

限制

  • Eleven v3 Conversational 无法保留专业语音克隆(PVC)的特征,输出的声音可能不像原始 PVC 音色。
  • 表达标签的效果大约持续 4-5 个词,之后恢复正常表达。
  • 表现力可能因音色和语言而异。

常见问题

不会。Eleven v3 Conversational 在 Agents 中的定价与其他 ElevenLabs TTS 模型相同,起价为每分钟 $0.08。

选择 V3 Conversational 作为智能体的 TTS 模型。此模型默认启用表达模式。

系统使用来自 Scribe v2 Realtime 的实时信号,包括情绪线索和语音模式,预测智能体何时应回应。它会分析转录文本以及词语的说话方式(韵律),从而自然地安排回应时机。

Eleven v3 Conversational 目前无法很好地保留 PVC 特征。如果保持 PVC 音色身份至关重要,请考虑改用 Flash v2。

Eleven v3 Conversational 支持 70+ 种语言,相比 Flash 模型的约 32 种语言更多。其中包括日语等此前细微表达较弱语言的表现力提升。

Eleven v3 Conversational 比 Flash 和 Multilingual v2 具有更广的情绪表达范围,并能根据对话上下文调整表达方式。它支持 70+ 种语言,而 Flash 支持约 32 种。其定价与其他模型相同。

相关功能