表现力模式
表现力模式
构建能根据对话上下文调整语气、时机和情绪表达的语音智能体。
概述
表达模式让智能体能够传达意图、情绪和重点,并根据用户的语气和说话内容实时调整。它基于对话系统的两项系统级改进:
- Eleven v3 Conversational —— ElevenAgents 中情绪理解和上下文感知能力最强的文本转语音模型。
- 全新轮次管理系统 —— 响应时机更准确,打断更少。
选择 Eleven v3 Conversational 作为智能体的 TTS 模型后,默认启用表达模式。
Eleven v3 Conversational
Eleven v3 Conversational 是 Eleven v3 的超低延迟版本,专为实时往返对话优化。它能在多轮对话中保持上下文,并调整表达方式以匹配每次交流的语气和意图。
- 上下文感知表达:智能体会根据对话上下文调整语气——当用户听起来担忧时,回应会更平静;需要清晰表达时,回应会更直接。
- 明确的情绪控制:通过系统提示词规则引导表达方式,可设置精确触发条件或更广泛的场景,以符合品牌语调和合规要求。
- 支持 70+ 种语言:相比 Flash 模型约 32 种语言大幅扩展,并提升了此前细微表达较弱的语言(包括日语)的表现力。
- 表达标签:LLM 可以输出
[laughs]、[whispers]或[sighs]等标签,控制特定片段的表达方式。
Eleven v3 Conversational 在 Agents 中的定价与其他 ElevenLabs TTS 模型相同,起价为 每分钟 $0.08。
轮次管理系统
新的轮次管理系统利用来自 Scribe v2 Realtime 的实时信号——包括情绪线索和语音模式——判断智能体何时应说话、暂停或等待。这让智能体的回应更自然,尤其适用于情绪较为强烈的场景。
例如,“yeah”既可以是完整的确认,也可能是在继续说话前的铺垫。系统除了分析转录文本,还会分析说话方式(如韵律等语音线索),从而更自然地安排智能体的回应时机。
还可以通过 轮次积极性 设置进一步调整轮次管理行为。
配置
启用表达模式
系统提示词示例
通过系统提示词中的自然语言说明引导智能体的情绪表达。模型会结合上下文理解这些说明,因此并非每种情况都需要明确标签。
宽泛指导
具体触发条件
使用表达标签
除了上下文感知表达外,LLM 还可以输出明确标签来控制特定片段。常见标签包括:
[laughs]—— 为语音添加笑声[whispers]—— 降低音量,形成耳语效果[sighs]—— 加入叹息感[slow]—— 放慢语速[excited]—— 让表达更兴奋
每个标签大约会影响接下来的 4-5 个词,之后恢复正常表达。
最佳实践
让表达匹配上下文
引导智能体根据场景调整情绪表达。面对沮丧的客户,应给予平静且有同理心的回应;用户分享好消息时,应展现真诚的温暖。语气不匹配会削弱信任。
使用系统提示词规则保持一致性
在系统提示词中定义清晰的语气指南,而非完全依赖模型判断。这样可以确保表达方式始终符合品牌语调和合规要求。
跨语言测试
不同语言中的表达效果可能有所差异。请在每种目标语言中测试智能体,确保情绪细微差别能按预期传达,尤其是对话习惯不同的语言。
结合轮次积极性设置
将表达模式与合适的 轮次积极性 设置搭配使用。耐心模式能在情绪敏感的对话中给用户更多表达空间,而积极模式适合快节奏互动。
监控并迭代
使用对话分析跟踪用户对表达式语音的反应。根据对话结果和用户反馈优化语气指南。
限制
- Eleven v3 Conversational 无法保留专业语音克隆(PVC)的特征,输出的声音可能不像原始 PVC 音色。
- 表达标签的效果大约持续 4-5 个词,之后恢复正常表达。
- 表现力可能因音色和语言而异。
常见问题
表达模式收费更高吗?
不会。Eleven v3 Conversational 在 Agents 中的定价与其他 ElevenLabs TTS 模型相同,起价为每分钟 $0.08。
如何启用表达模式?
选择 V3 Conversational 作为智能体的 TTS 模型。此模型默认启用表达模式。
轮次管理系统如何运作?
系统使用来自 Scribe v2 Realtime 的实时信号,包括情绪线索和语音模式,预测智能体何时应回应。它会分析转录文本以及词语的说话方式(韵律),从而自然地安排回应时机。
可以将表达模式与专业语音克隆结合使用吗?
Eleven v3 Conversational 目前无法很好地保留 PVC 特征。如果保持 PVC 音色身份至关重要,请考虑改用 Flash v2。
Eleven v3 Conversational 支持多少种语言?
Eleven v3 Conversational 支持 70+ 种语言,相比 Flash 模型的约 32 种语言更多。其中包括日语等此前细微表达较弱语言的表现力提升。
它与 ElevenAgents 中其他 TTS 模型相比如何?
Eleven v3 Conversational 比 Flash 和 Multilingual v2 具有更广的情绪表达范围,并能根据对话上下文调整表达方式。它支持 70+ 种语言,而 Flash 支持约 32 种。其定价与其他模型相同。
