文本转对话

了解如何使用 ElevenLabs 创建沉浸式、自然流畅的对话。

概述

ElevenLabs 文本转对话 API 使用 Eleven v4 和 Eleven v3,根据文本生成自然、富有表现力的对话。建议使用 Eleven v4。常见用途包括:

  • 为视频游戏生成自然精准的对话
  • 为播客和其他音频内容创建沉浸式对话
  • 用富有表现力的旁白让有声书更生动

可能需要多次生成才能达到理想效果。将文本转对话集成到应用时,建议生成多个版本,让用户选择最佳结果。

试听示例:

音色选项

ElevenLabs 通过多种创建方式提供数千种音色。Eleven v4 支持超过 90 种语言,Eleven v3 支持超过 70 种语言。

详细了解音色选项。

提示词

模型会直接从输入文本中理解情感语境。例如,添加“她兴奋地说道”等描述性文字,或使用感叹号,都会影响语音情感。稳定性和相似度等音色设置有助于控制一致性,而底层情感则来自文本线索。

更多详情请阅读提示词指南。

使用音频标签表达情感

此功能仍在积极开发中,实际效果可能有所不同。

Eleven v4 和 Eleven v3 支持使用非语音音频事件来影响对话的表达方式。只需将音频事件用方括号包裹后插入文本输入即可。

在文本转对话中,每一轮对话都有各自的文本和音色。在需要影响的对话轮次文本中添加音频标签。voice_id 仍用于选择该轮次的说话人音色,而标签则用于引导表达方式。

例如,一位说话人可使用一种音色,并让文本以 [giggling] 开头;下一位说话人则可使用另一种音色,并让文本以 [whispering] 开头。有关结合标签和 voice_id 的 API 示例,请参阅文本转对话快速入门。

音频标签是自然语言指令,而非枚举参数。请用方括号包裹指令,并将其置于需要改变表达方式的文本位置。以下示例并不详尽;如需了解如何有效使用标签,请参阅提示词指南。

音频标签有几种不同形式:

情感与表达方式

例如:[sad]、[laughing] 和 [whispering]

音频事件

例如:[leaves rustling]、[gentle footsteps] 和 [applause]。

整体指导

例如:[football]、[wrestling match] 和 [auctioneer]。

示例:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

还可以使用标点符号来表示对话节奏,例如打断:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

省略号可用于表示未说完的句子:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

默认响应格式为 mp3,也支持 pcm 和 ulaw 等其他格式。

  • MP3
    • 采样率:22.05kHz - 44.1kHz
    • 比特率:32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps、64kbps、96kbps、128kbps、192kbps
  • PCM (S16LE)
    • 采样率:16kHz - 44.1kHz
    • 比特率:8kHz、16kHz、22.05kHz、24kHz、44.1kHz、48kHz
    • 16 位深度
  • μ-law
    • 8kHz 采样率
    • 针对电话应用优化
  • A-law
    • 8kHz 采样率
    • 针对电话应用优化
  • Opus
    • 采样率:48kHz
    • 比特率:32kbps - 192kbps

更高质量的音频选项仅适用于付费套餐,详情请参阅价格 页面。

支持的语言

Eleven v4 支持超过 90 种语言。Eleven v3 支持超过 70 种语言。完整列表请参阅 Eleven v4 和 Eleven v3。

常见问题

文本转对话适用于 Eleven v4 和 Eleven v3 模型。

是。你保留所生成音频的所有权。但商业使用权仅适用于付费套餐。订阅付费套餐后,如果你拥有输入内容的知识产权,便可将生成音频用于商业用途并通过其获利。

在符合以下条件时,可免费重新生成相同的文本转语音内容,无需额外付费:

  • 仅可在 ElevenLabs 控制台中使用。
  • 每段内容最多可免费重新生成 2 次。
  • 内容必须与上次生成完全相同。若更改文本、音色设置或其他参数,则需进行新的付费生成。

当音频输出出现轻微失真时,免费重新生成功能会很有帮助。根据 ElevenLabs 的内部基准测试,重新生成可解决约一半的质量问题,其余问题通常由较差的训练数据造成。

对话中的说话人数没有限制。

模型具有非确定性。为提高一致性,可使用可选的 seed 参数,但仍可能出现细微差异。

为确保生成稳定,每次请求中所有 inputs[].text 值的总长度应不超过 2,000 个字符。将较长文本拆分为多个片段,并在应用中拼接生成的音频。

关键信息

  • 模型:支持 Eleven v4 和 Eleven v3
  • 说话人:每段对话的说话人数不限
  • 请求大小:每次请求中所有 inputs[].text 值的总长度应不超过 2,000 个字符
  • 确定性:输出具有非确定性 — 使用 seed 参数可获得更一致的结果
  • 免费重新生成:每次生成最多可免费重新生成 2 次(内容和参数相同,仅限控制台)
  • 所有权:你保留生成音频的所有权;商业使用需订阅付费套餐