什么是文本转语音 WebSockets API?

WebSocket 流式端点有时也称为输入流式端点,可通过 WebSockets 实现实时文本转语音转换。你可以发送文本消息,并实时接收音频数据。

该端点专为仅使用部分文本片段作为输入便开始生成音频片段而设计。它可在完整上下文传输完毕前开始生成输出,从而帮助降低延迟,适合与大语言模型(LLM)等工具结合使用。生成的音频听起来仍会是连贯的连续语音。

WebSockets API 虽然非常灵活,但并不适合所有场景。

适合以下情况:

  • 输入文本以流式方式传输或分块生成。
  • 需要尽可能低的延迟。
  • 需要词语与音频的对齐信息。

以下情况可能并非最佳选择:

  • 一次性提供完整输入文本。由于生成内容是分段的,过程中会涉及一定缓冲,因此与标准 HTTP 请求相比,延迟可能略高。在这种情况下,仅使用输出流式端点通常是更好的选择。
  • 想快速试用或创建原型。使用 WebSockets 可能比标准 HTTP API 更困难、更复杂,从而减慢快速开发和测试的速度。
  • 极其重视一致性时,需要考虑 AI 对上下文的理解。由于请求开始时 AI 未获得完整上下文,它只能部分理解文本,这在某些情况下可能导致问题。不过,你可以尝试使用 WebSocket 流式传输时提供的一些设置,例如 “chunk_length_schedule”。该参数决定 AI 在开始生成文本前所需的片段大小。

在这些情况下,请改用文本转语音 API。

如需了解更多,请参阅 WebSockets API 参考文档。