Was ist die Text-to-Speech-WebSockets-API?

Der WebSocket-Streaming-Endpoint, manchmal auch als Input-Streaming bezeichnet, ermöglicht Echtzeit-Text-to-Speech-Konvertierung über WebSockets. So können Sie eine Textnachricht senden und Audiodaten in Echtzeit zurückerhalten.

Er wurde entwickelt, um Audioblöcke bereits anhand unvollständiger Textblöcke zu generieren. Er kann die Latenz minimieren, indem die Ausgabe generiert wird, bevor der vollständige Kontext übermittelt wurde. Er ist für die Nutzung mit anderen Tools wie Large Language Models (LLMs) vorgesehen. Das generierte Audio klingt weiterhin wie fortlaufende Sprache.

Die WebSockets API ist zwar sehr flexibel, aber keine Universallösung.

Sie eignet sich gut für Szenarien, in denen:

  • der Eingabetext gestreamt oder in Blöcken generiert wird.
  • die geringstmögliche Latenz erforderlich ist.
  • Informationen zur Wort-Audio-Ausrichtung benötigt werden.

 Sie ist möglicherweise nicht die beste Wahl, wenn:

  • der gesamte Eingabetext auf einmal übermittelt wird. Da die Generierungen teilweise erfolgen, ist eine gewisse Pufferung erforderlich. Das kann im Vergleich zu einer Standard-HTTP-Anfrage zu etwas höherer Latenz führen. In solchen Fällen ist wahrscheinlich die Nutzung des reinen Output-Streaming-Endpoints die bessere Option.
  • Sie schnell experimentieren oder einen Prototyp erstellen möchten. Die Arbeit mit WebSockets kann schwieriger und komplexer sein als die Nutzung einer Standard-HTTP-API. Das kann die schnelle Entwicklung und Tests verlangsamen.
  • höchste Konsistenz besonders wichtig ist. Berücksichtigen Sie dabei das Kontextverständnis der KI. Da die KI zu Beginn der Anfrage nicht den vollständigen Kontext erhält, versteht sie den Text nur teilweise, was in bestimmten Fällen Probleme verursachen kann. Sie können jedoch mit einigen Einstellungen für WebSocket-Streaming experimentieren, etwa mit “chunk_length_schedule”. Dieser Parameter bestimmt, wie groß die Blöcke sein müssen, bevor die KI mit der Textgenerierung beginnt.

Verwenden Sie in diesen Fällen stattdessen die Text to Speech API.

Weitere Informationen finden Sie in der WebSockets API Reference.