¿Qué es la API WebSockets de Texto a Voz?

La ruta de streaming WebSocket, también denominada a veces streaming de entrada, ofrece conversión de texto a voz en tiempo real mediante WebSockets. Esto te permite enviar un mensaje de texto y recibir datos de audio en tiempo real.

Está diseñada para empezar a generar fragmentos de audio a partir de fragmentos de texto parciales como entrada. Puede ayudar a minimizar la latencia al empezar a generar el resultado antes de recibir todo el contexto y está pensada para usarse junto con otras herramientas, como los modelos de lenguaje de gran tamaño (LLM). El audio generado seguirá sonando como una secuencia de habla continua.

Aunque es muy flexible, la API WebSockets no es una solución universal.

Es adecuada para situaciones en las que:

  • El texto de entrada se transmite o se genera por fragmentos.
  • Se necesita la menor latencia posible.
  • Se requiere información de alineación entre palabras y audio.

 Puede no ser la mejor opción cuando:

  • Todo el texto de entrada se envía de una vez. Dado que las generaciones son parciales, hay cierto almacenamiento en búfer, lo que podría resultar en una latencia ligeramente mayor que con una solicitud HTTP estándar. En casos como este, probablemente sea mejor usar únicamente la ruta de streaming de salida.
  • Quieres experimentar o crear un prototipo rápidamente. Trabajar con WebSockets puede ser más difícil y complejo que usar una API HTTP estándar, lo que podría ralentizar el desarrollo y las pruebas rápidas.
  • La máxima consistencia es de suma importancia y necesitas tener en cuenta la comprensión del contexto por parte de la IA. Como la IA no recibe el contexto completo al inicio de la solicitud, solo tendrá una comprensión parcial del texto, lo que en ciertos casos puede causar problemas. Sin embargo, puedes probar algunos de los ajustes disponibles al usar streaming WebSocket, como “chunk_length_schedule”. Este parámetro determina el tamaño que deben tener los fragmentos antes de que la IA empiece a generar texto.

En estos casos, usa la API de Texto a Voz en su lugar.

Para obtener más información, consulta la referencia de la API WebSockets.