Texto a Diálogo
Texto a Diálogo
Descubre cómo crear diálogos inmersivos y naturales con ElevenLabs.
Resumen
La API de Texto a Diálogo de ElevenLabs crea diálogos expresivos y naturales a partir de texto con Eleven v4 y Eleven v3. Recomendamos Eleven v4. Algunos casos de uso habituales son:
- Generar conversaciones perfectas para videojuegos
- Crear diálogos inmersivos para podcasts y otros contenidos de audio
- Dar vida a audiolibros con narraciones expresivas
Puede que necesites varias generaciones para conseguir los resultados deseados. Al integrar Texto a Diálogo en tu aplicación, valora generar varias opciones y permitir que el usuario elija la mejor.
Escucha un ejemplo:
Opciones de voz
ElevenLabs ofrece miles de voces mediante distintos métodos de creación. Eleven v4 admite más de 90 idiomas y Eleven v3 admite más de 70 idiomas.
- Biblioteca de voces con más de 3000 voces compartidas por la comunidad
- Clonación de voz profesional para réplicas de máxima fidelidad
- Clonación de voz instantánea para replicar voces rápidamente
- Diseño de voz para generar voces personalizadas a partir de descripciones de texto
Más información sobre nuestras opciones de voz.
Prompting
Los modelos interpretan el contexto emocional directamente a partir del texto de entrada. Por ejemplo, añadir texto descriptivo como «dijo emocionada» o usar signos de exclamación influirá en la emoción de la voz. Los ajustes de voz, como Estabilidad y Similitud, ayudan a controlar la consistencia, mientras que la emoción subyacente procede de las señales textuales.
Consulta la guía de prompting para más detalles.
Entonaciones emocionales con audio tags
Eleven v4 y Eleven v3 permiten usar eventos de audio no vocales para influir en la entonación del diálogo. Para ello, inserta los eventos de audio en el texto de entrada entre corchetes.
En Texto a Diálogo, cada turno tiene su propio texto y voz. Añade audio tags dentro del texto del turno al que deban afectar. El voice_id sigue seleccionando la voz del hablante para ese turno, mientras que los tags guían la entonación.
Por ejemplo, un hablante puede usar una voz mientras el texto comienza con [giggling], y el siguiente hablante puede usar otra voz mientras el texto comienza con [whispering]. Para consultar un ejemplo de API que combina tags con voice_id, consulta la guía rápida de Texto a Diálogo.
Los audio tags son instrucciones en lenguaje natural, no un parámetro enum. Escribe la instrucción entre corchetes y colócala en el texto donde deba cambiar la entonación. Los ejemplos siguientes no son exhaustivos; consulta la guía de prompting para obtener más indicaciones sobre tags eficaces.
Los audio tags tienen varias formas:
Emociones y entonación
Por ejemplo, [sad], [laughing] y [whispering]
Eventos de audio
Por ejemplo, [leaves rustling], [gentle footsteps] y [applause].
Dirección general
Por ejemplo, [football], [wrestling match] y [auctioneer].
Algunos ejemplos:
También puedes usar puntuación para indicar el flujo del diálogo, como las interrupciones:
Puedes usar puntos suspensivos para indicar frases inacabadas:
Formatos de salida compatibles
El formato de respuesta predeterminado es mp3, pero también hay disponibles otros formatos, como pcm y ulaw.
- MP3
- Frecuencias de muestreo: 22.05kHz - 44.1kHz
- Tasas de bits: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Frecuencias de muestreo: 16kHz - 44.1kHz
- Tasas de bits: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- Profundidad de 16 bits
- μ-law
- Frecuencia de muestreo de 8kHz
- Optimizado para aplicaciones de telefonía
- A-law
- Frecuencia de muestreo de 8kHz
- Optimizado para aplicaciones de telefonía
- Opus
- Frecuencia de muestreo: 48kHz
- Tasas de bits: 32kbps - 192kbps
Las opciones de audio de mayor calidad solo están disponibles en los planes de pago; consulta nuestra página de precios para más información.
Idiomas compatibles
Eleven v4 admite más de 90 idiomas. Eleven v3 admite más de 70 idiomas. Consulta Eleven v4 y Eleven v3 para ver las listas completas.
Preguntas frecuentes
¿Qué modelos puedo usar?
Texto a Diálogo está disponible en los modelos Eleven v4 y Eleven v3.
¿Soy propietario del audio generado?
Sí. Mantienes la propiedad de cualquier audio que generes. Sin embargo, los derechos de uso comercial solo están disponibles con planes de pago. Con una suscripción de pago, puedes usar el audio generado con fines comerciales y monetizar los resultados si posees los derechos de propiedad intelectual del contenido de entrada.
¿Qué se considera una regeneración gratuita?
Una regeneración gratuita te permite volver a generar el mismo contenido de texto a voz sin coste adicional, siempre que se cumplan estas condiciones:
- Solo está disponible en el panel de control de ElevenLabs.
- Puedes regenerar cada contenido hasta 2 veces gratis.
- El contenido debe ser exactamente igual que en la generación anterior. Cualquier cambio en el texto, los ajustes de voz u otros parámetros requerirá una nueva generación de pago.
Las regeneraciones gratuitas son útiles si hay una ligera distorsión en el audio generado. Según los benchmarks internos de ElevenLabs, las regeneraciones resolverán aproximadamente la mitad de los problemas de calidad; los problemas restantes suelen deberse a datos de entrenamiento deficientes.
¿Cuántos hablantes puede tener mi diálogo?
No hay límite en el número de hablantes de un diálogo.
¿Por qué mi resultado es a veces inconsistente?
Los modelos no son deterministas. Para lograr consistencia, usa el parámetro seed opcional, aunque aún pueden producirse diferencias sutiles.
¿Cuál es la mejor práctica para conversiones de textos largos?
Para una generación fiable, mantén la longitud total de todos los valores inputs[].text en 2000 caracteres o menos por solicitud. Divide los textos más largos en fragmentos y concatena el audio resultante en tu aplicación.
Datos clave
- Modelos: Disponible con Eleven v4 y Eleven v3
- Hablantes: Sin límite de hablantes por diálogo
- Tamaño de solicitud: Mantén la longitud total de todos los valores
inputs[].texten 2000 caracteres o menos por solicitud - Determinismo: El resultado no es determinista; usa el parámetro
seedpara obtener resultados más consistentes - Regeneraciones gratuitas: Hasta 2 regeneraciones gratuitas por generación (mismo contenido, mismos parámetros, solo en el panel de control)
- Propiedad: Mantienes la propiedad del audio generado; el uso comercial requiere un plan de pago