Text to Dialogue

Erfahren Sie, wie Sie mit ElevenLabs immersive, natürlich klingende Dialoge erstellen.

Überblick

Die ElevenLabs-Text to Dialogue-API erstellt mit Eleven v4 und Eleven v3 natürlich klingende, ausdrucksstarke Dialoge aus Text. Wir empfehlen Eleven v4. Beliebte Anwendungsfälle:

  • Präzise Gespräche für Videospiele generieren
  • Immersive Dialoge für Podcasts und andere Audioinhalte erstellen
  • Hörbücher mit ausdrucksstarker Erzählung zum Leben erwecken

Möglicherweise sind mehrere Generierungen erforderlich, um die gewünschten Ergebnisse zu erzielen. Wenn Sie Text to Dialogue in Ihre Anwendung integrieren, sollten Sie mehrere Generierungen erstellen und Nutzern die Auswahl der besten ermöglichen.

Hören Sie sich ein Beispiel an:

Stimmenoptionen

ElevenLabs bietet über mehrere Erstellungsmethoden Tausende Stimmen. Eleven v4 unterstützt mehr als 90 Sprachen, Eleven v3 mehr als 70 Sprachen.

Erfahren Sie mehr über unsere Stimmenoptionen.

Prompting

Die Modelle interpretieren den emotionalen Kontext direkt aus der Texteingabe. Beispielsweise beeinflussen beschreibender Text wie „sagte sie aufgeregt“ oder Ausrufezeichen die emotionale Wirkung der Sprache. Stimmeinstellungen wie Stabilität und Ähnlichkeit helfen, die Konsistenz zu steuern, während die zugrunde liegende Emotion aus Textsignalen entsteht.

Weitere Details finden Sie im Prompting-Leitfaden.

Emotionale Darbietungen mit Audiotags

Diese Funktion befindet sich noch in aktiver Entwicklung. Die tatsächlichen Ergebnisse können variieren.

Eleven v4 und Eleven v3 ermöglichen den Einsatz von Nicht-Sprach-Audioereignissen, um die Darbietung des Dialogs zu beeinflussen. Fügen Sie dazu die Audioereignisse in eckigen Klammern in die Texteingabe ein.

In Text to Dialogue hat jeder Dialogzug seinen eigenen Text und seine eigene Stimme. Fügen Sie Audiotags in den Text des jeweiligen Dialogzugs ein, den sie beeinflussen sollen. Die voice_id wählt weiterhin die Sprecherstimme für diesen Zug aus, während die Tags die Darbietung steuern.

Beispielsweise kann ein Sprecher eine Stimme verwenden, während der Text mit [giggling] beginnt, und der nächste Sprecher kann eine andere Stimme verwenden, während der Text mit [whispering] beginnt. Ein API-Beispiel, das Tags mit voice_id kombiniert, finden Sie im Text to Dialogue-Schnellstart.

Audiotags sind Anweisungen in natürlicher Sprache, kein Enum-Parameter. Setzen Sie die Anweisung in eckige Klammern und platzieren Sie sie im Text an der Stelle, an der sich die Darbietung ändern soll. Die folgenden Beispiele sind nicht vollständig. Weitere Hinweise zu wirksamen Tags finden Sie im Prompting-Leitfaden.

Audiotags gibt es in verschiedenen Formen:

Emotionen und Darbietung

Zum Beispiel [sad], [laughing] und [whispering]

Audioereignisse

Zum Beispiel [leaves rustling], [gentle footsteps] und [applause].

Allgemeine Anweisungen

Zum Beispiel [football], [wrestling match] und [auctioneer].

Einige Beispiele:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

Sie können auch Satzzeichen verwenden, um den Dialogfluss anzuzeigen, etwa Unterbrechungen:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

Auslassungspunkte können unvollendete Sätze anzeigen:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

Das Standard-Antwortformat ist mp3, aber auch andere Formate wie pcm und ulaw sind verfügbar.

  • MP3
    • Abtastraten: 22.05kHz - 44.1kHz
    • Bitraten: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Abtastraten: 16kHz - 44.1kHz
    • Bitraten: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • 16-Bit-Tiefe
  • μ-law
    • 8kHz-Abtastrate
    • Optimiert für Telefonieanwendungen
  • A-law
    • 8kHz-Abtastrate
    • Optimiert für Telefonieanwendungen
  • Opus
    • Abtastrate: 48kHz
    • Bitraten: 32kbps - 192kbps

Audiooptionen mit höherer Qualität sind nur in kostenpflichtigen Tarifen verfügbar. Details finden Sie auf unserer Preisseite .

Unterstützte Sprachen

Eleven v4 unterstützt mehr als 90 Sprachen. Eleven v3 unterstützt mehr als 70 Sprachen. Die vollständigen Listen finden Sie unter Eleven v4 und Eleven v3.

FAQ

Text to Dialogue ist für die Modelle Eleven v4 und Eleven v3 verfügbar.

Ja. Sie behalten das Eigentum an allen generierten Audiodateien. Kommerzielle Nutzungsrechte sind jedoch nur mit kostenpflichtigen Tarifen verfügbar. Mit einem kostenpflichtigen Abonnement dürfen Sie generierte Audiodateien kommerziell nutzen und die Ausgaben monetarisieren, wenn Sie die IP-Rechte an den Eingabeinhalten besitzen.

Mit einer kostenlosen Regenerierung können Sie denselben Text-to-Speech-Inhalt ohne zusätzliche Kosten erneut generieren, sofern diese Bedingungen erfüllt sind:

  • Nur im ElevenLabs-Dashboard verfügbar.
  • Sie können jeden Inhalt bis zu zweimal kostenlos erneut generieren.
  • Der Inhalt muss exakt mit der vorherigen Generierung übereinstimmen. Änderungen an Text, Stimmeinstellungen oder anderen Parametern erfordern eine neue, kostenpflichtige Generierung.

Kostenlose Regenerierungen sind hilfreich, wenn die Audioausgabe leicht verzerrt ist. Laut internen Benchmarks von ElevenLabs lösen Regenerierungen etwa die Hälfte der Qualitätsprobleme. Die verbleibenden Probleme sind meist auf schlechte Trainingsdaten zurückzuführen.

Die Anzahl der Sprecher in einem Dialog ist unbegrenzt.

Die Modelle sind nicht deterministisch. Für konsistentere Ergebnisse verwenden Sie den optionalen seed- Parameter, obwohl weiterhin geringfügige Unterschiede auftreten können.

Halten Sie die Gesamtlänge aller inputs[].text-Werte pro Anfrage bei maximal 2.000 Zeichen, um eine zuverlässige Generierung zu gewährleisten. Teilen Sie längere Texte in Abschnitte auf und fügen Sie die resultierenden Audiodateien in Ihrer Anwendung zusammen.

Wichtige Fakten

  • Modelle: Verfügbar mit Eleven v4 und Eleven v3
  • Sprecher: Keine Begrenzung der Sprecheranzahl pro Dialog
  • Anfragegröße: Halten Sie die Gesamtlänge aller inputs[].text-Werte pro Anfrage bei maximal 2.000 Zeichen
  • Determinismus: Die Ausgabe ist nicht deterministisch — verwenden Sie den Parameter seed für konsistentere Ergebnisse
  • Kostenlose Regenerierungen: Bis zu 2 kostenlose Regenerierungen pro Generierung (gleicher Inhalt, gleiche Parameter, nur im Dashboard)
  • Eigentum: Sie behalten das Eigentum an generierten Audiodateien; die kommerzielle Nutzung erfordert einen kostenpflichtigen Tarif