Text to Dialogue
Erfahren Sie, wie Sie mit ElevenLabs immersive, natürlich klingende Dialoge erstellen.
Überblick
Die ElevenLabs-Text to Dialogue-API erstellt mit Eleven v4 und Eleven v3 natürlich klingende, ausdrucksstarke Dialoge aus Text. Wir empfehlen Eleven v4. Beliebte Anwendungsfälle:
- Präzise Gespräche für Videospiele generieren
- Immersive Dialoge für Podcasts und andere Audioinhalte erstellen
- Hörbücher mit ausdrucksstarker Erzählung zum Leben erwecken
Möglicherweise sind mehrere Generierungen erforderlich, um die gewünschten Ergebnisse zu erzielen. Wenn Sie Text to Dialogue in Ihre Anwendung integrieren, sollten Sie mehrere Generierungen erstellen und Nutzern die Auswahl der besten ermöglichen.
Hören Sie sich ein Beispiel an:
Stimmenoptionen
ElevenLabs bietet über mehrere Erstellungsmethoden Tausende Stimmen. Eleven v4 unterstützt mehr als 90 Sprachen, Eleven v3 mehr als 70 Sprachen.
- Stimmbibliothek mit über 3.000 von der Community geteilten Stimmen
- Professionelles Stimmenklonen für Replikate mit höchster Genauigkeit
- Sofortiges Stimmenklonen für schnelle Stimmreplikation
- Stimmendesign zum Generieren individueller Stimmen aus Textbeschreibungen
Erfahren Sie mehr über unsere Stimmenoptionen.
Prompting
Die Modelle interpretieren den emotionalen Kontext direkt aus der Texteingabe. Beispielsweise beeinflussen beschreibender Text wie „sagte sie aufgeregt“ oder Ausrufezeichen die emotionale Wirkung der Sprache. Stimmeinstellungen wie Stabilität und Ähnlichkeit helfen, die Konsistenz zu steuern, während die zugrunde liegende Emotion aus Textsignalen entsteht.
Weitere Details finden Sie im Prompting-Leitfaden.
Emotionale Darbietungen mit Audiotags
Eleven v4 und Eleven v3 ermöglichen den Einsatz von Nicht-Sprach-Audioereignissen, um die Darbietung des Dialogs zu beeinflussen. Fügen Sie dazu die Audioereignisse in eckigen Klammern in die Texteingabe ein.
In Text to Dialogue hat jeder Dialogzug seinen eigenen Text und seine eigene Stimme. Fügen Sie Audiotags in den Text des jeweiligen Dialogzugs ein, den sie beeinflussen sollen. Die voice_id wählt weiterhin die Sprecherstimme für diesen Zug aus, während die Tags die Darbietung steuern.
Beispielsweise kann ein Sprecher eine Stimme verwenden, während der Text mit [giggling] beginnt, und der nächste Sprecher kann eine andere Stimme verwenden, während der Text mit [whispering] beginnt. Ein API-Beispiel, das Tags mit voice_id kombiniert, finden Sie im Text to Dialogue-Schnellstart.
Audiotags sind Anweisungen in natürlicher Sprache, kein Enum-Parameter. Setzen Sie die Anweisung in eckige Klammern und platzieren Sie sie im Text an der Stelle, an der sich die Darbietung ändern soll. Die folgenden Beispiele sind nicht vollständig. Weitere Hinweise zu wirksamen Tags finden Sie im Prompting-Leitfaden.
Audiotags gibt es in verschiedenen Formen:
Emotionen und Darbietung
Zum Beispiel [sad], [laughing] und [whispering]
Audioereignisse
Zum Beispiel [leaves rustling], [gentle footsteps] und [applause].
Allgemeine Anweisungen
Zum Beispiel [football], [wrestling match] und [auctioneer].
Einige Beispiele:
Sie können auch Satzzeichen verwenden, um den Dialogfluss anzuzeigen, etwa Unterbrechungen:
Auslassungspunkte können unvollendete Sätze anzeigen:
Unterstützte Ausgabeformate
Das Standard-Antwortformat ist mp3, aber auch andere Formate wie pcm und ulaw sind verfügbar.
- MP3
- Abtastraten: 22.05kHz - 44.1kHz
- Bitraten: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Abtastraten: 16kHz - 44.1kHz
- Bitraten: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- 16-Bit-Tiefe
- μ-law
- 8kHz-Abtastrate
- Optimiert für Telefonieanwendungen
- A-law
- 8kHz-Abtastrate
- Optimiert für Telefonieanwendungen
- Opus
- Abtastrate: 48kHz
- Bitraten: 32kbps - 192kbps
Audiooptionen mit höherer Qualität sind nur in kostenpflichtigen Tarifen verfügbar. Details finden Sie auf unserer Preisseite .
Unterstützte Sprachen
Eleven v4 unterstützt mehr als 90 Sprachen. Eleven v3 unterstützt mehr als 70 Sprachen. Die vollständigen Listen finden Sie unter Eleven v4 und Eleven v3.
FAQ
Welche Modelle kann ich verwenden?
Text to Dialogue ist für die Modelle Eleven v4 und Eleven v3 verfügbar.
Gehört mir die Audioausgabe?
Ja. Sie behalten das Eigentum an allen generierten Audiodateien. Kommerzielle Nutzungsrechte sind jedoch nur mit kostenpflichtigen Tarifen verfügbar. Mit einem kostenpflichtigen Abonnement dürfen Sie generierte Audiodateien kommerziell nutzen und die Ausgaben monetarisieren, wenn Sie die IP-Rechte an den Eingabeinhalten besitzen.
Was gilt als kostenlose Regenerierung?
Mit einer kostenlosen Regenerierung können Sie denselben Text-to-Speech-Inhalt ohne zusätzliche Kosten erneut generieren, sofern diese Bedingungen erfüllt sind:
- Nur im ElevenLabs-Dashboard verfügbar.
- Sie können jeden Inhalt bis zu zweimal kostenlos erneut generieren.
- Der Inhalt muss exakt mit der vorherigen Generierung übereinstimmen. Änderungen an Text, Stimmeinstellungen oder anderen Parametern erfordern eine neue, kostenpflichtige Generierung.
Kostenlose Regenerierungen sind hilfreich, wenn die Audioausgabe leicht verzerrt ist. Laut internen Benchmarks von ElevenLabs lösen Regenerierungen etwa die Hälfte der Qualitätsprobleme. Die verbleibenden Probleme sind meist auf schlechte Trainingsdaten zurückzuführen.
Wie viele Sprecher kann mein Dialog haben?
Die Anzahl der Sprecher in einem Dialog ist unbegrenzt.
Warum ist meine Ausgabe manchmal inkonsistent?
Die Modelle sind nicht deterministisch. Für konsistentere Ergebnisse verwenden Sie den optionalen seed- Parameter, obwohl weiterhin geringfügige Unterschiede auftreten können.
Was ist die Best Practice für die Umwandlung großer Textmengen?
Halten Sie die Gesamtlänge aller inputs[].text-Werte pro Anfrage bei maximal 2.000 Zeichen, um eine zuverlässige Generierung zu gewährleisten. Teilen Sie längere Texte in Abschnitte auf und fügen Sie die resultierenden Audiodateien in Ihrer Anwendung zusammen.
Wichtige Fakten
- Modelle: Verfügbar mit Eleven v4 und Eleven v3
- Sprecher: Keine Begrenzung der Sprecheranzahl pro Dialog
- Anfragegröße: Halten Sie die Gesamtlänge aller
inputs[].text-Werte pro Anfrage bei maximal 2.000 Zeichen - Determinismus: Die Ausgabe ist nicht deterministisch — verwenden Sie den Parameter
seedfür konsistentere Ergebnisse - Kostenlose Regenerierungen: Bis zu 2 kostenlose Regenerierungen pro Generierung (gleicher Inhalt, gleiche Parameter, nur im Dashboard)
- Eigentum: Sie behalten das Eigentum an generierten Audiodateien; die kommerzielle Nutzung erfordert einen kostenpflichtigen Tarif