Text to Speech

Erfahren Sie, wie Sie mit ElevenLabs Text in lebensechtes gesprochenes Audio umwandeln.

Überblick

Die ElevenLabs-Text to Speech (TTS)-API wandelt Text in lebensechtes Audio mit nuancierter Intonation, passendem Tempo und emotionalem Verständnis um. Unsere Modelle passen sich an Textsignale in 32 Sprachen und verschiedenen Stimmstilen an und können für Folgendes verwendet werden:

  • Globale Medienkampagnen und Werbung vertonen
  • Hörbücher in mehreren Sprachen mit komplexer emotionaler Darbietung produzieren
  • Audio in Echtzeit aus Text streamen

Hören Sie sich ein Beispiel an:

Entdecken Sie unsere Stimmbibliothek, um die perfekte Stimme für Ihr Projekt zu finden.

Die Stimmbibliothek ist für Nutzer des kostenlosen Tarifs nicht über die API verfügbar.

Stimmenqualität

Für Echtzeitanwendungen bietet Flash v2.5 eine extrem niedrige Latenz von 75 ms, während Multilingual v2 Audio in höchster Qualität mit nuancierterem Ausdruck liefert.

Stimmenoptionen

ElevenLabs bietet über mehrere Erstellungsmethoden Tausende Stimmen in 32 Sprachen:

Erfahren Sie mehr über unsere Stimmenoptionen.

Das Standard-Antwortformat ist mp3, aber auch andere Formate wie pcm und ulaw sind verfügbar.

  • MP3
    • Abtastraten: 22.05kHz - 44.1kHz
    • Bitraten: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Abtastraten: 16kHz - 44.1kHz
    • Bitraten: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • 16-Bit-Tiefe
  • μ-law
    • 8kHz-Abtastrate
    • Optimiert für Telefonieanwendungen
  • A-law
    • 8kHz-Abtastrate
    • Optimiert für Telefonieanwendungen
  • Opus
    • Abtastrate: 48kHz
    • Bitraten: 32kbps - 192kbps

Audiooptionen mit höherer Qualität sind nur in kostenpflichtigen Tarifen verfügbar. Details finden Sie auf unserer Preisseite .

Unterstützte Sprachen

Unsere mehrsprachigen v2-Modelle unterstützen 29 Sprachen:

Englisch (USA, UK, Australien, Kanada), Japanisch, Chinesisch, Deutsch, Hindi, Französisch (Frankreich, Kanada), Koreanisch, Portugiesisch (Brasilien, Portugal), Italienisch, Spanisch (Spanien, Mexiko), Indonesisch, Niederländisch, Türkisch, Filipino, Polnisch, Schwedisch, Bulgarisch, Rumänisch, Arabisch (Saudi-Arabien, VAE), Tschechisch, Griechisch, Finnisch, Kroatisch, Malaiisch, Slowakisch, Dänisch, Tamil, Ukrainisch & Russisch.

Flash v2.5 unterstützt 32 Sprachen – alle Sprachen der v2-Modelle sowie:

Ungarisch, Norwegisch & Vietnamesisch

Geben Sie einfach Text in einer unserer unterstützten Sprachen ein und wählen Sie eine passende Stimme aus unserer Stimmbibliothek. Für die natürlichsten Ergebnisse wählen Sie eine Stimme mit einem Akzent, der zu Ihrer Zielsprache und Region passt.

Prompting

Die Modelle interpretieren den emotionalen Kontext direkt aus der Texteingabe. Beispielsweise beeinflussen beschreibender Text wie „sagte sie aufgeregt“ oder Ausrufezeichen die emotionale Wirkung der Sprache. Stimmeinstellungen wie Stabilität und Ähnlichkeit helfen, die Konsistenz zu steuern, während die zugrunde liegende Emotion aus Textsignalen entsteht.

Weitere Details finden Sie im Prompting-Leitfaden.

Beschreibender Text wird vom Modell mitgesprochen und muss bei Bedarf manuell aus dem Audio gekürzt oder entfernt werden.

FAQ

Ja, Sie können aus kurzen Audioclips sofortige Stimmklone Ihrer eigenen Stimme erstellen. Für Klone mit hoher Genauigkeit sehen Sie sich unsere Funktion für professionelles Stimmenklonen an.

Ja. Sie behalten das Eigentum an allen generierten Audiodateien. Kommerzielle Nutzungsrechte sind jedoch nur mit kostenpflichtigen Tarifen verfügbar. Mit einem kostenpflichtigen Abonnement dürfen Sie generierte Audiodateien kommerziell nutzen und die Ausgaben monetarisieren, wenn Sie die IP-Rechte an den Eingabeinhalten besitzen.

Mit einer kostenlosen Regenerierung können Sie denselben Text-to-Speech-Inhalt ohne zusätzliche Kosten erneut generieren, sofern diese Bedingungen erfüllt sind:

  • Sie können jeden Inhalt bis zu zweimal kostenlos erneut generieren
  • Der Inhalt muss exakt mit der vorherigen Generierung übereinstimmen. Änderungen an Text, Stimmeinstellungen oder anderen Parametern erfordern eine neue, kostenpflichtige Generierung

Kostenlose Regenerierungen sind hilfreich, wenn die Audioausgabe leicht verzerrt ist. Laut internen Benchmarks von ElevenLabs lösen Regenerierungen etwa die Hälfte der Qualitätsprobleme. Die verbleibenden Probleme sind meist auf schlechte Trainingsdaten zurückzuführen.

Verwenden Sie die für nahezu Echtzeit-Gespräche oder interaktive Szenarien optimierten Flash-Modelle mit niedriger Latenz (Flash v2 oder v2.5). Weitere Details finden Sie in unserem Leitfaden zur Latenzoptimierung .

Die Modelle sind nicht deterministisch. Für konsistentere Ergebnisse verwenden Sie den optionalen seed- Parameter, obwohl weiterhin geringfügige Unterschiede auftreten können.

Teilen Sie lange Texte in Segmente auf und verwenden Sie Streaming für Echtzeitwiedergabe und effiziente Verarbeitung. Um einen natürlichen Prosodiefluss zwischen Abschnitten beizubehalten, fügen Sie die Parameter für vorherigen/nächsten Text oder vorherige/nächste Anfrage-ID ein.

Wichtige Fakten

  • Determinismus: Die Ausgabe ist nicht deterministisch — verwenden Sie den Parameter seed für konsistentere Ergebnisse
  • Kostenlose Regenerierungen: Bis zu 2 kostenlose Regenerierungen pro Generierung (nur gleicher Inhalt und gleiche Parameter)
  • Eigentum: Sie behalten das Eigentum an generierten Audiodateien; die kommerzielle Nutzung erfordert einen kostenpflichtigen Tarif
  • Anwendungsfälle mit niedriger Latenz: Verwenden Sie Flash-Modelle (eleven_flash_v2 oder eleven_flash_v2_5) — siehe Leitfaden zur Latenzoptimierung
  • Große Texte: Teilen Sie lange Texte in Segmente auf; verwenden Sie die Parameter previous_text / next_text, um eine natürliche Prosodie über Abschnitte hinweg beizubehalten