Erzwungene Ausrichtung

Erfahren Sie, wie Sie gesprochene Audiodaten und Text mit ElevenLabs in ein zeitlich ausgerichtetes Transkript umwandeln.

Überblick

Die ElevenLabs-API für erzwungene Ausrichtung wandelt gesprochene Audiodaten und Text in ein zeitlich ausgerichtetes Transkript um. Das ist nützlich, wenn Sie über eine Audioaufnahme und ein Transkript verfügen, aber exakte Zeitstempel für jedes Wort oder jede Phrase im Transkript benötigen. Mögliche Einsatzbereiche:

  • Untertitel mit einer Videoaufnahme abgleichen
  • Zeitangaben für die Hörbuchaufnahme eines E-Books erstellen

Nutzung

Die API für erzwungene Ausrichtung kann durch direkte Anbindung an die ElevenLabs-API verwendet werden.

Unterstützte Sprachen

Unsere mehrsprachigen v2-Modelle unterstützen 29 Sprachen:

Englisch (USA, UK, Australien, Kanada), Japanisch, Chinesisch, Deutsch, Hindi, Französisch (Frankreich, Kanada), Koreanisch, Portugiesisch (Brasilien, Portugal), Italienisch, Spanisch (Spanien, Mexiko), Indonesisch, Niederländisch, Türkisch, Filipino, Polnisch, Schwedisch, Bulgarisch, Rumänisch, Arabisch (Saudi-Arabien, VAE), Tschechisch, Griechisch, Finnisch, Kroatisch, Malaiisch, Slowakisch, Dänisch, Tamil, Ukrainisch & Russisch.

Wichtige Fakten

  • Eingabetextformat: Nur Klartextzeichenfolge — betten Sie Eingabetext nicht in JSON oder eine andere Struktur ein
  • Sprechertrennung: Nicht unterstützt; die Eingabe von nach Sprecher:innen getrenntem Text führt zu unerwarteten Ergebnissen
  • Preise: Derselbe Preis wie für die Speech to Text API
  • Maximale Dateigröße: 3 GB
  • Maximale Audiodauer: 10 Stunden
  • Maximale Textlänge: 675.000 Zeichen