Wymuszone wyrównanie
Wymuszone wyrównanie
Dowiedz się, jak zamienić mówione audio i tekst w transkrypcję dopasowaną czasowo dzięki ElevenLabs.
Przegląd
API Wymuszonego wyrównania ElevenLabs zamienia mówione audio i tekst w transkrypcję dopasowaną czasowo. Jest przydatne, gdy masz nagranie audio i transkrypcję, ale potrzebujesz dokładnych znaczników czasu dla każdego słowa lub frazy w transkrypcji. Możesz go użyć do:
- Dopasowania napisów do nagrania wideo
- Wygenerowania czasów dla nagrania audiobooka na podstawie ebooka
Użycie
Z API Wymuszonego wyrównania możesz korzystać bezpośrednio przez API ElevenLabs.
Obsługiwane języki
Nasze wielojęzyczne modele v2 obsługują 29 języków:
angielski (USA, Wielka Brytania, Australia, Kanada), japoński, chiński, niemiecki, hindi, francuski (Francja, Kanada), koreański, portugalski (Brazylia, Portugalia), włoski, hiszpański (Hiszpania, Meksyk), indonezyjski, niderlandzki, turecki, filipiński, polski, szwedzki, bułgarski, rumuński, arabski (Arabia Saudyjska, ZEA), czeski, grecki, fiński, chorwacki, malajski, słowacki, duński, tamilski, ukraiński i rosyjski.
Najważniejsze informacje
- Format tekstu wejściowego: Tylko zwykły ciąg znaków — nie umieszczaj tekstu wejściowego w JSON ani innej strukturze
- Diarizacja: Nie jest obsługiwana; podanie tekstu z diarizacją da nieoczekiwane wyniki
- Cennik: Taka sama stawka jak w Speech to Text API
- Maksymalny rozmiar pliku: 3 GB
- Maksymalna długość audio: 10 godzin
- Maksymalna długość tekstu: 675 000 znaków