Forcerad justering
Lär dig hur du omvandlar talat ljud och text till ett tidsjusterat transkript med ElevenLabs.
Översikt
ElevenLabs API för forcerad justering omvandlar talat ljud och text till ett tidsjusterat transkript. Det är användbart när du har en ljudinspelning och ett transkript, men behöver exakta tidsstämplar för varje ord eller fras i transkriptet. Det kan användas för:
- Att matcha undertexter med en videoinspelning
- Att generera tidsangivelser för en ljudboksinspelning av en e-bok
Användning
API:et för forcerad justering kan användas genom att ansluta direkt till ElevenLabs API.
Språk som stöds
Våra flerspråkiga v2-modeller har stöd för 29 språk:
Engelska (USA, Storbritannien, Australien, Kanada), japanska, kinesiska, tyska, hindi, franska (Frankrike, Kanada), koreanska, portugisiska (Brasilien, Portugal), italienska, spanska (Spanien, Mexiko), indonesiska, nederländska, turkiska, filippinska, polska, svenska, bulgariska, rumänska, arabiska (Saudiarabien, Förenade Arabemiraten), tjeckiska, grekiska, finska, kroatiska, malajiska, slovakiska, danska, tamil, ukrainska och ryska.
Viktiga fakta
- Inmatningstextens format: Endast vanlig sträng — omslut inte inmatningstexten med JSON eller någon annan struktur
- Diarisering: Stöds inte. Att ange diariserad text ger oväntade resultat
- Prissättning: Samma pris som Speech to Text API
- Maximal filstorlek: 3 GB
- Maximal ljudlängd: 10 timmar
- Maximal textlängd: 675 000 tecken