Text to Speech
Lär dig hur du förvandlar text till verklighetstroget talat ljud med ElevenLabs.
Översikt
ElevenLabs Text to Speech (TTS)-API förvandlar text till verklighetstroget ljud med nyanserad intonation, tempo och känslomedvetenhet. Våra modeller anpassar sig till textsignaler på 32 språk och flera röststilar och kan användas för att:
- Berätta globala mediekampanjer och annonser
- Producera ljudböcker på flera språk med komplex känslomässig leverans
- Strömma ljud i realtid från text
Lyssna på ett exempel:
Utforska vårt röstbibliotek för att hitta den perfekta rösten för ditt projekt.
Röstkvalitet
För realtidsapplikationer ger Flash v2.5 ultralåg latens på 75 ms, medan Multilingual v2 levererar ljud av högsta kvalitet med mer nyanserade uttryck.
Röstalternativ
ElevenLabs erbjuder tusentals röster på 32 språk genom flera olika skapandemetoder:
- Röstbibliotek med över 3 000 röster delade av communityn
- Professionell röstkloning för kopior med högsta möjliga kvalitet
- Omedelbar röstkloning för snabb röstkopiering
- Voice Design för att skapa anpassade röster från textbeskrivningar
Läs mer om våra röstalternativ.
Utdataformat som stöds
Standardformatet för svaret är mp3, men andra format som pcm och ulaw är också tillgängliga.
- MP3
- Samplingsfrekvenser: 22,05 kHz–44,1 kHz
- Bithastigheter: 32 kbps–192 kbps
- 22,05 kHz @ 32 kbps
- 44,1 kHz @ 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
- PCM (S16LE)
- Samplingsfrekvenser: 16 kHz–44,1 kHz
- Bithastigheter: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
- 16-bitars djup
- μ-law
- Samplingsfrekvens på 8 kHz
- Optimerat för telefoniapplikationer
- A-law
- Samplingsfrekvens på 8 kHz
- Optimerat för telefoniapplikationer
- Opus
- Samplingsfrekvens: 48 kHz
- Bithastigheter: 32 kbps–192 kbps
Ljudalternativ med högre kvalitet är endast tillgängliga i betalabonnemang – se vår prissida för mer information.
Språk som stöds
Våra flerspråkiga v2-modeller har stöd för 29 språk:
Engelska (USA, Storbritannien, Australien, Kanada), japanska, kinesiska, tyska, hindi, franska (Frankrike, Kanada), koreanska, portugisiska (Brasilien, Portugal), italienska, spanska (Spanien, Mexiko), indonesiska, nederländska, turkiska, filippinska, polska, svenska, bulgariska, rumänska, arabiska (Saudiarabien, Förenade Arabemiraten), tjeckiska, grekiska, finska, kroatiska, malajiska, slovakiska, danska, tamil, ukrainska och ryska.
Flash v2.5 har stöd för 32 språk – alla språk från v2-modellerna samt:
Ungerska, norska och vietnamesiska
Skriv bara in text på något av våra språk som stöds och välj en passande röst från vårt röstbibliotek. För mest naturliga resultat väljer du en röst med en accent som matchar ditt målspråk och din region.
Promptning
Modellerna tolkar känslomässig kontext direkt från textinmatningen. Att till exempel lägga till beskrivande text som “sa hon upphetsat” eller använda utropstecken påverkar talets känsla. Röstinställningar som stabilitet och likhet hjälper till att styra konsekvensen, medan den underliggande känslan kommer från textens signaler.
Läs promptguiden för mer information.
Beskrivande text kommer att läsas upp av modellen och måste klippas bort eller tas bort manuellt från ljudet om så önskas.
Vanliga frågor
Kan jag klona min egen röst?
Ja, du kan skapa omedelbara röstkloner av din egen röst från korta ljudklipp. För kloner med hög kvalitet kan du läsa om vår funktion för professionell röstkloning.
Äger jag ljudutdata?
Ja. Du behåller äganderätten till allt ljud du genererar. Kommersiella användningsrättigheter är dock endast tillgängliga med betalabonnemang. Med en betald prenumeration kan du använda genererat ljud i kommersiella syften och tjäna pengar på resultatet om du äger IP-rättigheterna till innehållet du matar in.
Vad räknas som en kostnadsfri omgenerering?
En kostnadsfri omgenerering låter dig generera samma text till tal-innehåll igen utan extra kostnad, under följande villkor:
- Du kan generera varje innehållsdel igen upp till 2 gånger utan kostnad
- Innehållet måste vara exakt samma som i föregående generering. Alla ändringar av texten, röstinställningarna eller andra parametrar kräver en ny, betald generering
Kostnadsfria omgenereringar är användbara om det finns en mindre förvrängning i ljudutdata. Enligt ElevenLabs interna jämförelser löser omgenereringar ungefär hälften av kvalitetsproblemen, medan återstående problem vanligtvis beror på dåliga träningsdata.
Hur minskar jag latensen i realtidsscenarier?
Använd Flash-modellerna med låg latens (Flash v2 eller v2.5), som är optimerade för nära nog realtida samtals- eller interaktiva scenarier. Se vår guide för latensoptimering för mer information.
Varför är mina utdata ibland inkonsekventa?
Modellerna är icke-deterministiska. För bättre konsekvens kan du använda den valfria seed- parametern, även om små skillnader fortfarande kan förekomma.
Vilken metod är bäst för stora textkonverteringar?
Dela upp lång text i segment och använd streaming för realtidsuppspelning och effektiv bearbetning. För att behålla ett naturligt prosodiflöde mellan delar inkluderar du parametrarna föregående/nästa text eller föregående/nästa begärande-id.
Viktiga fakta
- Determinism: Utdata är icke-deterministiska — använd parametern
seedför mer konsekventa resultat - Kostnadsfria omgenereringar: Upp till 2 kostnadsfria omgenereringar per generering (endast samma innehåll och parametrar)
- Äganderätt: Du behåller äganderätten till genererat ljud; kommersiell användning kräver ett betalabonnemang
- Användningsområden med låg latens: Använd Flash-modeller (
eleven_flash_v2ellereleven_flash_v2_5) — se guiden för latensoptimering - Lång text: Dela upp lång text i segment; använd parametrarna
previous_text/next_textför att behålla naturlig prosodi mellan delar