Hoppa till navigering

Text to Speech

Lär dig hur du förvandlar text till verklighetstroget talat ljud med ElevenLabs.

Översikt

ElevenLabs Text to Speech (TTS)-API förvandlar text till verklighetstroget ljud med nyanserad intonation, tempo och känslomedvetenhet. Våra modeller anpassar sig till textsignaler på 32 språk och flera röststilar och kan användas för att:

  • Berätta globala mediekampanjer och annonser
  • Producera ljudböcker på flera språk med komplex känslomässig leverans
  • Strömma ljud i realtid från text

Lyssna på ett exempel:

Utforska vårt röstbibliotek för att hitta den perfekta rösten för ditt projekt.

Röstbiblioteket är inte tillgängligt via API:t för användare på kostnadsfri nivå.

Röstkvalitet

För realtidsapplikationer ger Flash v2.5 ultralåg latens på 75 ms, medan Multilingual v2 levererar ljud av högsta kvalitet med mer nyanserade uttryck.

Röstalternativ

ElevenLabs erbjuder tusentals röster på 32 språk genom flera olika skapandemetoder:

Läs mer om våra röstalternativ.

Standardformatet för svaret är mp3, men andra format som pcm och ulaw är också tillgängliga.

  • MP3
    • Samplingsfrekvenser: 22,05 kHz–44,1 kHz
    • Bithastigheter: 32 kbps–192 kbps
    • 22,05 kHz @ 32 kbps
    • 44,1 kHz @ 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
  • PCM (S16LE)
    • Samplingsfrekvenser: 16 kHz–44,1 kHz
    • Bithastigheter: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
    • 16-bitars djup
  • μ-law
    • Samplingsfrekvens på 8 kHz
    • Optimerat för telefoniapplikationer
  • A-law
    • Samplingsfrekvens på 8 kHz
    • Optimerat för telefoniapplikationer
  • Opus
    • Samplingsfrekvens: 48 kHz
    • Bithastigheter: 32 kbps–192 kbps

Ljudalternativ med högre kvalitet är endast tillgängliga i betalabonnemang – se vår prissida för mer information.

Språk som stöds

Våra flerspråkiga v2-modeller har stöd för 29 språk:

Engelska (USA, Storbritannien, Australien, Kanada), japanska, kinesiska, tyska, hindi, franska (Frankrike, Kanada), koreanska, portugisiska (Brasilien, Portugal), italienska, spanska (Spanien, Mexiko), indonesiska, nederländska, turkiska, filippinska, polska, svenska, bulgariska, rumänska, arabiska (Saudiarabien, Förenade Arabemiraten), tjeckiska, grekiska, finska, kroatiska, malajiska, slovakiska, danska, tamil, ukrainska och ryska.

Flash v2.5 har stöd för 32 språk – alla språk från v2-modellerna samt:

Ungerska, norska och vietnamesiska

Skriv bara in text på något av våra språk som stöds och välj en passande röst från vårt röstbibliotek. För mest naturliga resultat väljer du en röst med en accent som matchar ditt målspråk och din region.

Promptning

Modellerna tolkar känslomässig kontext direkt från textinmatningen. Att till exempel lägga till beskrivande text som “sa hon upphetsat” eller använda utropstecken påverkar talets känsla. Röstinställningar som stabilitet och likhet hjälper till att styra konsekvensen, medan den underliggande känslan kommer från textens signaler.

Läs promptguiden för mer information.

Beskrivande text kommer att läsas upp av modellen och måste klippas bort eller tas bort manuellt från ljudet om så önskas.

Vanliga frågor

Ja, du kan skapa omedelbara röstkloner av din egen röst från korta ljudklipp. För kloner med hög kvalitet kan du läsa om vår funktion för professionell röstkloning.

Ja. Du behåller äganderätten till allt ljud du genererar. Kommersiella användningsrättigheter är dock endast tillgängliga med betalabonnemang. Med en betald prenumeration kan du använda genererat ljud i kommersiella syften och tjäna pengar på resultatet om du äger IP-rättigheterna till innehållet du matar in.

En kostnadsfri omgenerering låter dig generera samma text till tal-innehåll igen utan extra kostnad, under följande villkor:

  • Du kan generera varje innehållsdel igen upp till 2 gånger utan kostnad
  • Innehållet måste vara exakt samma som i föregående generering. Alla ändringar av texten, röstinställningarna eller andra parametrar kräver en ny, betald generering

Kostnadsfria omgenereringar är användbara om det finns en mindre förvrängning i ljudutdata. Enligt ElevenLabs interna jämförelser löser omgenereringar ungefär hälften av kvalitetsproblemen, medan återstående problem vanligtvis beror på dåliga träningsdata.

Använd Flash-modellerna med låg latens (Flash v2 eller v2.5), som är optimerade för nära nog realtida samtals- eller interaktiva scenarier. Se vår guide för latensoptimering för mer information.

Modellerna är icke-deterministiska. För bättre konsekvens kan du använda den valfria seed- parametern, även om små skillnader fortfarande kan förekomma.

Dela upp lång text i segment och använd streaming för realtidsuppspelning och effektiv bearbetning. För att behålla ett naturligt prosodiflöde mellan delar inkluderar du parametrarna föregående/nästa text eller föregående/nästa begärande-id.

Viktiga fakta

  • Determinism: Utdata är icke-deterministiska — använd parametern seed för mer konsekventa resultat
  • Kostnadsfria omgenereringar: Upp till 2 kostnadsfria omgenereringar per generering (endast samma innehåll och parametrar)
  • Äganderätt: Du behåller äganderätten till genererat ljud; kommersiell användning kräver ett betalabonnemang
  • Användningsområden med låg latens: Använd Flash-modeller (eleven_flash_v2 eller eleven_flash_v2_5) — se guiden för latensoptimering
  • Lång text: Dela upp lång text i segment; använd parametrarna previous_text / next_text för att behålla naturlig prosodi mellan delar