Vi presenterar Eleven v3 (alpha)
- Publicerad
LyssnaLyssna på den här artikeln
Vi är glada att presentera Eleven v3 (alpha) – den mest uttrycksfulla Text to Speech-modellen.
Den här forskningsversionen ger oöverträffad kontroll och realism i talgenerering med:
- Över 70 språk
- Dialog med flera talare
- Audio tags som [excited], [whispers] och [sighs]
Eleven v3 (alpha) kräver mer prompt engineering än tidigare modeller – men resultatet är enastående.
Om du arbetar med videor, ljudböcker eller medieverktyg ger det här en helt ny nivå av uttrycksfullhet. För användning i realtid och konversationsbaserade användningsfall rekommenderar vi tills vidare v2.5 Turbo eller Flash. En realtidsversion av v3 är under utveckling.
Eleven v3 finns tillgänglig redan idag på vår webbplats och i API:t.
Varför vi byggde v3
Sedan lanseringen av Multilingual v2 har vi sett hur röst-AI används inom professionell film, spelutveckling, utbildning och tillgänglighet. Men den återkommande begränsningen handlade inte om ljudkvalitet – utan om uttrycksfullhet. Det var svårt att få fram starkare känslor, avbrott i samtal och trovärdiga dialoger.
Eleven v3 fyller det här tomrummet. Den har byggts från grunden för att skapa röster som suckar, viskar, skrattar och reagerar – och ger tal som känns genuint responsivt och levande.
Nyheter i Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Använda audio tags
Audio tags placeras direkt i ditt manus och skrivs med små bokstäver inom hakparenteser. Läs mer om audio tags i vår prompting-guide för v3 i dokumentationen.
Professional Voice Clones (PVC) är för närvarande inte helt optimerade för Eleven v3, vilket kan ge lägre klonkvalitet jämfört med tidigare modeller. Under den här forskningsfasen är det bäst att hitta en Instant Voice Clone (IVC) eller en designad röst till ditt projekt om du behöver använda v3-funktioner. Optimering av PVC för v3 kommer inom kort.
Du kan till exempel skriva: ”[whispers] Something’s coming… [sighs] I can feel it.” Du kan också kombinera flera taggar för mer uttrycksfull kontroll:
Skapa dialog med flera talare
Eleven v3 stöds i vår befintliga Text to Speech-endpoint. Dessutom lanserar vi en ny Text to Dialogue API-endpoint. Ange en strukturerad array med JSON-objekt – där varje objekt representerar en talares replik – så genererar modellen en sammanhängande ljudfil med överlappande tal:
Endpointen hanterar automatiskt talarbyten, känsloförändringar och avbrott.
Läs mer här.
Priser och tillgänglighet
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Så aktiverar du v3:
- Använd Model Picker och välj Eleven v3 (alpha)
API-åtkomst och stöd i Studio kommer snart. För tidig åtkomst kan du kontakta säljteamet.
När du inte ska använda v3
Eleven v3 (alpha) kräver mer prompt engineering än våra tidigare modeller. När den fungerar är resultatet enastående, men tillförlitligheten och den högre latensen gör den olämplig för användning i realtid och konversationsbaserade användningsfall. För sådana rekommenderar vi Eleven v2.5 Turbo/Flash.
Läs mer i den fullständiga v3-dokumentationen och vanliga frågor.
- Logga in på ElevenLabs UI
- Välj v3 (alpha) i modellmenyn
- Klistra in ditt manus – använd taggar eller dialog
- Generera ljud
Vi ser fram emot att se hur du ger v3 liv i nya användningsfall – från uppslukande berättande till filmiska produktionsflöden.







.jpg&w=3840&q=80)
.png&w=3840&q=80)

