Hoppa till innehållet

Vi presenterar Eleven v3 (alpha)

Publicerad

LyssnaLyssna på den här artikeln

Eleven v3 is no longer in alpha, and is now generally available.


Vi är glada att presentera Eleven v3 (alpha) – den mest uttrycksfulla Text to Speech-modellen.

Den här forskningsversionen ger oöverträffad kontroll och realism i talgenerering med:

  • Över 70 språk
  • Dialog med flera talare
  • Audio tags som [excited], [whispers] och [sighs]

Eleven v3 (alpha) kräver mer prompt engineering än tidigare modeller – men resultatet är enastående.

Om du arbetar med videor, ljudböcker eller medieverktyg ger det här en helt ny nivå av uttrycksfullhet. För användning i realtid och konversationsbaserade användningsfall rekommenderar vi tills vidare v2.5 Turbo eller Flash. En realtidsversion av v3 är under utveckling.

Eleven v3 finns tillgänglig redan idag på vår webbplats och i API:t.

Varför vi byggde v3

Sedan lanseringen av Multilingual v2 har vi sett hur röst-AI används inom professionell film, spelutveckling, utbildning och tillgänglighet. Men den återkommande begränsningen handlade inte om ljudkvalitet – utan om uttrycksfullhet. Det var svårt att få fram starkare känslor, avbrott i samtal och trovärdiga dialoger.

Eleven v3 fyller det här tomrummet. Den har byggts från grunden för att skapa röster som suckar, viskar, skrattar och reagerar – och ger tal som känns genuint responsivt och levande.

Nyheter i Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input

Hör v3 själv

Background
Background

Använda audio tags

Audio tags placeras direkt i ditt manus och skrivs med små bokstäver inom hakparenteser. Läs mer om audio tags i vår prompting-guide för v3 i dokumentationen.

Professional Voice Clones (PVC) är för närvarande inte helt optimerade för Eleven v3, vilket kan ge lägre klonkvalitet jämfört med tidigare modeller. Under den här forskningsfasen är det bäst att hitta en Instant Voice Clone (IVC) eller en designad röst till ditt projekt om du behöver använda v3-funktioner. Optimering av PVC för v3 kommer inom kort.

Du kan till exempel skriva: ”[whispers] Something’s coming… [sighs] I can feel it.” Du kan också kombinera flera taggar för mer uttrycksfull kontroll:

“[happily][shouts] We did it! [laughs].”

Skapa dialog med flera talare

Eleven v3 stöds i vår befintliga Text to Speech-endpoint. Dessutom lanserar vi en ny Text to Dialogue API-endpoint. Ange en strukturerad array med JSON-objekt – där varje objekt representerar en talares replik – så genererar modellen en sammanhängande ljudfil med överlappande tal:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

Endpointen hanterar automatiskt talarbyten, känsloförändringar och avbrott.

Läs mer här.

v3 är vår mest uttrycksfulla modell

Background
Background

Priser och tillgänglighet

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Så aktiverar du v3:

  • Använd Model Picker och välj Eleven v3 (alpha)

API-åtkomst och stöd i Studio kommer snart. För tidig åtkomst kan du kontakta säljteamet.

När du inte ska använda v3

Eleven v3 (alpha) kräver mer prompt engineering än våra tidigare modeller. När den fungerar är resultatet enastående, men tillförlitligheten och den högre latensen gör den olämplig för användning i realtid och konversationsbaserade användningsfall. För sådana rekommenderar vi Eleven v2.5 Turbo/Flash.

Läs mer i den fullständiga v3-dokumentationen och vanliga frågor.

Prova idag

Background
Background
  1. Logga in på ElevenLabs UI
  2. Välj v3 (alpha) i modellmenyn
  3. Klistra in ditt manus – använd taggar eller dialog 
  4. Generera ljud

Vi ser fram emot att se hur du ger v3 liv i nya användningsfall – från uppslukande berättande till filmiska produktionsflöden.

Skapa med AI-ljud av högsta kvalitet