Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Eleven v3 Audio Tags: Ger situationsmedvetenhet till AI-ljud

Skriven av
Ryan Morrison
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Audio Tags är en central del av den nya Eleven v3 (alpha)-Text to Speechmodellen. De låter dig styra hur repliker framförs — genom att ändra ton, känsla och tempo så att de speglar verkliga situationer.

I sin enklaste form är Audio Tags ord inom hakparenteser. Modellen tolkar dem som instruktioner för framförandet. Det innebär att du kan justera framförandet mitt i en mening för att spegla känslomässiga nyanser eller förändringar i situationen — och ge AI:n en viss situationsmedvetenhet.

Vad är situationsmedvetenhet i AI-tal?

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00

Situationsmedvetenhet innebär att AI:n anpassar sitt framförande efter stunden. Med Audio Tags styr du inte bara vad modellen säger — utan också hur den reagerar.

Oavsett om du skapar mer brådska med taggen [SHOUTING], gör en varning mjukare med [WHISPER] eller signalerar tvekan med [SIGH], förvandlar taggar berättande till ett framförande. De är särskilt värdefulla i scener med mycket kontext eller som förändras snabbt.

Ett framförande, inte bara uppläsning

Föreställ dig att du skriver manus till en Veo 3-höjdpunktsvideo från en fotbollsmatch mellan 11 United och 12 United. Du vill att intensiteten ska öka med spelet: ”Han dribblar förbi en försvarare — [EXCITED] här kommer inlägget — [SHOUTING] MÅÅÅL!”

Eller så ger du röst åt ett spännande ögonblick i en ljudbok: ”[WHISPERING] Jag tror att någon är i huset. [PAUSE] Var tyst.”

Det här är inte bara stilistiska tillägg. De definierar ögonblicket och styr hur det känns. Modellen läser inte bara — den framför.

Vanliga taggar för olika situationer

Audio Tags låter dig simulera en rad känslomässiga och fysiska signaler:

  • Känsloläge: [EXCITED], [NERVOUS], [FRUSTRATED], [TIRED]
  • Reaktioner: [GASP], [SIGH], [LAUGHS], [GULPS]
  • Volym och energi: [WHISPERING], [SHOUTING], [QUIETLY], [LOUDLY]
  • Tempo och rytm: [PAUSES], [STAMMERS], [RUSHED]

Taggar kan kombineras för att skapa fler nyanser: ”[NERVOUSLY] Jag ... jag är inte säker på att det här kommer att fungera. [GULPS] Men vi försöker ändå.”

Framföranden du kan styra

Eleven v3 har stöd för dessa taggar med en djupare kontextmodell. Den kan ändra ton mitt i en replik, hantera avbrott och behålla flytet — så att framförandet känns mer naturligt utan att du behöver skriva om manuset.

För röstdesigners, spelutvecklare och berättare öppnar detta upp ett nytt kreativt lager. Du skriver inte bara repliker. Du regisserar dem.

Välj rätt röst

Professional Voice Clones (PVC:er) är för närvarande inte helt optimerade för Eleven v3, vilket kan ge lägre klonkvalitet jämfört med tidigare modeller. Under den här forskningsförhandsvisningen är det bäst att hitta en Instant Voice Clone (IVC) eller en designad röst till ditt projekt om du behöver använda v3-funktioner. Optimering av PVC:er för v3 kommer inom kort.

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet