Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Hoppa till innehållet

Vad är Audio Tags? Den kompletta guiden till emotionell TTS

Skriven av
Jack Limebear
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Audio Tags är naturliga instruktioner inom hakparenteser, som [laughs], [gasps], [excited] och [worried], som Eleven v3 tolkar som regi i stället för ord som ska uttalas. När du skriver ett manus för en Text to Speech-modell ger dessa Audio Tags dig detaljerad kontroll över den känslomässiga leveransen i din text. 

Eleven v3 blev tillgängligt för allmänheten i mars 2026. Före v3 innebar det att generera om innehåll och hoppas på det bästa för att få en specifik känslomässig leverans från en Text to Speech-modell. Audio Tags tar bort gissningsarbetet och ger dig full kontroll över en känslomässig Text to Speech-leverans.

Den här guiden går igenom vad Audio Tags är, hur de fungerar, alla tillgängliga taggkategorier och hur de skiljer sig från SSML (Speech Synthesis Markup Language). Vi tar också upp vanliga användningsområden, med länkar till en särskild guide för varje område.

Sammanfattning

  • Audio Tags är instruktioner inom hakparenteser, som [shouts] eller [excited], som styr känsla, tempo, leverans och ton i TTS i Eleven v3.
  • Eleven v3 har inte stöd för SSML, men ersätter det med Audio Tags för en mer naturlig skrivupplevelse.
  • Taggar finns i flera kategorier, bland annat känslor, leverans och tempo, mänskliga reaktioner, accenter och ljudeffekter.
  • Interpunktion och versaler i texten hjälper dig att forma tempot i en AI-röstprestation.
  • Du kan använda Audio Tags i ElevenLabs via gränssnittet eller API:t.

Hur fungerar Audio Tags?

Audio Tags placeras direkt i transkriptionen och omsluts av hakparenteser. När du vill ändra leveransen, till exempel från normal till [worried], behöver du bara lägga till en audio tag.

Du kan också använda fler än en tagg i samma mening och kombinera taggar för en mer nyanserad leverans, till exempel [tired] Det har varit en lång dag… [upset] Hur många fler dagar orkar jag?

Arkitekturen bakom Eleven v3 gör att modellen kan läsa sammanhang på en djupare nivå än tidigare modeller. Den kan följa känslomässiga signaler, tonskiften, talarbyten och ledtrådar i sammanhanget utan en separat parameter eller inställning. Berätta bara för modellen vad ögonblicket kräver, så framför den repliken precis som du tänkt dig.

Eleven v3 hanterar också spontant känsliga dialoger med flera talare, inklusive avbrott, humörskiften och det naturliga samspelet i verkliga samtal, enbart utifrån taggar och manusets struktur. 

Audio Tags jämfört med SSML

Om du har arbetat med andra TTS-system har du förmodligen stött på Speech Synthesis Markup Language. Plattformar som Amazon Polly och Microsoft Azure Speech använder SSML-taggar som <break> eller <emphasis> för att ge ytterligare sammanhang till ett TTS-manus. 

Eleven v3 har inte stöd för SSML-breaktaggar eller resten av SSML-tagguppsättningen. I stället tar Audio Tags, interpunktion och själva textens struktur över den rollen, samtidigt som du får detaljerad kontroll över leveransen.

Du kan använda tabellen nedan för att mappa vanliga SSML-taggar till motsvarande funktion i Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Ur en skribents perspektiv kräver det mycket mindre arbete att lägga till [whispers] i en replik än att konfigurera en prosodi-hastighet.

Kategorierna av Audio Tags i v3: Regissera leveransen med Audio Tags

Du kan placera Audio Tags var som helst i manuset för att forma leveransen i realtid. Du kan också använda kombinationer av taggar i ett manus eller till och med i en mening.

Taggar delas in i följande huvudkategorier.

Känslor

De här taggarna kan hjälpa dig att ange röstens känslomässiga ton, oavsett om den är dyster, intensiv eller uppåt. Du kan till exempel använda en eller en kombination av [sad], [angry], [happily] och [sorrowful].

[sorrowful] I couldn't sleep that night. The air was too still, and the moonlight kept sliding through the blinds like it was trying to tell me something.
[quietly] And suddenly,
that's when I saw it.
0:00
Okay, you are not going to believe this. You know how I've been totally stuck on that short story, like staring at the screen for hours, just nothing? [sighs] I was seriously about to just trash the whole thing, start over, give up probably.
But then [chuckles] last night, I was just doodling, not even thinking about it, right? And this one little phrase popped into my head, just completely out of the blue. And it wasn't even for the story initially, but then I typed it out just to see, and it was like the floodgates opened. Suddenly, I knew exactly where the character needed to go, what the ending had to be. It all just clicked. [sighs] I stayed up till like 3:00 a.m. just typing like a maniac. Didn't even stop for coffee. [chuckles] And it's, it's good, like really good. It feels so complete now, you know? Like it finally has a soul. [sighs] I am so incredibly pumped to finish editing it now. It went from feeling like a chore to feeling like
magic. Seriously, I'm still buzzing.
0:00

Leverans och tempo

De här handlar mer om ton och framförande. Du kan använda dem för att justera volym och energi i scener som kräver återhållsamhet eller kraft. Exempel är taggar som [whispers], [shouts] och [softly].

Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00
So, I was thinking we could-
[jumping in] Test our new timing features.
[surprised] Exactly! How did you-
[overlapping] Know what you were thinking? Lucky guess. Sorry, go ahead.
[cautiously] Okay. So if we both try to talk at the same time-
We'll probably crash the system?
[panicking] Wait, are we crashing? I can't tell if this is a feature or a-
[interrupting] Bug. Did I just cut you off again?
[sighing] Yes. But honestly, this is kind of fun.
0:00

Mänskliga reaktioner

Äkta naturligt tal innehåller reaktioner. Du kan till exempel göra talet mer verklighetstroget genom att lägga in naturliga, oplanerade ögonblick. Taggar som [laughs], [clears throat] och [sighs] hjälper alla till att skapa en TTS-modell som kan förmedla mänskliga känslor.

Andra exempel på kategorier av audio tags är:

  • Accenter och karaktärsröster: Accenttaggar ändrar rösten till en viss region eller personlighet utan att du behöver byta modell, till exempel [French accent], [British accent] eller [pirate voice]. Använd dem för att förvandla en enda röst till en flexibel ensemble i stället för en fast prestation.
  • Ljudeffekter: Taggar för ljudeffekter lägger till ljud som inte är tal direkt i genereringen, till exempel [gunshot], [explosion] och [clapping]. De fungerar bra för uppslukande ljud, spel och dramatiserad berättarröst där scenen behöver mer än en röst. Du kan också använda ElevenCreative AI-ljudeffektgenerator.

Taggar ger dig hög kontroll, men du kan även använda interpunktion för att forma rytm och betoning. Lägg till exempel till en ellips för en naturlig paus eller använd kommatecken för att skapa naturliga andningsmönster. Prova att skriva ett ord med enbart versaler för att lägga till betoning: ”Jag vill ha det NU.”

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00
Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00

Vad kan du göra med Audio Tags?

Audio Tags låser upp manusets känslomässiga komplexitet på ett intuitivt sätt. Skriv naturligt och lägg till taggar längs vägen.

Här är en snabb överblick över några användningsområden för känslomässig TTS med Audio Tags.

Situationsmedvetenhet i AI-ljud

Taggar som [whisper] eller [shouting] låter Eleven v3 reagera på situationen. Du kan göra en varning mildare eller hålla en utdragen paus för spänning och på så sätt bygga in dynamisk situationsmedvetenhet i ditt manus.

För en fullständig genomgång, läs vår guide om situationsmedvetenhet i AI-ljud.

Regissera karaktärers leverans i tal

När du skapar ett manus med flera karaktärer vill du tydligt visa hur varje röst skiljer sig åt. Du kan justera deras personlighet med [sarcastically] eller definiera hur de talar med [British accent] och fånga hela känslospektrumet med vår TTS-motor.

Läs mer om att regissera karaktärers leverans i AI-tal.

Uttrycka känslomässigt sammanhang i tal

Audio Tags låter dig forma den känslomässiga leveransen av en replik medan den utvecklas. Du kan bygga upp känslor genom hela talet och nå ett crescendo i det ögonblick du föreställer dig att din karaktär når sin fulla potential. Taggar som [awe], [booming] och [big laugh] hjälper dig att bygga in ett helt känsloregister i din AI-röstprestation.

Läs mer om hur du använder känslomässigt sammanhang i AI-tal. 

Ge liv åt dialog med flera karaktärer

När du skapar dialoger med flera karaktärer kan du börja varje replik med en audio tag för att skapa rika karaktärssamtal. 

Ta följande som exempel: Tom: [coughing] [beginning to speak] förlåt, jag är lite sjuk i dag— Emma: [interrupting] —Sjuk? Du vet hur mycket jag avskyr hosta, Tom! Tom: [surprised] Det är bara lite hosta, inget allvarligt. Hur skulle du känna om— Emma: [overlapping] [annoyed] —Jag tycker att du behöver gå hem. 

Se vad mer du kan göra med dialog med flera karaktärer i Eleven v3.

Exakt kontroll över leveransen för AI-tal

Du kan styra talets tempo i Eleven v3 med Audio Tags eller genom interpunktion. Taggar som [pause], [rushed] eller [drawn out] låter dig aktivt forma repliken med precision. Du kan också lägga till ellipser, punkter och utropstecken för att naturligt bygga in känslor i din TTS-prestation.

Vi har skrivit en fördjupad guide om exakt kontroll över leveransen i Eleven v3.

Känslomässig TTS finns tillgänglig via API:t

Audio Tags fungerar på samma sätt via Text to Speech API som i ElevenLabs gränssnitt. Skriv taggen direkt i manustexten, så returnerar API:t den taggade leveransen i det genererade ljudet, från ljudbokspipelines till reklam-voice-overs. 

Läs mer om Eleven v3 eller kontakta säljteamet för att komma igång i dag.

Vanliga frågor om Audio Tags och känslomässig TTS

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet