Vad är Audio Tags? Den kompletta guiden till emotionell TTS
- Skriven av
- Jack Limebear
- Publicerad
- Senast uppdaterad
Audio Tags är naturliga instruktioner inom hakparenteser, som [laughs], [gasps], [excited] och [worried], som Eleven v3 tolkar som regi i stället för ord som ska uttalas. När du skriver ett manus för en Text to Speech-modell ger dessa Audio Tags dig detaljerad kontroll över den känslomässiga leveransen i din text.
Eleven v3 blev tillgängligt för allmänheten i mars 2026. Före v3 innebar det att generera om innehåll och hoppas på det bästa för att få en specifik känslomässig leverans från en Text to Speech-modell. Audio Tags tar bort gissningsarbetet och ger dig full kontroll över en känslomässig Text to Speech-leverans.
Den här guiden går igenom vad Audio Tags är, hur de fungerar, alla tillgängliga taggkategorier och hur de skiljer sig från SSML (Speech Synthesis Markup Language). Vi tar också upp vanliga användningsområden, med länkar till en särskild guide för varje område.
Sammanfattning
- Audio Tags är instruktioner inom hakparenteser, som [shouts] eller [excited], som styr känsla, tempo, leverans och ton i TTS i Eleven v3.
- Eleven v3 har inte stöd för SSML, men ersätter det med Audio Tags för en mer naturlig skrivupplevelse.
- Taggar finns i flera kategorier, bland annat känslor, leverans och tempo, mänskliga reaktioner, accenter och ljudeffekter.
- Interpunktion och versaler i texten hjälper dig att forma tempot i en AI-röstprestation.
- Du kan använda Audio Tags i ElevenLabs via gränssnittet eller API:t.
Hur fungerar Audio Tags?
Audio Tags placeras direkt i transkriptionen och omsluts av hakparenteser. När du vill ändra leveransen, till exempel från normal till [worried], behöver du bara lägga till en audio tag.
Du kan också använda fler än en tagg i samma mening och kombinera taggar för en mer nyanserad leverans, till exempel [tired] Det har varit en lång dag… [upset] Hur många fler dagar orkar jag?
Arkitekturen bakom Eleven v3 gör att modellen kan läsa sammanhang på en djupare nivå än tidigare modeller. Den kan följa känslomässiga signaler, tonskiften, talarbyten och ledtrådar i sammanhanget utan en separat parameter eller inställning. Berätta bara för modellen vad ögonblicket kräver, så framför den repliken precis som du tänkt dig.
Eleven v3 hanterar också spontant känsliga dialoger med flera talare, inklusive avbrott, humörskiften och det naturliga samspelet i verkliga samtal, enbart utifrån taggar och manusets struktur.
Audio Tags jämfört med SSML
Om du har arbetat med andra TTS-system har du förmodligen stött på Speech Synthesis Markup Language. Plattformar som Amazon Polly och Microsoft Azure Speech använder SSML-taggar som <break> eller <emphasis> för att ge ytterligare sammanhang till ett TTS-manus.
Eleven v3 har inte stöd för SSML-breaktaggar eller resten av SSML-tagguppsättningen. I stället tar Audio Tags, interpunktion och själva textens struktur över den rollen, samtidigt som du får detaljerad kontroll över leveransen.
Du kan använda tabellen nedan för att mappa vanliga SSML-taggar till motsvarande funktion i Eleven v3.
Ur en skribents perspektiv kräver det mycket mindre arbete att lägga till [whispers] i en replik än att konfigurera en prosodi-hastighet.
Kategorierna av Audio Tags i v3: Regissera leveransen med Audio Tags
Du kan placera Audio Tags var som helst i manuset för att forma leveransen i realtid. Du kan också använda kombinationer av taggar i ett manus eller till och med i en mening.
Taggar delas in i följande huvudkategorier.
Känslor
De här taggarna kan hjälpa dig att ange röstens känslomässiga ton, oavsett om den är dyster, intensiv eller uppåt. Du kan till exempel använda en eller en kombination av [sad], [angry], [happily] och [sorrowful].
Leverans och tempo
De här handlar mer om ton och framförande. Du kan använda dem för att justera volym och energi i scener som kräver återhållsamhet eller kraft. Exempel är taggar som [whispers], [shouts] och [softly].
Mänskliga reaktioner
Äkta naturligt tal innehåller reaktioner. Du kan till exempel göra talet mer verklighetstroget genom att lägga in naturliga, oplanerade ögonblick. Taggar som [laughs], [clears throat] och [sighs] hjälper alla till att skapa en TTS-modell som kan förmedla mänskliga känslor.
Andra exempel på kategorier av audio tags är:
- Accenter och karaktärsröster: Accenttaggar ändrar rösten till en viss region eller personlighet utan att du behöver byta modell, till exempel [French accent], [British accent] eller [pirate voice]. Använd dem för att förvandla en enda röst till en flexibel ensemble i stället för en fast prestation.
- Ljudeffekter: Taggar för ljudeffekter lägger till ljud som inte är tal direkt i genereringen, till exempel [gunshot], [explosion] och [clapping]. De fungerar bra för uppslukande ljud, spel och dramatiserad berättarröst där scenen behöver mer än en röst. Du kan också använda ElevenCreative AI-ljudeffektgenerator.
Taggar ger dig hög kontroll, men du kan även använda interpunktion för att forma rytm och betoning. Lägg till exempel till en ellips för en naturlig paus eller använd kommatecken för att skapa naturliga andningsmönster. Prova att skriva ett ord med enbart versaler för att lägga till betoning: ”Jag vill ha det NU.”
Vad kan du göra med Audio Tags?
Audio Tags låser upp manusets känslomässiga komplexitet på ett intuitivt sätt. Skriv naturligt och lägg till taggar längs vägen.
Här är en snabb överblick över några användningsområden för känslomässig TTS med Audio Tags.
Situationsmedvetenhet i AI-ljud
Taggar som [whisper] eller [shouting] låter Eleven v3 reagera på situationen. Du kan göra en varning mildare eller hålla en utdragen paus för spänning och på så sätt bygga in dynamisk situationsmedvetenhet i ditt manus.
För en fullständig genomgång, läs vår guide om situationsmedvetenhet i AI-ljud.
Regissera karaktärers leverans i tal
När du skapar ett manus med flera karaktärer vill du tydligt visa hur varje röst skiljer sig åt. Du kan justera deras personlighet med [sarcastically] eller definiera hur de talar med [British accent] och fånga hela känslospektrumet med vår TTS-motor.
Läs mer om att regissera karaktärers leverans i AI-tal.
Uttrycka känslomässigt sammanhang i tal
Audio Tags låter dig forma den känslomässiga leveransen av en replik medan den utvecklas. Du kan bygga upp känslor genom hela talet och nå ett crescendo i det ögonblick du föreställer dig att din karaktär når sin fulla potential. Taggar som [awe], [booming] och [big laugh] hjälper dig att bygga in ett helt känsloregister i din AI-röstprestation.
Läs mer om hur du använder känslomässigt sammanhang i AI-tal.
Ge liv åt dialog med flera karaktärer
När du skapar dialoger med flera karaktärer kan du börja varje replik med en audio tag för att skapa rika karaktärssamtal.
Ta följande som exempel: Tom: [coughing] [beginning to speak] förlåt, jag är lite sjuk i dag— Emma: [interrupting] —Sjuk? Du vet hur mycket jag avskyr hosta, Tom! Tom: [surprised] Det är bara lite hosta, inget allvarligt. Hur skulle du känna om— Emma: [overlapping] [annoyed] —Jag tycker att du behöver gå hem.
Se vad mer du kan göra med dialog med flera karaktärer i Eleven v3.
Exakt kontroll över leveransen för AI-tal
Du kan styra talets tempo i Eleven v3 med Audio Tags eller genom interpunktion. Taggar som [pause], [rushed] eller [drawn out] låter dig aktivt forma repliken med precision. Du kan också lägga till ellipser, punkter och utropstecken för att naturligt bygga in känslor i din TTS-prestation.
Vi har skrivit en fördjupad guide om exakt kontroll över leveransen i Eleven v3.
Känslomässig TTS finns tillgänglig via API:t
Audio Tags fungerar på samma sätt via Text to Speech API som i ElevenLabs gränssnitt. Skriv taggen direkt i manustexten, så returnerar API:t den taggade leveransen i det genererade ljudet, från ljudbokspipelines till reklam-voice-overs.
Läs mer om Eleven v3 eller kontakta säljteamet för att komma igång i dag.




