Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Czym są Audio Tags? Kompletny przewodnik po emocjonalnym TTS

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Audio Tags to wskazówki w nawiasach kwadratowych, zapisane naturalnym językiem, takie jak [laughs], [gasps], [excited] i [worried], które Eleven v3 odczytuje jako wskazówki dotyczące wykonania, a nie słowa do wypowiedzenia. Gdy piszesz skrypt dla modelu zamiany tekstu na mowę, dodanie tych Audio Tags daje ci precyzyjną kontrolę nad emocjami w wypowiedzi.

Eleven v3 stał się publicznie dostępny w marcu 2026 roku. Przed v3 uzyskanie konkretnej emocjonalnej interpretacji z modelu Text to Speech wymagało wielokrotnego generowania treści i liczenia na najlepsze. Audio Tags eliminują zgadywanie i dają ci pełną kontrolę nad emocjonalną interpretacją zamiany tekstu na mowę.

Ten przewodnik wyjaśnia, czym są Audio Tags, jak działają, jakie kategorie tagów są dostępne i jak wypadają na tle SSML (Speech Synthesis Markup Language). Omówimy też najczęstsze zastosowania — każde z linkiem do osobnego przewodnika.

Podsumowanie

  • Audio Tags to wskazówki w nawiasach kwadratowych, takie jak [shouts] czy [excited], które sterują emocjami, tempem, sposobem wypowiedzi i tonem TTS w Eleven v3.
  • Eleven v3 nie obsługuje SSML, ale zastępuje go Audio Tags, dzięki którym pisanie brzmi bardziej naturalnie.
  • Tagi obejmują kilka kategorii, m.in. emocje, sposób wypowiedzi i tempo, ludzkie reakcje, akcenty oraz efekty dźwiękowe.
  • Interpunkcja i wielkie litery w tekście pozwalają kształtować tempo wypowiedzi głosu AI.
  • Z Audio Tags możesz korzystać w ElevenLabs przez interfejs lub API.

Jak działają Audio Tags?

Audio Tags umieszcza się bezpośrednio w transkrypcji, w nawiasach kwadratowych. Gdy chcesz zmienić sposób wypowiedzi, na przykład z normalnego na [worried], po prostu dodaj tag audio.

W jednym zdaniu możesz też użyć kilku tagów i łączyć je, aby uzyskać bardziej złożoną interpretację, np. [tired] To był długi dzień… [upset] Ile jeszcze takich dni zniosę?

Architektura Eleven v3 pozwala modelowi odczytywać kontekst głębiej niż wcześniejsze modele. Dzięki temu śledzi wskazówki emocjonalne, zmiany tonu, przejścia między mówcami i wskazówki kontekstowe bez osobnych parametrów czy ustawień. Po prostu powiedz modelowi, czego wymaga dana chwila, a wypowie kwestię dokładnie tak, jak planujesz.

Eleven v3 obsługuje też spontanicznie brzmiące dialogi wielu mówców, w tym przerwania, zmiany nastroju i naturalną wymianę zdań — wyłącznie dzięki tagom i strukturze skryptu.

Audio Tags a SSML

Jeśli pracujesz z innymi systemami TTS, prawdopodobnie znasz Speech Synthesis Markup Language. Platformy takie jak Amazon Polly i Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, by dodać kontekst do skryptu TTS.

Eleven v3 nie obsługuje tagów przerw SSML ani pozostałych tagów SSML. Zamiast tego Audio Tags, interpunkcja i sama struktura tekstu przejmują tę rolę, nadal dając precyzyjną kontrolę nad sposobem wypowiedzi.

W tabeli poniżej znajdziesz odpowiedniki popularnych tagów SSML w Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Z perspektywy autora dodanie [whispers] do kwestii wymaga znacznie mniej wysiłku niż konfiguracja tempa prozodii.

Kategorie Audio Tags w v3: sterowanie interpretacją za pomocą Audio Tags

Audio Tags możesz umieścić w dowolnym miejscu skryptu, aby na bieżąco kształtować sposób wypowiedzi. Możesz też łączyć tagi w całym skrypcie, a nawet w jednym zdaniu.

Tagi należą do poniższych głównych kategorii.

Emocje

Te tagi pomagają nadać głosowi emocjonalny ton — ponury, intensywny lub pogodny. Możesz użyć na przykład jednego albo kilku tagów: [sad], [angry], [happily] i [sorrowful].

[sorrowful] I couldn't sleep that night. The air was too still, and the moonlight kept sliding through the blinds like it was trying to tell me something.
[quietly] And suddenly,
that's when I saw it.
0:00
Okay, you are not going to believe this. You know how I've been totally stuck on that short story, like staring at the screen for hours, just nothing? [sighs] I was seriously about to just trash the whole thing, start over, give up probably.
But then [chuckles] last night, I was just doodling, not even thinking about it, right? And this one little phrase popped into my head, just completely out of the blue. And it wasn't even for the story initially, but then I typed it out just to see, and it was like the floodgates opened. Suddenly, I knew exactly where the character needed to go, what the ending had to be. It all just clicked. [sighs] I stayed up till like 3:00 a.m. just typing like a maniac. Didn't even stop for coffee. [chuckles] And it's, it's good, like really good. It feels so complete now, you know? Like it finally has a soul. [sighs] I am so incredibly pumped to finish editing it now. It went from feeling like a chore to feeling like
magic. Seriously, I'm still buzzing.
0:00

Sposób wypowiedzi i tempo

Dotyczą bardziej tonu i wykonania. Możesz używać tych tagów, by dostosować głośność i energię w scenach wymagających powściągliwości lub siły. Przykłady to [whispers], [shouts] i [softly].

Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00
So, I was thinking we could-
[jumping in] Test our new timing features.
[surprised] Exactly! How did you-
[overlapping] Know what you were thinking? Lucky guess. Sorry, go ahead.
[cautiously] Okay. So if we both try to talk at the same time-
We'll probably crash the system?
[panicking] Wait, are we crashing? I can't tell if this is a feature or a-
[interrupting] Bug. Did I just cut you off again?
[sighing] Yes. But honestly, this is kind of fun.
0:00

Ludzkie reakcje

Prawdziwie naturalna mowa obejmuje reakcje. Możesz na przykład dodać realizmu, umieszczając w wypowiedzi naturalne, nieskryptowane momenty. Tagi takie jak [laughs], [clears throat] i [sighs] pomagają stworzyć model TTS zdolny wyrażać ludzkie emocje.

Inne przykłady kategorii tagów audio:

  • Akcenty i głosy postaci: Tagi akcentów zmieniają głos na określony region lub personę bez zmiany modelu, np. [French accent], [British accent] czy [pirate voice]. Dzięki nim jeden głos staje się elastyczną obsadą zamiast jednej stałej interpretacji.
  • Efekty dźwiękowe: Tagi efektów dźwiękowych dodają dźwięki inne niż mowa bezpośrednio do generacji, np. [gunshot], [explosion] i [clapping]. Sprawdzają się w immersyjnym audio, grach i dramatyzowanej narracji, gdy scena potrzebuje czegoś więcej niż głosu. Możesz też użyć generatora efektów dźwiękowych AI ElevenCreative.

Tagi dają ci dużą kontrolę, ale rytm i akcent możesz też kształtować interpunkcją. Dodaj na przykład wielokropek, by uzyskać naturalną pauzę, albo przecinki, by stworzyć naturalny rytm oddechu. Spróbuj zapisać słowo wielkimi literami, aby je podkreślić: „Chcę tego WŁAŚNIE TERAZ.”

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00
Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00

Co możesz zrobić z Audio Tags?

Audio Tags w intuicyjny sposób otwierają dostęp do emocjonalnej złożoności skryptów. Pisz naturalnie i dodawaj tagi po drodze.

Oto kilka zastosowań emocjonalnego TTS z Audio Tags.

Świadomość sytuacyjna w audio AI

Tagi takie jak [whisper] czy [shouting] pozwalają Eleven v3 reagować na sytuację. Możesz złagodzić ostrzeżenie lub wprowadzić dłuższą pauzę budującą napięcie, dodając dynamiczną świadomość sytuacyjną do skryptu.

Pełne omówienie znajdziesz w naszym przewodniku o świadomości sytuacyjnej w audio AI.

Reżyserowanie interpretacji postaci w mowie

Tworząc skrypt z wieloma postaciami, chcesz wyraźnie pokazać, czym różni się każdy głos. Od dopracowania osobowości za pomocą [sarcastically] po określenie sposobu mówienia z [British accent] — nasz silnik TTS pozwala uchwycić pełną gamę emocji.

Dowiedz się więcej o reżyserowaniu interpretacji postaci w mowie AI.

Wyrażanie emocjonalnego kontekstu w mowie

Audio Tags pozwalają kształtować emocjonalną interpretację kwestii w miarę jej rozwoju. Możesz budować emocje przez całą wypowiedź, aż do kulminacji w chwili, gdy twoja postać osiąga pełnię możliwości. Tagi takie jak [awe], [booming] i [big laugh] pomagają wprowadzić całą gamę emocji do wypowiedzi głosu AI.

Przeczytaj więcej o używaniu emocjonalnego kontekstu w mowie AI.

Ożywianie dialogów wielu postaci

Tworząc dialogi wielu postaci, możesz rozpocząć każdą kwestię od tagu audio, by budować bogate rozmowy między postaciami.

Przykład: Tom: [coughing] [beginning to speak] przepraszam, jestem dziś trochę chory— Emma: [interrupting] —Chory? Wiesz, jak nie znoszę kaszlu, Tom! Tom: [surprised] To tylko lekki kaszel, nic poważnego. Jak byś się czuła, gdyby— Emma: [overlapping] [annoyed] —Myślę, że powinieneś iść do domu.

Zobacz, co jeszcze możesz zrobić z dialogami wielu postaci w Eleven v3.

Precyzyjna kontrola sposobu wypowiedzi w mowie AI

Tempo mowy w Eleven v3 możesz kontrolować za pomocą Audio Tags lub interpunkcji. Tagi takie jak [pause], [rushed] czy [drawn out] pozwalają precyzyjnie kształtować kwestię. Możesz też dodać wielokropki, kropki i wykrzykniki, by naturalnie budować emocje w interpretacji TTS.

Przygotowaliśmy szczegółowy przewodnik o precyzyjnej kontroli sposobu wypowiedzi w Eleven v3.

Emocjonalne TTS jest dostępne przez API

Audio Tags działają tak samo przez Text to Speech API jak w interfejsie ElevenLabs. Wpisz tag bezpośrednio w tekście skryptu, a API zwróci interpretację z tagami w wygenerowanym audio — od procesów tworzenia audiobooków po głosy do reklam.

Dowiedz się więcej o Eleven v3 lub skontaktuj się z działem sprzedaży i zacznij już dziś.

FAQ: Audio Tags i emocjonalne TTS

Podobne artykuły

Twórz z najwyższej jakości audio AI