Czym są Audio Tags? Kompletny przewodnik po emocjonalnym TTS
- Autor
- Jack Limebear
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Audio Tags to wskazówki w nawiasach kwadratowych, zapisane naturalnym językiem, takie jak [laughs], [gasps], [excited] i [worried], które Eleven v3 odczytuje jako wskazówki dotyczące wykonania, a nie słowa do wypowiedzenia. Gdy piszesz skrypt dla modelu zamiany tekstu na mowę, dodanie tych Audio Tags daje ci precyzyjną kontrolę nad emocjami w wypowiedzi.
Eleven v3 stał się publicznie dostępny w marcu 2026 roku. Przed v3 uzyskanie konkretnej emocjonalnej interpretacji z modelu Text to Speech wymagało wielokrotnego generowania treści i liczenia na najlepsze. Audio Tags eliminują zgadywanie i dają ci pełną kontrolę nad emocjonalną interpretacją zamiany tekstu na mowę.
Ten przewodnik wyjaśnia, czym są Audio Tags, jak działają, jakie kategorie tagów są dostępne i jak wypadają na tle SSML (Speech Synthesis Markup Language). Omówimy też najczęstsze zastosowania — każde z linkiem do osobnego przewodnika.
Podsumowanie
- Audio Tags to wskazówki w nawiasach kwadratowych, takie jak [shouts] czy [excited], które sterują emocjami, tempem, sposobem wypowiedzi i tonem TTS w Eleven v3.
- Eleven v3 nie obsługuje SSML, ale zastępuje go Audio Tags, dzięki którym pisanie brzmi bardziej naturalnie.
- Tagi obejmują kilka kategorii, m.in. emocje, sposób wypowiedzi i tempo, ludzkie reakcje, akcenty oraz efekty dźwiękowe.
- Interpunkcja i wielkie litery w tekście pozwalają kształtować tempo wypowiedzi głosu AI.
- Z Audio Tags możesz korzystać w ElevenLabs przez interfejs lub API.
Jak działają Audio Tags?
Audio Tags umieszcza się bezpośrednio w transkrypcji, w nawiasach kwadratowych. Gdy chcesz zmienić sposób wypowiedzi, na przykład z normalnego na [worried], po prostu dodaj tag audio.
W jednym zdaniu możesz też użyć kilku tagów i łączyć je, aby uzyskać bardziej złożoną interpretację, np. [tired] To był długi dzień… [upset] Ile jeszcze takich dni zniosę?
Architektura Eleven v3 pozwala modelowi odczytywać kontekst głębiej niż wcześniejsze modele. Dzięki temu śledzi wskazówki emocjonalne, zmiany tonu, przejścia między mówcami i wskazówki kontekstowe bez osobnych parametrów czy ustawień. Po prostu powiedz modelowi, czego wymaga dana chwila, a wypowie kwestię dokładnie tak, jak planujesz.
Eleven v3 obsługuje też spontanicznie brzmiące dialogi wielu mówców, w tym przerwania, zmiany nastroju i naturalną wymianę zdań — wyłącznie dzięki tagom i strukturze skryptu.
Audio Tags a SSML
Jeśli pracujesz z innymi systemami TTS, prawdopodobnie znasz Speech Synthesis Markup Language. Platformy takie jak Amazon Polly i Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, by dodać kontekst do skryptu TTS.
Eleven v3 nie obsługuje tagów przerw SSML ani pozostałych tagów SSML. Zamiast tego Audio Tags, interpunkcja i sama struktura tekstu przejmują tę rolę, nadal dając precyzyjną kontrolę nad sposobem wypowiedzi.
W tabeli poniżej znajdziesz odpowiedniki popularnych tagów SSML w Eleven v3.
Z perspektywy autora dodanie [whispers] do kwestii wymaga znacznie mniej wysiłku niż konfiguracja tempa prozodii.
Kategorie Audio Tags w v3: sterowanie interpretacją za pomocą Audio Tags
Audio Tags możesz umieścić w dowolnym miejscu skryptu, aby na bieżąco kształtować sposób wypowiedzi. Możesz też łączyć tagi w całym skrypcie, a nawet w jednym zdaniu.
Tagi należą do poniższych głównych kategorii.
Emocje
Te tagi pomagają nadać głosowi emocjonalny ton — ponury, intensywny lub pogodny. Możesz użyć na przykład jednego albo kilku tagów: [sad], [angry], [happily] i [sorrowful].
Sposób wypowiedzi i tempo
Dotyczą bardziej tonu i wykonania. Możesz używać tych tagów, by dostosować głośność i energię w scenach wymagających powściągliwości lub siły. Przykłady to [whispers], [shouts] i [softly].
Ludzkie reakcje
Prawdziwie naturalna mowa obejmuje reakcje. Możesz na przykład dodać realizmu, umieszczając w wypowiedzi naturalne, nieskryptowane momenty. Tagi takie jak [laughs], [clears throat] i [sighs] pomagają stworzyć model TTS zdolny wyrażać ludzkie emocje.
Inne przykłady kategorii tagów audio:
- Akcenty i głosy postaci: Tagi akcentów zmieniają głos na określony region lub personę bez zmiany modelu, np. [French accent], [British accent] czy [pirate voice]. Dzięki nim jeden głos staje się elastyczną obsadą zamiast jednej stałej interpretacji.
- Efekty dźwiękowe: Tagi efektów dźwiękowych dodają dźwięki inne niż mowa bezpośrednio do generacji, np. [gunshot], [explosion] i [clapping]. Sprawdzają się w immersyjnym audio, grach i dramatyzowanej narracji, gdy scena potrzebuje czegoś więcej niż głosu. Możesz też użyć generatora efektów dźwiękowych AI ElevenCreative.
Tagi dają ci dużą kontrolę, ale rytm i akcent możesz też kształtować interpunkcją. Dodaj na przykład wielokropek, by uzyskać naturalną pauzę, albo przecinki, by stworzyć naturalny rytm oddechu. Spróbuj zapisać słowo wielkimi literami, aby je podkreślić: „Chcę tego WŁAŚNIE TERAZ.”
Co możesz zrobić z Audio Tags?
Audio Tags w intuicyjny sposób otwierają dostęp do emocjonalnej złożoności skryptów. Pisz naturalnie i dodawaj tagi po drodze.
Oto kilka zastosowań emocjonalnego TTS z Audio Tags.
Świadomość sytuacyjna w audio AI
Tagi takie jak [whisper] czy [shouting] pozwalają Eleven v3 reagować na sytuację. Możesz złagodzić ostrzeżenie lub wprowadzić dłuższą pauzę budującą napięcie, dodając dynamiczną świadomość sytuacyjną do skryptu.
Pełne omówienie znajdziesz w naszym przewodniku o świadomości sytuacyjnej w audio AI.
Reżyserowanie interpretacji postaci w mowie
Tworząc skrypt z wieloma postaciami, chcesz wyraźnie pokazać, czym różni się każdy głos. Od dopracowania osobowości za pomocą [sarcastically] po określenie sposobu mówienia z [British accent] — nasz silnik TTS pozwala uchwycić pełną gamę emocji.
Dowiedz się więcej o reżyserowaniu interpretacji postaci w mowie AI.
Wyrażanie emocjonalnego kontekstu w mowie
Audio Tags pozwalają kształtować emocjonalną interpretację kwestii w miarę jej rozwoju. Możesz budować emocje przez całą wypowiedź, aż do kulminacji w chwili, gdy twoja postać osiąga pełnię możliwości. Tagi takie jak [awe], [booming] i [big laugh] pomagają wprowadzić całą gamę emocji do wypowiedzi głosu AI.
Przeczytaj więcej o używaniu emocjonalnego kontekstu w mowie AI.
Ożywianie dialogów wielu postaci
Tworząc dialogi wielu postaci, możesz rozpocząć każdą kwestię od tagu audio, by budować bogate rozmowy między postaciami.
Przykład: Tom: [coughing] [beginning to speak] przepraszam, jestem dziś trochę chory— Emma: [interrupting] —Chory? Wiesz, jak nie znoszę kaszlu, Tom! Tom: [surprised] To tylko lekki kaszel, nic poważnego. Jak byś się czuła, gdyby— Emma: [overlapping] [annoyed] —Myślę, że powinieneś iść do domu.
Zobacz, co jeszcze możesz zrobić z dialogami wielu postaci w Eleven v3.
Precyzyjna kontrola sposobu wypowiedzi w mowie AI
Tempo mowy w Eleven v3 możesz kontrolować za pomocą Audio Tags lub interpunkcji. Tagi takie jak [pause], [rushed] czy [drawn out] pozwalają precyzyjnie kształtować kwestię. Możesz też dodać wielokropki, kropki i wykrzykniki, by naturalnie budować emocje w interpretacji TTS.
Przygotowaliśmy szczegółowy przewodnik o precyzyjnej kontroli sposobu wypowiedzi w Eleven v3.
Emocjonalne TTS jest dostępne przez API
Audio Tags działają tak samo przez Text to Speech API jak w interfejsie ElevenLabs. Wpisz tag bezpośrednio w tekście skryptu, a API zwróci interpretację z tagami w wygenerowanym audio — od procesów tworzenia audiobooków po głosy do reklam.
Dowiedz się więcej o Eleven v3 lub skontaktuj się z działem sprzedaży i zacznij już dziś.




