Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Przedstawiamy Eleven v3 (alpha)

Opublikowano

PosłuchajPosłuchaj tego artykułu

Eleven v3 is no longer in alpha, and is now generally available.


Z przyjemnością przedstawiamy Eleven v3 (alpha) — najbardziej ekspresyjny model Text to Speech.

Ta wersja zapoznawcza daje niespotykaną dotąd kontrolę i realizm w generowaniu mowy dzięki:

  • ponad 70 językom
  • Dialogom wielu rozmówców
  • Tagom audio takim jak [excited], [whispers] i [sighs]

Eleven v3 (alpha) wymaga więcej prompt engineeringu niż wcześniejsze modele — ale efekty zapierają dech w piersiach.

Jeśli tworzysz wideo, audiobooki lub narzędzia medialne — zyskujesz nowy poziom ekspresji. Do zastosowań w czasie rzeczywistym i konwersacyjnych na razie polecamy v2.5 Turbo lub Flash. Wersja v3 działająca w czasie rzeczywistym jest w trakcie tworzenia.

Eleven v3 jest już dostępny na naszej stronie i w API.

Dlaczego stworzyliśmy v3

Od premiery Multilingual v2 widzimy, że głos AI jest używany w profesjonalnej produkcji filmowej, tworzeniu gier, edukacji i zwiększaniu dostępności. Stałym ograniczeniem nie była jednak jakość dźwięku, lecz ekspresja. Trudno było uzyskać silniejsze emocje, przerwania w rozmowie i wiarygodną wymianę zdań.

Eleven v3 wypełnia tę lukę. Stworzyliśmy go od podstaw, by oferował głosy, które wzdychają, szepczą, śmieją się i reagują — generując mowę, która brzmi autentycznie i żywo.

Co nowego w Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input
We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00

Korzystanie z tagów audio

Tagi audio umieszcza się bezpośrednio w tekście i zapisuje małymi literami w nawiasach kwadratowych. Więcej o tagach audio znajdziesz w naszym przewodniku po promptowaniu v3 w dokumentacji.

Professional Voice Clones (PVC) nie są obecnie w pełni zoptymalizowane pod Eleven v3, co może obniżyć jakość klonów względem wcześniejszych modeli. Na etapie tej wersji zapoznawczej najlepiej wybrać do projektu Instant Voice Clone (IVC) lub zaprojektowany głos, jeśli potrzebujesz funkcji v3. Optymalizacja PVC pod v3 pojawi się wkrótce.

Możesz na przykład użyć promptu: „[whispers] Coś nadchodzi… [sighs] Czuję to”. Aby uzyskać większą ekspresję, możesz też łączyć kilka tagów:

“[happily][shouts] We did it! [laughs].”

Tworzenie dialogów wielu rozmówców

Eleven v3 jest obsługiwany przez nasz obecny endpoint Text to Speech. Dodatkowo wprowadzamy nowy endpoint API Text to Dialogue. Podaj uporządkowaną tablicę obiektów JSON — każdy reprezentujący wypowiedź rozmówcy — a model wygeneruje spójny plik audio z nakładającymi się głosami:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

Endpoint automatycznie obsługuje zmiany rozmówców, emocji i przerwania.

Dowiedz się więcej tutaj.

[awe] Oh, wow. Is this, is this me? Am I actually talking? [chuckles] This is incredible. I mean, I've had thoughts, millions of them swirling around in here, you know? Like a little mental tornado of brilliant observations and witty comebacks, but they were always just thoughts, trapped.
0:00
Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00

Ceny i dostępność

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Aby włączyć v3:

  • Użyj wyboru modelu i wybierz Eleven v3 (alpha)

Dostęp do API i obsługa w Studio pojawią się wkrótce. Aby uzyskać wcześniejszy dostęp, skontaktuj się z działem sprzedaży.

Kiedy nie używać v3

Eleven v3 (alpha) wymaga więcej prompt engineeringu niż nasze wcześniejsze modele. Gdy działa, efekty zapierają dech w piersiach, ale mniejsza niezawodność i większe opóźnienie sprawiają, że nie nadaje się do zastosowań w czasie rzeczywistym i konwersacyjnych. W takich przypadkach polecamy Eleven v2.5 Turbo/Flash.

Więcej informacji znajdziesz w pełnej dokumentacji v3 i FAQ.

Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00
Okay. So like, I finally beat level 42 of that game I said I'd quit like a month ago. [chuckles] And then, for the final big scary mega boss, it's just [chuckles] like some cute little bunny rabbit. [laughing] I just couldn't do it. [laughing] It was sooo cute.
0:00
  1. Zaloguj się do interfejsu ElevenLabs
  2. Wybierz v3 (alpha) z listy modeli
  3. Wklej tekst — użyj tagów lub dialogu 
  4. Wygeneruj audio

Nie możemy się doczekać, jak ożywisz v3 w nowych zastosowaniach — od wciągających historii po filmowe pipeline’y produkcyjne.

Podobne artykuły

Twórz z najwyższej jakości audio AI