Przejdź do treści

Przedstawiamy Eleven v3 (alpha)

Opublikowano

PosłuchajPosłuchaj tego artykułu

Eleven v3 is no longer in alpha, and is now generally available.


Z przyjemnością przedstawiamy Eleven v3 (alpha) — nasz najbardziej ekspresyjny model Text to Speech.

Ta wersja testowa daje niespotykaną dotąd kontrolę i realizm generowania mowy dzięki:

  • ponad 70 językom
  • dialogom z wieloma mówcami
  • tagom audio takim jak [excited], [whispers] i [sighs]

Eleven v3 (alpha) wymaga więcej prompt engineeringu niż wcześniejsze modele — ale efekty zapierają dech w piersiach.

Jeśli tworzysz wideo, audiobooki lub narzędzia medialne — zyskujesz nowy poziom ekspresji. Do zastosowań w czasie rzeczywistym i konwersacyjnych na razie polecamy v2.5 Turbo lub Flash. Wersja v3 działająca w czasie rzeczywistym jest w przygotowaniu.

Eleven v3 jest już dostępny na naszej stronie i przez API.

Dlaczego stworzyliśmy v3

Od premiery Multilingual v2 obserwujemy, jak głosy AI trafiają do profesjonalnych filmów, produkcji gier, edukacji i narzędzi dostępności. Stałym ograniczeniem nie była jednak jakość dźwięku, lecz ekspresja. Trudno było uzyskać silniejsze emocje, przerwania w rozmowie i wiarygodną wymianę zdań.

Eleven v3 wypełnia tę lukę. Stworzyliśmy go od podstaw, by głosy mogły wzdychać, szeptać, śmiać się i reagować — tworząc mowę, która brzmi żywo i naturalnie.

Co nowego w Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input

Posłuchaj v3

Background
Background

Korzystanie z tagów audio

Tagi audio umieszczasz bezpośrednio w skrypcie, w nawiasach kwadratowych i małymi literami. Więcej o tagach audio znajdziesz w naszym przewodniku po promptowaniu v3 w dokumentacji.

Professional Voice Clones (PVC) nie są jeszcze w pełni zoptymalizowane pod kątem Eleven v3, więc jakość klonu może być niższa niż w poprzednich modelach. Na tym etapie testów najlepiej wybrać Instant Voice Clone (IVC) lub zaprojektowany głos, jeśli chcesz korzystać z funkcji v3. Optymalizacja PVC dla v3 pojawi się wkrótce.

Możesz na przykład wpisać: „[whispers] Something’s coming… [sighs] I can feel it.” Aby lepiej kontrolować ekspresję, połącz kilka tagów:

“[happily][shouts] We did it! [laughs].”

Tworzenie dialogów z wieloma mówcami

Eleven v3 działa z naszym obecnym endpointem Text to Speech. Wprowadzamy też nowy endpoint API Text to Dialogue. Podaj uporządkowaną tablicę obiektów JSON — każdy reprezentuje wypowiedź mówcy — a model wygeneruje spójny plik audio z nakładającymi się głosami:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

Endpoint automatycznie zarządza zmianami mówców, emocjami i przerwaniami.

Dowiedz się więcej tutaj.

v3 to nasz najbardziej ekspresyjny model

Background
Background

Ceny i dostępność

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Aby włączyć v3:

  • Otwórz wybór modelu i wybierz Eleven v3 (alpha)

Dostęp przez API i obsługa w Studio pojawią się wkrótce. Aby uzyskać wcześniejszy dostęp, skontaktuj się z działem sprzedaży.

Kiedy nie używać v3

Eleven v3 (alpha) wymaga więcej prompt engineeringu niż nasze wcześniejsze modele. Gdy działa, efekty zapierają dech w piersiach, ale mniejsza niezawodność i większe opóźnienia sprawiają, że nie nadaje się do zastosowań w czasie rzeczywistym i konwersacyjnych. W takich przypadkach polecamy Eleven v2.5 Turbo/Flash.

Więcej informacji znajdziesz w pełnej dokumentacji v3 i FAQ.

Wypróbuj już dziś

Background
Background
  1. Zaloguj się do interfejsu ElevenLabs
  2. Wybierz v3 (alpha) z listy modeli
  3. Wklej skrypt — użyj tagów lub dialogu 
  4. Wygeneruj audio

Nie możemy się doczekać, jak wykorzystasz v3 w nowych zastosowaniach — od wciągających opowieści po filmowe procesy produkcyjne.

Podobne artykuły

Twórz z najwyższej jakości audio AI