Przedstawiamy Eleven v3 (alpha)
- Opublikowano
PosłuchajPosłuchaj tego artykułu
Z przyjemnością przedstawiamy Eleven v3 (alpha) — najbardziej ekspresyjny model Text to Speech.
Ta wersja zapoznawcza daje niespotykaną dotąd kontrolę i realizm w generowaniu mowy dzięki:
- ponad 70 językom
- Dialogom wielu rozmówców
- Tagom audio takim jak [excited], [whispers] i [sighs]
Eleven v3 (alpha) wymaga więcej prompt engineeringu niż wcześniejsze modele — ale efekty zapierają dech w piersiach.
Jeśli tworzysz wideo, audiobooki lub narzędzia medialne — zyskujesz nowy poziom ekspresji. Do zastosowań w czasie rzeczywistym i konwersacyjnych na razie polecamy v2.5 Turbo lub Flash. Wersja v3 działająca w czasie rzeczywistym jest w trakcie tworzenia.
Eleven v3 jest już dostępny na naszej stronie i w API.
Dlaczego stworzyliśmy v3
Od premiery Multilingual v2 widzimy, że głos AI jest używany w profesjonalnej produkcji filmowej, tworzeniu gier, edukacji i zwiększaniu dostępności. Stałym ograniczeniem nie była jednak jakość dźwięku, lecz ekspresja. Trudno było uzyskać silniejsze emocje, przerwania w rozmowie i wiarygodną wymianę zdań.
Eleven v3 wypełnia tę lukę. Stworzyliśmy go od podstaw, by oferował głosy, które wzdychają, szepczą, śmieją się i reagują — generując mowę, która brzmi autentycznie i żywo.
Co nowego w Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Korzystanie z tagów audio
Tagi audio umieszcza się bezpośrednio w tekście i zapisuje małymi literami w nawiasach kwadratowych. Więcej o tagach audio znajdziesz w naszym przewodniku po promptowaniu v3 w dokumentacji.
Professional Voice Clones (PVC) nie są obecnie w pełni zoptymalizowane pod Eleven v3, co może obniżyć jakość klonów względem wcześniejszych modeli. Na etapie tej wersji zapoznawczej najlepiej wybrać do projektu Instant Voice Clone (IVC) lub zaprojektowany głos, jeśli potrzebujesz funkcji v3. Optymalizacja PVC pod v3 pojawi się wkrótce.
Możesz na przykład użyć promptu: „[whispers] Coś nadchodzi… [sighs] Czuję to”. Aby uzyskać większą ekspresję, możesz też łączyć kilka tagów:
Tworzenie dialogów wielu rozmówców
Eleven v3 jest obsługiwany przez nasz obecny endpoint Text to Speech. Dodatkowo wprowadzamy nowy endpoint API Text to Dialogue. Podaj uporządkowaną tablicę obiektów JSON — każdy reprezentujący wypowiedź rozmówcy — a model wygeneruje spójny plik audio z nakładającymi się głosami:
Endpoint automatycznie obsługuje zmiany rozmówców, emocji i przerwania.
Dowiedz się więcej tutaj.
Ceny i dostępność
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Aby włączyć v3:
- Użyj wyboru modelu i wybierz Eleven v3 (alpha)
Dostęp do API i obsługa w Studio pojawią się wkrótce. Aby uzyskać wcześniejszy dostęp, skontaktuj się z działem sprzedaży.
Kiedy nie używać v3
Eleven v3 (alpha) wymaga więcej prompt engineeringu niż nasze wcześniejsze modele. Gdy działa, efekty zapierają dech w piersiach, ale mniejsza niezawodność i większe opóźnienie sprawiają, że nie nadaje się do zastosowań w czasie rzeczywistym i konwersacyjnych. W takich przypadkach polecamy Eleven v2.5 Turbo/Flash.
Więcej informacji znajdziesz w pełnej dokumentacji v3 i FAQ.
- Zaloguj się do interfejsu ElevenLabs
- Wybierz v3 (alpha) z listy modeli
- Wklej tekst — użyj tagów lub dialogu
- Wygeneruj audio
Nie możemy się doczekać, jak ożywisz v3 w nowych zastosowaniach — od wciągających historii po filmowe pipeline’y produkcyjne.




