Przedstawiamy Eleven v3 (alpha)
- Opublikowano
PosłuchajPosłuchaj tego artykułu
Z przyjemnością przedstawiamy Eleven v3 (alpha) — nasz najbardziej ekspresyjny model Text to Speech.
Ta wersja testowa daje niespotykaną dotąd kontrolę i realizm generowania mowy dzięki:
- ponad 70 językom
- dialogom z wieloma mówcami
- tagom audio takim jak [excited], [whispers] i [sighs]
Eleven v3 (alpha) wymaga więcej prompt engineeringu niż wcześniejsze modele — ale efekty zapierają dech w piersiach.
Jeśli tworzysz wideo, audiobooki lub narzędzia medialne — zyskujesz nowy poziom ekspresji. Do zastosowań w czasie rzeczywistym i konwersacyjnych na razie polecamy v2.5 Turbo lub Flash. Wersja v3 działająca w czasie rzeczywistym jest w przygotowaniu.
Eleven v3 jest już dostępny na naszej stronie i przez API.
Dlaczego stworzyliśmy v3
Od premiery Multilingual v2 obserwujemy, jak głosy AI trafiają do profesjonalnych filmów, produkcji gier, edukacji i narzędzi dostępności. Stałym ograniczeniem nie była jednak jakość dźwięku, lecz ekspresja. Trudno było uzyskać silniejsze emocje, przerwania w rozmowie i wiarygodną wymianę zdań.
Eleven v3 wypełnia tę lukę. Stworzyliśmy go od podstaw, by głosy mogły wzdychać, szeptać, śmiać się i reagować — tworząc mowę, która brzmi żywo i naturalnie.
Co nowego w Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Korzystanie z tagów audio
Tagi audio umieszczasz bezpośrednio w skrypcie, w nawiasach kwadratowych i małymi literami. Więcej o tagach audio znajdziesz w naszym przewodniku po promptowaniu v3 w dokumentacji.
Professional Voice Clones (PVC) nie są jeszcze w pełni zoptymalizowane pod kątem Eleven v3, więc jakość klonu może być niższa niż w poprzednich modelach. Na tym etapie testów najlepiej wybrać Instant Voice Clone (IVC) lub zaprojektowany głos, jeśli chcesz korzystać z funkcji v3. Optymalizacja PVC dla v3 pojawi się wkrótce.
Możesz na przykład wpisać: „[whispers] Something’s coming… [sighs] I can feel it.” Aby lepiej kontrolować ekspresję, połącz kilka tagów:
Tworzenie dialogów z wieloma mówcami
Eleven v3 działa z naszym obecnym endpointem Text to Speech. Wprowadzamy też nowy endpoint API Text to Dialogue. Podaj uporządkowaną tablicę obiektów JSON — każdy reprezentuje wypowiedź mówcy — a model wygeneruje spójny plik audio z nakładającymi się głosami:
Endpoint automatycznie zarządza zmianami mówców, emocjami i przerwaniami.
Dowiedz się więcej tutaj.
Ceny i dostępność
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Aby włączyć v3:
- Otwórz wybór modelu i wybierz Eleven v3 (alpha)
Dostęp przez API i obsługa w Studio pojawią się wkrótce. Aby uzyskać wcześniejszy dostęp, skontaktuj się z działem sprzedaży.
Kiedy nie używać v3
Eleven v3 (alpha) wymaga więcej prompt engineeringu niż nasze wcześniejsze modele. Gdy działa, efekty zapierają dech w piersiach, ale mniejsza niezawodność i większe opóźnienia sprawiają, że nie nadaje się do zastosowań w czasie rzeczywistym i konwersacyjnych. W takich przypadkach polecamy Eleven v2.5 Turbo/Flash.
Więcej informacji znajdziesz w pełnej dokumentacji v3 i FAQ.
- Zaloguj się do interfejsu ElevenLabs
- Wybierz v3 (alpha) z listy modeli
- Wklej skrypt — użyj tagów lub dialogu
- Wygeneruj audio
Nie możemy się doczekać, jak wykorzystasz v3 w nowych zastosowaniach — od wciągających opowieści po filmowe procesy produkcyjne.






.jpg&w=3840&q=80)
.png&w=3840&q=80)


