Eleven v4
Eleven v4 to nasz najnowszy i najbardziej zaawansowany model Text to Speech oraz pierwszy model nowej generacji. W porównaniu z Eleven v3 poprawia jakość wyników, zgodność głosu, spójność, emocje, sposób mówienia, tagi audio i obsługę języków.
Ogólnie Eleven v4 to wyraźny krok naprzód względem Eleven v3 i daje lepsze wyniki w niemal każdym przypadku. Zdecydowanie polecamy przejść na v4 i przetestować go na własnych głosach i treściach, by samemu zobaczyć różnicę. Choć w kilku nietypowych przypadkach lepiej sprawdzi się inny model, dla większości użytkowników v4 będzie lepszym wyborem.
Więcej o tagach, interpunkcji i promptowaniu dialogów znajdziesz w Promptowanie Eleven v4.
Klonowanie głosu
Dokładność klonowania głosu robi duży krok naprzód w Eleven v4. Sklonowane głosy wierniej niż w jakimkolwiek wcześniejszym modelu oddają cechy głosu źródłowego — barwę, rytm i sposób mówienia.
Instant Voice Clones (IVC) są w Eleven v4 dokładniejsze niż kiedykolwiek. Wierniej uchwytują kluczowe cechy głosu źródłowego, więc łatwiej szybko stworzyć przekonujący klon na podstawie krótkiej próbki audio.
Professional Voice Clones (PVC) są w pełni obsługiwane w Eleven v4. Bazują na tych samych ulepszeniach dokładności głosu i zapewniają wierniejsze odwzorowanie głosu źródłowego w workflow wymagających najwyższej spójności i kontroli.
Ze względu na ten duży skok dokładności Eleven v4 może brzmieć znacząco inaczej niż Eleven v3. Eleven v3 stworzył podstawę dla Eleven v4, kładąc duży nacisk na sposób mówienia i dokładność, a Eleven v4 rozwija ją dzięki znacznie lepszej zgodności głosu. W rezultacie Eleven v4 ma wierniej odwzorowywać głos źródłowy, choć nadal możesz preferować brzmienie głosu w Eleven v3. Dokładność i osobiste preferencje nie zawsze idą w parze, dlatego polecamy porównać obie wersje na własnych treściach i wybrać najlepszą dla twojego zastosowania.
Ponieważ Eleven v4 wierniej odtwarza cechy głosu źródłowego, w tym akcent, sposób mówienia, głośność i inne charakterystyczne właściwości, jakość nagrania źródłowego jest ważniejsza niż kiedykolwiek. Czyste, wyraźne audio treningowe pomaga Eleven v4 dokładnie uchwycić głos bez niechcianych dźwięków czy cech. Szum tła, zniekształcenia i inne problemy z nagraniem mogą wpłynąć na rezultat.
Nadal eksperymentujemy z Eleven v4, by lepiej zrozumieć, jak go używać. Dotąd wydaje się znacznie lepiej wychwytywać niuanse audio, zwłaszcza gdy dostępne jest dużo materiału treningowego, jak w przypadku Professional Voice Clones. Nasze zalecenia dotyczące zróżnicowanych danych treningowych mogą się zmienić, gdy będziemy dalej testować sterowanie modelem za pomocą bardziej wszechstronnego zestawu danych. Na razie polecamy trzymać się jednego stylu mówienia w audio treningowym, który Eleven v4 powinien uchwycić lepiej niż wcześniejsze modele.
Obsługa natywnego akcentu
To jedna z największych zmian w Eleven v4 w porównaniu ze starszymi modelami i warto ją dobrze zrozumieć.
Gdy język, który generujesz, jest zgodny z językiem głosu referencyjnego, oryginalny akcent zostaje zachowany tak jak wcześniej.
Gdy generowany język różni się od języka głosu referencyjnego, Eleven v4 tworzy płynną, naturalnie brzmiącą mowę w języku docelowym — zamiast przenosić akcent głosu referencyjnego z jego oryginalnego języka.
W praktyce: jeśli sklonujesz głos osoby mówiącej po koreańsku i wygenerujesz angielski, Eleven v4 stworzy naturalny, płynny angielski zamiast angielskiego z koreańskim akcentem. Dzięki temu każdy głos można wykorzystać w każdym obsługiwanym języku. Jest to szczególnie przydatne w dubbingu, treściach wielojęzycznych i agentach głosowych, którzy muszą obsługiwać użytkowników w różnych językach jednym głosem.
Jeśli twój workflow wymaga, by głos zachował natywny akcent w innych językach, przetestuj to zachowanie bezpośrednio w Eleven v4 przed migracją — to celowa zmiana w działaniu generowania między językami, a nie błąd.
Ta nowa funkcja jest jednak nadal dopracowywana i sprawdzamy, jak zmienić ją w przełącznik zamiast stale włączonej opcji. To wciąż projekt badawczy, więc na ten moment nie mamy harmonogramu ani dalszych informacji.
Warianty modelu
Eleven v4 występuje w dwóch wariantach, abyś mógł wybrać właściwy balans jakości i szybkości dla swojego zastosowania:
- Eleven v4 (
eleven_v4) — nasz model o najwyższej jakości, idealny do tworzenia treści, audiobooków, głosów postaci i każdego zastosowania, w którym jakość jest najważniejsza. - Eleven v4 Turbo (
eleven_v4_turbo) — niezwykle wysoka jakość przy imponująco niskim opóźnieniu, stworzony do zastosowań w czasie rzeczywistym, takich jak agenci konwersacyjni i interaktywne doświadczenia głosowe.
Oba warianty używają dwóch ustawień głosu: Stability i Similarity.
Stability określa, jak spójny jest sposób mówienia między generacjami. Niższe wartości pozwalają na bardziej ekspresyjny i zróżnicowany przekaz, a wyższe utrzymują wykonanie bliżej stałej bazy.
Similarity określa, jak ściśle wynik trzyma się głosu referencyjnego. Wyższe wartości wymuszają większą zgodność z referencją, co może odbywać się kosztem części naturalności.
Suwaki Style i Speed nie są dostępne w Eleven v4, a SSML nie jest obsługiwany.
Tagi audio (np. [whispering], [shouting], [laughing]) pozwalają precyzyjnie sterować sposobem mówienia, a Eleven v4 radzi sobie z nimi bardziej niuansowo niż wcześniejsze modele. Nie są jeszcze idealne i nadal rozwijamy oraz poprawiamy niezawodność, z jaką model wykonuje instrukcje tagów — to obszar, w który aktywnie inwestujemy i który będzie stale ulepszany.
Przykłady
Te przykłady są surowe. Nie poddaliśmy ich intensywnej postprodukcji: bez EQ, kompresji, normalizacji, redukcji sybilantów, usuwania głosek wybuchowych ani podobnych zabiegów. Jeśli usłyszysz powtarzające się problemy, takie jak clipping, głoski wybuchowe, nierówne EQ lub skoki głośności, najpewniej występują one w danych treningowych tego głosu. Model Eleven v4 je po prostu uchwycił, ponieważ jest bardzo dokładny, nawet gdy odwzorowuje wady. Zostawiliśmy audio bez zmian, abyś mógł usłyszeć, co wygenerował model.
Dokładność klonowania głosu
Każdy przykład zaczyna się od podglądu z Voice Library. Następnie wzięliśmy tekst i wygenerowaliśmy go przy użyciu Instant Voice Clone tego głosu zarówno w Eleven v3, jak i Eleven v4.
To nie jest idealne porównanie. Eleven v4 działa też z Professional Voice Clones, które mogą jeszcze lepiej dopasować głos. Aby jednak porównanie było bardziej uczciwe, użyliśmy Instant Voice Clones zarówno w Eleven v3, jak i Eleven v4.
Te przykłady pokazują, jak wiele z oryginalnego głosu wychwytuje model. Ważne, że obejmuje to także EQ, jakość, głośność oraz inne drobne szczegóły i niedoskonałości audio, takie jak głoski wybuchowe, ostre sybilanty i wahania głośności.
Posłuchaj podglądu, potem Eleven v3, a następnie Eleven v4.
Głos NfUrCNRReUL9RXS9upG1.
Głos HBDoL4wkcalemIO0nUAu.
Aktorstwo głosowe
To generacje Eleven v4. Tagi audio w tekście sterują sposobem mówienia.
Głos EkK5I93UQWFDigLMpZcX.
Głos t7VaN65ClS2VrEUwk1nR.
Audiobook
To narracja Eleven v4. Tagi określają tempo i ton sceny.
Głos KHRvDizAHFVPzoSehNY6.
Model będzie się dalej rozwijać
Eleven v4 jest stale i aktywnie rozwijany. W miarę dalszego trenowania i ulepszania modelu po premierze jego zachowanie może z czasem się zmieniać wraz ze wzrostem jakości. Polecamy okresowo ponownie testować swoje zastosowanie w miarę rozwoju modelu. Będziemy udostępniać ważne aktualizacje, gdy będą wdrażane.
FAQ
Jakie języki obsługuje Eleven v4?
Eleven v4 obsługuje języki: afrikaans, amharski, arabski, armeński, asamski, asturyjski, azerski, białoruski, bengalski, bośniacki, bułgarski, birmański, kantoński, kataloński, cebuański, chorwacki, czeski, duński, niderlandzki, angielski, estoński, filipiński, fiński, francuski, fulani (pulaar), galicyjski, gruziński, niemiecki, grecki, gudźarati, hausa, hebrajski, hindi, węgierski, islandzki, indonezyjski, włoski, japoński, kannada, kazachski, koreański, kirgiski, laotański, lingala, luksemburski, macedoński, malajski, malajalam, maltański, mandaryński chiński, maoryski, marathi, mongolski, nepalski, norweski bokmål, okcytański, orija, paszto, perski, polski, portugalski (Brazylia), pendżabski, rumuński, rosyjski, serbski, shona, sindhi, słowacki, słoweński, somalijski, kurdyjski sorani, hiszpański (Ameryka Łacińska), suahili, szwedzki, tadżycki, tamilski, telugu, tajski, turecki, ukraiński, urdu, uzbecki, wietnamski, walijski i wolof.
Niektóre języki są obsługiwane płynniej niż inne, ale ogólnie Eleven v4 bardzo dobrze radzi sobie z większością z nich.
Czy sklonowany głos zachowa swój akcent?
Gdy głos referencyjny i generowana mowa są w tym samym języku, akcent głosu zostaje zachowany. Na przykład jeśli sklonujesz osobę mówiącą po angielsku z konkretnym angielskim akcentem i wygenerujesz mowę po angielsku, ten akcent zostanie zachowany.
Czy mogę sprawić, by głos mówił w innym języku z oryginalnym akcentem?
Domyślnie, gdy generowany język różni się od języka głosu referencyjnego, Eleven v4 dąży do płynnej, naturalnie brzmiącej mowy w języku docelowym zamiast przenoszenia akcentu referencyjnego. Możesz spróbować użyć tagów audio, aby wskazać akcent lub styl mówienia, ale wyniki mogą się różnić, dlatego przetestuj konkretny głos i zastosowanie.
Czy klon Eleven v4 będzie brzmiał jak jego wersja w Eleven v3?
Ogólnie Eleven v4 znacznie dokładniej odtwarza cechy głosu źródłowego niż Eleven v3, w tym jego barwę, rytm, sposób mówienia i inne manieryzmy. W rezultacie klon z Eleven v4 zwykle będzie brzmiał bardziej jak głos źródłowy i może znacznie różnić się od swojej wersji z Eleven v3.
Czy muszę trenować Eleven v4?
Eleven v4 działa zarówno z Instant Voice Cloning, jak i Professional Voice Cloning.
W przypadku Instant Voice Cloning tworzysz głos bez osobnego etapu trenowania. Prześlij krótką próbkę, zwykle od jednej do dwóch minut, a w ciągu kilku sekund otrzymasz głos gotowy do użycia.
Professional Voice Cloning działa tak samo jak w przypadku wcześniejszych modeli. Trenuje osobny model na dłuższym zestawie nagrań.
Jeśli masz już Professional Voice Clone i chcesz trenować go w Eleven v4, otwórz My Voices, znajdź głos na liście i najedź na niego kursorem. Zobaczysz modele dostępne dla tego głosu. Kliknij przycisk plus obok Eleven v4, aby rozpocząć dostrajanie.
Czy używać Voice Design z Eleven v4?
Głosy Voice Design działają z Eleven v4, ale mogą nie być tak ekspresyjne ani brzmieć tak dobrze jak w przypadku wcześniejszych modeli.