Eleven v4

Nasz najnowszy i najbardziej zaawansowany model Text to Speech.

Eleven v4 to nasz najnowszy i najbardziej zaawansowany model Text to Speech oraz pierwszy model nowej generacji. W porównaniu z Eleven v3 poprawia jakość wyników, zgodność głosu, spójność, emocje, sposób mówienia, tagi audio i obsługę języków.

Ogólnie Eleven v4 to wyraźny krok naprzód względem Eleven v3 i daje lepsze wyniki w niemal każdym przypadku. Zdecydowanie polecamy przejść na v4 i przetestować go na własnych głosach i treściach, by samemu zobaczyć różnicę. Choć w kilku nietypowych przypadkach lepiej sprawdzi się inny model, dla większości użytkowników v4 będzie lepszym wyborem.

Więcej o tagach, interpunkcji i promptowaniu dialogów znajdziesz w Promptowanie Eleven v4.

Klonowanie głosu

Dokładność klonowania głosu robi duży krok naprzód w Eleven v4. Sklonowane głosy wierniej niż w jakimkolwiek wcześniejszym modelu oddają cechy głosu źródłowego — barwę, rytm i sposób mówienia.

Instant Voice Clones (IVC) są w Eleven v4 dokładniejsze niż kiedykolwiek. Wierniej uchwytują kluczowe cechy głosu źródłowego, więc łatwiej szybko stworzyć przekonujący klon na podstawie krótkiej próbki audio.

Professional Voice Clones (PVC) są w pełni obsługiwane w Eleven v4. Bazują na tych samych ulepszeniach dokładności głosu i zapewniają wierniejsze odwzorowanie głosu źródłowego w workflow wymagających najwyższej spójności i kontroli.

Ze względu na ten duży skok dokładności Eleven v4 może brzmieć znacząco inaczej niż Eleven v3. Eleven v3 stworzył podstawę dla Eleven v4, kładąc duży nacisk na sposób mówienia i dokładność, a Eleven v4 rozwija ją dzięki znacznie lepszej zgodności głosu. W rezultacie Eleven v4 ma wierniej odwzorowywać głos źródłowy, choć nadal możesz preferować brzmienie głosu w Eleven v3. Dokładność i osobiste preferencje nie zawsze idą w parze, dlatego polecamy porównać obie wersje na własnych treściach i wybrać najlepszą dla twojego zastosowania.

Ponieważ Eleven v4 wierniej odtwarza cechy głosu źródłowego, w tym akcent, sposób mówienia, głośność i inne charakterystyczne właściwości, jakość nagrania źródłowego jest ważniejsza niż kiedykolwiek. Czyste, wyraźne audio treningowe pomaga Eleven v4 dokładnie uchwycić głos bez niechcianych dźwięków czy cech. Szum tła, zniekształcenia i inne problemy z nagraniem mogą wpłynąć na rezultat.

Nadal eksperymentujemy z Eleven v4, by lepiej zrozumieć, jak go używać. Dotąd wydaje się znacznie lepiej wychwytywać niuanse audio, zwłaszcza gdy dostępne jest dużo materiału treningowego, jak w przypadku Professional Voice Clones. Nasze zalecenia dotyczące zróżnicowanych danych treningowych mogą się zmienić, gdy będziemy dalej testować sterowanie modelem za pomocą bardziej wszechstronnego zestawu danych. Na razie polecamy trzymać się jednego stylu mówienia w audio treningowym, który Eleven v4 powinien uchwycić lepiej niż wcześniejsze modele.

Obsługa natywnego akcentu

To jedna z największych zmian w Eleven v4 w porównaniu ze starszymi modelami i warto ją dobrze zrozumieć.

Gdy język, który generujesz, jest zgodny z językiem głosu referencyjnego, oryginalny akcent zostaje zachowany tak jak wcześniej.

Gdy generowany język różni się od języka głosu referencyjnego, Eleven v4 tworzy płynną, naturalnie brzmiącą mowę w języku docelowym — zamiast przenosić akcent głosu referencyjnego z jego oryginalnego języka.

W praktyce: jeśli sklonujesz głos osoby mówiącej po koreańsku i wygenerujesz angielski, Eleven v4 stworzy naturalny, płynny angielski zamiast angielskiego z koreańskim akcentem. Dzięki temu każdy głos można wykorzystać w każdym obsługiwanym języku. Jest to szczególnie przydatne w dubbingu, treściach wielojęzycznych i agentach głosowych, którzy muszą obsługiwać użytkowników w różnych językach jednym głosem.

Jeśli twój workflow wymaga, by głos zachował natywny akcent w innych językach, przetestuj to zachowanie bezpośrednio w Eleven v4 przed migracją — to celowa zmiana w działaniu generowania między językami, a nie błąd.

Ta nowa funkcja jest jednak nadal dopracowywana i sprawdzamy, jak zmienić ją w przełącznik zamiast stale włączonej opcji. To wciąż projekt badawczy, więc na ten moment nie mamy harmonogramu ani dalszych informacji.

Warianty modelu

Eleven v4 występuje w dwóch wariantach, abyś mógł wybrać właściwy balans jakości i szybkości dla swojego zastosowania:

  • Eleven v4 (eleven_v4) — nasz model o najwyższej jakości, idealny do tworzenia treści, audiobooków, głosów postaci i każdego zastosowania, w którym jakość jest najważniejsza.
  • Eleven v4 Turbo (eleven_v4_turbo) — niezwykle wysoka jakość przy imponująco niskim opóźnieniu, stworzony do zastosowań w czasie rzeczywistym, takich jak agenci konwersacyjni i interaktywne doświadczenia głosowe.

Oba warianty używają dwóch ustawień głosu: Stability i Similarity.

Stability określa, jak spójny jest sposób mówienia między generacjami. Niższe wartości pozwalają na bardziej ekspresyjny i zróżnicowany przekaz, a wyższe utrzymują wykonanie bliżej stałej bazy.

Similarity określa, jak ściśle wynik trzyma się głosu referencyjnego. Wyższe wartości wymuszają większą zgodność z referencją, co może odbywać się kosztem części naturalności.

Suwaki Style i Speed nie są dostępne w Eleven v4, a SSML nie jest obsługiwany.

Tagi audio (np. [whispering], [shouting], [laughing]) pozwalają precyzyjnie sterować sposobem mówienia, a Eleven v4 radzi sobie z nimi bardziej niuansowo niż wcześniejsze modele. Nie są jeszcze idealne i nadal rozwijamy oraz poprawiamy niezawodność, z jaką model wykonuje instrukcje tagów — to obszar, w który aktywnie inwestujemy i który będzie stale ulepszany.

Przykłady

Te przykłady są surowe. Nie poddaliśmy ich intensywnej postprodukcji: bez EQ, kompresji, normalizacji, redukcji sybilantów, usuwania głosek wybuchowych ani podobnych zabiegów. Jeśli usłyszysz powtarzające się problemy, takie jak clipping, głoski wybuchowe, nierówne EQ lub skoki głośności, najpewniej występują one w danych treningowych tego głosu. Model Eleven v4 je po prostu uchwycił, ponieważ jest bardzo dokładny, nawet gdy odwzorowuje wady. Zostawiliśmy audio bez zmian, abyś mógł usłyszeć, co wygenerował model.

Dokładność klonowania głosu

Każdy przykład zaczyna się od podglądu z Voice Library. Następnie wzięliśmy tekst i wygenerowaliśmy go przy użyciu Instant Voice Clone tego głosu zarówno w Eleven v3, jak i Eleven v4.

To nie jest idealne porównanie. Eleven v4 działa też z Professional Voice Clones, które mogą jeszcze lepiej dopasować głos. Aby jednak porównanie było bardziej uczciwe, użyliśmy Instant Voice Clones zarówno w Eleven v3, jak i Eleven v4.

Te przykłady pokazują, jak wiele z oryginalnego głosu wychwytuje model. Ważne, że obejmuje to także EQ, jakość, głośność oraz inne drobne szczegóły i niedoskonałości audio, takie jak głoski wybuchowe, ostre sybilanty i wahania głośności.

Posłuchaj podglądu, potem Eleven v3, a następnie Eleven v4.

Głos NfUrCNRReUL9RXS9upG1.

"Brother... I must cross the sea, though I'd rather stay beside you. If the gods will it, we'll see each other again. Until then, when the sun sinks beyond the waves, know that I'll be looking toward home."
He clasped my forearm beneath the pale morning sky. I held on a moment longer, then watched him turn toward the waiting ship.

Głos HBDoL4wkcalemIO0nUAu.

"When I was young, I thought the mountain stood because it was strong. Then winter came, and the mountain wore its crown of snow without complaint. Spring followed, and it let every stream run free.
"So remember, traveler: strength is not always holding fast. Sometimes it is knowing what to carry, and what the season asks you to release."

Aktorstwo głosowe

To generacje Eleven v4. Tagi audio w tekście sterują sposobem mówienia.

Głos EkK5I93UQWFDigLMpZcX.

[casual] "You're looking for work, eh? Hmm, I might have something for you. Just outside the valley, there's a group of wild horned boars I need you to take care of - nasty little beasts. The village would be grateful if you could get that done, and I'll make it worth your while."
------------
[annoyed] [under his breath] "Oh, you again... [sigh] Did you take care of that little problem I mentioned earlier? No, not yet? All right, off you go. I don't have time to chitchat. I'm busy standing here... handing out quests."
------------
[ecstatic] "You did it, you crazy bastard! [dismissive] Not that I didn't have any faith in you, but you wouldn't be the first one to fail. Yes, yes, I know. One of them might have been a little bigger than the others. But hey, you survived. You got it done. You helped the village."

Głos t7VaN65ClS2VrEUwk1nR.

[quietly curious] "Hmm… that mark. I haven't seen one like it in years. Where did you get it? Oh, you gonna make me guess? [giggle]"
------------
[measured] "No need to explain, if you'd rather not. This town has a way of leaving its mark on people. [soft chuckle] Usually not quite so literally."
------------
[lower, thoughtful] "Keep it covered when you can. There are still a few who remember what it means, and they may not ask as politely as I have."

Audiobook

To narracja Eleven v4. Tagi określają tempo i ton sceny.

Głos KHRvDizAHFVPzoSehNY6.

[Quiet, measured narration] The moonlit training court lay beneath the keep, its stone walls silvered with frost. Beyond the battlements, a dragon's distant call rolled over the mountains.
Sir Alden lifted his blunted practice sword. "Ready?"
Bram, his broad shoulders wrapped in a travel-worn cloak, studied the wooden shield strapped to his arm. "I've faced worse odds."
[Pause, dry amusement] "You lost to a turnip cart yesterday," Sir Alden said.
"It was a very determined cart," Bran muttered
[Gradually building energy] They circled across the frost-dusted stones. One step. Another. Alden watched Bram's hands; Bram watched the faint blue glow gathering along Alden's blade. The air between them prickled with harmless magic.
[Quick, light, playful pace] Bram charged. Alden slipped aside. Clack! Wood met steel. Bram turned, his cloak flaring, and swung wide. Alden ducked beneath it. Bram's boot skidded on the frost; he windmilled, caught himself, and bowed as if he'd meant to do that all along.
"Magnificent," Alden said.
"I was giving you time to admire the cloak," Bran retorted.

Model będzie się dalej rozwijać

Eleven v4 jest stale i aktywnie rozwijany. W miarę dalszego trenowania i ulepszania modelu po premierze jego zachowanie może z czasem się zmieniać wraz ze wzrostem jakości. Polecamy okresowo ponownie testować swoje zastosowanie w miarę rozwoju modelu. Będziemy udostępniać ważne aktualizacje, gdy będą wdrażane.

FAQ

Eleven v4 obsługuje języki: afrikaans, amharski, arabski, armeński, asamski, asturyjski, azerski, białoruski, bengalski, bośniacki, bułgarski, birmański, kantoński, kataloński, cebuański, chorwacki, czeski, duński, niderlandzki, angielski, estoński, filipiński, fiński, francuski, fulani (pulaar), galicyjski, gruziński, niemiecki, grecki, gudźarati, hausa, hebrajski, hindi, węgierski, islandzki, indonezyjski, włoski, japoński, kannada, kazachski, koreański, kirgiski, laotański, lingala, luksemburski, macedoński, malajski, malajalam, maltański, mandaryński chiński, maoryski, marathi, mongolski, nepalski, norweski bokmål, okcytański, orija, paszto, perski, polski, portugalski (Brazylia), pendżabski, rumuński, rosyjski, serbski, shona, sindhi, słowacki, słoweński, somalijski, kurdyjski sorani, hiszpański (Ameryka Łacińska), suahili, szwedzki, tadżycki, tamilski, telugu, tajski, turecki, ukraiński, urdu, uzbecki, wietnamski, walijski i wolof.

Niektóre języki są obsługiwane płynniej niż inne, ale ogólnie Eleven v4 bardzo dobrze radzi sobie z większością z nich.

Gdy głos referencyjny i generowana mowa są w tym samym języku, akcent głosu zostaje zachowany. Na przykład jeśli sklonujesz osobę mówiącą po angielsku z konkretnym angielskim akcentem i wygenerujesz mowę po angielsku, ten akcent zostanie zachowany.

Domyślnie, gdy generowany język różni się od języka głosu referencyjnego, Eleven v4 dąży do płynnej, naturalnie brzmiącej mowy w języku docelowym zamiast przenoszenia akcentu referencyjnego. Możesz spróbować użyć tagów audio, aby wskazać akcent lub styl mówienia, ale wyniki mogą się różnić, dlatego przetestuj konkretny głos i zastosowanie.

Ogólnie Eleven v4 znacznie dokładniej odtwarza cechy głosu źródłowego niż Eleven v3, w tym jego barwę, rytm, sposób mówienia i inne manieryzmy. W rezultacie klon z Eleven v4 zwykle będzie brzmiał bardziej jak głos źródłowy i może znacznie różnić się od swojej wersji z Eleven v3.

Eleven v4 działa zarówno z Instant Voice Cloning, jak i Professional Voice Cloning.

W przypadku Instant Voice Cloning tworzysz głos bez osobnego etapu trenowania. Prześlij krótką próbkę, zwykle od jednej do dwóch minut, a w ciągu kilku sekund otrzymasz głos gotowy do użycia.

Professional Voice Cloning działa tak samo jak w przypadku wcześniejszych modeli. Trenuje osobny model na dłuższym zestawie nagrań.

Jeśli masz już Professional Voice Clone i chcesz trenować go w Eleven v4, otwórz My Voices, znajdź głos na liście i najedź na niego kursorem. Zobaczysz modele dostępne dla tego głosu. Kliknij przycisk plus obok Eleven v4, aby rozpocząć dostrajanie.

Głosy Voice Design działają z Eleven v4, ale mogą nie być tak ekspresyjne ani brzmieć tak dobrze jak w przypadku wcześniejszych modeli.