Instant Voice Cloning

Dowiedz się, jak błyskawicznie sklonować swój głos za pomocą naszych najlepszych modeli.

Funkcja klonowania głosu

Tworzenie klonu Instant Voice Clone

Przy klonowaniu głosu warto wziąć pod uwagę, na czym trenowano AI: w jakich językach i na jakim typie zbioru danych. Więcej o każdym modelu i jego mocnych stronach znajdziesz na stronie modeli.

Instrukcja

Jeśli nie masz pewności, co jest dozwolone prawnie, zapoznaj się z Warunkami korzystania i informacjami o zabezpieczeniach AI.

1

Przejdź do strony Instant Voice Cloning

W panelu ElevenLabs wybierz po lewej sekcję Voices, a potem kliknij ikonę plus.

W oknie modalnym wybierz Instant Voice Clone.

2

Prześlij lub nagraj audio

Postępuj zgodnie z instrukcjami na ekranie, aby przesłać lub nagrać audio.

3

Potwierdź szczegóły głosu

Okno modalne klonowania głosu IVC

Nadaj nazwę i etykietę swojemu klonowi głosu, potwierdź, że masz prawo i zgodę na sklonowanie głosu, a potem kliknij Save voice.

4

Użyj klonu głosu

W sekcji Voices w panelu kliknij My Voices, a potem Use voice, aby zacząć go używać.

Dobre praktyki

Nagraj co najmniej 1 minutę audio

Unikaj nagrań dłuższych niż 3 minuty — niewiele poprawią, a w niektórych przypadkach mogą nawet pogorszyć klon.

Sposób nagrania audio jest ważniejszy niż łączna długość próbek. Liczba próbek nie ma znaczenia; liczy się ich łączna długość.

Zalecamy około 1–2 minut czystego audio bez pogłosu, artefaktów i szumów tła. Przez „jakość audio lub nagrania” nie rozumiemy kodeka, takiego jak MP3 czy WAV, lecz sposób nagrania dźwięku. Jeśli chodzi o kodeki, zalecamy MP3 o przepływności 128 kb/s lub wyższej. Wyższe przepływności nie wpływają znacząco na jakość klonu.

Zachowaj spójność nagrania

AI spróbuje naśladować wszystko, co usłyszy w audio. Dotyczy to tempa mowy, intonacji, akcentu, barwy, sposobu i siły oddychania, a także szumów i mlaskania. Uwzględnia nawet szumy i artefakty, które mogą je zdezorientować.

Dbaj o spójny ton i sposób mówienia przez całe nagranie. Zadbaj też o stałą jakość audio we wszystkich próbkach. Nawet jeśli używasz tylko jednej próbki, powinna być spójna na całej długości. Podanie AI bardzo dynamicznego audio, z dużymi wahaniami wysokości i głośności, da mniej przewidywalne rezultaty.

Odtwórz swój sposób mówienia

Pamiętaj też, że AI spróbuje odtworzyć sposób mówienia z dostarczonego głosu. Jeśli mówisz powoli, monotonnie i bez emocji, AI będzie to naśladować. Z kolei jeśli mówisz szybko i emocjonalnie, AI postara się to odtworzyć.

Głos musi być spójny we wszystkich próbkach — nie tylko pod względem tonu, ale też sposobu mówienia. Zbyt duże różnice mogą zdezorientować AI i prowadzić do bardziej zróżnicowanych wyników między generacjami.

Ustaw odpowiednią głośność

Ustaw odpowiednią głośność, aby audio nie było ani za ciche, ani za głośne. Idealnie: od -23 dB do -18 dB RMS, ze szczytem rzeczywistym -3 dB.

FAQ

Professional Voice Cloning, w przeciwieństwie do Instant Voice Cloning, które pozwala szybko klonować głosy z mniej niż 2 minut audio, umożliwia wytrenowanie bardziej realistycznego modelu twojego głosu. Osiągamy to, trenując dedykowany model na dużym zbiorze danych głosowych, aby stworzyć model praktycznie nieodróżnialny od twojego oryginalnego głosu.

Ponieważ Professional Voice Clones wymagają Finetune i trenowania, trochę potrwa, zanim będziesz mógł użyć klonu głosu. Dokładne oszacowanie jest trudne, ponieważ zależy to od liczby osób przed tobą w kolejce i kilku innych czynników, ale Finetune zwykle trwa 3–6 godzin.

Gdy twój Professional Voice Clone będzie gotowy, otrzymasz powiadomienie e-mail.

Klonowanie za pomocą Instant Voice Cloning może być nieco skomplikowane i mamy kilka ogólnych wskazówek. To jednak tylko wskazówki. Nie mamy sztywnych zasad dotyczących liczby próbek ani ich długości. Widzieliśmy użytkowników, którzy uzyskali świetne wyniki z próbek trwających zaledwie 30 sekund, ale też takich, którzy użyli 10 minut audio i osiągnęli gorsze wyniki. Jest jednak kilka rzeczy, które warto wziąć pod uwagę.

  • Jakość audio to najważniejszy aspekt przy korzystaniu z Instant Voice Cloning.
  • Liczba próbek nie ma znaczenia; ważny jest łączny czas trwania. Ponad 2–3 minuty audio przyniosą niewielką poprawę, a w niektórych przypadkach mogą nawet negatywnie wpłynąć na stabilność klonu.

W przypadku Instant Voice Cloning i Professional Voice Cloning akceptujemy różne typy plików. Zdecydowanie zalecamy MP3 o jakości 192 kbps lub wyższej.

Zalecany format

  • MP3, 192 kbps lub wyższa jakość

Zalecana długość

  • Instant Voice Cloning: 1–2 minuty dobrej jakości audio
  • Professional Voice Cloning: 30–180 minut dobrej jakości audio

Nieskompresowane formaty, takie jak WAV, zwykle nie poprawiają jakości klonu i mogą powodować problemy podczas przesyłania. Zamiast tego skup się na jakości nagrania: użyj czystego nagrania bez szumu tła, pogłosu pomieszczenia ani wielu mówców, o stałej głośności i barwie, bez długich przerw ciszy.

Więcej informacji znajdziesz w artykułach Instant Voice Cloning (IVC) i Professional Voice Cloning (PVC).

W ElevenLabs w pełni angażujemy się zarówno w poszanowanie praw własności intelektualnej, jak i we wdrażanie zabezpieczeń przed potencjalnym niewłaściwym użyciem naszej technologii:

  • Współpracujemy tylko z klientami, którzy przestrzegają naszych Warunków świadczenia usług i Polityki zakazanego użycia, zakazujących złośliwego wykorzystywania naszej technologii do celów, które można uznać za nielegalne lub szkodliwe;
  • Wspieramy właścicieli głosów i ich licencjodawców w dochodzeniu praw, a wszystkie znane naruszenia są sprawdzane i odpowiednio obsługiwane;
  • Każde audio wygenerowane przez nasze modele można natychmiast przypisać użytkownikowi odpowiedzialnemu za generowanie.

Technologia, którą rozwijamy, jest nowa, a jasne przepisy nie zostały jeszcze wprowadzone. Jako laboratorium badawcze AI chcemy między innymi zwiększać świadomość istnienia tej technologii, jej możliwości i ograniczeń.

Pełny przewodnik znajdziesz w naszej dokumentacji o Instant Voice Cloning i Professional Voice Cloning.

W skrócie: dobre, spójne dane wejściowe = dobry, spójny wynik.

Długość

  • Instant Voice Cloning: 1–2 minuty dobrego audio
  • Professional Voice Cloning: 30–180 minut dobrego audio

Użyj najlepszych i najczystszych nagrań, jakie możesz znaleźć. Powinien mówić tylko jeden rozmówca, bez szumu ani zakłóceń w tle, a jego głos powinien być głośny i wyraźny.

Zamiast używać wielu nagrań o różnej jakości tylko po to, by zwiększyć długość, wybieraj nagrania z wyraźnie wysoką jakością mikrofonu oraz spójną jakością i tonem w całym materiale. Nie skupiaj się na wydłużaniu łącznego czasu nagrań.

Dopilnuj, by większość wypowiedzi w nagraniach pasowała do preferowanego stylu mówienia i intonacji rozmówcy. Unikaj zbyt wielu fragmentów, w których rozmówca odbiega od pożądanego sposobu mówienia.

W razie potrzeby użyj narzędzia do usuwania szumów, by ograniczyć hałas w tle.

Więcej informacji znajdziesz w naszej dokumentacji tutaj.

Tak. Możesz sklonować swój głos w dowolnym języku obsługiwanym przez Flash v2.5 i Multilingual v2. Pełną listę obsługiwanych języków znajdziesz tutaj.

Możesz też sklonować głos mówiący w języku, którego AI nie obsługuje. Klon może uchwycić ton rozmówcy, ale nie będzie w stanie mówić w tym języku, a wyniki mogą być nieprzewidywalne. Nie zalecamy tego.

Nie możesz pobrać ani wyeksportować klonów głosu jako osobnych plików. Klony głosu pozostają na twoim koncie ElevenLabs.

Nadal możesz używać swoich głosów ElevenLabs poza stroną ElevenLabs. Dzięki kluczowi API usługi zewnętrzne mogą wywoływać API ElevenLabs i generować mowę głosami z twojego konta.

Jeśli zechcesz później odtworzyć klon, zachowaj oryginalne próbki audio użyte do jego utworzenia. Każdy klon będzie brzmiał nieco inaczej, nawet gdy użyjesz tego samego audio.

ElevenLabs oferuje dwie opcje klonowania:

  • Instant Voice Cloning: Szybkie rezultaty na podstawie około 1–3 minut audio. Działa dobrze w przypadku większości głosów, ale może mieć trudności z rzadkimi akcentami lub nietypowymi głosami.
  • Professional Voice Cloning: Wyższa jakość przy użyciu od 30 minut do około 3 godzin audio. Finetune zwykle trwa 3–6 godzin, ale może potrwać dłużej, jeśli w kolejce jest wiele głosów.

Jeśli Instant Voice Cloning nie oddaje dobrze twojego głosu lub akcentu, wypróbuj Professional Voice Cloning.

Po utworzeniu klonu nie możesz zmienić jego akcentu ani barwy. Aby poprawić efekt, zmień używane próbki audio. Niewielkie zmiany w próbkach mogą zrobić dużą różnicę.

Ten błąd pojawi się, jeśli spróbujesz użyć Professional Voice Clone (PVC), zanim zakończy się proces Finetune i głos będzie gotowy do użycia.

Po utworzeniu PVC musi on przejść kilka etapów, zanim będzie gotowy do użycia. Po zweryfikowaniu głosu zostanie on przetworzony i dodany do kolejki Finetune. W zależności od liczby innych głosów oczekujących obecnie na Finetune proces ten zwykle trwa od 3 do 6 godzin, ale może potrwać do 24 godzin.

Postęp PVC możesz sprawdzić w My Voices: znajdź głos na liście, a następnie kliknij View, aby zobaczyć więcej szczegółów. Najedź kursorem na każdy model, aby sprawdzić jego obecny status.

Więcej informacji o znaczeniu poszczególnych statusów znajdziesz w artykule Co oznacza status mojego Professional Voice Clone?

Gdy PVC zakończy Finetune i będzie gotowy do użycia, zobaczysz powiadomienie w wyskakującym oknie, a także otrzymasz e-mail.

No results