Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Przedstawiamy Voice Changer

Opublikowano

PosłuchajPosłuchaj tego artykułu

Voice Changer pierwotnie nazywał się speech-to-speech. W kontekście agentów głosowych AI, „speech-to-speech” oznacza też architektury zespolone, w których jeden model bezpośrednio obsługuje wejście i wyjście audio. ElevenAgents korzysta na swojej platformie z zaawansowanej architektury kaskadowej. Dowiedz się więcej: Modele kaskadowe a zespolone.

Voice Changer

Dodaliśmy Voice Changer do Speech Synthesis. Voice Changer to narzędzie do konwersji głosu, które bierze nagranie jednego głosu i sprawia, że brzmi, jakby mówił je ktoś inny — przy zachowaniu oryginalnej interpretacji. Oznacza to, że emocje, timing, tempo i wymowa z nagrania przechodzą do głosu wynikowego.

Daje ci to poziom kontroli, którego same prompty zamiany tekstu na mowę nie zawsze zapewniają. Możesz używać go na dwa główne sposoby.

Wydobądź z głosu więcej emocji. Nie każdy głos równie dobrze reaguje na wskazówki emocjonalne w promptach zamiany tekstu na mowę. Voice Changer pozwala nagrać lub przesłać bardzo ekspresyjną wypowiedź i odtworzyć jej zakres emocji w innym głosie. Jeśli profesjonalny narrator ma brzmieć cieplej albo postać z książki dla dzieci bardziej figlarnie, możesz samodzielnie zagrać tę kwestię, a Voice Changer przeniesie ją do wybranego głosu.

Doprecyzuj sposób wypowiedzi. Nasze modele zamiany tekstu na mowę zwykle dobrze radzą sobie z intonacją od razu. Gdy jednak potrzebujesz dokładnej kontroli nad sposobem wypowiedzenia konkretnej frazy — gdzie pada akcent, jak wybrzmiewa pauza, jaki jest rytm — Voice Changer pozwala pokazać to własnym głosem, a potem zastosować tę interpretację w dowolnym głosie. Będzie to jeszcze przydatniejsze, gdy zintegrujemy Voice Changer bezpośrednio ze Studio, ale cel pozostaje ten sam: dać ci precyzyjną kontrolę nad wynikiem.

Oto instruktaż od jednego z członków naszej społeczności:

Badania

Aby przekonwertować mowę źródłową na docelową, musimy wyrazić treść mowy źródłowej cechami mowy docelowej. Dobrą analogią jest podmiana twarzy: aplikacje, które biorą dwie twarze i łączą je, umieszczając cechy jednej osoby w odwzorowanej strukturze twarzy drugiej.

Polega to na pobraniu obrazu twarzy i odwzorowaniu jej cech. Znaczniki w przykładzie poniżej robią właśnie to — wyznaczają granice, w których renderowana byłaby druga twarz.

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

W konwersji głosu kluczowe jest renderowanie treści mowy źródłowej z użyciem fonemów mowy docelowej. Jest tu jednak kompromis, podobnie jak przy podmianie twarzy: im więcej znaczników używasz do odwzorowania cech jednej twarzy, tym więcej ograniczeń nakładasz na twarz umieszczaną w tej strukturze. Mniej znaczników oznacza mniej ograniczeń.

Tak samo jest z konwersją głosu. Im większy priorytet dajemy mowie docelowej, tym większe ryzyko, że rozjedzie się ona z mową źródłową. Jeśli jednak nadamy jej zbyt niski priorytet, możemy stracić wiele z tego, co nadaje tej mowie charakter. Na przykład gdybyśmy chcieli wyrenderować nagranie osoby krzyczącej ze złością głosem szeptanym, pojawiłby się problem. Zbyt duży priorytet dla emocji mowy źródłowej sprawi, że stracimy wrażenie, że mówi głos szeptany. Zbyt duży nacisk na szeptany sposób mówienia odbierze emocjonalny ładunek mowie źródłowej.

Produkt i ostatnie aktualizacje

Zmiany w gotowych głosach

Wprowadzamy zmiany w domyślnych głosach dostępnych w Speech Synthesis. Wycofamy kilka głosów i zastąpimy je nowymi, a w nadchodzących tygodniach planujemy dodać ponad 20 kolejnych.

Zaczniemy też wyświetlać w interfejsie informacje o tym, jak długo dany głos ma być dostępny. W grudniu odświeżymy funkcje udostępniania głosów i wynagrodzeń za ich użycie, by zwiększyć różnorodność głosów. Wkrótce podamy więcej szczegółów.

Eleven Turbo v2 i format uLaw 8 kHz

Turbo v2 to efekt miesięcy badań naszego zespołu. Zaprojektowano go do interakcji w czasie rzeczywistym, ale sprawdzi się w każdym zastosowaniu. Obsługuje też standardowy format (m)uLaw 8 kHz dla systemów IVR.

Normalizacja i metadane w Studio

Studio obsługuje teraz branżowe wytyczne dotyczące publikacji audiobooków, w tym regulację wzmocnienia i kompresję dynamiki. Możesz też osadzać metadane — ISBN, autora i tytuł — bezpośrednio w projekcie Studio.

Słownik wymowy

To jedna z naszych najczęściej wyczekiwanych funkcji. W zeszłym miesiącu dodaliśmy w naszych angielskich modelach obsługę tagów SSML do określania wymowy za pomocą słowników IPA i CMU. Teraz udostępniliśmy słownik wymowy w interfejsie Studio, który pozwala przesłać plik określający wymowę za pomocą IPA, CMU lub zamienników słów (aliasów). Pliki słowników używają otwartego, branżowego formatu plików leksykonu .PLS format pliku leksykonu.

IPA i CMU są obecnie obsługiwane przez Turbo v2 English. Zamienniki słów obsługują wszystkie modele i języki. Pełna dokumentacja jest dostępna tutaj.

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

Jeśli masz uwagi, napisz do nas na Discordzie!

Wypróbuj Voice Changer

Powiedz to po swojemu i usłysz w zupełnie innym głosie, z pełną kontrolą nad interpretacją. Uchwyć szepty, śmiech, akcenty i subtelne emocje.

Powiedz to po swojemu i usłysz to w zupełnie innym głosie, mając pełną kontrolę nad efektem. Wychwytuj szepty, śmiech, akcenty i subtelne emocje.

Podobne artykuły

Twórz z najwyższej jakości audio AI