Pierwsza AI, która potrafi się śmiać
- Opublikowano
PosłuchajPosłuchaj tego artykułu
W naszym ostatnim wpisie pokazaliśmy kilka dłuższych próbek wygenerowanych przez nasze narzędzie do syntezy mowy oraz krótko wyjaśniliśmy, jak unikalna konstrukcja naszego modelu pozwala tworzyć płynną, naturalnie brzmiącą mowę. Dziś pokażemy, że jest też bogatszy emocjonalnie i lepiej rozumie kontekst niż jakikolwiek inny. Dzięki temu nie tylko świetnie się go słucha, ale też sprawdza się w zastosowaniach od udźwiękowienia książek i gier po reklamy.
Emocje
Obie mocne strony naszego modelu — płynność i właściwa intonacja — wynikają z ogromu danych treningowych, które poznał (ponad 500 tys. godzin!), ale kluczowe jest to, jak się z nich uczy, czyli jego konstrukcja. Na najbardziej podstawowym poziomie rozumie emocje zawarte w tekście i decyduje, czy mówca powinien brzmieć radośnie, gniewnie, smutno czy neutralnie. Zobacz kilka przykładów:
Wszystkie różnice w intonacji i nastroju wynikają wyłącznie z tekstu — nic innego nie wpłynęło na rezultat. Interpunkcja i znaczenie słów odgrywają kluczową rolę w określaniu sposobu wypowiedzenia zdania, ale zwróć też uwagę, jak model przekonująco tworzy dźwięki nienależące do zwykłej mowy, takie jak śmiech, gdy mówca cieszy się ze zwycięstwa (wkrótce opublikujemy kompilację różnych śmiechów, do których zdolna jest nasza AI!). Podobnie odpowiednio wyolbrzymia reakcję, gdy mówcę bawi coś bardzo zabawnego — to „taaaakie śmieszne”.
Kontekst
Sama znajomość znaczenia pojedynczych słów nie wystarczy. Nasz model jest równie wrażliwy na szerszą sytuację otaczającą każdą wypowiedź — ocenia, czy coś ma sens, na podstawie powiązań z wcześniejszym i późniejszym tekstem. Ta szersza perspektywa pozwala mu właściwie intonować dłuższe fragmenty, nadając kilku zdaniom jeden spójny wzorzec emocjonalny, jak pokazaliśmy w poprzednim wpisie z dłuższymi treściami. Pomaga też unikać błędów logicznych. Na przykład niektóre słowa zapisuje się tak samo, ale znaczą coś innego, np. angielskie „read” w czasie teraźniejszym i przeszłym albo „minute” jako jednostka czasu lub coś bardzo małego. To, które znaczenie jest właściwe, zależy od kontekstu:
Słowo pisane a mówione
Projektujemy naszą platformę z myślą o długich treściach, dlatego model musi też rozumieć, że symbole, skróty i pewne konwencje typowe dla pisma należy wymawiać w określony sposób albo nie dosłownie. Na przykład model musi wiedzieć, że FBI, TNT i ATM wymawia się inaczej niż UNESCO czy NASA. Podobnie zapis $3tr jest poprawny, ale odczytany na głos powinien brzmieć „trzy biliony dolarów”.
Udział człowieka
Rozpoznawanie tych subtelnych różnic jest kluczowe, bo chcemy ograniczyć udział człowieka w procesie generowania. W końcu nie promujemy możliwości stworzenia audiobooka w kilka minut po to, by ktoś musiał przesłuchać całość i przepisać cały tekst. Choć stale aktualizujemy zasady wymowy naszego modelu, zawsze może coś go zmylić. Dlatego tworzymy system oznaczania niepewności, który pozwoli użytkownikom od razu zobaczyć fragmenty tekstu problematyczne dla modelu i nauczyć go, jak powinny być wypowiadane.
Niezliczone zastosowania
Wszystkie pokazane możliwości przybliżają nas do stworzenia najbardziej wszechstronnego narzędzia AI do generowania głosu.
Wydawcy serwisów informacyjnych już odkryli, że większa obecność w audio to świetny sposób na utrzymanie subskrybentów. Dużą zaletą dołączenia nagrania do każdego artykułu jest to, że można go słuchać podczas innych zajęć. Wydawcy, którzy tak robią, często korzystają z aktorów głosowych, co jest kosztowne, a nie każdy artykuł zostaje nagrany. Mogą też zlecać czytanie tekstów własnym reporterom, co zabiera czas, a więc również kosztuje. Ci, którzy używają syntezowanej mowy do udźwiękowienia treści, oszczędzają pieniądze, ale kosztem jakości. Z ElevenLabs nie trzeba już iść na kompromisy — możesz mieć jedno i drugie.
Wyobraź sobie też tworzenie audiobooków z różnymi, pełnymi emocji głosami dla wszystkich postaci — w kilka minut. To nie tylko otwiera nowe sposoby obcowania z książkami, ale też znacznie ułatwia dostęp osobom z trudnościami w nauce.
Pomyśl tylko o możliwościach, które otwierają się teraz przed twórcami gier wideo, którzy nie muszą już zastanawiać się, czy dana postać jest na tyle ważna, by uzasadniać niemały koszt nagrania głosu z udziałem prawdziwych aktorów. Wszystkie postaci NPC mogą teraz mieć własne głosy i osobowości.
Agencje reklamowe i producenci mogą teraz swobodnie eksperymentować oraz dostosowywać nałożone głosy do tonu każdej kampanii — niezależnie od tego, czy chodzi o sportowy kanał telewizyjny, czy markę luksusowych zegarków. Głos każdego aktora można licencjonować do klonowania, aby zmiany wprowadzać od razu, bez jego fizycznej obecności. A jeśli wybiorą w pełni syntetyczny głos, reklamodawcy nie muszą też martwić się o opłaty za prawa do głosu.
Wirtualni asystenci mogą stać się bardziej realistyczni, ponieważ Voice Cloning pozwala im mówić głosem znajomym danemu użytkownikowi, a nowa głębia sposobu wypowiedzi sprawia, że kontakt z nimi staje się bardziej naturalny.
ElevenLabs Beta
Przejdź tutaj , aby zarejestrować się na naszej platformie beta i wypróbować ją samodzielnie. Stale ją ulepszamy, a każda opinia użytkowników jest dla nas bardzo cenna na tym wczesnym etapie. Miłej zabawy!




