Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Przewodnik po słownikach wymowy: popraw wymowę każdego słowa w TTS w Eleven v4

Opublikowano

PosłuchajPosłuchaj tego artykułu

Eleven v4 wyznacza nowy standard wymowy w modelach Text to Speech — dokładniej niż kiedykolwiek wcześniej radzi sobie ze skrótami, terminami technicznymi, nazwami i tekstem w różnych językach. Każda marka ma jednak własne słownictwo: unikalne nazwy produktów i branżowy żargon. Dlatego warto mieć pełną kontrolę nad brzmieniem tych słów.

Eleven v4 oferuje wiele sposobów na poprawę wymowy, dając ci precyzyjną kontrolę nad tym, jak mówi model. Możesz stworzyć rozbudowany słownik wymowy, który działa w każdym skrypcie pisanym w aplikacji TTS. Możesz też wpisać IPA bezpośrednio w tekście, aby jednorazowo poprawić wymowę. 

Oto krótki przykład, jak Eleven v4 radzi sobie ze skryptem pełnym trudnych terminów:

At 2:47 A.M., Siobhan Lester's phone lit up. The search service on the Kubernetes cluster was timing out. She read the pod logs and found the cause in Tuesday's release. A new fuzzy matching feature compared every query against the entire product catalog using Levenshtein distance, so each search took 1,400 milliseconds, well past the one-second limit. Her lead, a purist who quotes Dijkstra and Euler in code reviews, wanted to rewrite the matcher from scratch. Instead, she rolled back to Monday's build, and by 3:30 A.M., the rollback was live and response times were back under 50 milliseconds. The proper fix, an index that narrows each search to close matches, shipped in Thursday's release.
0:00

Ten przewodnik pokazuje, jak tworzyć i używać słownika wymowy TTS oraz jakie strategie pomagają uzyskać audio jak najbliższe temu, które masz na myśli. 

Podsumowanie

  • Słownik wymowy to zestaw reguł, które określają modelowi Text to Speech, jak wymawiać konkretne słowa lub frazy.
  • Reguły wymowy TTS mogą opierać się na aliasach, które podmieniają tekst, albo na fonemach, które używają zapisu fonetycznego.
  • Eleven v4 obsługuje reguły fonemowe oraz IPA w tekście (Międzynarodowy Alfabet Fonetyczny).
  • Tagi SSML phoneme i break nie działają w Eleven v4, ale możesz użyć słownika wymowy lub Audio Tags jako alternatywy opartej na języku naturalnym.
  • W jednym żądaniu przez ElevenAPI możesz zastosować do trzech słowników wymowy.

Czym jest słownik wymowy?

Słownik wymowy to narzędzie, które pozwala dokładnie określić, jak model zamiany tekstu na mowę wymawia dane słowa. Dodając słowa lub frazy do słownika wymowy, ustalasz, jak będą brzmiały za każdym razem, gdy pojawią się w skrypcie TTS. 

Słowniki wymowy zwykle stosuje się do:

  • Nazw marek: Nazwy marek często trafiają do słowników wymowy, szczególnie gdy mają unikalną lub nietypową pisownię.
  • Akronimów: Niektóre akronimy wymawia się w określony sposób. Na przykład AEO powinno brzmieć jak /ˌeɪ.iːˈoʊ/ („A-E-O”), a nie /eɪˈjoʊ/ („ej-jo”). Stała reguła w słowniku sprawia, że model za każdym razem wymawia je poprawnie.
  • Nazw miejsc i innych nazw własnych: Niektóre nazwy miejsc mogą brzmieć zupełnie inaczej, niż sugeruje ich pisownia. Dobrym przykładem jest Worcestershire — przewodnik wymowy pomaga uniknąć takich problemów.
  • Terminów branżowych: Branżowy żargon lub specjalistyczne terminy, na przykład medyczne czy prawnicze, mogą wymagać słownika wymowy, jeśli model nie był trenowany na danych z tych dziedzin. 

Poza zamianą tekstu na mowę słowniki wymowy to zwykle tworzone przez społeczność zbiory klipów audio od rodzimych użytkowników języka. Osoby uczące się korzystają z nich, by usłyszeć wymowę danych słów.

Different uses of pronunciation dictionaries in TTS apps

Jak kontrolować wymowę TTS w Eleven v4

Eleven v4 to najwyżej oceniany pod względem jakości model Text to Speech według Provider Voice Arena od Artificial Analysis.1 Jednym z powodów, dla których Eleven v4 jest liderem rynku, jest zdolność modelu do obsługi złożonych tekstów przy zachowaniu naturalnego brzmienia audio. 

Aby zapewnić użytkownikom jak najlepsze doświadczenie z Eleven v4, model oferuje wiele sposobów dostosowania wymowy, tak aby każde audio spełniało twoje wymagania dotyczące dokładności. 

Tak możesz kontrolować wymowę w Eleven v4:

  • IPA w tekście: Możesz wpisywać IPA w skryptach między ukośnikami, aby określić wymowę bez używania słownika wymowy. Za chwilę omówimy szczegóły.
  • Reguły fonemowe w słownikach: Dodaj do słowników wymowy reguły oparte na fonemach, by kontrolować fonetyczne brzmienie często występujących słów.
  • Płynna wymowa w różnych językach: Eleven v4 może tworzyć naturalnie brzmiącą mowę w ponad 90 językach. Zachowaj rodzimą wymowę w każdym języku, używając tego samego głosu, aby zapewnić spójne doświadczenie brandingu dźwiękowego.

Tak różne modele TTS ElevenLabs wypadają pod względem kontroli wymowy:

Model

Reguły aliasów (słownik)

Reguły fonemowe (słownik)

IPA w tekście (/.../)

Tagi fonemów SSML (<phoneme>)

Eleven v4

Tak

Tak

Tak

Nie

Eleven v4 Turbo

Tak

Tak

Tak

Nie

Eleven v3

Tak

Tak

Tak

Nie

Eleven Flash v2

Tak

Tak

Nie

Tak (tylko angielski)

Eleven Turbo v2

Tak

Nie

Nie

Tak (tylko angielski)

Eleven Multilingual v2

Tak

Nie

Nie

Nie

Pronunciation dictionary guide on ElevenLabs across different models

Czym różnią się reguły aliasów od reguł fonemowych w słowniku wymowy?

Reguły wymowy oparte na aliasach zastępują jeden fragment tekstu innym, zanim model wypowie słowo. Dzieje się to w tle przy każdym generowaniu audio przez model: brzmienie słowa lub frazy zostaje zastąpione tym, co dodano do słownika wymowy. 

Oto kilka przykładów reguł wymowy opartych na aliasach:

  • „SaaS” zmienia się w „sass”
  • „UN” zmienia się w „United Nations”
  • „OAuth” zmienia się w „oh auth”

Z kolei reguły fonemowe podają modelowi dokładny zapis fonetyczny. Są trudniejsze do utworzenia, ponieważ musisz samodzielnie zapisać lub wygenerować transkrypcję IPA i dodać ją do słownika. Na przykład „Kubernetes” zmienia się w /ˌkuː.bərˈnɛt.iːz/.

Jak poprawić wymowę nazwy marki w modelu TTS

Nazwy marek to jedne z najczęstszych wpisów w słownikach wymowy, ponieważ nie zawsze są prawdziwymi słowami. Jeśli twoja firma stworzyła nowe słowo lub unikalną pisownię nazwy marki, modele TTS mogą mieć problem z poprawną wymową — dostępnych danych treningowych z tą konkretną wymową jest niewiele.

Tak poprawisz wymowę nazwy marki w Eleven v4:

  1. Sprawdź domyślne brzmienie: Otwórz aplikację Text to Speech i wpisz nazwę swojej marki. Wygeneruj klip i posłuchaj, jak brzmi. Jeśli wymowa jest błędna, przejdź do następnego kroku. 
  2. Wypróbuj regułę aliasu: Najłatwiejszym sposobem na poprawę wymowy marki jest utworzenie reguły aliasu. Tworzy się je szybko i intuicyjnie.
  3. Przejdź na regułę fonemową: Jeśli reguła aliasu nie działa wystarczająco dobrze, użyj IPA. Zapisz nazwę marki w IPA, a następnie utwórz regułę w słowniku wymowy Text to Speech, aby poprawić jej wymowę.
  4. Uwzględnij każdą wielkość liter: Jeśli używasz obu wersji, dodaj transkrypcję IPA zarówno dla nazwy marki zapisanej małymi, jak i wielkimi literami.
  5. Użyj IPA w tekście do jednorazowych zmian: Jeśli potrzebujesz szybkiej poprawki tylko dla jednego generowania, po prostu dodaj IPA bezpośrednio do skryptu zamiast konfigurować wpis w słowniku.

Gdy utworzysz regułę dla nazwy marki, będzie dostępna we wszystkich udostępnionych projektach — w twoim agencie AI lub przez API.

Jak utworzyć słownik wymowy w ElevenLabs

Słownik wymowy możesz utworzyć, dodając reguły w aplikacji Text to Speech, przesyłając plik .pls lub przez ElevenAPI. W tym przewodniku omawiamy pierwszą opcję, która wymaga tylko kilku kroków.

Title slide: “How to create a pronunciation dictionary,” by ElevenLabs and ElevenCreative.

Aby utworzyć słownik wymowy, wykonaj te kroki:

  1. Otwórz panel słowników wymowy: Na stronie Text to Speech kliknij pasek wyszukiwania u góry, wpisz „Pronunciation dictionary” i w sekcji Actions wybierz Pronunciation dictionaries.
  2. Utwórz lub wybierz słownik: Kliknij New, aby utworzyć nowy słownik, albo wybierz istniejący z listy po lewej stronie. 
  3. Dodaj regułę: Kliknij Add rule, aby utworzyć nowy wiersz. Wpisz słowo, które chcesz poprawić. W polu Input wpisz słowo lub frazę dokładnie tak, jak występuje w twoich skryptach. Reguły rozróżniają wielkość liter, więc zachowaj używaną pisownię. 
  4. Wybierz typ reguły: Wybierz Alias, aby podmienić tekst, lub Phoneme, aby wpisać zapis IPA albo CMU. 
  5. Wpisz zamiennik: W polu Output wpisz alias lub zapis fonetyczny. Użyj selektora głosu u góry panelu, aby usłyszeć regułę głosem, z którym pracujesz. 
  6. Zapisz zmiany: Kliknij Save changes u dołu panelu.

Aby dołączyć przewodnik wymowy do agenta lub zastosować go przez API, skorzystaj z naszej dokumentacji słowników wymowy.

Jak używać IPA w zamianie tekstu na mowę w Eleven v4

W przypadku drobnych zmian lub rzadkich słów nie musisz tworzyć nowego wpisu w słowniku wymowy TTS, aby poprawić błąd. Zamiast tego użyj IPA w tekście, by dokładnie określić, jak model ma wymówić słowo.

W Eleven v4 możesz włączyć IPA w tekście za pomocą ukośników. Tak jak Audio Tags, wpisujesz je bezpośrednio w skrypcie, aby było jak najprościej. Oto kilka przykładów IPA w Eleven v4:

  • Terminy techniczne: Termin "/ˌbaɪoʊˈkemɪstri/" oznacza naukę o procesach chemicznych. 
  • Słownictwo medyczne: "/ɡluːˈkoʊs/" i "/ˈɪnsjəlɪn/" są powszechnie używane w leczeniu schorzeń takich jak "/ˌdaɪəˈbiːtiːz/". 
  • Nazwy marek i produktów: Nasze serwery działają na "/ˌɛndʒɪnˈɛks/", aby obsługiwać nagłe wzrosty ruchu.

Na marginesie: jeśli nie masz wykształcenia lingwistycznego, konwerter IPA pomoże ci uzyskać właściwy zapis IPA do wklejenia w skrypcie na podstawie zwykłego tekstu.

Dlaczego tagi fonemów SSML nie działają w Eleven v4

Eleven v4 nie obsługuje SSML. Zamiast tego oferuje bardziej elastyczne funkcje, takie jak Audio Tags i słowniki wymowy, które dają ci większą kontrolę nad końcową produkcją audio. 

Każda funkcja SSML ma bezpośredni odpowiednik w v4:

Tag SSML

Działanie

Odpowiednik w Eleven v4

<phoneme>

Ustawiał wymowę fonetyczną

IPA w tekście (/…/) lub reguła fonemowa w słowniku

<sub alias>

Podmieniał tekst przed wypowiedzeniem

Reguła aliasu w słowniku

<break>

Dodawał pauzę

Audio Tags, takie jak [pause], wielokropki lub podziały wiersza

<prosody rate>

Zmieniał tempo mowy

Audio Tags określające tempo, takie jak [slowly] lub [rushed]

<emphasis>

Akcentował słowo

Wielkie litery lub Audio Tag określający sposób wypowiedzi

Zacznij korzystać z naturalnej wymowy zamiany tekstu na mowę w Eleven v4

Dzięki narzędziom, które pomagają dopracować dokładność wymowy w Eleven v4, możesz pisać szczegółowe skrypty i zlecać modelowi ich wykonanie dokładnie tak, jak sobie wyobrażasz.

Twórz słowniki wymowy w aplikacji ElevenLabs Text to Speech i stosuj je na dużą skalę z ElevenAPI. 

Zarejestruj się , aby zacząć, lub dowiedz się więcej o Eleven v4 już dziś.

FAQ

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30 września 2026

Podobne artykuły

Twórz z najwyższej jakości audio AI