Vai alla navigazione

Utilizzare i dizionari di pronuncia

Questa guida ti mostra come gestire i dizionari di pronuncia a livello di codice.

Guida pratica · Presuppone che tu abbia completato la guida rapida di ElevenAPI .

Panoramica

I dizionari di pronuncia ti consentono di personalizzare il modo in cui il tuo agente IA pronuncia parole o frasi specifiche. Sono particolarmente utili per:

  • Correggere la pronuncia di nomi, luoghi o termini tecnici
  • Garantire una pronuncia coerente tra le conversazioni
  • Personalizzare le variazioni regionali della pronuncia

ElevenLabs supporta entrambi gli alfabeti IPA e CMU.

I tag fonemici dei dizionari di pronuncia funzionano solo con i modelli eleven_v4, eleven_flash_v2 ed eleven_v3.

Gli altri modelli ignorano i tag fonemici del dizionario e usano la pronuncia predefinita. Per gli altri modelli, usa invece i tag alias per sostituire grafie o frasi che producono la pronuncia desiderata.

Se vuoi usare le pronunce IPA e CMU in lingue diverse dall’inglese, dovrai passare al modello eleven_v4.

Guida rapida

Questa guida presuppone che tu abbia configurato la chiave API e l’SDK. Completa prima la guida rapida, se non l’hai già fatto.

1

Crea un file di dizionario di pronuncia

In questo esempio, creeremo un file di dizionario di pronuncia per la parola tomato.

Questa regola utilizzerà l’alfabeto “IPA” e aggiornerà la pronuncia di tomato e Tomato con una pronuncia diversa. I file PLS distinguono tra maiuscole e minuscole, per questo li includiamo sia con che senza la “T” maiuscola.

Puoi usare strumenti di IA come Claude o ChatGPT per generare notazioni IPA o CMU per parole specifiche.

dictionary.pls
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme>
<grapheme>tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
<lexeme>
<grapheme>Tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
</lexicon>
2

Crea un dizionario di pronuncia da un file tramite l'SDK

Crea un nuovo file denominato example.py o example.mts, a seconda del linguaggio scelto, e aggiungi il seguente codice:

from elevenlabs import ElevenLabs, PronunciationDictionaryVersionLocator
from elevenlabs.play import play
elevenlabs = ElevenLabs()
with open("dictionary.pls", "rb") as f:
# this dictionary changes how tomato is pronounced
pronunciation_dictionary = elevenlabs.pronunciation_dictionaries.create_from_file(
file=f.read(), name="example"
)
audio_1 = elevenlabs.text_to_speech.convert(
text="Without the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
)
audio_2 = elevenlabs.text_to_speech.convert(
text="With the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
pronunciation_dictionary_locators=[
PronunciationDictionaryVersionLocator(
pronunciation_dictionary_id=pronunciation_dictionary.id,
version_id=pronunciation_dictionary.version_id,
)
],
)
# play the audio
play(audio_1)
play(audio_2)
3

Esegui il codice

python example.py

Dovresti sentire due versioni dell’audio riprodotte dagli altoparlanti: una con il dizionario di pronuncia e una senza.

Passaggi successivi