उच्चारण शब्दकोशों का उपयोग

यह गाइड बताती है कि प्रोग्रामेटिक तरीके से उच्चारण शब्दकोशों को कैसे मैनेज करें।

कैसे करें गाइड · मानता है कि आपने ElevenAPI क्विकस्टार्ट पूरा कर लिया है।

ओवरव्यू

उच्चारण शब्दकोश आपको यह कस्टमाइज़ करने देते हैं कि आपका AI एजेंट खास शब्दों या वाक्यांशों का उच्चारण कैसे करे। यह विशेष रूप से इन कामों के लिए उपयोगी है:

  • नामों, जगहों या तकनीकी शब्दों के उच्चारण को ठीक करना
  • बातचीतों में एक जैसा उच्चारण सुनिश्चित करना
  • क्षेत्रीय उच्चारण भिन्नताओं को कस्टमाइज़ करना

ElevenLabs IPA और CMU दोनों अल्फ़ाबेट्स को सपोर्ट करता है।

उच्चारण शब्दकोश के फ़ोनीम टैग केवल eleven_v4, eleven_flash_v2 और eleven_v3 मॉडल्स के साथ काम करते हैं।

अन्य मॉडल्स शब्दकोश के फ़ोनीम टैग को स्किप करते हैं और डिफ़ॉल्ट उच्चारण का उपयोग करते हैं। अन्य मॉडल्स के लिए, ऐसे स्पेलिंग या वाक्यांश बदलने के लिए alias टैग इस्तेमाल करें जिनसे आपको ज़रूरी उच्चारण मिलता है।

अगर आप अंग्रेज़ी के अलावा अन्य भाषाओं में IPA और CMU उच्चारण इस्तेमाल करना चाहते हैं, तो आपको eleven_v4 मॉडल पर स्विच करना होगा।

क्विकस्टार्ट

यह गाइड मानती है कि आपने अपनी API कुंजी और SDK सेट अप कर लिया है। अगर नहीं किया है, तो पहले क्विकस्टार्ट पूरा करें।

1

उच्चारण शब्दकोश फ़ाइल बनाएं

इस उदाहरण में, हम tomato शब्द के लिए एक उच्चारण शब्दकोश फ़ाइल बनाएंगे।

यह नियम “IPA” अल्फ़ाबेट का उपयोग करेगा और tomato और Tomato के उच्चारण को एक अलग उच्चारण से अपडेट करेगा। PLS फ़ाइलें केस-सेंसिटिव होती हैं, इसलिए हम इसे कैपिटल “T” के साथ और उसके बिना, दोनों तरह से शामिल करते हैं।

आप खास शब्दों के लिए IPA या CMU नोटेशन जनरेट करने में मदद के लिए Claude या ChatGPT जैसे AI टूल्स का उपयोग कर सकते हैं।

dictionary.pls
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme>
<grapheme>tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
<lexeme>
<grapheme>Tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
</lexicon>
2

SDK से फ़ाइल के ज़रिए उच्चारण शब्दकोश बनाएं

अपनी पसंद की भाषा के आधार पर example.py या example.mts नाम की नई फ़ाइल बनाएं और इसमें यह कोड जोड़ें:

from elevenlabs import ElevenLabs, PronunciationDictionaryVersionLocator
from elevenlabs.play import play
elevenlabs = ElevenLabs()
with open("dictionary.pls", "rb") as f:
# this dictionary changes how tomato is pronounced
pronunciation_dictionary = elevenlabs.pronunciation_dictionaries.create_from_file(
file=f.read(), name="example"
)
audio_1 = elevenlabs.text_to_speech.convert(
text="Without the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
)
audio_2 = elevenlabs.text_to_speech.convert(
text="With the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
pronunciation_dictionary_locators=[
PronunciationDictionaryVersionLocator(
pronunciation_dictionary_id=pronunciation_dictionary.id,
version_id=pronunciation_dictionary.version_id,
)
],
)
# play the audio
play(audio_1)
play(audio_2)
3

कोड चलाएं

python example.py

आपको अपने स्पीकर्स पर ऑडियो के दो वर्ज़न सुनाई देंगे—एक उच्चारण शब्दकोश के साथ और एक उसके बिना।

अगले चरण