टेक्स्ट टू डायलॉग

जानें कि ElevenLabs के साथ इमर्सिव, स्वाभाविक लगने वाले संवाद कैसे बनाएं।

परिचय

ElevenLabs टेक्स्ट टू डायलॉग API, Eleven v4 और Eleven v3 का इस्तेमाल करके टेक्स्ट से स्वाभाविक और भावपूर्ण संवाद बनाता है। हम Eleven v4 की सलाह देते हैं। इसके लोकप्रिय इस्तेमालों में शामिल हैं:

  • वीडियो गेम्स के लिए एकदम सटीक बातचीत जनरेट करना
  • पॉडकास्ट और अन्य ऑडियो कॉन्टेंट के लिए इमर्सिव संवाद बनाना
  • भावपूर्ण नैरेशन के साथ ऑडियोबुक्स को जीवंत बनाना

मनचाहे नतीजे पाने के लिए कई बार जनरेशन की ज़रूरत पड़ सकती है। टेक्स्ट टू डायलॉग को अपने एप्लिकेशन में इंटीग्रेट करते समय, कई जनरेशन बनाने और यूज़र को उनमें से सबसे अच्छा चुनने का विकल्प देने पर विचार करें।

एक सैंपल सुनें:

वॉइस विकल्प

ElevenLabs कई तरीकों से बनाई गई हज़ारों वॉइस उपलब्ध कराता है। Eleven v4 90+ भाषाओं को और Eleven v3 70+ भाषाओं को सपोर्ट करता है।

हमारे वॉइस विकल्पों के बारे में और जानें।

प्रॉम्प्टिंग

मॉडल टेक्स्ट इनपुट से भावनात्मक संदर्भ को सीधे समझते हैं। उदाहरण के लिए, “उसने उत्साह से कहा” जैसा वर्णनात्मक टेक्स्ट जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने का भाव प्रभावित होगा। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता को नियंत्रित करने में मदद करती हैं, जबकि मूल भाव टेक्स्ट संकेतों से आता है।

ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।

ऑडियो टैग्स के साथ भावपूर्ण डिलीवरी

यह सुविधा अभी सक्रिय रूप से विकसित की जा रही है, इसलिए वास्तविक नतीजे अलग हो सकते हैं।

Eleven v4 और Eleven v3, संवाद की डिलीवरी को प्रभावित करने के लिए गैर-वाणी ऑडियो इवेंट्स के इस्तेमाल की अनुमति देते हैं। इसके लिए टेक्स्ट इनपुट में ऑडियो इवेंट्स को वर्गाकार ब्रैकेट्स में डालें।

टेक्स्ट टू डायलॉग में, हर संवाद टर्न का अपना टेक्स्ट और वॉइस होता है। जिस टर्न पर ऑडियो टैग्स का असर होना चाहिए, उसके टेक्स्ट में उन्हें जोड़ें। voice_id उस टर्न के लिए स्पीकर वॉइस चुनता है, जबकि टैग्स डिलीवरी को निर्देशित करते हैं।

उदाहरण के लिए, एक स्पीकर एक वॉइस इस्तेमाल कर सकता है जबकि उसका टेक्स्ट [giggling] से शुरू होता है, और अगला स्पीकर दूसरी वॉइस इस्तेमाल कर सकता है जबकि उसका टेक्स्ट [whispering] से शुरू होता है। टैग्स और voice_id को मिलाने वाले API उदाहरण के लिए, टेक्स्ट टू डायलॉग क्विकस्टार्ट देखें।

ऑडियो टैग्स प्राकृतिक भाषा के निर्देश हैं, कोई enum पैरामीटर नहीं। निर्देश को वर्गाकार ब्रैकेट्स में डालें और टेक्स्ट में वहाँ रखें जहाँ डिलीवरी बदलनी चाहिए। नीचे दिए गए उदाहरण पूरी सूची नहीं हैं; प्रभावी टैग्स के बारे में ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।

ऑडियो टैग्स कुछ अलग-अलग रूपों में आते हैं:

भावनाएं और डिलीवरी

उदाहरण के लिए, [sad], [laughing] और [whispering]

ऑडियो इवेंट्स

उदाहरण के लिए, [leaves rustling], [gentle footsteps] और [applause]।

समग्र निर्देशन

उदाहरण के लिए, [football], [wrestling match] और [auctioneer]।

कुछ उदाहरण:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

संवाद के प्रवाह को दिखाने के लिए, जैसे बीच में टोकना, आप विराम चिह्नों का भी इस्तेमाल कर सकते हैं:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

अधूरे वाक्यों को दिखाने के लिए इलिप्सिस का इस्तेमाल किया जा सकता है:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।

  • MP3
    • सैंपल रेट: 22.05kHz - 44.1kHz
    • बिटरेट: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • सैंपल रेट: 16kHz - 44.1kHz
    • बिटरेट: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • 16-बिट डेप्थ
  • μ-law
    • 8kHz सैंपल रेट
    • टेलीफोनी एप्लिकेशनों के लिए ऑप्टिमाइज़्ड
  • A-law
    • 8kHz सैंपल रेट
    • टेलीफोनी एप्लिकेशनों के लिए ऑप्टिमाइज़्ड
  • Opus
    • सैंपल रेट: 48kHz
    • बिटरेट: 32kbps - 192kbps

बेहतर क्वालिटी वाले ऑडियो विकल्प सिर्फ़ पेड टियर्स में उपलब्ध हैं — जानकारी के लिए हमारा प्राइसिंग पेज देखें।

समर्थित भाषाएं

Eleven v4 90+ भाषाओं को सपोर्ट करता है। Eleven v3 70+ भाषाओं को सपोर्ट करता है। पूरी सूचियों के लिए Eleven v4 और Eleven v3 देखें।

FAQ

टेक्स्ट टू डायलॉग, Eleven v4 और Eleven v3 मॉडल्स पर उपलब्ध है।

हाँ। आपके द्वारा जनरेट किए गए किसी भी ऑडियो का मालिकाना हक आपके पास रहता है। हालांकि, व्यावसायिक उपयोग के अधिकार केवल पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, अगर आपके पास इनपुट कॉन्टेंट के IP अधिकार हैं, तो आप जनरेट किए गए ऑडियो का व्यावसायिक उपयोग कर सकते हैं और आउटपुट से कमाई कर सकते हैं।

मुफ़्त रीजनरेशन से आप इन शर्तों के तहत बिना अतिरिक्त लागत के उसी टेक्स्ट टू स्पीच कॉन्टेंट को फिर से जनरेट कर सकते हैं:

  • केवल ElevenLabs डैशबोर्ड में उपलब्ध।
  • आप हर कॉन्टेंट को मुफ़्त में 2 बार तक फिर से जनरेट कर सकते हैं।
  • कॉन्टेंट पिछली जनरेशन जैसा बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में कोई भी बदलाव नई, पेड जनरेशन की ज़रूरत होगी।

अगर ऑडियो आउटपुट में हल्का डिस्टॉर्शन हो, तो मुफ़्त रीजनरेशन उपयोगी हैं। ElevenLabs के आंतरिक बेंचमार्क्स के अनुसार, रीजनरेशन से क्वालिटी से जुड़ी लगभग आधी समस्याएं हल हो जाती हैं; बाकी समस्याएं आमतौर पर खराब ट्रेनिंग डेटा के कारण होती हैं।

संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं है।

मॉडल nondeterministic हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।

विश्वसनीय जनरेशन के लिए, हर रिक्वेस्ट में सभी inputs[].text वैल्यू की कुल लंबाई 2,000 कैरेक्टर्स या उससे कम रखें। लंबे टेक्स्ट को हिस्सों में बांटें और अपने एप्लिकेशन में बने हुए ऑडियो को जोड़ें।

मुख्य तथ्य

  • मॉडल्स: Eleven v4 और Eleven v3 के साथ उपलब्ध
  • स्पीकर्स: हर संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं
  • रिक्वेस्ट साइज़: हर रिक्वेस्ट में सभी inputs[].text वैल्यू की कुल लंबाई 2,000 कैरेक्टर्स या उससे कम रखें
  • निर्धारणीयता: आउटपुट nondeterministic है — अधिक एकरूप नतीजों के लिए seed पैरामीटर इस्तेमाल करें
  • मुफ़्त रीजनरेशन: हर जनरेशन पर 2 तक मुफ़्त रीजनरेशन (वही कॉन्टेंट, वही पैरामीटर्स, केवल डैशबोर्ड)
  • मालिकाना हक: जनरेट किए गए ऑडियो का मालिकाना हक आपके पास रहता है; व्यावसायिक उपयोग के लिए पेड प्लान ज़रूरी है