टेक्स्ट टू डायलॉग
टेक्स्ट टू डायलॉग
जानें कि ElevenLabs के साथ इमर्सिव, स्वाभाविक लगने वाले संवाद कैसे बनाएं।
परिचय
ElevenLabs टेक्स्ट टू डायलॉग API, Eleven v4 और Eleven v3 का इस्तेमाल करके टेक्स्ट से स्वाभाविक और भावपूर्ण संवाद बनाता है। हम Eleven v4 की सलाह देते हैं। इसके लोकप्रिय इस्तेमालों में शामिल हैं:
- वीडियो गेम्स के लिए एकदम सटीक बातचीत जनरेट करना
- पॉडकास्ट और अन्य ऑडियो कॉन्टेंट के लिए इमर्सिव संवाद बनाना
- भावपूर्ण नैरेशन के साथ ऑडियोबुक्स को जीवंत बनाना
मनचाहे नतीजे पाने के लिए कई बार जनरेशन की ज़रूरत पड़ सकती है। टेक्स्ट टू डायलॉग को अपने एप्लिकेशन में इंटीग्रेट करते समय, कई जनरेशन बनाने और यूज़र को उनमें से सबसे अच्छा चुनने का विकल्प देने पर विचार करें।
एक सैंपल सुनें:
वॉइस विकल्प
ElevenLabs कई तरीकों से बनाई गई हज़ारों वॉइस उपलब्ध कराता है। Eleven v4 90+ भाषाओं को और Eleven v3 70+ भाषाओं को सपोर्ट करता है।
- कम्युनिटी द्वारा शेयर की गई 3,000+ वॉइस वाली वॉइस लाइब्रेरी
- सबसे सटीक प्रतिकृतियों के लिए प्रोफेशनल वॉइस क्लोनिंग
- तेज़ी से वॉइस की प्रतिकृति बनाने के लिए इंस्टेंट वॉइस क्लोनिंग
- टेक्स्ट विवरणों से कस्टम वॉइस जनरेट करने के लिए वॉइस डिज़ाइन
हमारे वॉइस विकल्पों के बारे में और जानें।
प्रॉम्प्टिंग
मॉडल टेक्स्ट इनपुट से भावनात्मक संदर्भ को सीधे समझते हैं। उदाहरण के लिए, “उसने उत्साह से कहा” जैसा वर्णनात्मक टेक्स्ट जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने का भाव प्रभावित होगा। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता को नियंत्रित करने में मदद करती हैं, जबकि मूल भाव टेक्स्ट संकेतों से आता है।
ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।
ऑडियो टैग्स के साथ भावपूर्ण डिलीवरी
Eleven v4 और Eleven v3, संवाद की डिलीवरी को प्रभावित करने के लिए गैर-वाणी ऑडियो इवेंट्स के इस्तेमाल की अनुमति देते हैं। इसके लिए टेक्स्ट इनपुट में ऑडियो इवेंट्स को वर्गाकार ब्रैकेट्स में डालें।
टेक्स्ट टू डायलॉग में, हर संवाद टर्न का अपना टेक्स्ट और वॉइस होता है। जिस टर्न पर ऑडियो टैग्स का असर होना चाहिए, उसके टेक्स्ट में उन्हें जोड़ें। voice_id उस टर्न के लिए स्पीकर वॉइस चुनता है, जबकि टैग्स डिलीवरी को निर्देशित करते हैं।
उदाहरण के लिए, एक स्पीकर एक वॉइस इस्तेमाल कर सकता है जबकि उसका टेक्स्ट [giggling] से शुरू होता है, और अगला स्पीकर दूसरी वॉइस इस्तेमाल कर सकता है जबकि उसका टेक्स्ट [whispering] से शुरू होता है। टैग्स और voice_id को मिलाने वाले API उदाहरण के लिए, टेक्स्ट टू डायलॉग क्विकस्टार्ट देखें।
ऑडियो टैग्स प्राकृतिक भाषा के निर्देश हैं, कोई enum पैरामीटर नहीं। निर्देश को वर्गाकार ब्रैकेट्स में डालें और टेक्स्ट में वहाँ रखें जहाँ डिलीवरी बदलनी चाहिए। नीचे दिए गए उदाहरण पूरी सूची नहीं हैं; प्रभावी टैग्स के बारे में ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।
ऑडियो टैग्स कुछ अलग-अलग रूपों में आते हैं:
भावनाएं और डिलीवरी
उदाहरण के लिए, [sad], [laughing] और [whispering]
ऑडियो इवेंट्स
उदाहरण के लिए, [leaves rustling], [gentle footsteps] और [applause]।
समग्र निर्देशन
उदाहरण के लिए, [football], [wrestling match] और [auctioneer]।
कुछ उदाहरण:
संवाद के प्रवाह को दिखाने के लिए, जैसे बीच में टोकना, आप विराम चिह्नों का भी इस्तेमाल कर सकते हैं:
अधूरे वाक्यों को दिखाने के लिए इलिप्सिस का इस्तेमाल किया जा सकता है:
समर्थित आउटपुट फ़ॉर्मैट
डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।
- MP3
- सैंपल रेट: 22.05kHz - 44.1kHz
- बिटरेट: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- सैंपल रेट: 16kHz - 44.1kHz
- बिटरेट: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- 16-बिट डेप्थ
- μ-law
- 8kHz सैंपल रेट
- टेलीफोनी एप्लिकेशनों के लिए ऑप्टिमाइज़्ड
- A-law
- 8kHz सैंपल रेट
- टेलीफोनी एप्लिकेशनों के लिए ऑप्टिमाइज़्ड
- Opus
- सैंपल रेट: 48kHz
- बिटरेट: 32kbps - 192kbps
बेहतर क्वालिटी वाले ऑडियो विकल्प सिर्फ़ पेड टियर्स में उपलब्ध हैं — जानकारी के लिए हमारा प्राइसिंग पेज देखें।
समर्थित भाषाएं
Eleven v4 90+ भाषाओं को सपोर्ट करता है। Eleven v3 70+ भाषाओं को सपोर्ट करता है। पूरी सूचियों के लिए Eleven v4 और Eleven v3 देखें।
FAQ
मैं कौन से मॉडल इस्तेमाल कर सकता हूँ?
टेक्स्ट टू डायलॉग, Eleven v4 और Eleven v3 मॉडल्स पर उपलब्ध है।
क्या ऑडियो आउटपुट का मालिकाना हक मेरा है?
हाँ। आपके द्वारा जनरेट किए गए किसी भी ऑडियो का मालिकाना हक आपके पास रहता है। हालांकि, व्यावसायिक उपयोग के अधिकार केवल पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, अगर आपके पास इनपुट कॉन्टेंट के IP अधिकार हैं, तो आप जनरेट किए गए ऑडियो का व्यावसायिक उपयोग कर सकते हैं और आउटपुट से कमाई कर सकते हैं।
मुफ़्त रीजनरेशन के लिए क्या शर्तें हैं?
मुफ़्त रीजनरेशन से आप इन शर्तों के तहत बिना अतिरिक्त लागत के उसी टेक्स्ट टू स्पीच कॉन्टेंट को फिर से जनरेट कर सकते हैं:
- केवल ElevenLabs डैशबोर्ड में उपलब्ध।
- आप हर कॉन्टेंट को मुफ़्त में 2 बार तक फिर से जनरेट कर सकते हैं।
- कॉन्टेंट पिछली जनरेशन जैसा बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में कोई भी बदलाव नई, पेड जनरेशन की ज़रूरत होगी।
अगर ऑडियो आउटपुट में हल्का डिस्टॉर्शन हो, तो मुफ़्त रीजनरेशन उपयोगी हैं। ElevenLabs के आंतरिक बेंचमार्क्स के अनुसार, रीजनरेशन से क्वालिटी से जुड़ी लगभग आधी समस्याएं हल हो जाती हैं; बाकी समस्याएं आमतौर पर खराब ट्रेनिंग डेटा के कारण होती हैं।
मेरे संवाद में कितने स्पीकर हो सकते हैं?
संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं है।
मेरा आउटपुट कभी-कभी असंगत क्यों होता है?
मॉडल nondeterministic हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।
बड़े टेक्स्ट कन्वर्ज़न के लिए सबसे अच्छा तरीका क्या है?
विश्वसनीय जनरेशन के लिए, हर रिक्वेस्ट में सभी inputs[].text वैल्यू की कुल लंबाई 2,000 कैरेक्टर्स या उससे कम रखें। लंबे टेक्स्ट को हिस्सों में बांटें और अपने एप्लिकेशन में बने हुए ऑडियो को जोड़ें।
मुख्य तथ्य
- मॉडल्स: Eleven v4 और Eleven v3 के साथ उपलब्ध
- स्पीकर्स: हर संवाद में स्पीकर्स की संख्या की कोई सीमा नहीं
- रिक्वेस्ट साइज़: हर रिक्वेस्ट में सभी
inputs[].textवैल्यू की कुल लंबाई 2,000 कैरेक्टर्स या उससे कम रखें - निर्धारणीयता: आउटपुट nondeterministic है — अधिक एकरूप नतीजों के लिए
seedपैरामीटर इस्तेमाल करें - मुफ़्त रीजनरेशन: हर जनरेशन पर 2 तक मुफ़्त रीजनरेशन (वही कॉन्टेंट, वही पैरामीटर्स, केवल डैशबोर्ड)
- मालिकाना हक: जनरेट किए गए ऑडियो का मालिकाना हक आपके पास रहता है; व्यावसायिक उपयोग के लिए पेड प्लान ज़रूरी है