टेक्स्ट टू स्पीच
टेक्स्ट टू स्पीच
ElevenLabs के साथ टेक्स्ट को जीवंत बोले गए ऑडियो में बदलना सीखें।
परिचय
ElevenLabs टेक्स्ट टू स्पीच (TTS) API, सूक्ष्म स्वराघात, गति और भावनात्मक समझ के साथ टेक्स्ट को जीवंत ऑडियो में बदलता है। हमारे मॉडल्स 32 भाषाओं और कई वॉइस स्टाइल्स में टेक्स्ट संकेतों के अनुसार ढलते हैं और इनका इस्तेमाल इन कामों के लिए किया जा सकता है:
- वैश्विक मीडिया कैंपेन्स और विज्ञापनों का नैरेशन करना
- जटिल भावनात्मक डिलीवरी के साथ कई भाषाओं में ऑडियोबुक्स बनाना
- टेक्स्ट से रियल-टाइम ऑडियो स्ट्रीम करना
एक सैंपल सुनें:
अपने प्रोजेक्ट के लिए सही वॉइस ढूँढने के लिए हमारी वॉइस लाइब्रेरी देखें।
वॉइस क्वालिटी
रियल-टाइम एप्लिकेशंस के लिए Flash v2.5, बेहद कम 75ms लेटेंसी देता है, जबकि Multilingual v2 अधिक सूक्ष्म अभिव्यक्ति के साथ सबसे उच्च क्वालिटी का ऑडियो देता है।
वॉइस विकल्प
ElevenLabs कई तरीकों से बनाई गई 32 भाषाओं की हज़ारों वॉइसेज़ देता है:
- समुदाय द्वारा शेयर की गई 3,000+ वॉइसेज़ वाली वॉइस लाइब्रेरी
- सबसे सटीक प्रतिकृतियों के लिए प्रोफेशनल वॉइस क्लोनिंग
- तेज़ी से वॉइस की प्रतिकृति बनाने के लिए इंस्टेंट वॉइस क्लोनिंग
- टेक्स्ट विवरणों से कस्टम वॉइसेज़ जनरेट करने के लिए वॉइस डिज़ाइन
हमारे वॉइस विकल्पों के बारे में और जानें।
समर्थित आउटपुट फ़ॉर्मैट
डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।
- MP3
- सैंपल रेट: 22.05kHz - 44.1kHz
- बिटरेट: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- सैंपल रेट: 16kHz - 44.1kHz
- बिटरेट: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- 16-बिट डेप्थ
- μ-law
- 8kHz सैंपल रेट
- टेलीफोनी एप्लिकेशन के लिए ऑप्टिमाइज़्ड
- A-law
- 8kHz सैंपल रेट
- टेलीफोनी एप्लिकेशन के लिए ऑप्टिमाइज़्ड
- Opus
- सैंपल रेट: 48kHz
- बिटरेट: 32kbps - 192kbps
बेहतर क्वालिटी के ऑडियो विकल्प सिर्फ़ पेड टियर्स पर उपलब्ध हैं - जानकारी के लिए हमारा प्राइसिंग पेज देखें।
समर्थित भाषाएँ
हमारे multilingual v2 मॉडल्स 29 भाषाओं को support करते हैं:
अंग्रेज़ी (USA, UK, ऑस्ट्रेलिया, कनाडा), जापानी, चीनी, जर्मन, हिंदी, फ़्रेंच (फ़्रांस, कनाडा), कोरियाई, पुर्तगाली (ब्राज़ील, पुर्तगाल), इतालवी, स्पेनिश (स्पेन, मेक्सिको), इंडोनेशियाई, डच, तुर्की, फ़िलिपीनो, पोलिश, स्वीडिश, बल्गेरियाई, रोमानियाई, अरबी (सऊदी अरब, UAE), चेक, यूनानी, फ़िनिश, क्रोएशियाई, मलय, स्लोवाक, डेनिश, तमिल, यूक्रेनी और रूसी।
Flash v2.5, v2 मॉडल्स की सभी भाषाओं के साथ-साथ 32 भाषाओं को support करता है:
हंगेरियन, नॉर्वेजियन और वियतनामी
बस हमारी किसी भी समर्थित भाषा में टेक्स्ट इनपुट करें और वॉइस लाइब्रेरी से उससे मेल खाती वॉइस चुनें। सबसे स्वाभाविक नतीजों के लिए, ऐसी वॉइस चुनें जिसका एक्सेंट आपकी टारगेट भाषा और क्षेत्र से मेल खाता हो।
प्रॉम्प्टिंग
मॉडल टेक्स्ट इनपुट से भावनात्मक संदर्भ को सीधे समझते हैं। उदाहरण के लिए, “उसने उत्साह से कहा” जैसा विवरण जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने की भावना प्रभावित होगी। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता को नियंत्रित करने में मदद करती हैं, जबकि मूल भावना टेक्स्ट संकेतों से आती है।
ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।
विवरणात्मक टेक्स्ट मॉडल द्वारा बोला जाएगा और चाहें तो उसे ऑडियो से मैन्युअली ट्रिम या हटाना होगा।
FAQ
क्या मैं अपनी वॉइस क्लोन कर सकता हूँ?
हाँ, आप छोटी ऑडियो क्लिप्स से अपनी वॉइस के इंस्टेंट वॉइस क्लोन्स बना सकते हैं। उच्च-सटीकता वाले क्लोन्स के लिए हमारी प्रोफेशनल वॉइस क्लोनिंग सुविधा देखें।
क्या ऑडियो आउटपुट मेरा होता है?
हाँ। आपके जनरेट किए गए किसी भी ऑडियो का स्वामित्व आपके पास रहता है। हालांकि, कमर्शियल उपयोग के अधिकार सिर्फ़ पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, यदि आपके पास इनपुट कंटेंट के IP अधिकार हैं, तो आप जनरेट किए गए ऑडियो का कमर्शियल इस्तेमाल कर सकते हैं और आउटपुट से कमाई कर सकते हैं।
मुफ़्त रीजनरेशन के लिए क्या योग्य है?
मुफ़्त रीजनरेशन से आप बिना अतिरिक्त लागत के उसी टेक्स्ट टू स्पीच कंटेंट को दोबारा जनरेट कर सकते हैं, बशर्ते ये शर्तें पूरी हों:
- आप हर कंटेंट को मुफ़्त में अधिकतम 2 बार रीजनरेट कर सकते हैं
- कंटेंट पिछली जनरेशन जैसा बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में कोई भी बदलाव नई, पेड जनरेशन की ज़रूरत पैदा करेगा
ऑडियो आउटपुट में हल्का विकार होने पर मुफ़्त रीजनरेशन उपयोगी हैं। ElevenLabs के आंतरिक बेंचमार्क्स के अनुसार, रीजनरेशन क्वालिटी से जुड़ी लगभग आधी समस्याओं को हल कर देगा; बाकी समस्याएँ आमतौर पर खराब ट्रेनिंग डेटा के कारण होती हैं।
रियल-टाइम मामलों के लिए लेटेंसी कैसे कम करूँ?
लगभग रियल-टाइम कन्वर्सेशनल या इंटरैक्टिव स्थितियों के लिए ऑप्टिमाइज़ किए गए कम-लेटेंसी Flash मॉडल्स (Flash v2 या v2.5) इस्तेमाल करें। ज़्यादा जानकारी के लिए हमारी लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें।
मेरा आउटपुट कभी-कभी असंगत क्यों होता है?
मॉडल नॉनडिटरमिनिस्टिक हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।
बड़े टेक्स्ट कन्वर्ज़न के लिए सबसे अच्छा तरीका क्या है?
लंबे टेक्स्ट को सेगमेंट्स में बाँटें और रियल-टाइम प्लेबैक व कुशल प्रोसेसिंग के लिए स्ट्रीमिंग इस्तेमाल करें। चंक्स के बीच स्वाभाविक प्रोसोडी फ्लो बनाए रखने के लिए पिछला/अगला टेक्स्ट या पिछली/अगली रिक्वेस्ट id पैरामीटर्स शामिल करें।
मुख्य तथ्य
- निर्धारकता: आउटपुट नॉनडिटरमिनिस्टिक है — अधिक एकरूप नतीजों के लिए
seedपैरामीटर इस्तेमाल करें - मुफ़्त रीजनरेशन: हर जनरेशन पर अधिकतम 2 मुफ़्त रीजनरेशन (केवल समान कंटेंट और पैरामीटर्स)
- स्वामित्व: जनरेट किए गए ऑडियो का स्वामित्व आपके पास रहता है; कमर्शियल इस्तेमाल के लिए पेड प्लान चाहिए
- कम-लेटेंसी उपयोग के मामले: Flash मॉडल्स (
eleven_flash_v2याeleven_flash_v2_5) इस्तेमाल करें — लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें - बड़ा टेक्स्ट: लंबे टेक्स्ट को सेगमेंट्स में बाँटें; चंक्स के बीच स्वाभाविक प्रोसोडी बनाए रखने के लिए
previous_text/next_textपैरामीटर्स इस्तेमाल करें