टेक्स्ट टू स्पीच

ElevenLabs के साथ टेक्स्ट को जीवंत बोले गए ऑडियो में बदलना सीखें।

परिचय

ElevenLabs टेक्स्ट टू स्पीच (TTS) API, सूक्ष्म स्वराघात, गति और भावनात्मक समझ के साथ टेक्स्ट को जीवंत ऑडियो में बदलता है। हमारे मॉडल्स 32 भाषाओं और कई वॉइस स्टाइल्स में टेक्स्ट संकेतों के अनुसार ढलते हैं और इनका इस्तेमाल इन कामों के लिए किया जा सकता है:

  • वैश्विक मीडिया कैंपेन्स और विज्ञापनों का नैरेशन करना
  • जटिल भावनात्मक डिलीवरी के साथ कई भाषाओं में ऑडियोबुक्स बनाना
  • टेक्स्ट से रियल-टाइम ऑडियो स्ट्रीम करना

एक सैंपल सुनें:

अपने प्रोजेक्ट के लिए सही वॉइस ढूँढने के लिए हमारी वॉइस लाइब्रेरी देखें।

वॉइस लाइब्रेरी API के ज़रिए मुफ़्त टियर यूज़र्स के लिए उपलब्ध नहीं है।

वॉइस क्वालिटी

रियल-टाइम एप्लिकेशंस के लिए Flash v2.5, बेहद कम 75ms लेटेंसी देता है, जबकि Multilingual v2 अधिक सूक्ष्म अभिव्यक्ति के साथ सबसे उच्च क्वालिटी का ऑडियो देता है।

Eleven v4

हमारा सबसे भावपूर्ण, उच्च-गुणवत्ता वाला स्पीच सिंथेसिस मॉडल

बेहतरीन वॉइस क्लोनिंग क्षमताएं
90+ भाषाएं समर्थित
10,000 कैरेक्टर की सीमा
नैचुरल मल्टी-स्पीकर डायलॉग के लिए सपोर्ट
Eleven v4 Turbo

हमारा सबसे भावपूर्ण, रियल-टाइम स्पीच सिंथेसिस मॉडल

अल्ट्रा-लो लेटेंसी (मीडियन इन्फ़रेंस लेटेंसी ~100ms†)
बेहतरीन वॉइस क्लोनिंग क्षमताएं
90+ भाषाएं समर्थित
बारीक नियंत्रण के लिए ऑडियो टैग्स
Eleven v3

हमारा भावनाओं से भरपूर, एक्सप्रेसिव स्पीच सिंथेसिस मॉडल

नाटकीय डिलीवरी और परफ़ॉर्मेंस
70+ भाषाएं समर्थित
5,000 कैरेक्टर की सीमा
नैचुरल मल्टी-स्पीकर डायलॉग के लिए सपोर्ट
Eleven v3 Conversational

हमारा एक्सप्रेसिव, रियलटाइम स्पीच सिंथेसिस मॉडल

लो लेटेंसी (~280ms)
नाटकीय डिलीवरी और परफ़ॉर्मेंस
70+ भाषाएं समर्थित
बारीक नियंत्रण के लिए ऑडियो टैग्स
Eleven Multilingual v2

जीवंत, एक जैसी गुणवत्ता वाला स्पीच सिंथेसिस मॉडल

स्वाभाविक सुनाई देने वाला आउटपुट
29 भाषाएं समर्थित
10,000 कैरेक्टर की सीमा
लंबे जनरेशन में सबसे स्थिर
Eleven Flash v2.5

हमारा तेज़, किफ़ायती स्पीच सिंथेसिस मॉडल

अल्ट्रा-लो लेटेंसी (~75ms†)
32 भाषाएं समर्थित
40,000 कैरेक्टर की सीमा
तेज़ मॉडल, API जनरेशन के लिए प्रति कैरेक्टर 50% कम कीमत

वॉइस विकल्प

ElevenLabs कई तरीकों से बनाई गई 32 भाषाओं की हज़ारों वॉइसेज़ देता है:

हमारे वॉइस विकल्पों के बारे में और जानें।

डिफ़ॉल्ट रिस्पॉन्स फ़ॉर्मैट mp3 है, लेकिन pcm और ulaw जैसे अन्य फ़ॉर्मैट भी उपलब्ध हैं।

  • MP3
    • सैंपल रेट: 22.05kHz - 44.1kHz
    • बिटरेट: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • सैंपल रेट: 16kHz - 44.1kHz
    • बिटरेट: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • 16-बिट डेप्थ
  • μ-law
    • 8kHz सैंपल रेट
    • टेलीफोनी एप्लिकेशन के लिए ऑप्टिमाइज़्ड
  • A-law
    • 8kHz सैंपल रेट
    • टेलीफोनी एप्लिकेशन के लिए ऑप्टिमाइज़्ड
  • Opus
    • सैंपल रेट: 48kHz
    • बिटरेट: 32kbps - 192kbps

बेहतर क्वालिटी के ऑडियो विकल्प सिर्फ़ पेड टियर्स पर उपलब्ध हैं - जानकारी के लिए हमारा प्राइसिंग पेज देखें।

समर्थित भाषाएँ

हमारे multilingual v2 मॉडल्स 29 भाषाओं को support करते हैं:

अंग्रेज़ी (USA, UK, ऑस्ट्रेलिया, कनाडा), जापानी, चीनी, जर्मन, हिंदी, फ़्रेंच (फ़्रांस, कनाडा), कोरियाई, पुर्तगाली (ब्राज़ील, पुर्तगाल), इतालवी, स्पेनिश (स्पेन, मेक्सिको), इंडोनेशियाई, डच, तुर्की, फ़िलिपीनो, पोलिश, स्वीडिश, बल्गेरियाई, रोमानियाई, अरबी (सऊदी अरब, UAE), चेक, यूनानी, फ़िनिश, क्रोएशियाई, मलय, स्लोवाक, डेनिश, तमिल, यूक्रेनी और रूसी।

Flash v2.5, v2 मॉडल्स की सभी भाषाओं के साथ-साथ 32 भाषाओं को support करता है:

हंगेरियन, नॉर्वेजियन और वियतनामी

बस हमारी किसी भी समर्थित भाषा में टेक्स्ट इनपुट करें और वॉइस लाइब्रेरी से उससे मेल खाती वॉइस चुनें। सबसे स्वाभाविक नतीजों के लिए, ऐसी वॉइस चुनें जिसका एक्सेंट आपकी टारगेट भाषा और क्षेत्र से मेल खाता हो।

प्रॉम्प्टिंग

मॉडल टेक्स्ट इनपुट से भावनात्मक संदर्भ को सीधे समझते हैं। उदाहरण के लिए, “उसने उत्साह से कहा” जैसा विवरण जोड़ने या विस्मयादिबोधक चिह्नों का इस्तेमाल करने से बोलने की भावना प्रभावित होगी। Stability और Similarity जैसी वॉइस सेटिंग्स एकरूपता को नियंत्रित करने में मदद करती हैं, जबकि मूल भावना टेक्स्ट संकेतों से आती है।

ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड पढ़ें।

विवरणात्मक टेक्स्ट मॉडल द्वारा बोला जाएगा और चाहें तो उसे ऑडियो से मैन्युअली ट्रिम या हटाना होगा।

FAQ

हाँ, आप छोटी ऑडियो क्लिप्स से अपनी वॉइस के इंस्टेंट वॉइस क्लोन्स बना सकते हैं। उच्च-सटीकता वाले क्लोन्स के लिए हमारी प्रोफेशनल वॉइस क्लोनिंग सुविधा देखें।

हाँ। आपके जनरेट किए गए किसी भी ऑडियो का स्वामित्व आपके पास रहता है। हालांकि, कमर्शियल उपयोग के अधिकार सिर्फ़ पेड प्लान्स के साथ उपलब्ध हैं। पेड सब्सक्रिप्शन के साथ, यदि आपके पास इनपुट कंटेंट के IP अधिकार हैं, तो आप जनरेट किए गए ऑडियो का कमर्शियल इस्तेमाल कर सकते हैं और आउटपुट से कमाई कर सकते हैं।

मुफ़्त रीजनरेशन से आप बिना अतिरिक्त लागत के उसी टेक्स्ट टू स्पीच कंटेंट को दोबारा जनरेट कर सकते हैं, बशर्ते ये शर्तें पूरी हों:

  • आप हर कंटेंट को मुफ़्त में अधिकतम 2 बार रीजनरेट कर सकते हैं
  • कंटेंट पिछली जनरेशन जैसा बिल्कुल समान होना चाहिए। टेक्स्ट, वॉइस सेटिंग्स या अन्य पैरामीटर्स में कोई भी बदलाव नई, पेड जनरेशन की ज़रूरत पैदा करेगा

ऑडियो आउटपुट में हल्का विकार होने पर मुफ़्त रीजनरेशन उपयोगी हैं। ElevenLabs के आंतरिक बेंचमार्क्स के अनुसार, रीजनरेशन क्वालिटी से जुड़ी लगभग आधी समस्याओं को हल कर देगा; बाकी समस्याएँ आमतौर पर खराब ट्रेनिंग डेटा के कारण होती हैं।

लगभग रियल-टाइम कन्वर्सेशनल या इंटरैक्टिव स्थितियों के लिए ऑप्टिमाइज़ किए गए कम-लेटेंसी Flash मॉडल्स (Flash v2 या v2.5) इस्तेमाल करें। ज़्यादा जानकारी के लिए हमारी लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें।

मॉडल नॉनडिटरमिनिस्टिक हैं। एकरूपता के लिए वैकल्पिक seed पैरामीटर इस्तेमाल करें, हालांकि हल्के अंतर फिर भी हो सकते हैं।

लंबे टेक्स्ट को सेगमेंट्स में बाँटें और रियल-टाइम प्लेबैक व कुशल प्रोसेसिंग के लिए स्ट्रीमिंग इस्तेमाल करें। चंक्स के बीच स्वाभाविक प्रोसोडी फ्लो बनाए रखने के लिए पिछला/अगला टेक्स्ट या पिछली/अगली रिक्वेस्ट id पैरामीटर्स शामिल करें।

मुख्य तथ्य

  • निर्धारकता: आउटपुट नॉनडिटरमिनिस्टिक है — अधिक एकरूप नतीजों के लिए seed पैरामीटर इस्तेमाल करें
  • मुफ़्त रीजनरेशन: हर जनरेशन पर अधिकतम 2 मुफ़्त रीजनरेशन (केवल समान कंटेंट और पैरामीटर्स)
  • स्वामित्व: जनरेट किए गए ऑडियो का स्वामित्व आपके पास रहता है; कमर्शियल इस्तेमाल के लिए पेड प्लान चाहिए
  • कम-लेटेंसी उपयोग के मामले: Flash मॉडल्स (eleven_flash_v2 या eleven_flash_v2_5) इस्तेमाल करें — लेटेंसी ऑप्टिमाइज़ेशन गाइड देखें
  • बड़ा टेक्स्ट: लंबे टेक्स्ट को सेगमेंट्स में बाँटें; चंक्स के बीच स्वाभाविक प्रोसोडी बनाए रखने के लिए previous_text / next_text पैरामीटर्स इस्तेमाल करें