टेक्स्ट टू स्पीच

ElevenLabs के साथ टेक्स्ट को स्पीच में बदलने की गाइड

ओवरव्यू

ElevenLabs की टेक्स्ट टू स्पीच टेक्नोलॉजी हमारी सेवाओं का अहम हिस्सा है, जो दुनियाभर में अलग-अलग ऐप्लिकेशन्स के लिए उच्च-गुणवत्ता वाली AI-जनरेटेड स्पीच उपलब्ध कराती है। संभव है कि आप हमारी वॉइसेज़ को पहले ही इस्तेमाल होते सुन चुके हों, जो जीवंत ऑडियो अनुभव देती हैं।

टेक्स्ट टू स्पीच से अपना पहला ऑडियो जनरेट करना बहुत आसान है। हालांकि, इस फीचर का पूरा फायदा लेने के लिए आपको कुछ बातें ध्यान में रखनी होंगी।

गाइड

टेक्स्ट टू स्पीच डेमो

1

टेक्स्ट इनपुट

टेक्स्ट टू स्पीच पेज पर इनपुट बॉक्स में अपना टेक्स्ट टाइप करें या पेस्ट करें।

2

वॉइस चुनें

स्क्रीन के नीचे बाईं ओर अपनी वॉइसेज़ में से वह वॉइस चुनें जिसे आप इस्तेमाल करना चाहते हैं।

3

सेटिंग्स एडजस्ट करें (वैकल्पिक)

मनचाहा आउटपुट पाने के लिए वॉइस सेटिंग्स बदलें।
4

जनरेट करें

अपनी ऑडियो फ़ाइल बनाने के लिए ‘Generate’ बटन पर क्लिक करें।

सेटिंग्स

उच्च-गुणवत्ता वाली स्पीच बनाने के लिए वॉइसेज़, मॉडल्स और सेटिंग्स को समझें।

आप जिन सेटिंग्स का इस्तेमाल करते हैं, खासकर वॉइस और मॉडल, वे आउटपुट पर काफी असर डालती हैं। इन्हें समझना और कुछ बेहतरीन तरीकों को जानना बहुत ज़रूरी है। दूसरी सेटिंग्स भी आउटपुट को प्रभावित करती हैं, लेकिन चुनी गई वॉइस और मॉडल की तुलना में उनका असर कम होता है।

महत्व का क्रम इस प्रकार है: वॉइस का चयन सबसे महत्वपूर्ण है, उसके बाद मॉडल का चयन और फिर मॉडल सेटिंग्स। ये सभी और इनका संयोजन आउटपुट को प्रभावित करते हैं।

वॉइसेज़

टेक्स्ट टू स्पीच वॉइस
चयन

हम कई तरह की वॉइसेज़ देते हैं, जिनमें चुनी हुई डिफ़ॉल्ट वॉइसेज़, लगभग हर कल्पनीय वॉइस वाली हमारी विशाल वॉइस लाइब्रेरी w, हमारे वॉइस डिज़ाइन टूल से बनाई गई पूरी तरह सिंथेटिक वॉइसेज़, और हमारी दो टेक्नोलॉजी—इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग—से बनाई गई आपकी अपनी क्लोन वॉइसेज़ की कलेक्शन शामिल है।

सभी वॉइसेज़ एक जैसी नहीं होतीं और बहुत कुछ उन्हें बनाने के लिए इस्तेमाल किए गए सोर्स ऑडियो पर निर्भर करता है। कुछ वॉइसेज़ बेहतर, अधिक मानवीय परफॉर्मेंस और डिलीवरी देंगी, जबकि कुछ अधिक स्थिर होंगी।

अपने खास कंटेंट के लिए सही वॉइस चुनना बेहद ज़रूरी है। संभवतः यह सबसे अहम फैसला है, जिसका अंतिम आउटपुट पर सबसे बड़ा असर होगा। यह जेंडर, टोन, एक्सेंट, लय और डिलीवरी तय करता है। सही वॉइस चुनने और उसे अच्छी तरह टेस्ट करने में अतिरिक्त समय देना फायदेमंद है, ताकि यह सुनिश्चित हो सके कि वह एक जैसी रहे और आपकी अपेक्षाओं पर खरी उतरे।

किसी खास भाषा में स्पीच जनरेट करने के लिए, वॉइस लाइब्रेरी की उस भाषा की नेटिव वॉइस इस्तेमाल करने या सही एक्सेंट में वह भाषा बोलने वाली वॉइस को क्लोन करने से सबसे अच्छे नतीजे मिलेंगे। तकनीकी रूप से कोई भी वॉइस कोई भी भाषा बोल सकती है, लेकिन उसका मूल एक्सेंट बना रहेगा। उदाहरण के लिए, फ़्रेंच स्पीच जनरेट करने के लिए नेटिव अंग्रेज़ी वॉइस का इस्तेमाल करने पर आउटपुट फ़्रेंच में तो होगा, लेकिन संभवतः अंग्रेज़ी एक्सेंट के साथ, क्योंकि AI को यह सामान्यीकृत करना होता है कि जिस भाषा पर उस वॉइस को ट्रेन नहीं किया गया था, उसमें वह कैसी सुनाई देगी।

वॉइसेज़ के बारे में और जानें

अगर आपको कोई वॉइस पसंद है लेकिन आप उसकी डिलीवरी बदलना चाहते हैं, तो हमारा वॉइस रीमिक्सिंग टूल मदद कर सकता है। इससे आप नेचुरल लैंग्वेज प्रॉम्प्ट का इस्तेमाल करके वॉइस की डिलीवरी, लय, टोन, जेंडर और यहाँ तक कि एक्सेंट भी बदल सकते हैं। एक्सेंट बदलते समय, बेस वॉइस और टारगेट एक्सेंट बहुत महत्वपूर्ण होते हैं। नतीजे अलग-अलग हो सकते हैं; कभी यह बिल्कुल सही काम करता है, तो कभी सही नतीजा पाने के लिए कुछ कोशिशें लग सकती हैं।

वॉइस रीमिक्सिंग से आपको बहुत अच्छे नतीजे मिल सकते हैं, लेकिन वे आमतौर पर सही ढंग से क्लोन की गई प्रोफेशनल वॉइस क्लोन जितने अच्छे नहीं होंगे। वे इंस्टेंट वॉइस क्लोन के ज़्यादा करीब होंगे।

ध्यान रखें, वॉइस रीमिक्सिंग सिर्फ़ खास वॉइसेज़ के लिए काम करती है। उदाहरण के लिए, आप वॉइस लाइब्रेरी की वॉइसेज़ को रीमिक्स नहीं कर सकते; आप सिर्फ़ अपनी बनाई वॉइसेज़ या डिफ़ॉल्ट वॉइसेज़ को रीमिक्स कर सकते हैं।

मॉडल्स

टेक्स्ट टू स्पीच मॉडल
चयन

हम मॉडल्स के दो परिवार देते हैं: स्टैंडर्ड (उच्च-गुणवत्ता) मॉडल्स और बेहद कम लेटेंसी के लिए ऑप्टिमाइज़ किए गए फ़्लैश मॉडल्स। ज़्यादातर परिवारों में सिर्फ़ अंग्रेज़ी और मल्टीलिंगुअल, दोनों वर्ज़न शामिल होते हैं।

Eleven v4 हमारा नवीनतम मॉडल है। यह दो वेरिएंट में आता है: Eleven v4 और Eleven v4 Turbo।

वॉइस चुनने के बाद, मॉडल का चयन आपके अंतिम ऑडियो आउटपुट को प्रभावित करने वाला दूसरा सबसे महत्वपूर्ण कारक है। हम सुझाव देते हैं कि सबसे उपयुक्त विकल्प खोजने के लिए अपनी चुनी हुई वॉइस के साथ अलग-अलग मॉडल्स को टेस्ट करें। हमारे सभी मॉडल्स की अपनी खूबियाँ और सीमाएँ हैं और कुछ वॉइसेज़ के साथ वे दूसरों की तुलना में बेहतर काम करते हैं, इसलिए अच्छा संयोजन ढूँढना ज़रूरी है।

अगर आपका आउटपुट सिर्फ़ अंग्रेज़ी में होगा, तो हम अपने सिर्फ़ अंग्रेज़ी वाले मॉडल्स में से किसी एक का इस्तेमाल करने की पुरज़ोर सलाह देते हैं। इनके साथ काम करना अक्सर आसान होता है, ये अधिक स्थिर होते हैं और आम तौर पर सिर्फ़ अंग्रेज़ी कंटेंट के लिए बेहतर परफॉर्मेंस देते हैं। अगर आपका कंटेंट किसी दूसरी भाषा में होगा या संभावित रूप से मल्टीलिंगुअल होगा, तो आपको मल्टीलिंगुअल मॉडल्स में से किसी एक का इस्तेमाल करना होगा।

Eleven v4

हमारा सबसे भावपूर्ण, उच्च-गुणवत्ता वाला स्पीच सिंथेसिस मॉडल

बेहतरीन वॉइस क्लोनिंग क्षमताएं
90+ भाषाएं समर्थित
10,000 कैरेक्टर की सीमा
नैचुरल मल्टी-स्पीकर डायलॉग के लिए सपोर्ट
Eleven v4 Turbo

हमारा सबसे भावपूर्ण, रियल-टाइम स्पीच सिंथेसिस मॉडल

अल्ट्रा-लो लेटेंसी (मीडियन इन्फ़रेंस लेटेंसी ~100ms†)
बेहतरीन वॉइस क्लोनिंग क्षमताएं
90+ भाषाएं समर्थित
बारीक नियंत्रण के लिए ऑडियो टैग्स
Eleven v3

हमारा भावनाओं से भरपूर, एक्सप्रेसिव स्पीच सिंथेसिस मॉडल

नाटकीय डिलीवरी और परफ़ॉर्मेंस
70+ भाषाएं समर्थित
5,000 कैरेक्टर की सीमा
नैचुरल मल्टी-स्पीकर डायलॉग के लिए सपोर्ट
Eleven v3 Conversational

हमारा एक्सप्रेसिव, रियलटाइम स्पीच सिंथेसिस मॉडल

लो लेटेंसी (~280ms)
नाटकीय डिलीवरी और परफ़ॉर्मेंस
70+ भाषाएं समर्थित
बारीक नियंत्रण के लिए ऑडियो टैग्स
Eleven Multilingual v2

जीवंत, एक जैसी गुणवत्ता वाला स्पीच सिंथेसिस मॉडल

स्वाभाविक सुनाई देने वाला आउटपुट
29 भाषाएं समर्थित
10,000 कैरेक्टर की सीमा
लंबे जनरेशन में सबसे स्थिर
Eleven Flash v2.5

हमारा तेज़, किफ़ायती स्पीच सिंथेसिस मॉडल

अल्ट्रा-लो लेटेंसी (~75ms†)
32 भाषाएं समर्थित
40,000 कैरेक्टर की सीमा
तेज़ मॉडल, API जनरेशन के लिए प्रति कैरेक्टर 50% कम कीमत

हमारे मॉडल्स के बारे में और जानें

वॉइस सेटिंग्स

टेक्स्ट टू स्पीच वॉइस
सेटिंग्स

सबसे आम सेटिंग में स्टेबिलिटी लगभग 50, सिमिलैरिटी लगभग 75 और स्टाइल 0 रखा जाता है, जिसके बाद बहुत कम बदलाव किए जाते हैं। बेशक, यह सब मूल वॉइस और आपके इच्छित परफॉर्मेंस स्टाइल पर निर्भर करता है।

यह ध्यान रखना ज़रूरी है कि AI गैर-निर्धारक है; स्लाइडर्स को खास वैल्यू पर सेट करने से हर बार एक जैसे नतीजों की गारंटी नहीं मिलती। इसके बजाय, स्लाइडर्स एक रेंज की तरह काम करते हैं और तय करते हैं कि हर जनरेशन के बीच रैंडमाइज़ेशन कितना व्यापक हो सकता है।

स्पीड

स्पीड सेटिंग से आप जनरेट की गई स्पीच की गति बढ़ा या घटा सकते हैं। डिफ़ॉल्ट वैल्यू 1.0 है, यानी स्पीड एडजस्ट नहीं की जाती। 1.0 से कम वैल्यू वॉइस को धीमा करती हैं, न्यूनतम 0.7 तक। 1.0 से अधिक वैल्यू वॉइस को तेज़ करती हैं, अधिकतम 1.2 तक। अत्यधिक वैल्यू जनरेट की गई स्पीच की गुणवत्ता को प्रभावित कर सकती हैं।

Eleven v3 मॉडल के लिए स्पीड उपलब्ध नहीं है।

स्टेबिलिटी

स्टेबिलिटी स्लाइडर तय करता है कि वॉइस कितनी स्थिर है और हर जनरेशन के बीच कितना रैंडमनेस होगा। इस स्लाइडर को कम करने से वॉइस में भावनाओं की रेंज बढ़ती है। जैसा कि पहले बताया गया है, यह मूल वॉइस से भी बहुत प्रभावित होता है। स्लाइडर को बहुत कम सेट करने से अजीब परफॉर्मेंस मिल सकते हैं, जो अत्यधिक रैंडम हों और कैरेक्टर को बहुत तेज़ बोलने पर मजबूर करें। दूसरी ओर, इसे बहुत अधिक सेट करने से सीमित भावनाओं वाली एकरस वॉइस मिल सकती है।

अधिक जीवंत और नाटकीय परफॉर्मेंस के लिए, स्टेबिलिटी स्लाइडर को कम सेट करने और अपनी पसंद की परफॉर्मेंस मिलने तक कुछ बार जनरेट करने की सलाह दी जाती है।

दूसरी ओर, अगर आप अधिक गंभीर परफॉर्मेंस चाहते हैं, जो बहुत अधिक वैल्यू पर लगभग मोनोटोन भी हो, तो स्टेबिलिटी स्लाइडर को अधिक सेट करने की सलाह दी जाती है। चूँकि यह अधिक एकसमान और स्थिर होता है, इसलिए वांछित नतीजा पाने के लिए आमतौर पर आपको उतने सैंपल जनरेट करने की ज़रूरत नहीं पड़ती। अपने लिए सबसे अच्छा विकल्प जानने के लिए प्रयोग करें!

सिमिलैरिटी

सिमिलैरिटी स्लाइडर तय करता है कि AI उसे दोहराने की कोशिश करते समय मूल वॉइस का कितनी बारीकी से पालन करे। अगर मूल ऑडियो खराब गुणवत्ता का है और सिमिलैरिटी स्लाइडर बहुत अधिक सेट है, तो मूल रिकॉर्डिंग में मौजूद आर्टिफ़ैक्ट्स या बैकग्राउंड नॉइज़ को दोहराने की कोशिश में AI उन्हें भी दोबारा उत्पन्न कर सकता है।

Eleven v3 मॉडल के लिए सिमिलैरिटी उपलब्ध नहीं है।

स्टाइल एक्सैजरेशन

नए मॉडल्स के आने के साथ, हमने स्टाइल एक्सैजरेशन सेटिंग भी जोड़ी है। यह सेटिंग मूल स्पीकर के स्टाइल को बढ़ाने की कोशिश करती है। यह अतिरिक्त कंप्यूटेशनल संसाधनों का इस्तेमाल करती है और 0 के अलावा कोई अन्य वैल्यू सेट होने पर लेटेंसी बढ़ा सकती है। यह ध्यान रखना ज़रूरी है कि इस सेटिंग का इस्तेमाल मॉडल को थोड़ा कम स्थिर बना सकता है, क्योंकि यह मूल वॉइस के स्टाइल को उभारने और उसकी नकल करने की कोशिश करता है।

सामान्य तौर पर, हम इस सेटिंग को हमेशा 0 पर रखने की सलाह देते हैं।

स्पीकर बूस्ट

यह सेटिंग मूल स्पीकर से सिमिलैरिटी बढ़ाती है। हालांकि, इस सेटिंग के इस्तेमाल के लिए थोड़ा अधिक कंप्यूटेशनल लोड चाहिए, जिससे लेटेंसी बढ़ जाती है। इस सेटिंग से आने वाले अंतर आमतौर पर काफी सूक्ष्म होते हैं।

Eleven v3 मॉडल के लिए स्पीकर बूस्ट उपलब्ध नहीं है।

जनरेट करें

वॉइस चुनने, मॉडल चुनने और अपनी सेटिंग्स कॉन्फ़िगर करने के बाद, जनरेशन प्रक्रिया आसान है: आप टेक्स्ट डालते हैं, “स्पीच जनरेट करें” दबाते हैं, और फिर ऑडियो जनरेट हो जाता है।

हालाँकि ऊपर से यह प्रक्रिया बहुत आसान लगती है, लेकिन वांछित आउटपुट पाने के लिए आपके द्वारा दिया गया टेक्स्ट इनपुट बेहद महत्वपूर्ण है। ऐसे शब्द इस्तेमाल करने पर जो शायद “डिस्ट्रिब्यूशन से बाहर” हों—यानी ऐसी चीज़ें जिनका AI ने ट्रेनिंग के दौरान शायद ही कभी सामना किया हो—जैसे अजीब नाम, असामान्य संक्षिप्त रूप, सिंबल या इमोजी, AI भ्रमित हो सकता है और आउटपुट अधिक अस्थिर हो सकता है। इमोजी और कुछ सिंबल को सही तरह समझना AI के लिए खास तौर पर मुश्किल होता है।

UI के ज़रिए टेक्स्ट टू स्पीच इस्तेमाल करते समय, हम आपके इनपुट पर एक ऑटोमेटेड नॉर्मलाइज़ेशन स्टेप चलाते हैं, ताकि टेक्स्ट अधिक पठनीय हो और AI के लिए प्रोसेस करना आसान हो। आम तौर पर, यह स्टेप सिंबल्स और नंबरों को लिखे हुए टेक्स्ट में बदल देता है, जिससे AI को सही उच्चारण की जानकारी मिलती है।

एक बेहतरीन तरीका जिसकी हम पुरज़ोर सलाह देते हैं, वह है नंबरों को अंकों में लिखने या सिंबल्स इस्तेमाल करने से बचना, खासकर मल्टीलिंगुअल मॉडल्स इस्तेमाल करते समय (हालाँकि यह सिर्फ़ अंग्रेज़ी वाले मॉडल्स पर भी लागू होता है)। चूँकि नंबर और सिंबल कई भाषाओं में एक जैसे लिखे जाते हैं लेकिन उनका उच्चारण अलग होता है, इसलिए अंकों पर निर्भर रहने से AI के लिए अस्पष्टता पैदा होती है। उदाहरण के लिए, नंबर “1” अंग्रेज़ी और कई अन्य भाषाओं में एक ही तरह लिखा जाता है, लेकिन उसका उच्चारण अलग होता है। नंबर को टेक्स्ट में लिखने से, जैसे “one,” AI को यह समझने की ज़रूरत नहीं पड़ती कि उसे क्या करना है।

हम अधिक उन्नत वर्कफ़्लो पर काम कर रहे हैं, जिनसे आप ऑडियो टैग्स के ज़रिए AI की डिलीवरी और परफॉर्मेंस को प्रभावित कर सकेंगे। यह सुविधा Eleven v4 और Eleven v3 में उपलब्ध है। अगर आप इस सुविधा के बारे में और जानना चाहते हैं, तो हम हमारी प्रॉम्प्टिंग गाइड पढ़ने की सलाह देते हैं।

अक्सर पूछे जाने वाले सवाल

पहला और सबसे अहम कारक यह है कि अच्छा, उच्च-गुणवत्ता वाला और एकरूप इनपुट, अच्छा, उच्च-गुणवत्ता वाला और एकरूप आउटपुट देगा।

अगर आप AI को ऐसा ऑडियो देते हैं जो आदर्श से कम है—जैसे बहुत अधिक शोर वाला ऑडियो, साफ़ आवाज़ पर रीवर्ब, कई स्पीकर, या वॉल्यूम, प्रदर्शन और बोलने के तरीके में असंगति—तो AI अधिक अस्थिर हो जाएगा और आउटपुट कम अनुमानित होगा।

अगर आप अपनी वॉइस क्लोन करने की योजना बना रहे हैं, तो हम दृढ़ता से सलाह देते हैं कि सही वॉइस क्लोन बनाने के लिए दस्तावेज़ में दी गई हमारी गाइडलाइंस पढ़ें, क्योंकि इससे आपको शुरुआत के लिए सबसे बेहतर आधार मिलेगा। भले ही आप सिर्फ़ इंस्टेंट वॉइस क्लोन्स का इस्तेमाल करना चाहते हों, प्रोफेशनल वॉइस क्लोनिंग सेक्शन भी पढ़ना अच्छा रहेगा। इस सेक्शन में वॉइस क्लोन बनाने की उपयोगी जानकारी है, हालांकि इन दोनों तकनीकों की आवश्यकताएं थोड़ी अलग हैं।

दूसरा ध्यान देने वाला कारक यह है कि आपके चुने हुए वॉइस का आउटपुट पर बहुत बड़ा असर होगा। जैसा कि पहले कारक में बताया गया है, उस खास क्लोन को बनाने में इस्तेमाल किए गए सैंपल्स की गुणवत्ता और एकरूपता बेहद महत्वपूर्ण है, साथ ही वॉइस की भाषा और टोन भी।

अगर आप ऐसी वॉइस चाहते हैं जो खुश और उत्साही लगे, तो आपको खुश और उत्साही सैंपल्स से क्लोन की गई वॉइस इस्तेमाल करनी चाहिए। इसके उलट, अगर आप आत्मचिंतनशील और गंभीर लगने वाली वॉइस चाहते हैं, तो ऐसी विशेषताओं वाली वॉइस चुनें।

हालांकि, सही भाषा में प्रशिक्षित वॉइस का इस्तेमाल करना भी बहुत ज़रूरी है। उदाहरण के लिए, डिफ़ॉल्ट वॉइस के रूप में हमारे सभी प्रोफेशनल वॉइस क्लोन अंग्रेज़ी वॉइस हैं और उन्हें अंग्रेज़ी सैंपल्स पर प्रशिक्षित किया गया है। इसलिए, अगर आप उनसे दूसरी भाषाएं बुलवाते हैं, तो उन भाषाओं में उनका प्रदर्शन अनुमानित नहीं हो सकता। ऐसी वॉइस इस्तेमाल करना ज़रूरी है जिसे उन सैंपल्स से क्लोन किया गया हो जिनमें वॉइस वही भाषा बोल रही थी जो आप AI से बुलवाना चाहते हैं।

यह थोड़ा मामूली लग सकता है, लेकिन इससे बड़ा फर्क पड़ सकता है। AI टेक्स्ट के संदर्भ के आधार पर यह समझने की कोशिश करता है कि किसी चीज़ को कैसे पढ़ना है। इसमें सिर्फ़ इस्तेमाल किए गए शब्द ही नहीं, बल्कि उन्हें जोड़ने का तरीका, विराम चिह्नों का इस्तेमाल, व्याकरण और टेक्स्ट की सामान्य फ़ॉर्मैटिंग भी शामिल है।

इससे AI के बोलने के तरीके पर छोटा लेकिन प्रभावशाली असर पड़ सकता है। अगर आप किसी शब्द की वर्तनी गलत लिखते हैं, तो AI उसे ठीक नहीं करेगा और उसे लिखे हुए तरीके से ही पढ़ने की कोशिश करेगा।

AI की सेटिंग्स अनियत होती हैं, यानी समान शुरुआती स्थितियों (वॉइस, सेटिंग्स, मॉडल) में भी यह आपको थोड़ा अलग आउटपुट दे सकता है, ठीक वैसे ही जैसे कोई वॉइस ऐक्टर हर बार थोड़ा अलग प्रदर्शन करता है।

यह भिन्नता कई कारकों के कारण हो सकती है, जैसे पहले बताए गए विकल्प: वॉइस, सेटिंग्स, मॉडल। आम तौर पर, इस भिन्नता की सीमा को स्टेबिलिटी स्लाइडर से नियंत्रित किया जा सकता है। कम स्टेबिलिटी सेटिंग का मतलब है कि जनरेशन के बीच भिन्नता की सीमा अधिक होगी, लेकिन इससे अलग-अलग जनरेशन के बीच भी भिन्नता आती है, जिसमें AI थोड़ा अधिक अभिव्यंजक हो सकता है।

अधिक भिन्नता अक्सर वांछनीय हो सकती है, क्योंकि स्टेबिलिटी को बहुत अधिक सेट करने से कुछ वॉइस एकरस लग सकती हैं, क्योंकि इससे AI को अधिक विविध कंटेंट जनरेट करने की उतनी गुंजाइश नहीं मिलती। हालांकि, स्टेबिलिटी को बहुत कम करने से दूसरी समस्याएं भी आ सकती हैं, जिनमें जनरेशन अस्थिर हो जाती हैं, खासकर उन कुछ वॉइस के साथ जिनकी क्लोनिंग प्रक्रिया में आदर्श से कम ऑडियो इस्तेमाल हुआ हो।

ज़्यादातर उपयोगों के लिए 50 की डिफ़ॉल्ट सेटिंग आम तौर पर एक शानदार शुरुआती बिंदु है।

हम Eleven v4 पर स्विच करने और अपने कंटेंट के साथ इसका परीक्षण करने की सलाह देते हैं।

Eleven v4 हमारा नवीनतम और सबसे उन्नत टेक्स्ट टू स्पीच मॉडल है और मॉडल्स की नई पीढ़ी में पहला है। Eleven v3 की तुलना में यह आउटपुट क्वालिटी, वॉइस की सटीकता, भावनाओं, ऑडियो टैग और भाषाओं के कवरेज को बेहतर बनाता है।

Eleven v4 के साथ वॉइस क्लोनिंग की सटीकता में बड़ा सुधार हुआ है। क्लोन की गई आवाज़ें स्रोत आवाज़ की विशेषताओं — टिंबर, लय और डिलीवरी — को पिछले किसी भी मॉडल से अधिक सटीकता से कैप्चर करती हैं।

Eleven v4 में Instant Voice Clones (IVCs) पहले से अधिक सटीक हैं। वे स्रोत आवाज़ की परिभाषित विशेषताओं को अधिक सटीकता से कैप्चर करते हैं, जिससे छोटे ऑडियो सैंपल से जल्दी विश्वसनीय क्लोन बनाना आसान हो जाता है।

Eleven v4 में Professional Voice Clones (PVCs) पूरी तरह समर्थित हैं। वे वॉइस सटीकता में हुई इन्हीं प्रगतियों पर आधारित हैं और उन workflows के लिए स्रोत आवाज़ की अधिक सटीक प्रतिकृति देते हैं जिनमें सबसे उच्च स्तर की निरंतरता और नियंत्रण चाहिए।

Eleven v4 के दो वेरिएंट हैं, ताकि आप अपने उपयोग के मामले के लिए क्वालिटी और स्पीड का सही संतुलन चुन सकें:

  • Eleven v4 (eleven_v4) — हमारा सबसे उच्च-गुणवत्ता वाला मॉडल, जो कंटेंट बनाने, ऑडियोबुक, किरदारों के वॉइसओवर और ऐसे किसी भी उपयोग के मामले के लिए आदर्श है जहां क्वालिटी सबसे अहम हो।
  • Eleven v4 Turbo (eleven_v4_turbo) — बेहद कम लेटेंसी बनाए रखते हुए अत्यंत उच्च क्वालिटी देता है, और कन्वर्सेशनल एजेंट्स तथा इंटरैक्टिव वॉइस अनुभवों जैसे रीयल-टाइम उपयोग के मामलों के लिए खास तौर पर बनाया गया है।

दोनों वेरिएंट दो वॉइस सेटिंग्स का उपयोग करते हैं: Stability और Similarity। Eleven v4 में Style और Speed स्लाइडर उपलब्ध नहीं हैं और SSML समर्थित नहीं है।

जब आपकी जनरेट की जा रही भाषा आपकी रेफरेंस वॉइस की भाषा से मेल खाती है, तो मूल एक्सेंट पहले की तरह ही बना रहता है। जब आप जिस भाषा में जनरेट कर रहे हैं वह रेफरेंस वॉइस की भाषा से अलग होती है, तो Eleven v4 लक्ष्य भाषा में धाराप्रवाह, प्राकृतिक लगने वाली आवाज़ बनाता है — रेफरेंस वॉइस के मूल भाषा वाले एक्सेंट को साथ ले जाने के बजाय।

आप मॉडल ID eleven_v4 का उपयोग करके Create speech और Stream speech से जनरेट कर सकते हैं। कई स्पीकर्स के लिए Create dialogue और Stream dialogue का उपयोग करें।

क्लोनिंग, एक्सेंट, तुलना और पूरे विवरण के लिए Eleven v4 देखें। टैग और प्रॉम्प्टिंग के लिए Prompting Eleven v4 देखें।

हम Eleven v4 पर स्विच करने और अपने कंटेंट के साथ इसका परीक्षण करने की सलाह देते हैं। Eleven v4 के लिए कई प्रॉम्प्टिंग तकनीकें Eleven v3 पर भी लागू होती हैं।

Eleven v3 भावनात्मक रूप से समृद्ध और अभिव्यंजक टेक्स्ट टू स्पीच मॉडल है। यह 70+ भाषाओं में व्यापक भावनात्मक रेंज और संदर्भ की समझ के साथ प्राकृतिक, जीवंत आवाज़ बनाता है।

Eleven v3 में ये सुविधाएं हैं:

  • ऑडियो टैग का समर्थन
    • भावनाएं: [sad] [angry] [happily]
    • डिलीवरी निर्देश: [whispers] [shouts]
    • गैर-मौखिक प्रतिक्रियाएं: [laughs] [clears throat] [sighs]
  • कई स्पीकर्स के साथ प्राकृतिक लगने वाले ऑडियो के लिए डायलॉग मोड
  • 70+ भाषाओं का समर्थन

यह मॉडल किरदारों की बातचीत, ऑडियोबुक नैरेशन और भावनात्मक डायलॉग के लिए अच्छा काम करता है।

आप मॉडल ID eleven_v3 देकर हमारे Create speech और Stream speech एंडपॉइंट्स के जरिए API से v3 का उपयोग कर सकते हैं।

कई स्पीकर्स के साथ प्राकृतिक लगने वाला डायलॉग बनाने के लिए आप हमारे Create dialogue और Stream dialogue एंडपॉइंट्स का भी उपयोग कर सकते हैं।

अधिक जानकारी के लिए ये संसाधन देखें:

वॉइस की गति नियंत्रित करने की सुविधा स्पीच सिंथेसिस, स्टूडियो, ElevenAgents और हमारे API के ज़रिए टेक्स्ट टू स्पीच में उपलब्ध है।

आप Speed सेटिंग का इस्तेमाल करके वॉइस की गति नियंत्रित कर सकते हैं।

संभावित मान 0.7 से 1.2 तक होते हैं। 1 से कम मान स्पीच को धीमा करेंगे और 1 से ज़्यादा मान उसे तेज़ करेंगे। बहुत ज़्यादा या बहुत कम मान जनरेट की गई स्पीच की क्वालिटी को प्रभावित कर सकते हैं। 

यह सेटिंग सभी वॉइस और सभी मॉडल के लिए उपलब्ध है। यह आपको वॉइस सेटिंग्स में मिलेगी।

API का इस्तेमाल करते समय स्पीच को नियंत्रित करने की जानकारी के लिए हमारा API रेफरेंस देखें।

कोई भी वॉइस किसी भी समर्थित भाषा को बोल सकती है।

वर्तमान मॉडल ऐसे काम करता है कि आपको कोई खास भाषा चुनने की ज़रूरत नहीं होती। आप बस उस भाषा में लिखते हैं जिसमें आप AI से बुलवाना चाहते हैं और AI उसे अपने-आप समझ लेता है। हालांकि, अलग-अलग भाषाओं में कुछ समान शब्द और शब्दावली हो सकती है, लेकिन उनके उच्चारण और एक्सेंट काफी अलग हो सकते हैं। इसलिए आपको ऐसी क्लोन की गई वॉइस इस्तेमाल करनी चाहिए जिसे सही एक्सेंट वाली भाषा बोलते हुए क्लोन किया गया हो।

भाषा टेक्स्ट से तय होती है, जबकि एक्सेंट और उच्चारण वॉइस से तय होते हैं। बेहतर ढंग से काम करने के लिए इसे दोनों संदर्भों की ज़रूरत होती है।

हम भाषा चुनने को आसान बनाने के लिए नई तकनीक विकसित करने पर काम कर रहे हैं, लेकिन AI के काम करने के तरीके की वजह से यह अभी प्रगति पर है।

आप जनरेट की गई फ़ाइलें दो तरीकों से डाउनलोड कर सकते हैं:

कंटेंट जनरेट करने के बाद, नीचे दाईं ओर मौजूद डाउनलोड बटन पर क्लिक करके आप तुरंत जनरेट की गई फ़ाइल डाउनलोड कर सकते हैं।

पहले जनरेट की गई फ़ाइलें आपकी हिस्ट्री से डाउनलोड की जा सकती हैं। 

अपनी हिस्ट्री देखने के लिए अपने अकाउंट में लॉग इन करें और साइडबार में टेक्स्ट टू स्पीच चुनें। फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।

अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 (128kbps) या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं। 

अतिरिक्त फ़ाइल फ़ॉर्मैट में डाउनलोड करने के लिए आप एडवांस्ड पर भी क्लिक कर सकते हैं:

  • MP3 (192kbps)
  • MP3 (256kbps)
  • M4A
  • FLAC

हां। Eleven v4 और Eleven v3 के साथ, आप जनरेट की गई स्पीच में सांस लेने और ऐसी ही प्रतिक्रियाएं जोड़ने के लिए [sighs] या [exhales] जैसे ऑडियो टैग इस्तेमाल कर सकते हैं।

ऑडियो टैग और डिलीवरी कंट्रोल की ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।

हमारे Flash और Turbo मॉडल खास तौर पर कम लेटेंसी वाले ऐप्लिकेशन के लिए विकसित किए गए हैं।

Flash v2 और Flash v2.5 हमारे बेहद कम लेटेंसी वाले मॉडल हैं, जो 75ms से कम समय में ऑडियो जनरेट करते हैं। Flash v2 सिर्फ़ अंग्रेज़ी के लिए है, जबकि Flash v2.5 32 भाषाओं को सपोर्ट करता है। सभी समर्थित भाषाओं की पूरी सूची यहाँ देख सकते हैं।

हमारे Turbo मॉडल भी कम लेटेंसी वाले हैं, लेकिन Flash मॉडल बहुत मिलते-जुलते नतीजे देते हैं, इसलिए हम Turbo के बजाय Flash मॉडल इस्तेमाल करने की सलाह देते हैं। Turbo v2 सिर्फ़ अंग्रेज़ी के लिए है, जबकि Turbo v2.5 32 भाषाओं को सपोर्ट करता है और Turbo v2 से 25% तेज़ है। यह लगभग 300ms में ऑडियो जनरेट करता है।

Flash और Turbo, दोनों ही बहुत अनुकूलित मॉडल हैं। इन्हें खास तौर पर वॉइस प्रदर्शन से समझौता किए बिना और हमारे मॉडल से लोगों की अपेक्षित क्वालिटी बनाए रखते हुए, कम लेटेंसी वाले ऐप्लिकेशन के लिए तैयार किया गया है।

API के ज़रिए जनरेट करने पर दोनों मॉडल पर छूट मिलती है। जानकारी के लिए हमारी API Pricing देखें।

हम कस्टमाइज़्ड, इंटरैक्टिव वॉइस एजेंट डिप्लॉय करने के लिए अपना प्लेटफ़ॉर्म ElevenAgents भी देते हैं। अधिक जानने के लिए हमारे ElevenAgents दस्तावेज़ देखें।

विराम या ठहराव जोड़ने और स्पीकर की लय व गति को प्रभावित करने के कुछ तरीके हैं। आप कौन-सा तरीका अपनाते हैं, यह मॉडल पर निर्भर करता है।

ऑडियो टैग (Eleven v4 और Eleven v3)

Eleven v4 और Eleven v3 के साथ, गति और डिलीवरी को नियंत्रित करने के लिए ऑडियो टैग और विराम चिह्न इस्तेमाल करें। ये मॉडल SSML ब्रेक टैग को सपोर्ट नहीं करते।

विराम और डिलीवरी के लिए प्रॉम्प्टिंग की जानकारी हेतु प्रॉम्प्टिंग गाइड देखें।

ब्रेक टैग (Multilingual v2, Flash v2, और Flash v2.5)

Multilingual v2, Flash v2 और Flash v2.5 में विराम जोड़ने का सबसे भरोसेमंद तरीका SSML ब्रेक टैग सिंटैक्स <break time="1.5s" /> है। इससे स्पीच में सटीक और प्राकृतिक विराम बनता है। यह सिर्फ़ शब्दों के बीच डाली गई चुप्पी नहीं है—मॉडल सिंटैक्स को समझता है और प्राकृतिक विराम जोड़ता है।

मॉडल इन विरामों को कैसे संभालता है, इसमें अंतर हो सकता है। इस्तेमाल की गई वॉइस आउटपुट में अहम भूमिका निभाती है। कुछ वॉइस, जिन्हें कुछ “uh” और “ah” के साथ ट्रेन किया गया है, विराम के दौरान असली वक्ता की तरह ऐसी वोकल आदतें जोड़ सकती हैं।

एक उदाहरण ऐसा हो सकता है:

“मुझे इसके बारे में सोचने के लिए एक सेकंड दीजिए।” <break time="1.0s" /> “हां, यह काम करेगा।”

ब्रेक समय सेकंड में बताया जाना चाहिए। AI 3 सेकंड तक के विराम संभाल सकता है और इसे टेक्स्ट टू स्पीच तथा API के ज़रिए इस्तेमाल किया जा सकता है।

अगर आप टेक्स्ट में बहुत ज़्यादा SSML ब्रेक इस्तेमाल करते हैं, तो समस्याएं हो सकती हैं। स्पीच तेज़ हो सकती है, या ऑडियो में ज़्यादा शोर और अन्य आर्टिफैक्ट आ सकते हैं। हम इसे ठीक करने पर काम कर रहे हैं।

विराम चिह्न

ये विकल्प ब्रेक टैग या ऑडियो टैग से कम भरोसेमंद हैं, लेकिन फिर भी गति को प्रभावित कर सकते हैं।

साधारण डैश - या एम डैश — अक्सर अच्छी तरह काम करता है। लंबे विराम के लिए आप कई डैश, जैसे -- --, जोड़ सकते हैं।

“अब - बहुत - देर हो रही है।”

एलिप्सिस ... कभी-कभी शब्दों के बीच विराम जोड़ सकता है, लेकिन आमतौर पर यह वॉइस में कुछ झिझक या घबराहट भी जोड़ता है, जो हमेशा उपयुक्त नहीं होती।

“मैं… हां, शायद ऐसा ही है…”

Eleven v3 में अंतरराष्ट्रीय ध्वन्यात्मक वर्णमाला (IPA) का मूल समर्थन शामिल है। Eleven v3 के साथ IPA में और जानें।

SSML फ़ोनीम टैग (सिर्फ़ Flash v2 और Turbo v2)

Flash v2 और Turbo v2 पर, आप SSML फ़ोनीम टैग के साथ कोई खास उच्चारण तय कर सकते हैं। हम IPA और CMU, दोनों को सपोर्ट करते हैं। मौजूदा इम्प्लीमेंटेशन के साथ CMU थोड़ा ज़्यादा अनुमानित और स्थिर रहता है। अधिक जानकारी के लिए हमारी उच्चारण गाइड देखें।

वैकल्पिक वर्तनी

वैकल्पिक रूप से, आप कोई दूसरी वर्तनी ढूंढकर शब्द को अधिक ध्वन्यात्मक ढंग से लिख सकते हैं। आप बड़े अक्षर, डैश, अपोस्ट्रॉफ़ी या किसी एक अक्षर अथवा अक्षरों के चारों ओर सिंगल कोटेशन मार्क जैसे कई तरीके अपना सकते हैं।

उदाहरण के लिए, “trapezii” जैसे शब्द को “trapezIi” लिखा जा सकता है, ताकि शब्द के “ii” पर ज़्यादा ज़ोर दिया जाए।

Eleven v4 और Eleven v3 ऑडियो टैग को सपोर्ट करते हैं। हम Eleven v4 की सलाह देते हैं। किसी छोटे निर्देश को वर्गाकार कोष्ठक में लिखें और उसे टेक्स्ट में वहां रखें जहां डिलीवरी बदलनी चाहिए। दोनों मॉडलों के साथ एक जैसे टैग काम करते हैं।

  • भावनाएं: [curious] [crying] [mischievously]
  • डिलीवरी निर्देश: [whispers] [shouts]
  • मानवीय प्रतिक्रियाएं: [laughs] [clears throat] [sighs]

ज़्यादा जानकारी के लिए हमारी प्रॉम्प्टिंग गाइड देखें।

आप मॉडल ID eleven_v4 या eleven_v3 बताकर हमारे स्पीच बनाएं और स्पीच स्ट्रीम करें एंडपॉइंट के ज़रिए API से जनरेट कर सकते हैं।

कई स्पीकर्स के साथ प्राकृतिक सुनाई देने वाला डायलॉग बनाने के लिए आप हमारे डायलॉग बनाएं और डायलॉग स्ट्रीम करें एंडपॉइंट भी इस्तेमाल कर सकते हैं।

रीयल-टाइम एप्लिकेशन के लिए Eleven v4 Turbo (eleven_v4_turbo) भी ऑडियो टैग को सपोर्ट करता है।

ज़्यादा जानकारी के लिए ये संसाधन देखें:

टेक्स्ट टू स्पीच या वॉइस चेंजर से जनरेट की गई फ़ाइलें MP3, WAV, M4A या FLAC फ़ाइलों के रूप में डाउनलोड की जा सकती हैं। WAV, M4A और FLAC फ़ाइलें आपकी हिस्ट्री से डाउनलोड करनी होंगी।   

WAV फ़ाइलें कैसे डाउनलोड करें

साइडबार में टेक्स्ट टू स्पीच या वॉइस चेंजर चुनें, फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करके अपनी हिस्ट्री देखें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।

अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं।

FLAC या M4A फ़ाइलें कैसे डाउनलोड करें

साइडबार में टेक्स्ट टू स्पीच या वॉइस चेंजर चुनें, फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करके अपनी हिस्ट्री देखें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।

अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं। FLAC और M4A समेत अतिरिक्त फ़ाइल फ़ॉर्मैट देखने के लिए एडवांस्ड पर क्लिक करें और अपना पसंदीदा फ़ॉर्मैट चुनें।

वेबसाइट पर जनरेट करते समय भाषा

जब आप ElevenLabs वेबसाइट पर ऑडियो जनरेट करते हैं, तो हमारा AI आपके प्रॉम्प्ट के टेक्स्ट के संदर्भ के आधार पर भाषा को अपने-आप पहचान लेता है। इसलिए, एक ही प्रॉम्प्ट में कई भाषाओं का इस्तेमाल न करना बेहतर है, क्योंकि इससे यह भ्रम हो सकता है कि किस भाषा का इस्तेमाल किया जाए। फ़िलहाल, वेबसाइट पर जनरेट करते समय भाषा तय करना संभव नहीं है। 

API के ज़रिए जनरेट करते समय भाषा

अगर आप API के ज़रिए ऑडियो जनरेट करते हैं, तो language_code पैरामीटर का इस्तेमाल करके अपने प्रॉम्प्ट की भाषा मैन्युअल रूप से तय कर सकते हैं। यह एक वैकल्पिक पैरामीटर है जो ISO 639-1 भाषा कोड स्वीकार करता है। 

यह छोटे या अस्पष्ट प्रॉम्प्ट के लिए उपयोगी हो सकता है, जैसे जब टेक्स्ट में सिर्फ़ संख्याएं हों। भाषा तय करने से यह सुनिश्चित होता है कि नॉर्मलाइज़र उस भाषा के सही नियम लागू करे।

नॉर्मलाइज़ेशन के बारे में ज़्यादा जानकारी के लिए यह लेख देखें। 

ऐक्सेंट

आपके जनरेशन में इस्तेमाल होने वाला ऐक्सेंट उस वॉइस से आता है जिसका आप इस्तेमाल कर रहे हैं। अगर आप ऐसी वॉइस इस्तेमाल करते हैं जिसे उस भाषा में प्रशिक्षित नहीं किया गया है जिसमें आप जनरेट कर रहे हैं, तो आपको वॉइस की मूल भाषा का हल्का ऐक्सेंट सुनाई दे सकता है।

सबसे अच्छे नतीजों के लिए, हम ऐसी वॉइस इस्तेमाल करने की सलाह देते हैं जिसे आपकी पसंद के ऐक्सेंट के साथ, उसी भाषा के ऑडियो पर प्रशिक्षित किया गया हो जिसमें आप जनरेट कर रहे हैं। इससे AI को उच्चारण और स्वराघात को ज़्यादा सटीकता से समझने में मदद मिलती है।

यह खास तौर पर उन भाषाओं के लिए ज़रूरी है जो एक जैसी हैं या जिनमें कई सामान्य शब्द हैं। सही भाषा पर प्रशिक्षित वॉइस चुनने से यह सुनिश्चित होता है कि AI सही उच्चारण और ऐक्सेंट का इस्तेमाल करे।

आप:

  • अपनी पसंद की भाषा और ऐक्सेंट वाले ऑडियो से क्लोन की गई वॉइस बना सकते हैं।
  • वॉइस लाइब्रेरी देख सकते हैं और अपनी ज़रूरतों के मुताबिक वॉइस ढूंढने के लिए सर्च फ़िल्टर इस्तेमाल कर सकते हैं।

वेबसाइट पर Eleven v3 से जनरेट करने की लागत प्रति कैरेक्टर 1 क्रेडिट है। API जनरेशन पर छूट मिलती है—विवरण के लिए API कीमतें देखें।

ज़्यादा जानकारी के लिए ये संसाधन देखें:

Eleven v4 और Eleven v3 के साथ, आप जनरेट की गई स्पीच में हंसी और अन्य प्रतिक्रियाएं जोड़ने के लिए [laughs] जैसे ऑडियो टैग इस्तेमाल कर सकते हैं। ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।

अन्य मॉडलों के लिए, भावनात्मक डिलीवरी संदर्भ, विराम चिह्न और वॉइस सेटिंग्स पर निर्भर करती है। भावनाएं कैसे पैदा करें? देखें।

मॉडल हर कथन के आसपास के व्यापक संदर्भ के प्रति संवेदनशील है—वह यह देखता है कि कोई बात पिछले और अगले टेक्स्ट से कैसे जुड़ती है। यह व्यापक दृष्टिकोण उसे कई वाक्यों तक फैली किसी सोच को एक समान भावनात्मक पैटर्न के साथ जोड़कर लंबे अंशों में सही स्वराघात देने देता है।

भावनाएं पैदा करने के सुझाव:

  • खास भावनाएं जनरेट करने के लिए संदर्भ अहम है। अगर आप हंसाने वाला या मज़ेदार टेक्स्ट डालते हैं, तो आपको खुश आउटपुट मिल सकता है। यही बात गुस्से, उदासी और अन्य भावनाओं पर भी लागू होती है—संदर्भ तय करना अहम है।
  • आउटपुट की डिलीवरी में विराम चिह्न और वॉइस सेटिंग्स मुख्य भूमिका निभाते हैं।
  • संबंधित शब्दों या वाक्यांशों को उद्धरण चिह्नों में रखकर ज़ोर दें।
  • क्लोन की गई वॉइस से जनरेट की गई स्पीच में, क्लोनिंग के लिए अपलोड किए गए सैंपल्स की बोलने की शैली आउटपुट में दोहराई जाती है। अगर अपलोड किए गए सैंपल की स्पीच एकरस है, तो मॉडल के लिए एक्सप्रेसिव आउटपुट बनाना मुश्किल होगा।

Eleven v4 और Eleven v3 के साथ, आप भावना और डिलीवरी को ज़्यादा सीधे नियंत्रित करने के लिए ऑडियो टैग भी इस्तेमाल कर सकते हैं, जैसे [happy], [sad], [angry], [whispers], और [laughs]। ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।

ये सुझाव भावनात्मक डिलीवरी को दिशा देने में मदद करते हैं, लेकिन किसी खास परिणाम की गारंटी नहीं देते।

दुर्भाग्य से, फ़िलहाल हम जनरेशन-आधारित कटौती के विकल्प के तौर पर डाउनलोड-आधारित कटौती नहीं देते। अभी कोटा काटे बिना जनरेशन का प्रीव्यू करने का कोई तरीका नहीं है।

जब आप वेबसाइट पर ‘Generate’ दबाते हैं, तो आपके क्रेडिट काटे जाएंगे क्योंकि सर्वर को शुरू करना होता है और ऑडियो जनरेट करना होता है। क्रेडिट इस्तेमाल किए बिना, अपने टेक्स्ट से किसी वॉइस को टेस्ट या प्रीव्यू करने का कोई तरीका नहीं है।

हम वेबसाइट के ज़रिए टेक्स्ट टू स्पीच में, नीचे दी गई परिस्थितियों में दो मुफ़्त रीजनरेशन की अनुमति देते हैं:

  • प्रॉम्प्ट (टेक्स्ट टू स्पीच के लिए) या फ़ाइल (वॉइस चेंजर के लिए), वॉइस और मॉडल एक जैसे रहें। आप वॉइस सेटिंग स्लाइडर्स बदल सकते हैं।
  • पहला जनरेशन दो घंटे से कम समय पहले किया गया था।
  • मूल ऑडियो जनरेट करने के बाद आपने पेज रिफ़्रेश नहीं किया है।

अगर ऐसा है, तो आपको ‘Regenerate speech’ दिखाई देगा। ‘Regenerate speech’ बटन पर होवर करने पर बचे हुए मुफ़्त रीजनरेशन की संख्या दिखाई जाएगी:

जब आपके मुफ़्त रीजनरेशन इस्तेमाल हो जाएंगे, तो बटन फिर से ‘Generate speech’ हो जाएगा और जनरेशन के लिए इस्तेमाल होने वाले क्रेडिट की संख्या दिखाई जाएगी:

मुफ़्त रीजनरेशन सिर्फ़ वेबसाइट के ज़रिए टेक्स्ट टू स्पीच में उपलब्ध हैं। ये API के ज़रिए उपलब्ध नहीं हैं।

हम यह देख रहे हैं कि कीमतें या लागत बढ़ाए बिना, इस गुणवत्ता पर प्रीव्यू की सुविधा कैसे दी जा सकती है। हम AI को ज़्यादा नियंत्रित करने योग्य बनाने के तरीके भी खोज रहे हैं, ताकि आपको प्रीव्यू न करना पड़े और उम्मीद है कि पहली कोशिश में ही मनचाहा नतीजा मिल जाए।

Eleven v4 और Eleven v3 में डायलॉग मोड है, जिससे आप बातचीत के संदर्भ के आधार पर रुकावटों, टोन में बदलाव और भावनात्मक संकेतों को संभालने वाली, प्राकृतिक गति के साथ कई स्पीकर्स की गतिशील बातचीत जनरेट कर सकते हैं।

वेबसाइट के ज़रिए कई स्पीकर्स इस्तेमाल करने पर डायलॉग मोड उपलब्ध होता है।

कई स्पीकर्स के इंटरैक्शन जनरेट करने के लिए आप टेक्स्ट टू डायलॉग API एंडपॉइंट भी इस्तेमाल कर सकते हैं। ज़्यादा जानकारी के लिए हमारे API दस्तावेज़ देखें:

ज़्यादा जानकारी के लिए ये संसाधन देखें:

कोई भी वॉइस, AI द्वारा फ़िलहाल समर्थित कोई भी भाषा बोल सकती है; हालांकि, अगर आप ऐसी वॉइस इस्तेमाल नहीं करते जो उस भाषा की मूल वॉइस हो जिसे आप AI से बुलवाना चाहते हैं — उदाहरण के लिए, आप जनरेट की गई वॉइस या अंग्रेज़ी बोलते हुए क्लोन की गई वॉइस का इस्तेमाल करते हैं — तो AI में हल्का अंग्रेज़ी ऐक्सेंट हो सकता है या वह मिलती-जुलती भाषाओं के बीच बदल सकता है।

सभी समर्थित भाषाओं की पूरी सूची के लिए यह लेख देखें: आप किन भाषाओं का समर्थन करते हैं?

मौजूदा मॉडल इस तरह काम करता है कि आप कोई खास भाषा नहीं चुनते। इसके बजाय, आप उस भाषा में लिखते हैं जो आप AI से बुलवाना चाहते हैं, और AI अपने-आप समझ जाता है। हालांकि, अलग-अलग भाषाओं में मिलते-जुलते शब्द और शब्दावली हो सकती है, लेकिन उनके उच्चारण और ऐक्सेंट काफी अलग हो सकते हैं। इसलिए, आपको ऐसी क्लोन की गई वॉइस इस्तेमाल करनी चाहिए जिसे सही ऐक्सेंट के साथ उसी भाषा में बोलते हुए क्लोन किया गया हो। इससे AI को यह समझने के लिए सबसे ज़्यादा संदर्भ मिलता है कि किसी बात को कैसे और किस भाषा में बोलना है।

भाषा टेक्स्ट से तय होती है, जबकि ऐक्सेंट और उच्चारण वॉइस से तय होते हैं।

हम भाषा चुनने की सुविधा देने वाली नई तकनीक विकसित करने पर काम कर रहे हैं, लेकिन AI जिस तरह बनाया गया है, उसके कारण यह सब अभी प्रगति में है।

वेबसाइट पर टेक्स्ट टू स्पीच का इस्तेमाल करके, आप किसी भी पेड प्लान में एक बार में 5,000 कैरेक्टर तक और सभी मुफ़्त प्लान में 2,500 कैरेक्टर तक जनरेट कर सकते हैं।

हालाँकि, अगर आप कुछ हज़ार कैरेक्टर से ज़्यादा लंबा कंटेंट जनरेट करना चाहते हैं, तो हम Studio इस्तेमाल करने की पुरज़ोर सलाह देते हैं। इससे आप किताबों और उपन्यासों जैसा बेहद लंबा कंटेंट आसानी से जनरेट कर सकते हैं। इसके बारे में और जानकारी यहाँ पढ़ें।

अगर आप API से जनरेट कर रहे हैं, तो इनपुट की अधिकतम लंबाई आपके इस्तेमाल किए जा रहे मॉडल के अनुसार अलग-अलग होती है:

टेक्स्ट टू स्पीच

Flash v2.5 - 40,000 कैरेक्टर तक (~40 मिनट का ऑडियो)

Turbo v2.5 - 40,000 कैरेक्टर तक (~40 मिनट का ऑडियो)

Flash v2 - 30,000 कैरेक्टर तक (~30 मिनट का ऑडियो)

Turbo v2 - 30,000 कैरेक्टर तक (~30 मिनट का ऑडियो)

Multilingual v2 - 10,000 कैरेक्टर तक (~10 मिनट का ऑडियो)

वॉइस चेंजर

Multilingual v2 - 10 मिनट तक का ऑडियो

सभी पहले से बनी वॉइस और जनरेट की गई वॉइस अंग्रेज़ी की हैं। इसका मतलब है कि दूसरी भाषाएँ बोलते समय उनका उच्चारण या लहजा सही नहीं हो सकता।

वॉइस लाइब्रेरी में प्रोफेशनल कैटेगरी के तहत आपको समुदाय की हमारे साथ साझा की गई वॉइस मिल सकती हैं। ये वॉइस, अपनी वॉइस के Professional Voice Clones हैं। इन वॉइस पर आम तौर पर उस भाषा का टैग होता है जिसमें उन्हें क्लोन किया गया था, इसलिए वे उस भाषा की मूल वॉइस होती हैं। आप खास भाषाओं के लिए फ़िल्टर करने हेतु भाषा खोज फ़िल्टर भी इस्तेमाल कर सकते हैं।

संख्याएँ, तारीखें, प्रतीक और संक्षिप्ताक्षर AI के लिए चुनौती हो सकते हैं, क्योंकि अक्सर उन्हें सही तरीके से कहने के कई तरीके होते हैं। यह इस्तेमाल की जा रही भाषा पर भी निर्भर कर सकता है। उदाहरण के लिए, “11” को “Eleven” पढ़ा जा सकता है, लेकिन स्पैनिश में “Once” या जर्मन में “Elf” भी पढ़ा जा सकता है।

संख्याओं, तारीखों, संक्षिप्ताक्षरों और प्रतीकों का सही उच्चारण सुनिश्चित करने के कई तरीके हैं।

पूरा लिखें, शब्दों में

सबसे अच्छे नतीजों के लिए, हम संख्याओं, संक्षिप्ताक्षरों, तारीखों और प्रतीकों को पूरे शब्दों में, उसी तरह लिखने की सलाह देते हैं जैसा आप चाहते हैं कि AI उन्हें बोले। इससे AI को सबसे ज़्यादा संदर्भ मिलता है, ताकि वह सही आउटपुट दे सके। उदाहरण के लिए, “$100” के लिए हम “a hundred dollars” या “one hundred dollars” लिखने की सलाह देंगे, ताकि आपको मनचाहा नतीजा मिले।

LLM का इस्तेमाल

अगर आप अपने टेक्स्ट प्रॉम्प्ट जनरेट करने के लिए किसी लार्ज लैंग्वेज मॉडल का इस्तेमाल कर रहे हैं, जैसे ElevenAgents इस्तेमाल करते समय, तो आप मॉडल को प्रॉम्प्ट दे सकते हैं कि वह संख्याएँ, तारीखें, प्रतीक और संक्षिप्ताक्षर हमेशा शब्दों में लिखे, जिस तरह से आप चाहते हैं कि AI उन्हें बोले।

नॉर्मलाइज़ेशन

अगर आप API के ज़रिए जनरेट कर रहे हैं, तो apply_text_normalization पैरामीटर का इस्तेमाल करके तय कर सकते हैं कि टेक्स्ट नॉर्मलाइज़ेशन लागू करना है या नहीं। बेहतर उच्चारण सुनिश्चित करने के लिए टेक्स्ट नॉर्मलाइज़ेशन संख्याओं और तारीखों को शब्दों में लिखता है। इस विकल्प से लेटेंसी बढ़ती है, क्योंकि नॉर्मलाइज़ेशन प्रक्रिया में अतिरिक्त प्रोसेसिंग समय लगता है।

apply_text_normalization पैरामीटर में तीन मोड हैं:

  • on, यानी यह हमेशा लागू होता है
  • off, यानी यह कभी लागू नहीं होता
  • auto, यानी AI अपने-आप तय करता है कि टेक्स्ट नॉर्मलाइज़ेशन कब लागू करना है

आप language_code पैरामीटर से अपने प्रॉम्प्ट की भाषा भी तय कर सकते हैं। यह एक वैकल्पिक पैरामीटर है, जो ISO 639-1 भाषा कोड स्वीकार करता है।

यह छोटे या अस्पष्ट प्रॉम्प्ट के लिए उपयोगी हो सकता है, जैसे जब टेक्स्ट में सिर्फ संख्याएँ या प्रतीक हों। भाषा तय करने से यह सुनिश्चित होता है कि नॉर्मलाइज़र उस भाषा के सही नियम लागू करे।

ज़्यादा जानकारी के लिए, हमारा API रेफरेंस देखें।

वेबसाइट पर टेक्स्ट टू स्पीच से जनरेट करते समय नॉर्मलाइज़ेशन डिफ़ॉल्ट रूप से सक्षम होता है।

Studio में, डिफ़ॉल्ट रूप से नॉर्मलाइज़ेशन अपने-आप लागू होता है, यानी AI तय करता है कि टेक्स्ट नॉर्मलाइज़ेशन कब लागू करना है। आप नॉर्मलाइज़ेशन को हमेशा लागू होने के लिए भी सेट कर सकते हैं - यह विकल्प Project settings में Advanced टैब के तहत है।

गलत उच्चारण कई कारणों से हो सकते हैं। सबसे आम कारण यह है कि शब्द की वर्तनी गलत होती है। AI गलत वर्तनी वाले शब्दों को सुधारने की कोशिश नहीं करेगा और उन्हें ठीक उसी तरह पढ़ने की कोशिश करेगा जैसे वे लिखे गए हैं। इसलिए AI से पढ़वाने से पहले टेक्स्ट को दोबारा जाँचना और प्रूफ़रीड करके पूरा करना ज़रूरी है।

अगर आप कोई खास उच्चारण तय करना चाहते हैं, तो हमारे Flash v2 मॉडल के साथ SSML फ़ोनीम टैग इस्तेमाल कर सकते हैं। इसके बारे में हमारी उच्चारण गाइड में और जानें।

कभी-कभी AI शब्दों का गलत उच्चारण कर सकता है या उसका लहजा अजीब हो सकता है, जो आपकी अपेक्षा वाला नहीं होता। ऐसा कई कारणों से हो सकता है और ज़्यादातर मामलों में यह वॉइस और भाषा पर बहुत निर्भर करता है। सही लहजा और उच्चारण सुनिश्चित करने का सबसे अच्छा तरीका है कि सही लहजे और उच्चारण वाली वॉइस क्लोन की जाए। इससे ऑडियो जनरेट करते समय AI को सबसे ज़्यादा संदर्भ मिलता है।

भाषा टेक्स्ट से तय होती है और लहजा वॉइस से तय होता है। इसलिए, अगर आप ऐसी भाषा में लिख रहे हैं जिसमें दूसरी भाषा के साथ बहुत से शब्द समान हों या जो किसी दूसरी भाषा से काफ़ी मिलती-जुलती हो, तो AI को कुछ शब्दों का उच्चारण समझने या लहजों के बीच बदलने में मुश्किल हो सकती है।

हालाँकि, कुछ परिस्थितियों में AI अंग्रेज़ी में भी सही लिखे शब्दों का गलत उच्चारण कर सकता है। यह इस्तेमाल की गई वॉइस और टेक्स्ट पर बहुत निर्भर लगता है, लेकिन ऐसा बहुत कम होना चाहिए।

No results