For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
ElevenLabs के साथ टेक्स्ट को स्पीच में बदलने की गाइड
ओवरव्यू
ElevenLabs की टेक्स्ट टू स्पीच टेक्नोलॉजी हमारी सेवाओं का अहम हिस्सा है, जो दुनियाभर में अलग-अलग ऐप्लिकेशन्स के लिए उच्च-गुणवत्ता वाली AI-जनरेटेड स्पीच उपलब्ध कराती है। संभव है कि आप हमारी वॉइसेज़ को पहले ही इस्तेमाल होते सुन चुके हों, जो जीवंत ऑडियो अनुभव देती हैं।
टेक्स्ट टू स्पीच से अपना पहला ऑडियो जनरेट करना बहुत आसान है। हालांकि, इस फीचर का पूरा फायदा लेने के लिए आपको कुछ बातें ध्यान में रखनी होंगी।
अपनी ऑडियो फ़ाइल बनाने के लिए ‘Generate’ बटन पर क्लिक करें।
सेटिंग्स
उच्च-गुणवत्ता वाली स्पीच बनाने के लिए वॉइसेज़, मॉडल्स और सेटिंग्स को समझें।
आप जिन सेटिंग्स का इस्तेमाल करते हैं, खासकर वॉइस और मॉडल, वे आउटपुट पर काफी असर डालती हैं। इन्हें समझना और कुछ बेहतरीन तरीकों को जानना बहुत ज़रूरी है। दूसरी सेटिंग्स भी आउटपुट को प्रभावित करती हैं, लेकिन चुनी गई वॉइस और मॉडल की तुलना में उनका असर कम होता है।
महत्व का क्रम इस प्रकार है: वॉइस का चयन सबसे महत्वपूर्ण है, उसके बाद मॉडल का चयन और फिर मॉडल सेटिंग्स। ये सभी और इनका संयोजन आउटपुट को प्रभावित करते हैं।
वॉइसेज़
वॉइसेज़
हम कई तरह की वॉइसेज़ देते हैं, जिनमें चुनी हुई डिफ़ॉल्ट वॉइसेज़, लगभग हर कल्पनीय वॉइस वाली हमारी विशाल वॉइस लाइब्रेरी w, हमारे वॉइस डिज़ाइन टूल से बनाई गई पूरी तरह सिंथेटिक वॉइसेज़, और हमारी दो टेक्नोलॉजी—इंस्टेंट वॉइस क्लोनिंग और प्रोफेशनल वॉइस क्लोनिंग—से बनाई गई आपकी अपनी क्लोन वॉइसेज़ की कलेक्शन शामिल है।
सभी वॉइसेज़ एक जैसी नहीं होतीं और बहुत कुछ उन्हें बनाने के लिए इस्तेमाल किए गए सोर्स ऑडियो पर निर्भर करता है। कुछ वॉइसेज़ बेहतर, अधिक मानवीय परफॉर्मेंस और डिलीवरी देंगी, जबकि कुछ अधिक स्थिर होंगी।
अपने खास कंटेंट के लिए सही वॉइस चुनना बेहद ज़रूरी है। संभवतः यह सबसे अहम फैसला है, जिसका अंतिम आउटपुट पर सबसे बड़ा असर होगा। यह जेंडर, टोन, एक्सेंट, लय और डिलीवरी तय करता है। सही वॉइस चुनने और उसे अच्छी तरह टेस्ट करने में अतिरिक्त समय देना फायदेमंद है, ताकि यह सुनिश्चित हो सके कि वह एक जैसी रहे और आपकी अपेक्षाओं पर खरी उतरे।
किसी खास भाषा में स्पीच जनरेट करने के लिए, वॉइस लाइब्रेरी की उस भाषा की नेटिव वॉइस इस्तेमाल करने या सही एक्सेंट में वह भाषा बोलने वाली वॉइस को क्लोन करने से सबसे अच्छे नतीजे मिलेंगे। तकनीकी रूप से कोई भी वॉइस कोई भी भाषा बोल सकती है, लेकिन उसका मूल एक्सेंट बना रहेगा। उदाहरण के लिए, फ़्रेंच स्पीच जनरेट करने के लिए नेटिव अंग्रेज़ी वॉइस का इस्तेमाल करने पर आउटपुट फ़्रेंच में तो होगा, लेकिन संभवतः अंग्रेज़ी एक्सेंट के साथ, क्योंकि AI को यह सामान्यीकृत करना होता है कि जिस भाषा पर उस वॉइस को ट्रेन नहीं किया गया था, उसमें वह कैसी सुनाई देगी।
अगर आपको कोई वॉइस पसंद है लेकिन आप उसकी डिलीवरी बदलना चाहते हैं, तो हमारा वॉइस रीमिक्सिंग टूल मदद कर सकता है। इससे आप नेचुरल लैंग्वेज प्रॉम्प्ट का इस्तेमाल करके वॉइस की डिलीवरी, लय, टोन, जेंडर और यहाँ तक कि एक्सेंट भी बदल सकते हैं। एक्सेंट बदलते समय, बेस वॉइस और टारगेट एक्सेंट बहुत महत्वपूर्ण होते हैं। नतीजे अलग-अलग हो सकते हैं; कभी यह बिल्कुल सही काम करता है, तो कभी सही नतीजा पाने के लिए कुछ कोशिशें लग सकती हैं।
वॉइस रीमिक्सिंग से आपको बहुत अच्छे नतीजे मिल सकते हैं, लेकिन वे आमतौर पर सही ढंग से क्लोन की गई प्रोफेशनल वॉइस क्लोन जितने अच्छे नहीं होंगे। वे इंस्टेंट वॉइस क्लोन के ज़्यादा करीब होंगे।
ध्यान रखें, वॉइस रीमिक्सिंग सिर्फ़ खास वॉइसेज़ के लिए काम करती है। उदाहरण के लिए, आप वॉइस लाइब्रेरी की वॉइसेज़ को रीमिक्स नहीं कर सकते; आप सिर्फ़ अपनी बनाई वॉइसेज़ या डिफ़ॉल्ट वॉइसेज़ को रीमिक्स कर सकते हैं।
मॉडल्स
मॉडल्स
हम मॉडल्स के दो परिवार देते हैं: स्टैंडर्ड (उच्च-गुणवत्ता) मॉडल्स और बेहद कम लेटेंसी के लिए ऑप्टिमाइज़ किए गए फ़्लैश मॉडल्स। ज़्यादातर परिवारों में सिर्फ़ अंग्रेज़ी और मल्टीलिंगुअल, दोनों वर्ज़न शामिल होते हैं।
Eleven v4 हमारा नवीनतम मॉडल है। यह दो वेरिएंट में आता है: Eleven v4 और Eleven v4 Turbo।
वॉइस चुनने के बाद, मॉडल का चयन आपके अंतिम ऑडियो आउटपुट को प्रभावित करने वाला दूसरा सबसे महत्वपूर्ण कारक है। हम सुझाव देते हैं कि सबसे उपयुक्त विकल्प खोजने के लिए अपनी चुनी हुई वॉइस के साथ अलग-अलग मॉडल्स को टेस्ट करें। हमारे सभी मॉडल्स की अपनी खूबियाँ और सीमाएँ हैं और कुछ वॉइसेज़ के साथ वे दूसरों की तुलना में बेहतर काम करते हैं, इसलिए अच्छा संयोजन ढूँढना ज़रूरी है।
अगर आपका आउटपुट सिर्फ़ अंग्रेज़ी में होगा, तो हम अपने सिर्फ़ अंग्रेज़ी वाले मॉडल्स में से किसी एक का इस्तेमाल करने की पुरज़ोर सलाह देते हैं। इनके साथ काम करना अक्सर आसान होता है, ये अधिक स्थिर होते हैं और आम तौर पर सिर्फ़ अंग्रेज़ी कंटेंट के लिए बेहतर परफॉर्मेंस देते हैं। अगर आपका कंटेंट किसी दूसरी भाषा में होगा या संभावित रूप से मल्टीलिंगुअल होगा, तो आपको मल्टीलिंगुअल मॉडल्स में से किसी एक का इस्तेमाल करना होगा।
सबसे आम सेटिंग में स्टेबिलिटी लगभग 50, सिमिलैरिटी लगभग 75 और स्टाइल 0 रखा जाता है, जिसके बाद बहुत कम बदलाव किए जाते हैं। बेशक, यह सब मूल वॉइस और आपके इच्छित परफॉर्मेंस स्टाइल पर निर्भर करता है।
यह ध्यान रखना ज़रूरी है कि AI गैर-निर्धारक है; स्लाइडर्स को खास वैल्यू पर सेट करने से हर बार एक जैसे नतीजों की गारंटी नहीं मिलती। इसके बजाय, स्लाइडर्स एक रेंज की तरह काम करते हैं और तय करते हैं कि हर जनरेशन के बीच रैंडमाइज़ेशन कितना व्यापक हो सकता है।
स्पीड
स्पीड सेटिंग से आप जनरेट की गई स्पीच की गति बढ़ा या घटा सकते हैं। डिफ़ॉल्ट वैल्यू 1.0 है, यानी स्पीड एडजस्ट नहीं की जाती। 1.0 से कम वैल्यू वॉइस को धीमा करती हैं, न्यूनतम 0.7 तक। 1.0 से अधिक वैल्यू वॉइस को तेज़ करती हैं, अधिकतम 1.2 तक। अत्यधिक वैल्यू जनरेट की गई स्पीच की गुणवत्ता को प्रभावित कर सकती हैं।
Eleven v3 मॉडल के लिए स्पीड उपलब्ध नहीं है।
स्टेबिलिटी
स्टेबिलिटी स्लाइडर तय करता है कि वॉइस कितनी स्थिर है और हर जनरेशन के बीच कितना रैंडमनेस होगा। इस स्लाइडर को कम करने से वॉइस में भावनाओं की रेंज बढ़ती है। जैसा कि पहले बताया गया है, यह मूल वॉइस से भी बहुत प्रभावित होता है। स्लाइडर को बहुत कम सेट करने से अजीब परफॉर्मेंस मिल सकते हैं, जो अत्यधिक रैंडम हों और कैरेक्टर को बहुत तेज़ बोलने पर मजबूर करें। दूसरी ओर, इसे बहुत अधिक सेट करने से सीमित भावनाओं वाली एकरस वॉइस मिल सकती है।
अधिक जीवंत और नाटकीय परफॉर्मेंस के लिए, स्टेबिलिटी स्लाइडर को कम सेट करने और अपनी पसंद की परफॉर्मेंस मिलने तक कुछ बार जनरेट करने की सलाह दी जाती है।
दूसरी ओर, अगर आप अधिक गंभीर परफॉर्मेंस चाहते हैं, जो बहुत अधिक वैल्यू पर लगभग मोनोटोन भी हो, तो स्टेबिलिटी स्लाइडर को अधिक सेट करने की सलाह दी जाती है। चूँकि यह अधिक एकसमान और स्थिर होता है, इसलिए वांछित नतीजा पाने के लिए आमतौर पर आपको उतने सैंपल जनरेट करने की ज़रूरत नहीं पड़ती। अपने लिए सबसे अच्छा विकल्प जानने के लिए प्रयोग करें!
सिमिलैरिटी
सिमिलैरिटी स्लाइडर तय करता है कि AI उसे दोहराने की कोशिश करते समय मूल वॉइस का कितनी बारीकी से पालन करे। अगर मूल ऑडियो खराब गुणवत्ता का है और सिमिलैरिटी स्लाइडर बहुत अधिक सेट है, तो मूल रिकॉर्डिंग में मौजूद आर्टिफ़ैक्ट्स या बैकग्राउंड नॉइज़ को दोहराने की कोशिश में AI उन्हें भी दोबारा उत्पन्न कर सकता है।
Eleven v3 मॉडल के लिए सिमिलैरिटी उपलब्ध नहीं है।
स्टाइल एक्सैजरेशन
नए मॉडल्स के आने के साथ, हमने स्टाइल एक्सैजरेशन सेटिंग भी जोड़ी है। यह सेटिंग मूल स्पीकर के स्टाइल को बढ़ाने की कोशिश करती है। यह अतिरिक्त कंप्यूटेशनल संसाधनों का इस्तेमाल करती है और 0 के अलावा कोई अन्य वैल्यू सेट होने पर लेटेंसी बढ़ा सकती है। यह ध्यान रखना ज़रूरी है कि इस सेटिंग का इस्तेमाल मॉडल को थोड़ा कम स्थिर बना सकता है, क्योंकि यह मूल वॉइस के स्टाइल को उभारने और उसकी नकल करने की कोशिश करता है।
सामान्य तौर पर, हम इस सेटिंग को हमेशा 0 पर रखने की सलाह देते हैं।
स्पीकर बूस्ट
यह सेटिंग मूल स्पीकर से सिमिलैरिटी बढ़ाती है। हालांकि, इस सेटिंग के इस्तेमाल के लिए थोड़ा अधिक कंप्यूटेशनल लोड चाहिए, जिससे लेटेंसी बढ़ जाती है। इस सेटिंग से आने वाले अंतर आमतौर पर काफी सूक्ष्म होते हैं।
Eleven v3 मॉडल के लिए स्पीकर बूस्ट उपलब्ध नहीं है।
जनरेट करें
वॉइस चुनने, मॉडल चुनने और अपनी सेटिंग्स कॉन्फ़िगर करने के बाद, जनरेशन प्रक्रिया आसान है: आप टेक्स्ट डालते हैं, “स्पीच जनरेट करें” दबाते हैं, और फिर ऑडियो जनरेट हो जाता है।
हालाँकि ऊपर से यह प्रक्रिया बहुत आसान लगती है, लेकिन वांछित आउटपुट पाने के लिए आपके द्वारा दिया गया टेक्स्ट इनपुट बेहद महत्वपूर्ण है। ऐसे शब्द इस्तेमाल करने पर जो शायद “डिस्ट्रिब्यूशन से बाहर” हों—यानी ऐसी चीज़ें जिनका AI ने ट्रेनिंग के दौरान शायद ही कभी सामना किया हो—जैसे अजीब नाम, असामान्य संक्षिप्त रूप, सिंबल या इमोजी, AI भ्रमित हो सकता है और आउटपुट अधिक अस्थिर हो सकता है। इमोजी और कुछ सिंबल को सही तरह समझना AI के लिए खास तौर पर मुश्किल होता है।
UI के ज़रिए टेक्स्ट टू स्पीच इस्तेमाल करते समय, हम आपके इनपुट पर एक ऑटोमेटेड नॉर्मलाइज़ेशन स्टेप चलाते हैं, ताकि टेक्स्ट अधिक पठनीय हो और AI के लिए प्रोसेस करना आसान हो। आम तौर पर, यह स्टेप सिंबल्स और नंबरों को लिखे हुए टेक्स्ट में बदल देता है, जिससे AI को सही उच्चारण की जानकारी मिलती है।
एक बेहतरीन तरीका जिसकी हम पुरज़ोर सलाह देते हैं, वह है नंबरों को अंकों में लिखने या सिंबल्स इस्तेमाल करने से बचना, खासकर मल्टीलिंगुअल मॉडल्स इस्तेमाल करते समय (हालाँकि यह सिर्फ़ अंग्रेज़ी वाले मॉडल्स पर भी लागू होता है)। चूँकि नंबर और सिंबल कई भाषाओं में एक जैसे लिखे जाते हैं लेकिन उनका उच्चारण अलग होता है, इसलिए अंकों पर निर्भर रहने से AI के लिए अस्पष्टता पैदा होती है। उदाहरण के लिए, नंबर “1” अंग्रेज़ी और कई अन्य भाषाओं में एक ही तरह लिखा जाता है, लेकिन उसका उच्चारण अलग होता है। नंबर को टेक्स्ट में लिखने से, जैसे “one,” AI को यह समझने की ज़रूरत नहीं पड़ती कि उसे क्या करना है।
हम अधिक उन्नत वर्कफ़्लो पर काम कर रहे हैं, जिनसे आप ऑडियो टैग्स के ज़रिए AI की डिलीवरी और परफॉर्मेंस को प्रभावित कर सकेंगे। यह सुविधा Eleven v4 और Eleven v3 में उपलब्ध है। अगर आप इस सुविधा के बारे में और जानना चाहते हैं, तो हम हमारी प्रॉम्प्टिंग गाइड पढ़ने की सलाह देते हैं।
अक्सर पूछे जाने वाले सवाल
अच्छा इनपुट, अच्छा आउटपुट
पहला और सबसे अहम कारक यह है कि अच्छा, उच्च-गुणवत्ता वाला और एकरूप इनपुट, अच्छा, उच्च-गुणवत्ता वाला और एकरूप आउटपुट देगा।
अगर आप AI को ऐसा ऑडियो देते हैं जो आदर्श से कम है—जैसे बहुत अधिक शोर वाला ऑडियो, साफ़ आवाज़ पर रीवर्ब, कई स्पीकर, या वॉल्यूम, प्रदर्शन और बोलने के तरीके में असंगति—तो AI अधिक अस्थिर हो जाएगा और आउटपुट कम अनुमानित होगा।
अगर आप अपनी वॉइस क्लोन करने की योजना बना रहे हैं, तो हम दृढ़ता से सलाह देते हैं कि सही वॉइस क्लोन बनाने के लिए दस्तावेज़ में दी गई हमारी गाइडलाइंस पढ़ें, क्योंकि इससे आपको शुरुआत के लिए सबसे बेहतर आधार मिलेगा। भले ही आप सिर्फ़ इंस्टेंट वॉइस क्लोन्स का इस्तेमाल करना चाहते हों, प्रोफेशनल वॉइस क्लोनिंग सेक्शन भी पढ़ना अच्छा रहेगा। इस सेक्शन में वॉइस क्लोन बनाने की उपयोगी जानकारी है, हालांकि इन दोनों तकनीकों की आवश्यकताएं थोड़ी अलग हैं।
सही वॉइस इस्तेमाल करें
दूसरा ध्यान देने वाला कारक यह है कि आपके चुने हुए वॉइस का आउटपुट पर बहुत बड़ा असर होगा। जैसा कि पहले कारक में बताया गया है, उस खास क्लोन को बनाने में इस्तेमाल किए गए सैंपल्स की गुणवत्ता और एकरूपता बेहद महत्वपूर्ण है, साथ ही वॉइस की भाषा और टोन भी।
अगर आप ऐसी वॉइस चाहते हैं जो खुश और उत्साही लगे, तो आपको खुश और उत्साही सैंपल्स से क्लोन की गई वॉइस इस्तेमाल करनी चाहिए। इसके उलट, अगर आप आत्मचिंतनशील और गंभीर लगने वाली वॉइस चाहते हैं, तो ऐसी विशेषताओं वाली वॉइस चुनें।
हालांकि, सही भाषा में प्रशिक्षित वॉइस का इस्तेमाल करना भी बहुत ज़रूरी है। उदाहरण के लिए, डिफ़ॉल्ट वॉइस के रूप में हमारे सभी प्रोफेशनल वॉइस क्लोन अंग्रेज़ी वॉइस हैं और उन्हें अंग्रेज़ी सैंपल्स पर प्रशिक्षित किया गया है। इसलिए, अगर आप उनसे दूसरी भाषाएं बुलवाते हैं, तो उन भाषाओं में उनका प्रदर्शन अनुमानित नहीं हो सकता। ऐसी वॉइस इस्तेमाल करना ज़रूरी है जिसे उन सैंपल्स से क्लोन किया गया हो जिनमें वॉइस वही भाषा बोल रही थी जो आप AI से बुलवाना चाहते हैं।
सही फ़ॉर्मैटिंग इस्तेमाल करें
यह थोड़ा मामूली लग सकता है, लेकिन इससे बड़ा फर्क पड़ सकता है। AI टेक्स्ट के संदर्भ के आधार पर यह समझने की कोशिश करता है कि किसी चीज़ को कैसे पढ़ना है। इसमें सिर्फ़ इस्तेमाल किए गए शब्द ही नहीं, बल्कि उन्हें जोड़ने का तरीका, विराम चिह्नों का इस्तेमाल, व्याकरण और टेक्स्ट की सामान्य फ़ॉर्मैटिंग भी शामिल है।
इससे AI के बोलने के तरीके पर छोटा लेकिन प्रभावशाली असर पड़ सकता है। अगर आप किसी शब्द की वर्तनी गलत लिखते हैं, तो AI उसे ठीक नहीं करेगा और उसे लिखे हुए तरीके से ही पढ़ने की कोशिश करेगा।
अनियत
AI की सेटिंग्स अनियत होती हैं, यानी समान शुरुआती स्थितियों (वॉइस, सेटिंग्स, मॉडल) में भी यह आपको थोड़ा अलग आउटपुट दे सकता है, ठीक वैसे ही जैसे कोई वॉइस ऐक्टर हर बार थोड़ा अलग प्रदर्शन करता है।
यह भिन्नता कई कारकों के कारण हो सकती है, जैसे पहले बताए गए विकल्प: वॉइस, सेटिंग्स, मॉडल। आम तौर पर, इस भिन्नता की सीमा को स्टेबिलिटी स्लाइडर से नियंत्रित किया जा सकता है। कम स्टेबिलिटी सेटिंग का मतलब है कि जनरेशन के बीच भिन्नता की सीमा अधिक होगी, लेकिन इससे अलग-अलग जनरेशन के बीच भी भिन्नता आती है, जिसमें AI थोड़ा अधिक अभिव्यंजक हो सकता है।
अधिक भिन्नता अक्सर वांछनीय हो सकती है, क्योंकि स्टेबिलिटी को बहुत अधिक सेट करने से कुछ वॉइस एकरस लग सकती हैं, क्योंकि इससे AI को अधिक विविध कंटेंट जनरेट करने की उतनी गुंजाइश नहीं मिलती। हालांकि, स्टेबिलिटी को बहुत कम करने से दूसरी समस्याएं भी आ सकती हैं, जिनमें जनरेशन अस्थिर हो जाती हैं, खासकर उन कुछ वॉइस के साथ जिनकी क्लोनिंग प्रक्रिया में आदर्श से कम ऑडियो इस्तेमाल हुआ हो।
ज़्यादातर उपयोगों के लिए 50 की डिफ़ॉल्ट सेटिंग आम तौर पर एक शानदार शुरुआती बिंदु है।
Eleven v4 क्या है?
हम Eleven v4 पर स्विच करने और अपने कंटेंट के साथ इसका परीक्षण करने की सलाह देते हैं।
Eleven v4 हमारा नवीनतम और सबसे उन्नत टेक्स्ट टू स्पीच मॉडल है और मॉडल्स की नई पीढ़ी में पहला है। Eleven v3 की तुलना में यह आउटपुट क्वालिटी, वॉइस की सटीकता, भावनाओं, ऑडियो टैग और भाषाओं के कवरेज को बेहतर बनाता है।
Eleven v4 के साथ वॉइस क्लोनिंग की सटीकता में बड़ा सुधार हुआ है। क्लोन की गई आवाज़ें स्रोत आवाज़ की विशेषताओं — टिंबर, लय और डिलीवरी — को पिछले किसी भी मॉडल से अधिक सटीकता से कैप्चर करती हैं।
Eleven v4 में Instant Voice Clones (IVCs) पहले से अधिक सटीक हैं। वे स्रोत आवाज़ की परिभाषित विशेषताओं को अधिक सटीकता से कैप्चर करते हैं, जिससे छोटे ऑडियो सैंपल से जल्दी विश्वसनीय क्लोन बनाना आसान हो जाता है।
Eleven v4 में Professional Voice Clones (PVCs) पूरी तरह समर्थित हैं। वे वॉइस सटीकता में हुई इन्हीं प्रगतियों पर आधारित हैं और उन workflows के लिए स्रोत आवाज़ की अधिक सटीक प्रतिकृति देते हैं जिनमें सबसे उच्च स्तर की निरंतरता और नियंत्रण चाहिए।
Eleven v4 के दो वेरिएंट हैं, ताकि आप अपने उपयोग के मामले के लिए क्वालिटी और स्पीड का सही संतुलन चुन सकें:
Eleven v4 (eleven_v4) — हमारा सबसे उच्च-गुणवत्ता वाला मॉडल, जो कंटेंट बनाने, ऑडियोबुक, किरदारों के वॉइसओवर और ऐसे किसी भी उपयोग के मामले के लिए आदर्श है जहां क्वालिटी सबसे अहम हो।
Eleven v4 Turbo (eleven_v4_turbo) — बेहद कम लेटेंसी बनाए रखते हुए अत्यंत उच्च क्वालिटी देता है, और कन्वर्सेशनल एजेंट्स तथा इंटरैक्टिव वॉइस अनुभवों जैसे रीयल-टाइम उपयोग के मामलों के लिए खास तौर पर बनाया गया है।
दोनों वेरिएंट दो वॉइस सेटिंग्स का उपयोग करते हैं: Stability और Similarity। Eleven v4 में Style और Speed स्लाइडर उपलब्ध नहीं हैं और SSML समर्थित नहीं है।
जब आपकी जनरेट की जा रही भाषा आपकी रेफरेंस वॉइस की भाषा से मेल खाती है, तो मूल एक्सेंट पहले की तरह ही बना रहता है। जब आप जिस भाषा में जनरेट कर रहे हैं वह रेफरेंस वॉइस की भाषा से अलग होती है, तो Eleven v4 लक्ष्य भाषा में धाराप्रवाह, प्राकृतिक लगने वाली आवाज़ बनाता है — रेफरेंस वॉइस के मूल भाषा वाले एक्सेंट को साथ ले जाने के बजाय।
क्लोनिंग, एक्सेंट, तुलना और पूरे विवरण के लिए Eleven v4 देखें। टैग और प्रॉम्प्टिंग के लिए Prompting Eleven v4 देखें।
Eleven v3 क्या है?
हम Eleven
v4 पर स्विच करने और अपने कंटेंट के साथ इसका परीक्षण करने की सलाह देते हैं। Eleven
v4 के लिए कई प्रॉम्प्टिंग तकनीकें
Eleven v3 पर भी लागू होती हैं।
Eleven v3 भावनात्मक रूप से समृद्ध और अभिव्यंजक टेक्स्ट टू स्पीच मॉडल है। यह 70+ भाषाओं में व्यापक भावनात्मक रेंज और संदर्भ की समझ के साथ प्राकृतिक, जीवंत आवाज़ बनाता है।
वॉइस की गति नियंत्रित करने की सुविधा स्पीच सिंथेसिस, स्टूडियो, ElevenAgents और हमारे API के ज़रिए टेक्स्ट टू स्पीच में उपलब्ध है।
आप Speed सेटिंग का इस्तेमाल करके वॉइस की गति नियंत्रित कर सकते हैं।
संभावित मान 0.7 से 1.2 तक होते हैं। 1 से कम मान स्पीच को धीमा करेंगे और 1 से ज़्यादा मान उसे तेज़ करेंगे। बहुत ज़्यादा या बहुत कम मान जनरेट की गई स्पीच की क्वालिटी को प्रभावित कर सकते हैं।
यह सेटिंग सभी वॉइस और सभी मॉडल के लिए उपलब्ध है। यह आपको वॉइस सेटिंग्स में मिलेगी।
API का इस्तेमाल करते समय स्पीच को नियंत्रित करने की जानकारी के लिए हमारा API रेफरेंस देखें।
क्या मैं अलग-अलग भाषाओं में एक ही क्लोन की गई/डिज़ाइन की गई वॉइस इस्तेमाल कर सकता हूं?
कोई भी वॉइस किसी भी समर्थित भाषा को बोल सकती है।
वर्तमान मॉडल ऐसे काम करता है कि आपको कोई खास भाषा चुनने की ज़रूरत नहीं होती। आप बस उस भाषा में लिखते हैं जिसमें आप AI से बुलवाना चाहते हैं और AI उसे अपने-आप समझ लेता है। हालांकि, अलग-अलग भाषाओं में कुछ समान शब्द और शब्दावली हो सकती है, लेकिन उनके उच्चारण और एक्सेंट काफी अलग हो सकते हैं। इसलिए आपको ऐसी क्लोन की गई वॉइस इस्तेमाल करनी चाहिए जिसे सही एक्सेंट वाली भाषा बोलते हुए क्लोन किया गया हो।
भाषा टेक्स्ट से तय होती है, जबकि एक्सेंट और उच्चारण वॉइस से तय होते हैं। बेहतर ढंग से काम करने के लिए इसे दोनों संदर्भों की ज़रूरत होती है।
हम भाषा चुनने को आसान बनाने के लिए नई तकनीक विकसित करने पर काम कर रहे हैं, लेकिन AI के काम करने के तरीके की वजह से यह अभी प्रगति पर है।
मैं टेक्स्ट टू स्पीच से जनरेट की गई फ़ाइलें कैसे डाउनलोड करूं?
आप जनरेट की गई फ़ाइलें दो तरीकों से डाउनलोड कर सकते हैं:
कंटेंट जनरेट करने के बाद, नीचे दाईं ओर मौजूद डाउनलोड बटन पर क्लिक करके आप तुरंत जनरेट की गई फ़ाइल डाउनलोड कर सकते हैं।
पहले जनरेट की गई फ़ाइलें आपकी हिस्ट्री से डाउनलोड की जा सकती हैं।
अपनी हिस्ट्री देखने के लिए अपने अकाउंट में लॉग इन करें और साइडबार में टेक्स्ट टू स्पीच चुनें। फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।
अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 (128kbps) या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं।
अतिरिक्त फ़ाइल फ़ॉर्मैट में डाउनलोड करने के लिए आप एडवांस्ड पर भी क्लिक कर सकते हैं:
MP3 (192kbps)
MP3 (256kbps)
M4A
FLAC
क्या आप वॉइस से सांस लेने की आवाज़ बनवा सकते हैं?
हां। Eleven v4 और Eleven v3 के साथ, आप जनरेट की गई स्पीच में सांस लेने और ऐसी ही प्रतिक्रियाएं जोड़ने के लिए [sighs] या [exhales] जैसे ऑडियो टैग इस्तेमाल कर सकते हैं।
ऑडियो टैग और डिलीवरी कंट्रोल की ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।
क्या आप बातचीत या चैटबॉट्स के लिए AI मॉडल देते हैं?
हमारे Flash और Turbo मॉडल खास तौर पर कम लेटेंसी वाले ऐप्लिकेशन के लिए विकसित किए गए हैं।
Flash v2 और Flash v2.5 हमारे बेहद कम लेटेंसी वाले मॉडल हैं, जो 75ms से कम समय में ऑडियो जनरेट करते हैं। Flash v2 सिर्फ़ अंग्रेज़ी के लिए है, जबकि Flash v2.5 32 भाषाओं को सपोर्ट करता है। सभी समर्थित भाषाओं की पूरी सूची
यहाँ देख सकते हैं।
हमारे Turbo मॉडल भी कम लेटेंसी वाले हैं, लेकिन Flash मॉडल बहुत मिलते-जुलते नतीजे देते हैं, इसलिए हम Turbo के बजाय Flash मॉडल इस्तेमाल करने की सलाह देते हैं। Turbo v2 सिर्फ़ अंग्रेज़ी के लिए है, जबकि Turbo v2.5 32 भाषाओं को सपोर्ट करता है और Turbo v2 से 25% तेज़ है। यह लगभग 300ms में ऑडियो जनरेट करता है।
Flash और Turbo, दोनों ही बहुत अनुकूलित मॉडल हैं। इन्हें खास तौर पर वॉइस प्रदर्शन से समझौता किए बिना और हमारे मॉडल से लोगों की अपेक्षित क्वालिटी बनाए रखते हुए, कम लेटेंसी वाले ऐप्लिकेशन के लिए तैयार किया गया है।
API के ज़रिए जनरेट करने पर दोनों मॉडल पर छूट मिलती है। जानकारी के लिए हमारी API Pricing देखें।
हम कस्टमाइज़्ड, इंटरैक्टिव वॉइस एजेंट डिप्लॉय करने के लिए अपना प्लेटफ़ॉर्म ElevenAgents भी देते हैं। अधिक जानने के लिए हमारे ElevenAgents दस्तावेज़ देखें।
मैं पॉज़ कैसे जोड़ूं?
विराम या ठहराव जोड़ने और स्पीकर की लय व गति को प्रभावित करने के कुछ तरीके हैं। आप कौन-सा तरीका अपनाते हैं, यह मॉडल पर निर्भर करता है।
ऑडियो टैग (Eleven v4 और Eleven v3)
Eleven v4 और Eleven v3 के साथ, गति और डिलीवरी को नियंत्रित करने के लिए ऑडियो टैग और विराम चिह्न इस्तेमाल करें। ये मॉडल SSML ब्रेक टैग को सपोर्ट नहीं करते।
विराम और डिलीवरी के लिए प्रॉम्प्टिंग की जानकारी हेतु प्रॉम्प्टिंग गाइड देखें।
ब्रेक टैग (Multilingual v2, Flash v2, और Flash v2.5)
Multilingual v2, Flash v2 और Flash v2.5 में विराम जोड़ने का सबसे भरोसेमंद तरीका SSML ब्रेक टैग सिंटैक्स <break time="1.5s" /> है। इससे स्पीच में सटीक और प्राकृतिक विराम बनता है। यह सिर्फ़ शब्दों के बीच डाली गई चुप्पी नहीं है—मॉडल सिंटैक्स को समझता है और प्राकृतिक विराम जोड़ता है।
मॉडल इन विरामों को कैसे संभालता है, इसमें अंतर हो सकता है। इस्तेमाल की गई वॉइस आउटपुट में अहम भूमिका निभाती है। कुछ वॉइस, जिन्हें कुछ “uh” और “ah” के साथ ट्रेन किया गया है, विराम के दौरान असली वक्ता की तरह ऐसी वोकल आदतें जोड़ सकती हैं।
एक उदाहरण ऐसा हो सकता है:
“मुझे इसके बारे में सोचने के लिए एक सेकंड दीजिए।” <break time="1.0s" /> “हां, यह काम करेगा।”
ब्रेक समय सेकंड में बताया जाना चाहिए। AI 3 सेकंड तक के विराम संभाल सकता है और इसे टेक्स्ट टू स्पीच तथा API के ज़रिए इस्तेमाल किया जा सकता है।
अगर आप टेक्स्ट में बहुत ज़्यादा SSML ब्रेक इस्तेमाल करते हैं, तो समस्याएं हो सकती हैं। स्पीच तेज़ हो सकती है, या ऑडियो में ज़्यादा शोर और अन्य आर्टिफैक्ट आ सकते हैं। हम इसे ठीक करने पर काम कर रहे हैं।
विराम चिह्न
ये विकल्प ब्रेक टैग या ऑडियो टैग से कम भरोसेमंद हैं, लेकिन फिर भी गति को प्रभावित कर सकते हैं।
साधारण डैश - या एम डैश — अक्सर अच्छी तरह काम करता है। लंबे विराम के लिए आप कई डैश, जैसे -- --, जोड़ सकते हैं।
“अब - बहुत - देर हो रही है।”
एलिप्सिस ... कभी-कभी शब्दों के बीच विराम जोड़ सकता है, लेकिन आमतौर पर यह वॉइस में कुछ झिझक या घबराहट भी जोड़ता है, जो हमेशा उपयुक्त नहीं होती।
“मैं… हां, शायद ऐसा ही है…”
मैं किसी शब्द या नाम का एक खास उच्चारण कैसे तय करूं?
Eleven v3 में अंतरराष्ट्रीय ध्वन्यात्मक वर्णमाला (IPA) का मूल समर्थन शामिल है। Eleven v3 के साथ IPA में और जानें।
SSML फ़ोनीम टैग (सिर्फ़ Flash v2 और Turbo v2)
Flash v2 और Turbo v2 पर, आप SSML फ़ोनीम टैग के साथ कोई खास उच्चारण तय कर सकते हैं। हम IPA और CMU, दोनों को सपोर्ट करते हैं। मौजूदा इम्प्लीमेंटेशन के साथ CMU थोड़ा ज़्यादा अनुमानित और स्थिर रहता है। अधिक जानकारी के लिए हमारी उच्चारण गाइड देखें।
वैकल्पिक वर्तनी
वैकल्पिक रूप से, आप कोई दूसरी वर्तनी ढूंढकर शब्द को अधिक ध्वन्यात्मक ढंग से लिख सकते हैं। आप बड़े अक्षर, डैश, अपोस्ट्रॉफ़ी या किसी एक अक्षर अथवा अक्षरों के चारों ओर सिंगल कोटेशन मार्क जैसे कई तरीके अपना सकते हैं।
उदाहरण के लिए, “trapezii” जैसे शब्द को “trapezIi” लिखा जा सकता है, ताकि शब्द के “ii” पर ज़्यादा ज़ोर दिया जाए।
Eleven v3 और v4 के साथ ऑडियो टैग कैसे काम करते हैं?
Eleven v4 और Eleven v3 ऑडियो टैग को सपोर्ट करते हैं। हम Eleven v4 की सलाह देते हैं। किसी छोटे निर्देश को वर्गाकार कोष्ठक में लिखें और उसे टेक्स्ट में वहां रखें जहां डिलीवरी बदलनी चाहिए। दोनों मॉडलों के साथ एक जैसे टैग काम करते हैं।
टेक्स्ट टू स्पीच या वॉइस चेंजर से जनरेट की गई फ़ाइलें MP3, WAV, M4A या FLAC फ़ाइलों के रूप में डाउनलोड की जा सकती हैं। WAV, M4A और FLAC फ़ाइलें आपकी हिस्ट्री से डाउनलोड करनी होंगी।
WAV फ़ाइलें कैसे डाउनलोड करें
साइडबार में टेक्स्ट टू स्पीच या वॉइस चेंजर चुनें, फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करके अपनी हिस्ट्री देखें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।
अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं।
FLAC या M4A फ़ाइलें कैसे डाउनलोड करें
साइडबार में टेक्स्ट टू स्पीच या वॉइस चेंजर चुनें, फिर स्क्रीन के दाईं ओर के पैनल में हिस्ट्री टैब पर क्लिक करके अपनी हिस्ट्री देखें। संकरी स्क्रीन पर, आप स्पीच जनरेट करें बटन के ऊपर मौजूद हिस्ट्री आइकन पर क्लिक करके अपनी हिस्ट्री देख सकते हैं।
अपनी हिस्ट्री से, आप डाउनलोड आइकन पर क्लिक करके MP3 या WAV फ़ाइल के रूप में डाउनलोड करने का विकल्प देख सकते हैं। FLAC और M4A समेत अतिरिक्त फ़ाइल फ़ॉर्मैट देखने के लिए एडवांस्ड पर क्लिक करें और अपना पसंदीदा फ़ॉर्मैट चुनें।
मैं भाषा और एक्सेंट कैसे चुनूं?
वेबसाइट पर जनरेट करते समय भाषा
जब आप ElevenLabs वेबसाइट पर ऑडियो जनरेट करते हैं, तो हमारा AI आपके प्रॉम्प्ट के टेक्स्ट के संदर्भ के आधार पर भाषा को अपने-आप पहचान लेता है। इसलिए, एक ही प्रॉम्प्ट में कई भाषाओं का इस्तेमाल न करना बेहतर है, क्योंकि इससे यह भ्रम हो सकता है कि किस भाषा का इस्तेमाल किया जाए। फ़िलहाल, वेबसाइट पर जनरेट करते समय भाषा तय करना संभव नहीं है।
API के ज़रिए जनरेट करते समय भाषा
अगर आप API के ज़रिए ऑडियो जनरेट करते हैं, तो language_code पैरामीटर का इस्तेमाल करके अपने प्रॉम्प्ट की भाषा मैन्युअल रूप से तय कर सकते हैं। यह एक वैकल्पिक पैरामीटर है जो ISO 639-1 भाषा कोड स्वीकार करता है।
यह छोटे या अस्पष्ट प्रॉम्प्ट के लिए उपयोगी हो सकता है, जैसे जब टेक्स्ट में सिर्फ़ संख्याएं हों। भाषा तय करने से यह सुनिश्चित होता है कि नॉर्मलाइज़र उस भाषा के सही नियम लागू करे।
नॉर्मलाइज़ेशन के बारे में ज़्यादा जानकारी के लिए यह लेख देखें।
ऐक्सेंट
आपके जनरेशन में इस्तेमाल होने वाला ऐक्सेंट उस वॉइस से आता है जिसका आप इस्तेमाल कर रहे हैं। अगर आप ऐसी वॉइस इस्तेमाल करते हैं जिसे उस भाषा में प्रशिक्षित नहीं किया गया है जिसमें आप जनरेट कर रहे हैं, तो आपको वॉइस की मूल भाषा का हल्का ऐक्सेंट सुनाई दे सकता है।
सबसे अच्छे नतीजों के लिए, हम ऐसी वॉइस इस्तेमाल करने की सलाह देते हैं जिसे आपकी पसंद के ऐक्सेंट के साथ, उसी भाषा के ऑडियो पर प्रशिक्षित किया गया हो जिसमें आप जनरेट कर रहे हैं। इससे AI को उच्चारण और स्वराघात को ज़्यादा सटीकता से समझने में मदद मिलती है।
यह खास तौर पर उन भाषाओं के लिए ज़रूरी है जो एक जैसी हैं या जिनमें कई सामान्य शब्द हैं। सही भाषा पर प्रशिक्षित वॉइस चुनने से यह सुनिश्चित होता है कि AI सही उच्चारण और ऐक्सेंट का इस्तेमाल करे।
आप:
अपनी पसंद की भाषा और ऐक्सेंट वाले ऑडियो से क्लोन की गई वॉइस बना सकते हैं।
वॉइस लाइब्रेरी देख सकते हैं और अपनी ज़रूरतों के मुताबिक वॉइस ढूंढने के लिए सर्च फ़िल्टर इस्तेमाल कर सकते हैं।
Eleven v3 (Alpha) का इस्तेमाल करके जनरेट करने की लागत कितनी है?
वेबसाइट पर Eleven v3 से जनरेट करने की लागत प्रति कैरेक्टर 1 क्रेडिट है। API जनरेशन पर छूट मिलती है—विवरण के लिए API कीमतें देखें।
Eleven v4 और Eleven v3 के साथ, आप जनरेट की गई स्पीच में हंसी और अन्य प्रतिक्रियाएं जोड़ने के लिए [laughs] जैसे ऑडियो टैग इस्तेमाल कर सकते हैं। ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।
अन्य मॉडलों के लिए, भावनात्मक डिलीवरी संदर्भ, विराम चिह्न और वॉइस सेटिंग्स पर निर्भर करती है। भावनाएं कैसे पैदा करें? देखें।
भावनाएं कैसे व्यक्त करें?
मॉडल हर कथन के आसपास के व्यापक संदर्भ के प्रति संवेदनशील है—वह यह देखता है कि कोई बात पिछले और अगले टेक्स्ट से कैसे जुड़ती है। यह व्यापक दृष्टिकोण उसे कई वाक्यों तक फैली किसी सोच को एक समान भावनात्मक पैटर्न के साथ जोड़कर लंबे अंशों में सही स्वराघात देने देता है।
भावनाएं पैदा करने के सुझाव:
खास भावनाएं जनरेट करने के लिए संदर्भ अहम है। अगर आप हंसाने वाला या मज़ेदार टेक्स्ट डालते हैं, तो आपको खुश आउटपुट मिल सकता है। यही बात गुस्से, उदासी और अन्य भावनाओं पर भी लागू होती है—संदर्भ तय करना अहम है।
आउटपुट की डिलीवरी में विराम चिह्न और वॉइस सेटिंग्स मुख्य भूमिका निभाते हैं।
संबंधित शब्दों या वाक्यांशों को उद्धरण चिह्नों में रखकर ज़ोर दें।
क्लोन की गई वॉइस से जनरेट की गई स्पीच में, क्लोनिंग के लिए अपलोड किए गए सैंपल्स की बोलने की शैली आउटपुट में दोहराई जाती है। अगर अपलोड किए गए सैंपल की स्पीच एकरस है, तो मॉडल के लिए एक्सप्रेसिव आउटपुट बनाना मुश्किल होगा।
Eleven v4 और Eleven v3 के साथ, आप भावना और डिलीवरी को ज़्यादा सीधे नियंत्रित करने के लिए ऑडियो टैग भी इस्तेमाल कर सकते हैं, जैसे [happy], [sad], [angry], [whispers], और [laughs]। ज़्यादा जानकारी के लिए प्रॉम्प्टिंग गाइड देखें।
ये सुझाव भावनात्मक डिलीवरी को दिशा देने में मदद करते हैं, लेकिन किसी खास परिणाम की गारंटी नहीं देते।
क्या डाउनलोड करने से पहले कोटा गंवाए बिना ऑडियो का प्रीव्यू करने का कोई तरीका है?
दुर्भाग्य से, फ़िलहाल हम जनरेशन-आधारित कटौती के विकल्प के तौर पर डाउनलोड-आधारित कटौती नहीं देते। अभी कोटा काटे बिना जनरेशन का प्रीव्यू करने का कोई तरीका नहीं है।
जब आप वेबसाइट पर ‘Generate’ दबाते हैं, तो आपके क्रेडिट काटे जाएंगे क्योंकि सर्वर को शुरू करना होता है और ऑडियो जनरेट करना होता है। क्रेडिट इस्तेमाल किए बिना, अपने टेक्स्ट से किसी वॉइस को टेस्ट या प्रीव्यू करने का कोई तरीका नहीं है।
हम वेबसाइट के ज़रिए टेक्स्ट टू स्पीच में, नीचे दी गई परिस्थितियों में दो मुफ़्त रीजनरेशन की अनुमति देते हैं:
प्रॉम्प्ट (टेक्स्ट टू स्पीच के लिए) या फ़ाइल (वॉइस चेंजर के लिए), वॉइस और मॉडल एक जैसे रहें। आप वॉइस सेटिंग स्लाइडर्स बदल सकते हैं।
पहला जनरेशन दो घंटे से कम समय पहले किया गया था।
मूल ऑडियो जनरेट करने के बाद आपने पेज रिफ़्रेश नहीं किया है।
अगर ऐसा है, तो आपको ‘Regenerate speech’ दिखाई देगा। ‘Regenerate speech’ बटन पर होवर करने पर बचे हुए मुफ़्त रीजनरेशन की संख्या दिखाई जाएगी:
जब आपके मुफ़्त रीजनरेशन इस्तेमाल हो जाएंगे, तो बटन फिर से ‘Generate speech’ हो जाएगा और जनरेशन के लिए इस्तेमाल होने वाले क्रेडिट की संख्या दिखाई जाएगी:
मुफ़्त रीजनरेशन सिर्फ़ वेबसाइट के ज़रिए टेक्स्ट टू स्पीच में उपलब्ध हैं। ये API के ज़रिए उपलब्ध नहीं हैं।
हम यह देख रहे हैं कि कीमतें या लागत बढ़ाए बिना, इस गुणवत्ता पर प्रीव्यू की सुविधा कैसे दी जा सकती है। हम AI को ज़्यादा नियंत्रित करने योग्य बनाने के तरीके भी खोज रहे हैं, ताकि आपको प्रीव्यू न करना पड़े और उम्मीद है कि पहली कोशिश में ही मनचाहा नतीजा मिल जाए।
डायलॉग मोड क्या है?
Eleven v4 और Eleven v3 में डायलॉग मोड है, जिससे आप बातचीत के संदर्भ के आधार पर रुकावटों, टोन में बदलाव और भावनात्मक संकेतों को संभालने वाली, प्राकृतिक गति के साथ कई स्पीकर्स की गतिशील बातचीत जनरेट कर सकते हैं।
वेबसाइट के ज़रिए कई स्पीकर्स इस्तेमाल करने पर डायलॉग मोड उपलब्ध होता है।
कई स्पीकर्स के इंटरैक्शन जनरेट करने के लिए आप टेक्स्ट टू डायलॉग API एंडपॉइंट भी इस्तेमाल कर सकते हैं। ज़्यादा जानकारी के लिए हमारे API दस्तावेज़ देखें:
कोई भी वॉइस, AI द्वारा फ़िलहाल समर्थित कोई भी भाषा बोल सकती है; हालांकि, अगर आप ऐसी वॉइस इस्तेमाल नहीं करते जो उस भाषा की मूल वॉइस हो जिसे आप AI से बुलवाना चाहते हैं — उदाहरण के लिए, आप जनरेट की गई वॉइस या अंग्रेज़ी बोलते हुए क्लोन की गई वॉइस का इस्तेमाल करते हैं — तो AI में हल्का अंग्रेज़ी ऐक्सेंट हो सकता है या वह मिलती-जुलती भाषाओं के बीच बदल सकता है।
मौजूदा मॉडल इस तरह काम करता है कि आप कोई खास भाषा नहीं चुनते। इसके बजाय, आप उस भाषा में लिखते हैं जो आप AI से बुलवाना चाहते हैं, और AI अपने-आप समझ जाता है। हालांकि, अलग-अलग भाषाओं में मिलते-जुलते शब्द और शब्दावली हो सकती है, लेकिन उनके उच्चारण और ऐक्सेंट काफी अलग हो सकते हैं। इसलिए, आपको ऐसी क्लोन की गई वॉइस इस्तेमाल करनी चाहिए जिसे सही ऐक्सेंट के साथ उसी भाषा में बोलते हुए क्लोन किया गया हो। इससे AI को यह समझने के लिए सबसे ज़्यादा संदर्भ मिलता है कि किसी बात को कैसे और किस भाषा में बोलना है।
भाषा टेक्स्ट से तय होती है, जबकि ऐक्सेंट और उच्चारण वॉइस से तय होते हैं।
हम भाषा चुनने की सुविधा देने वाली नई तकनीक विकसित करने पर काम कर रहे हैं, लेकिन AI जिस तरह बनाया गया है, उसके कारण यह सब अभी प्रगति में है।
मैं अधिकतम कितने कैरेक्टर और टेक्स्ट जनरेट कर सकता हूं?
वेबसाइट पर टेक्स्ट टू स्पीच का इस्तेमाल करके, आप किसी भी पेड प्लान में एक बार में 5,000 कैरेक्टर तक और सभी मुफ़्त प्लान में 2,500 कैरेक्टर तक जनरेट कर सकते हैं।
हालाँकि, अगर आप कुछ हज़ार कैरेक्टर से ज़्यादा लंबा कंटेंट जनरेट करना चाहते हैं, तो हम Studio इस्तेमाल करने की पुरज़ोर सलाह देते हैं। इससे आप किताबों और उपन्यासों जैसा बेहद लंबा कंटेंट आसानी से जनरेट कर सकते हैं। इसके बारे में और जानकारी यहाँ पढ़ें।
अगर आप API से जनरेट कर रहे हैं, तो इनपुट की अधिकतम लंबाई आपके इस्तेमाल किए जा रहे मॉडल के अनुसार अलग-अलग होती है:
टेक्स्ट टू स्पीच
Flash v2.5 - 40,000 कैरेक्टर तक (~40 मिनट का ऑडियो)
Turbo v2.5 - 40,000 कैरेक्टर तक (~40 मिनट का ऑडियो)
Flash v2 - 30,000 कैरेक्टर तक (~30 मिनट का ऑडियो)
Turbo v2 - 30,000 कैरेक्टर तक (~30 मिनट का ऑडियो)
Multilingual v2 - 10,000 कैरेक्टर तक (~10 मिनट का ऑडियो)
वॉइस चेंजर
Multilingual v2 - 10 मिनट तक का ऑडियो
वॉइस लाइब्रेरी में कौन सी वॉइस किसी खास भाषा की मूल वॉइस हैं?
सभी पहले से बनी वॉइस और जनरेट की गई वॉइस अंग्रेज़ी की हैं। इसका मतलब है कि दूसरी भाषाएँ बोलते समय उनका उच्चारण या लहजा सही नहीं हो सकता।
वॉइस लाइब्रेरी में प्रोफेशनल कैटेगरी के तहत आपको समुदाय की हमारे साथ साझा की गई वॉइस मिल सकती हैं। ये वॉइस, अपनी वॉइस के Professional Voice Clones हैं। इन वॉइस पर आम तौर पर उस भाषा का टैग होता है जिसमें उन्हें क्लोन किया गया था, इसलिए वे उस भाषा की मूल वॉइस होती हैं। आप खास भाषाओं के लिए फ़िल्टर करने हेतु भाषा खोज फ़िल्टर भी इस्तेमाल कर सकते हैं।
नंबर, तारीखें, प्रतीक और संक्षिप्ताक्षर सही तरीके से या सही भाषा में क्यों नहीं बोले जाते?
संख्याएँ, तारीखें, प्रतीक और संक्षिप्ताक्षर AI के लिए चुनौती हो सकते हैं, क्योंकि अक्सर उन्हें सही तरीके से कहने के कई तरीके होते हैं। यह इस्तेमाल की जा रही भाषा पर भी निर्भर कर सकता है। उदाहरण के लिए, “11” को “Eleven” पढ़ा जा सकता है, लेकिन स्पैनिश में “Once” या जर्मन में “Elf” भी पढ़ा जा सकता है।
संख्याओं, तारीखों, संक्षिप्ताक्षरों और प्रतीकों का सही उच्चारण सुनिश्चित करने के कई तरीके हैं।
पूरा लिखें, शब्दों में
सबसे अच्छे नतीजों के लिए, हम संख्याओं, संक्षिप्ताक्षरों, तारीखों और प्रतीकों को पूरे शब्दों में, उसी तरह लिखने की सलाह देते हैं जैसा आप चाहते हैं कि AI उन्हें बोले। इससे AI को सबसे ज़्यादा संदर्भ मिलता है, ताकि वह सही आउटपुट दे सके। उदाहरण के लिए, “$100” के लिए हम “a hundred dollars” या “one hundred dollars” लिखने की सलाह देंगे, ताकि आपको मनचाहा नतीजा मिले।
LLM का इस्तेमाल
अगर आप अपने टेक्स्ट प्रॉम्प्ट जनरेट करने के लिए किसी लार्ज लैंग्वेज मॉडल का इस्तेमाल कर रहे हैं, जैसे ElevenAgents इस्तेमाल करते समय, तो आप मॉडल को प्रॉम्प्ट दे सकते हैं कि वह संख्याएँ, तारीखें, प्रतीक और संक्षिप्ताक्षर हमेशा शब्दों में लिखे, जिस तरह से आप चाहते हैं कि AI उन्हें बोले।
नॉर्मलाइज़ेशन
अगर आप API के ज़रिए जनरेट कर रहे हैं, तो apply_text_normalization पैरामीटर का इस्तेमाल करके तय कर सकते हैं कि टेक्स्ट नॉर्मलाइज़ेशन लागू करना है या नहीं। बेहतर उच्चारण सुनिश्चित करने के लिए टेक्स्ट नॉर्मलाइज़ेशन संख्याओं और तारीखों को शब्दों में लिखता है। इस विकल्प से लेटेंसी बढ़ती है, क्योंकि नॉर्मलाइज़ेशन प्रक्रिया में अतिरिक्त प्रोसेसिंग समय लगता है।
apply_text_normalization पैरामीटर में तीन मोड हैं:
on, यानी यह हमेशा लागू होता है
off, यानी यह कभी लागू नहीं होता
auto, यानी AI अपने-आप तय करता है कि टेक्स्ट नॉर्मलाइज़ेशन कब लागू करना है
आप language_code पैरामीटर से अपने प्रॉम्प्ट की भाषा भी तय कर सकते हैं। यह एक वैकल्पिक पैरामीटर है, जो ISO 639-1 भाषा कोड स्वीकार करता है।
यह छोटे या अस्पष्ट प्रॉम्प्ट के लिए उपयोगी हो सकता है, जैसे जब टेक्स्ट में सिर्फ संख्याएँ या प्रतीक हों। भाषा तय करने से यह सुनिश्चित होता है कि नॉर्मलाइज़र उस भाषा के सही नियम लागू करे।
वेबसाइट पर टेक्स्ट टू स्पीच से जनरेट करते समय नॉर्मलाइज़ेशन डिफ़ॉल्ट रूप से सक्षम होता है।
Studio में, डिफ़ॉल्ट रूप से नॉर्मलाइज़ेशन अपने-आप लागू होता है, यानी AI तय करता है कि टेक्स्ट नॉर्मलाइज़ेशन कब लागू करना है। आप नॉर्मलाइज़ेशन को हमेशा लागू होने के लिए भी सेट कर सकते हैं - यह विकल्प Project settings में Advanced टैब के तहत है।
मेरी वॉइस कुछ शब्दों का गलत उच्चारण क्यों कर रही है?
गलत उच्चारण कई कारणों से हो सकते हैं। सबसे आम कारण यह है कि शब्द की वर्तनी गलत होती है। AI गलत वर्तनी वाले शब्दों को सुधारने की कोशिश नहीं करेगा और उन्हें ठीक उसी तरह पढ़ने की कोशिश करेगा जैसे वे लिखे गए हैं। इसलिए AI से पढ़वाने से पहले टेक्स्ट को दोबारा जाँचना और प्रूफ़रीड करके पूरा करना ज़रूरी है।
अगर आप कोई खास उच्चारण तय करना चाहते हैं, तो हमारे Flash v2 मॉडल के साथ SSML फ़ोनीम टैग इस्तेमाल कर सकते हैं। इसके बारे में हमारी उच्चारण गाइड में और जानें।
कभी-कभी AI शब्दों का गलत उच्चारण कर सकता है या उसका लहजा अजीब हो सकता है, जो आपकी अपेक्षा वाला नहीं होता। ऐसा कई कारणों से हो सकता है और ज़्यादातर मामलों में यह वॉइस और भाषा पर बहुत निर्भर करता है। सही लहजा और उच्चारण सुनिश्चित करने का सबसे अच्छा तरीका है कि सही लहजे और उच्चारण वाली वॉइस क्लोन की जाए। इससे ऑडियो जनरेट करते समय AI को सबसे ज़्यादा संदर्भ मिलता है।
भाषा टेक्स्ट से तय होती है और लहजा वॉइस से तय होता है। इसलिए, अगर आप ऐसी भाषा में लिख रहे हैं जिसमें दूसरी भाषा के साथ बहुत से शब्द समान हों या जो किसी दूसरी भाषा से काफ़ी मिलती-जुलती हो, तो AI को कुछ शब्दों का उच्चारण समझने या लहजों के बीच बदलने में मुश्किल हो सकती है।
हालाँकि, कुछ परिस्थितियों में AI अंग्रेज़ी में भी सही लिखे शब्दों का गलत उच्चारण कर सकता है। यह इस्तेमाल की गई वॉइस और टेक्स्ट पर बहुत निर्भर लगता है, लेकिन ऐसा बहुत कम होना चाहिए।