Eleven v4
हमारा सबसे नया और उन्नत टेक्स्ट टू स्पीच मॉडल।
Eleven v4 हमारा सबसे नया और सबसे उन्नत टेक्स्ट टू स्पीच मॉडल है, और मॉडलों की नई पीढ़ी का पहला मॉडल है। Eleven v3 की तुलना में यह आउटपुट क्वालिटी, वॉइस की सटीकता, एकरूपता, भावना, डिलीवरी, ऑडियो टैग और भाषा कवरेज को बेहतर बनाता है।
आम तौर पर, Eleven v4, Eleven v3 से बेहतर अपग्रेड है और लगभग हर मामले में बेहतर नतीजे देता है। हम ज़ोर देकर सलाह देते हैं कि आप v4 पर स्विच करें और फर्क खुद देखने के लिए इसे अपनी वॉइस और कंटेंट के साथ टेस्ट करें। कुछ खास मामलों में कोई दूसरा विकल्प बेहतर हो सकता है, लेकिन ज़्यादातर यूज़र्स के लिए v4 बेहतर विकल्प होगा।
टैग, विराम चिह्न और डायलॉग प्रॉम्प्टिंग के लिए, Prompting Eleven v4 देखें।
वॉइस क्लोनिंग
Eleven v4 के साथ वॉइस क्लोनिंग की सटीकता में बड़ा सुधार हुआ है। क्लोन की गई वॉइस, सोर्स वॉइस की विशेषताओं — टिंबर, कैडेंस और डिलीवरी — को पिछले किसी भी मॉडल की तुलना में ज़्यादा सटीकता से कैप्चर करती हैं।
Eleven v4 में इंस्टेंट वॉइस क्लोन्स (IVCs) पहले से कहीं ज़्यादा सटीक हैं। वे सोर्स वॉइस की खास विशेषताओं को ज़्यादा सटीकता से कैप्चर करते हैं, जिससे छोटे ऑडियो सैंपल से जल्दी एक विश्वसनीय क्लोन बनाना आसान हो जाता है।
Eleven v4 में प्रोफेशनल वॉइस क्लोन्स (PVCs) पूरी तरह समर्थित हैं। वे वॉइस की सटीकता में हुए इन्हीं सुधारों पर आधारित हैं और उन वर्कफ़्लो के लिए सोर्स वॉइस की ज़्यादा सटीक प्रतिकृति देते हैं, जिनमें सबसे उच्च स्तर की एकरूपता और नियंत्रण चाहिए।
सटीकता में इस बड़े सुधार की वजह से Eleven v4, Eleven v3 से काफ़ी अलग सुनाई दे सकता है। Eleven v3 ने डिलीवरी और सटीकता पर ज़ोर देते हुए Eleven v4 की नींव रखी, जबकि Eleven v4 उसी नींव पर वॉइस की सटीकता को काफ़ी बेहतर बनाता है। इसलिए, Eleven v4 को सोर्स वॉइस को ज़्यादा सटीकता से कैप्चर करने के लिए डिज़ाइन किया गया है, हालांकि आपको अब भी पसंद आ सकता है कि कोई वॉइस Eleven v3 में कैसी सुनाई देती थी। सटीकता और व्यक्तिगत पसंद हमेशा एक जैसी नहीं होतीं, इसलिए हम सुझाव देते हैं कि अपने इस्तेमाल के मामले के लिए सबसे अच्छा विकल्प चुनने हेतु दोनों वर्ज़न को अपने कंटेंट के साथ तुलना करें।
क्योंकि Eleven v4 सोर्स वॉइस की विशेषताओं, जैसे उसके एक्सेंट, डिलीवरी, आवाज़ की तीव्रता और अन्य विशिष्ट गुणों को ज़्यादा सटीकता से दोहराता है, इसलिए सोर्स रिकॉर्डिंग की क्वालिटी पहले से ज़्यादा मायने रखती है। साफ़ और स्पष्ट ट्रेनिंग ऑडियो, अनचाही ध्वनियां या विशेषताएं जोड़े बिना Eleven v4 को वॉइस सही ढंग से कैप्चर करने में मदद करता है। बैकग्राउंड नॉइज़, डिस्टॉर्शन या रिकॉर्डिंग से जुड़ी अन्य समस्याएं नतीजे को प्रभावित कर सकती हैं।
हम अभी भी Eleven v4 के साथ प्रयोग कर रहे हैं, ताकि इसे सबसे अच्छे तरीके से इस्तेमाल करने का तरीका समझ सकें। अब तक, यह सूक्ष्म ऑडियो को कैप्चर करने में काफ़ी बेहतर लगता है, खासकर तब जब बहुत सारा ट्रेनिंग ऑडियो हो, जैसे प्रोफेशनल वॉइस क्लोन्स में। अधिक विविध डेटासेट से मॉडल को नियंत्रित करने के तरीके की टेस्टिंग जारी रहने पर, विविध ट्रेनिंग डेटा इस्तेमाल करने संबंधी हमारी सलाह बदल सकती है। अभी के लिए, हम सुझाव देते हैं कि अपने ट्रेनिंग ऑडियो में बोलने की एक ही शैली रखें, जिसे Eleven v4 को पहले के मॉडलों की तुलना में बेहतर ढंग से कैप्चर करना चाहिए।
नेटिव एक्सेंट हैंडलिंग
पुराने मॉडलों की तुलना में Eleven v4 में यह सबसे बड़े बदलावों में से एक है, और इसे स्पष्ट रूप से समझना ज़रूरी है।
जब आप जिस भाषा में जनरेट कर रहे हैं वह आपकी रेफ़रेंस वॉइस की भाषा से मेल खाती है, तो मूल एक्सेंट पहले की तरह ही पूरी तरह बरकरार रहता है।
जब आप जिस भाषा में जनरेट कर रहे हैं वह रेफ़रेंस वॉइस की भाषा से अलग होती है, तो Eleven v4 रेफ़रेंस वॉइस के मूल भाषा वाले एक्सेंट को बनाए रखने के बजाय लक्ष्य भाषा में धाराप्रवाह, स्वाभाविक लगने वाली स्पीच जनरेट करता है।
व्यवहार में: अगर आप किसी कोरियाई स्पीकर की वॉइस क्लोन करते हैं और अंग्रेज़ी जनरेट करते हैं, तो Eleven v4 कोरियाई एक्सेंट के साथ बोली गई अंग्रेज़ी के बजाय स्वाभाविक, धाराप्रवाह अंग्रेज़ी तैयार करेगा। इससे हर वॉइस को हर समर्थित भाषा में इस्तेमाल किया जा सकता है। यह खास तौर पर डबिंग, बहुभाषी कंटेंट और ऐसे वॉइस एजेंट्स के लिए उपयोगी है जिन्हें एक ही वॉइस के ज़रिए अलग-अलग भाषाओं में यूज़र्स की सेवा करनी होती है।
अगर आपका वर्कफ़्लो इस बात पर निर्भर है कि कोई वॉइस दूसरी भाषाओं में अपना नेटिव एक्सेंट बनाए रखे, तो माइग्रेट करने से पहले इस व्यवहार को सीधे Eleven v4 के साथ टेस्ट करें — यह अलग-अलग भाषाओं में जनरेशन के काम करने के तरीके में जानबूझकर किया गया बदलाव है, कोई बग नहीं।
हालांकि, इस नई सुविधा को अभी भी बेहतर बनाया जा रहा है और हम इसे हमेशा चालू रखने के बजाय टॉगल बनाने के तरीके खोज रहे हैं। यह अभी एक रिसर्च प्रोजेक्ट है, इसलिए फिलहाल हमारे पास इसकी कोई समयसीमा या अन्य जानकारी नहीं है।
मॉडल वेरिएंट्स
Eleven v4 दो वेरिएंट्स में आता है, ताकि आप अपने इस्तेमाल के मामले के लिए क्वालिटी और स्पीड का सही संतुलन चुन सकें:
- Eleven v4 (
eleven_v4) — हमारा सबसे उच्च-क्वालिटी मॉडल, जो कंटेंट क्रिएशन, ऑडियोबुक्स, कैरेक्टर वॉइसओवर और ऐसे किसी भी इस्तेमाल के मामले के लिए आदर्श है जहां क्वालिटी सबसे अहम हो। - Eleven v4 Turbo (
eleven_v4_turbo) — बेहद कम लेटेंसी बनाए रखते हुए बेहद उच्च क्वालिटी प्रदान करता है। इसे खास तौर पर कन्वर्सेशनल एजेंट्स और इंटरैक्टिव वॉइस अनुभवों जैसे रियल-टाइम इस्तेमाल के मामलों के लिए बनाया गया है।
दोनों वेरिएंट्स में दो वॉइस सेटिंग्स होती हैं: स्टेबिलिटी और सिमिलैरिटी।
स्टेबिलिटी यह नियंत्रित करती है कि अलग-अलग जनरेशन में डिलीवरी कितनी एक जैसी रहे। कम वैल्यू ज़्यादा एक्सप्रेसिव और विविध डिलीवरी देती हैं; ज़्यादा वैल्यू परफॉर्मेंस को एक निश्चित बेसलाइन के करीब रखती हैं।
सिमिलैरिटी यह नियंत्रित करती है कि आउटपुट रेफ़रेंस वॉइस का कितनी बारीकी से पालन करे। ज़्यादा वैल्यू रेफ़रेंस के और करीब पालन को लागू करती हैं, जिससे कुछ स्वाभाविकता कम हो सकती है।
Eleven v4 में स्टाइल और स्पीड स्लाइडर्स उपलब्ध नहीं हैं, और SSML समर्थित नहीं है।
ऑडियो टैग (जैसे [whispering], [shouting], [laughing]) आपको बारीकी से नियंत्रण के साथ डिलीवरी निर्देशित करने देते हैं, और Eleven v4 उन्हें पिछले मॉडलों से कहीं अधिक सूक्ष्मता के साथ संभालता है। वे अभी पूरी तरह सटीक नहीं हैं, और हम टैग निर्देशों का मॉडल कितनी विश्वसनीयता से पालन करता है इसे लगातार बेहतर बना रहे हैं — यह हमारे निरंतर निवेश का एक सक्रिय क्षेत्र है और इसमें सुधार होता रहेगा।
उदाहरण
ये उदाहरण रॉ हैं। इनमें कुछ भी भारी पोस्ट-प्रोसेस नहीं किया गया है: कोई EQ, कंप्रेशन, नॉर्मलाइज़ेशन, डी-एसिंग, प्लोसिव हटाना या ऐसा कुछ नहीं। अगर आपको कोई बार-बार होने वाली समस्या सुनाई दे, जैसे क्लिपिंग, प्लोसिव्स, असमान EQ या वॉल्यूम में उछाल, तो वे बहुत संभव है कि उस वॉइस के ट्रेनिंग डेटा में मौजूद हों। Eleven v4 मॉडल ने बस उन्हें कैप्चर किया है, क्योंकि यह कमियों को कैप्चर करते समय भी बहुत सटीक है। हमने ऑडियो को बिना छुए रखा है, ताकि आप सुन सकें कि मॉडल ने क्या तैयार किया।
वॉइस क्लोनिंग की सटीकता
हर उदाहरण की शुरुआत वॉइस लाइब्रेरी प्रीव्यू से होती है। फिर हमने कुछ टेक्स्ट लिया और उस वॉइस के इंस्टेंट वॉइस क्लोन का उपयोग करके उसे Eleven v3 और Eleven v4, दोनों पर जनरेट किया।
यह एकदम सही तुलना नहीं है। Eleven v4 प्रोफेशनल वॉइस क्लोन्स के साथ भी काम करता है, जो मैच को और बेहतर बना सकते हैं। हालांकि, तुलना को निष्पक्ष रखने के लिए हमने Eleven v3 और Eleven v4 दोनों के लिए इंस्टेंट वॉइस क्लोन्स का इस्तेमाल किया।
ये उदाहरण दिखाते हैं कि मॉडल मूल वॉइस का कितना हिस्सा कैप्चर करता है। यह ध्यान रखना ज़रूरी है कि इसमें ऑडियो का EQ, क्वालिटी, वॉल्यूम और अन्य छोटे विवरण व कमियां भी शामिल हैं, जैसे प्लोसिव्स, तीखी सिबिलेंस और वॉल्यूम में उतार-चढ़ाव।
पहले प्रीव्यू सुनें, फिर Eleven v3, फिर Eleven v4।
वॉइस NfUrCNRReUL9RXS9upG1।
वॉइस HBDoL4wkcalemIO0nUAu।
वॉइस ऐक्टिंग
ये Eleven v4 जनरेशन हैं। टेक्स्ट में मौजूद ऑडियो टैग डिलीवरी को निर्देशित करते हैं।
वॉइस EkK5I93UQWFDigLMpZcX।
वॉइस t7VaN65ClS2VrEUwk1nR।
ऑडियोबुक
यह Eleven v4 नैरेशन है। टैग सीन की गति और टोन सेट करते हैं।
वॉइस KHRvDizAHFVPzoSehNY6।
मॉडल लगातार विकसित होता रहेगा
Eleven v4 पर सक्रिय रूप से लगातार काम किया जा रहा है। लॉन्च के बाद भी जब हम मॉडल को ट्रेनिंग और बेहतर बनाते रहेंगे, तो क्वालिटी बेहतर होने के साथ इसका व्यवहार समय के साथ बदल सकता है। हम सुझाव देते हैं कि मॉडल के विकसित होने पर आप समय-समय पर अपने इस्तेमाल के मामले को फिर से टेस्ट करें। जैसे-जैसे महत्वपूर्ण अपडेट जारी होंगे, हम उन्हें साझा करेंगे।
अक्सर पूछे जाने वाले सवाल
Eleven v4 किन भाषाओं को सपोर्ट करता है?
Eleven v4 अफ़्रीकांस, अम्हारिक, अरबी, आर्मेनियाई, असमिया, अस्तूरियाई, अज़रबैजानी, बेलारूसी, बंगाली, बोस्नियाई, बल्गेरियाई, बर्मी, कैंटोनीज़, कैटलन, सेबुआनो, क्रोएशियाई, चेक, डेनिश, डच, अंग्रेज़ी, एस्टोनियाई, फ़िलिपीनो, फ़िनिश, फ़्रेंच, फुला (पुलार), गैलिशियन, जॉर्जियाई, जर्मन, ग्रीक, गुजराती, हौसा, हिब्रू, हिंदी, हंगेरियन, आइसलैंडिक, इंडोनेशियाई, इतालवी, जापानी, कन्नड़, कज़ाख, कोरियाई, किर्गिज़, लाओ, लिंगाला, लिथुआनियाई, लुगांडा, लक्ज़मबर्गिश, मैसेडोनियन, मलय, मलयालम, माल्टीज़, मंदारिन चीनी, माओरी, मराठी, मंगोलियाई, नेपाली, नॉर्वेजियन बोकमोल, ओक्सितान, ओड़िया, पश्तो, फ़ारसी, पोलिश, पुर्तगाली (ब्राज़ील), पंजाबी, रोमानियाई, रूसी, सर्बियाई, शोना, सिंधी, स्लोवाक, स्लोवेनियाई, सोमाली, सोरानी कुर्दिश, स्पैनिश (लैटएम), स्वाहिली, स्वीडिश, ताजिक, तमिल, तेलुगु, थाई, तुर्की, यूक्रेनी, उर्दू, उज़्बेक, वियतनामी, वेल्श, और वोलोफ़ को सपोर्ट करता है।
कुछ भाषाओं को अन्य की तुलना में ज़्यादा धाराप्रवाह ढंग से संभाला जाता है, लेकिन आम तौर पर Eleven v4 इनमें से अधिकांश भाषाओं को बहुत अच्छी तरह संभालता है।
क्या क्लोन की गई वॉइस अपना एक्सेंट बनाए रखेगी?
जब रेफ़रेंस वॉइस और जनरेट की गई स्पीच एक ही भाषा में हों, तो वॉइस का एक्सेंट बरकरार रहता है। उदाहरण के लिए, अगर आप किसी व्यक्ति की किसी खास अंग्रेज़ी एक्सेंट में बोलती अंग्रेज़ी वॉइस क्लोन करते हैं और अंग्रेज़ी स्पीच जनरेट करते हैं, तो वह एक्सेंट बना रहेगा।
क्या मैं किसी वॉइस से उसके मूल एक्सेंट में दूसरी भाषा बुलवा सकता हूं?
डिफ़ॉल्ट रूप से, जब जनरेट की गई भाषा रेफ़रेंस वॉइस की भाषा से अलग होती है, तो Eleven v4 रेफ़रेंस एक्सेंट को बनाए रखने के बजाय लक्ष्य भाषा में धाराप्रवाह, स्वाभाविक लगने वाली स्पीच का लक्ष्य रखता है। आप एक्सेंट या डिलीवरी स्टाइल निर्देशित करने के लिए ऑडियो टैग इस्तेमाल कर सकते हैं, लेकिन नतीजे अलग हो सकते हैं, इसलिए अपनी खास वॉइस और इस्तेमाल के मामले के साथ टेस्ट करें।
क्या Eleven v4 क्लोन अपने Eleven v3 वर्ज़न जैसा सुनाई देगा?
आम तौर पर, Eleven v4 सोर्स वॉइस की विशेषताओं को Eleven v3 की तुलना में कहीं अधिक सटीकता से दोहराता है, जिसमें उसका टिंबर, कैडेंस, डिलीवरी और अन्य तौर-तरीके शामिल हैं। इसलिए, Eleven v4 क्लोन आम तौर पर सोर्स वॉइस के ज़्यादा करीब सुनाई देगा और अपने Eleven v3 वर्ज़न से काफ़ी अलग सुनाई दे सकता है।
क्या मुझे Eleven v4 को ट्रेन करने की ज़रूरत है?
Eleven v4, Instant Voice Cloning और Professional Voice Cloning दोनों के साथ काम करता है।
इंस्टेंट वॉइस क्लोनिंग के साथ, आप अलग ट्रेनिंग स्टेप के बिना वॉइस बनाते हैं। आम तौर पर एक से दो मिनट का छोटा सैंपल अपलोड करें और कुछ ही सेकंड में आपके पास इस्तेमाल के लिए तैयार वॉइस होगी।
Professional Voice Cloning पहले के मॉडलों की तरह ही काम करता है। यह लंबे रिकॉर्डिंग सेट पर एक समर्पित मॉडल को ट्रेन करता है।
अगर आपके पास पहले से प्रोफेशनल वॉइस क्लोन है और आप उसे Eleven v4 पर ट्रेन करना चाहते हैं, तो My Voices खोलें, सूची में वॉइस ढूंढें और उस पर होवर करें। आपको उस वॉइस के लिए उपलब्ध मॉडल दिखेंगे। फाइन-ट्यूनिंग शुरू करने के लिए Eleven v4 के पास वाले प्लस बटन पर क्लिक करें।
क्या मुझे Eleven v4 के साथ वॉइस डिज़ाइन इस्तेमाल करना चाहिए?
वॉइस डिज़ाइन वॉइस Eleven v4 के साथ काम करती हैं, लेकिन हो सकता है कि वे पहले के मॉडलों की तुलना में उतनी प्रभावशाली न हों या उतनी अच्छी न सुनाई दें।