टेक्स्ट टू स्पीच बनाम टेक्स्ट टू डायलॉग WebSockets
टेक्स्ट टू स्पीच बनाम टेक्स्ट टू डायलॉग WebSockets
यह गाइड आपको स्ट्रीमिंग स्पीच के लिए सही WebSocket चुनने और दोनों प्रोटोकॉल के अंतर को समझने में मदद करती है।
ElevenLabs सिंथेसाइज़्ड स्पीच स्ट्रीम करने के लिए दो अलग-अलग WebSocket प्रोडक्ट देता है। वे अलग-अलग समस्याओं का समाधान करते हैं, अलग-अलग मैसेज फ़ॉर्मैट स्वीकार करते हैं और अलग-अलग मॉडल्स के लिए हैं।
मुझे कौन-सा WebSocket इस्तेमाल करना चाहिए?
Text to Speech (TTS) WebSocket का इस्तेमाल करें, जब आप हर कनेक्शन पर एक वॉइस के लिए प्लेन टेक्स्ट स्ट्रीम करते हैं (वॉइस URL में तय होती है) और आपको Flash या Multilingual v2 जैसे non-v3 मॉडल्स, वैकल्पिक SSML, चंक शेड्यूल या एजेंट-स्टाइल इंटरप्शन हैंडलिंग के लिए multi-context वेरिएंट चाहिए।
Text to Dialogue (TTD) WebSocket का इस्तेमाल करें, जब आपको Eleven v3 डायलॉग व्यवहार चाहिए: एक्सप्रेसिव डिलीवरी, हर चंक के लिए voice_id, टर्न बाउंड्रीज़ (new_turn) और सर्वर पर v3 के लिए इस्तेमाल होने वाली वही डायलॉग-ओरिएंटेड बफ़रिंग।
बैच या HTTP स्ट्रीमिंग डायलॉग के लिए (एक कॉल में पूरा रिक्वेस्ट), WebSocket की जगह Create dialogue या Stream dialogue इस्तेमाल करें।
तुलना
TTS WebSocket कब बेहतर विकल्प है
- आप लेटेंसी या भाषा कवरेज के लिए पहले से Flash या Multilingual v2 इंटीग्रेट कर चुके हैं।
- आपको हर कनेक्शन पर एक नैरेटर वॉइस और एक आसान टेक्स्ट-पर-फ़्रेम प्रोटोकॉल चाहिए।
- आपको बार्ज-इन और पैरलल उच्चारणों के लिए multi-context ऑर्केस्ट्रेशन चाहिए (multi-context गाइड)।
TTS WebSocket की पूरी जानकारी के लिए रीयल-टाइम में ऑडियो जनरेट करें देखें।
TTD WebSocket कब बेहतर विकल्प है
- आपका लक्ष्य Eleven v4 डायलॉग है (एक्सप्रेसिव टैग्स, बातचीत की गति, मल्टी-स्पीकर लाइनें)।
- आप स्क्रिप्टेड या LLM-जनरेटेड डायलॉग स्ट्रीम करते हैं, जिसमें बोलने वाली वॉइस हर लाइन पर बदल सकती है, बिना नया कनेक्शन खोले।
- आपको सर्वर पर केवल v4 डायलॉग जनरेशन के साथ WebSocket-जैसा इंक्रीमेंटल इनपुट चाहिए।
व्यावहारिक जानकारी के लिए रीयलटाइम टेक्स्ट टू डायलॉग देखें। प्रोटोकॉल की जानकारी API रेफरेंस में है।