स्पीच इंजन
स्पीच इंजन
ElevenLabs के साथ अपने चैट एजेंट या LLM में आवाज़ जोड़ें।
परिचय
ElevenLabs स्पीच इंजन किसी भी चैट एजेंट में आवाज़ की सुविधाएं जोड़ता है। ElevenLabs स्पीच टू टेक्स्ट और टेक्स्ट टू स्पीच संभालता है, जबकि आपका सर्वर LLM लॉजिक देता है। SDK कनेक्शन लाइफ़साइकल, टर्न-टेकिंग और इंटरप्शन डिटेक्शन मैनेज करता है, ताकि आप अपने एजेंट के व्यवहार पर ध्यान दे सकें।
यह कैसे काम करता है
स्पीच इंजन WebSocket के ज़रिए आपके सर्वर को ElevenLabs से कनेक्ट करता है। हर कनेक्शन एक बातचीत को दर्शाता है।
- यूज़र ब्राउज़र में बोलता है। ElevenLabs ऑडियो कैप्चर करता है और उसे ट्रांसक्राइब करता है।
- ट्रांसक्रिप्ट पूरी बातचीत की हिस्ट्री के साथ आपके सर्वर पर भेजी जाती है।
- आपका सर्वर ट्रांसक्रिप्ट को आपके LLM तक भेजता है और रिस्पॉन्स को स्ट्रीम करके वापस भेजता है।
- ElevenLabs टेक्स्ट को स्पीच में बदलता है और उसे ब्राउज़र में चलाता है।
स्पीच इंजन का इस्तेमाल कब करें
स्पीच इंजन उन डेवलपर्स के लिए है जो अपना LLM इस्तेमाल करना चाहते हैं और अपने सर्वर पर बातचीत का लॉजिक नियंत्रित करना चाहते हैं। इसका इस्तेमाल तब करें, जब आपको:
- किसी मौजूदा टेक्स्ट-आधारित चैट एजेंट में आवाज़ जोड़नी हो
- किसी खास LLM, फ़ाइन-ट्यून्ड मॉडल या कस्टम इन्फ़रेंस पाइपलाइन का इस्तेमाल करना हो
- बातचीत की रूटिंग, कॉन्टेक्स्ट मैनेजमेंट और टूल कॉलिंग पर पूरा नियंत्रण रखना हो
- किसी मौजूदा सर्वर ऐप्लिकेशन (Express, FastAPI वगैरह) में आवाज़ इंटीग्रेट करनी हो
अगर आपको पूरी तरह होस्ट किया गया समाधान चाहिए, जिसमें ElevenLabs LLM, नॉलेज बेस और टूल्स देता है, तो ElevenAgents इस्तेमाल करें।
मुख्य सुविधाएं
- कोई भी LLM - OpenAI, Anthropic, Google Gemini या टेक्स्ट जनरेट करने वाले किसी भी मॉडल का इस्तेमाल करें। SDK OpenAI, Anthropic और Gemini स्ट्रीम फ़ॉर्मैट्स से टेक्स्ट अपने-आप एक्सट्रैक्ट करता है।
- इंटरप्शन हैंडलिंग - जब यूज़र रिस्पॉन्स के बीच में बोलता है, तो SDK
AbortSignal(TypeScript) या टास्क कैंसलेशन (Python) के ज़रिए चल रहे LLM रिक्वेस्ट को अपने-आप कैंसल कर देता है। - स्ट्रीमिंग - रिस्पॉन्स जनरेट होते ही ब्राउज़र पर स्ट्रीम किए जाते हैं। एक स्ट्रिंग, async iterable या नेटिव LLM स्ट्रीम ऑब्जेक्ट पास करें।
- टर्न-टेकिंग - SDK बातचीत के टर्न मैनेज करता है, इसलिए आपके सर्वर को सिर्फ़ ट्रांसक्रिप्ट्स का जवाब देना होता है।
IP अलाउलिस्टिंग
अगर आपका सर्वर फ़ायरवॉल के पीछे है या IP-आधारित एक्सेस कंट्रोल इस्तेमाल करता है, तो आप उन स्टैटिक इग्रेस IPs को अलाउलिस्ट कर सकते हैं जिनसे ElevenLabs WebSocket कनेक्शन शुरू होते हैं। IP पतों की पूरी सूची के लिए IP अलाउलिस्टिंग देखें।
IP अलाउलिस्टिंग इस्तेमाल करने से यह सुनिश्चित होता है कि आपका सर्वर सिर्फ़ ElevenLabs के सिस्टम्स से WebSocket कनेक्शन स्वीकार करे।
अक्सर पूछे जाने वाले सवाल
कौन से LLMs सपोर्टेड हैं?
टेक्स्ट जनरेट करने वाला कोई भी LLM। SDK में OpenAI (Responses API और Chat Completions API), Anthropic Messages API और Google Gemini API के लिए बिल्ट-इन स्ट्रीम एक्सट्रैक्शन है। अन्य प्रोवाइडर्स के लिए, एक साधारण स्ट्रिंग या स्ट्रिंग चंक्स का async iterable पास करें।
स्पीच इंजन और ElevenAgents में क्या अंतर है?
ElevenAgents एक पूरी तरह होस्ट किया गया प्लेटफ़ॉर्म है, जिसमें ElevenLabs LLM, नॉलेज बेस और टूल्स देता है। स्पीच इंजन उन डेवलपर्स के लिए है जो अपना LLM इस्तेमाल करना चाहते हैं और अपने सर्वर पर बातचीत का लॉजिक नियंत्रित करना चाहते हैं।
कौन से सर्वर फ्रेमवर्क्स सपोर्टेड हैं?
TypeScript में, आप स्पीच इंजन को किसी भी Node.js HTTP सर्वर (Express, Fastify या
साधारण http.createServer()) से जोड़ सकते हैं, या एक स्टैंडअलोन WebSocket सर्वर चला सकते हैं। Python में, SDK
engine.serve() के ज़रिए एक स्टैंडअलोन सर्वर देता है, या आप FastAPI, Starlette या किसी भी
ASGI फ्रेमवर्क के साथ engine.create_session() का इस्तेमाल करके इंटीग्रेट कर सकते हैं।