ElevenLabs दस्तावेज़

ElevenLabs इंटीग्रेट करने के लिए हमारे दस्तावेज़ और गाइड्स देखें

ElevenLabs कैसे काम करता है

ElevenLabs AI वॉइस इंफ्रास्ट्रक्चर देता है: टेक्स्ट टू स्पीच, स्पीच टू टेक्स्ट, वॉइस क्लोनिंग, कन्वर्सेशनल एजेंट्स और जनरेटिव ऑडियो। आप इसे चार तरीकों से इस्तेमाल कर सकते हैं, जो अलग-अलग तरह के यूज़र्स के लिए बनाए गए हैं।

ElevenCreative एक नो-कोड वेब ऐप्लिकेशन है, जहाँ क्रिएटर्स, प्रोड्यूसर्स और एडिटर्स ब्राउज़र में सीधे वॉइसओवर, म्यूज़िक, डब और स्टूडियो प्रोजेक्ट्स बना सकते हैं।

ElevenAgents कन्वर्सेशनल वॉइस एजेंट्स को डिज़ाइन और ऑपरेट करने का प्लेटफ़ॉर्म है। इसमें गैर-तकनीकी यूज़र्स के लिए विज़ुअल बिल्डर और डेवलपर्स के लिए पूरा प्रोग्रामेटिक कंट्रोल है।

ElevenAPI हर क्षमता को आधिकारिक Python और TypeScript SDKs के साथ REST इंटरफ़ेस के रूप में उपलब्ध कराता है, ताकि डेवलपर्स अपनी ऐप्लिकेशन्स और वर्कफ़्लो में वॉइस जोड़ सकें।

Reception AI छोटे और मध्यम व्यवसायों के लिए तुरंत डिप्लॉय होने वाला AI फ़ोन रिसेप्शनिस्ट है, जो कॉल्स का जवाब देता है, अपॉइंटमेंट बुक करता है और एक ही डैशबोर्ड से रोज़मर्रा के काम संभालता है।

अवधारणाएँ

वॉइसेज़ ऑडियो जनरेशन में इस्तेमाल होने वाली स्पीच पर्सोना हैं। हर वॉइस की एक यूनिक ID होती है — जैसे JBFqnCBsd6RMkjVDRZzb — जिसे आप डैशबोर्ड में चुनते हैं या API रिक्वेस्ट में भेजते हैं। ElevenLabs के पास 10,000+ वॉइसेज़ की लाइब्रेरी है। आप ऑडियो रिकॉर्डिंग से वॉइस क्लोन कर सकते हैं या टेक्स्ट विवरण से नई वॉइस बना सकते हैं।

मॉडल्स जनरेट किए गए ऑडियो की क्वालिटी, लेटेंसी और भाषा कवरेज नियंत्रित करते हैं। eleven_v4 90+ भाषाओं में सबसे ज़्यादा अभिव्यक्तिपूर्ण आउटपुट देता है। eleven_v4_turbo लगभग 100ms की मीडियन इन्फ़रेंस लेटेंसी के साथ रियल-टाइम इस्तेमाल के लिए बनाया गया है। हर क्षमता — स्पीच टू टेक्स्ट, म्यूज़िक, साउंड इफेक्ट्स — का अपना समर्पित मॉडल है।

क्रेडिट्स हर प्रोडक्ट में इस्तेमाल होने वाली खपत की इकाई हैं। टेक्स्ट टू स्पीच में इनपुट टेक्स्ट के हर कैरेक्टर पर एक क्रेडिट लगता है। अन्य ऑपरेशन्स में प्रोसेस किए गए ऑडियो के हर सेकंड के हिसाब से शुल्क लिया जाता है। क्रेडिट्स हर महीने रीसेट होते हैं और इस्तेमाल न हुए क्रेडिट्स दो महीने तक रोल ओवर होते हैं। पूरा विवरण देखने के लिए प्राइसिंग देखें।

अपना रास्ता चुनें

मॉडल्स से मिलें

Eleven v4

हमारा सबसे भावपूर्ण, उच्च-गुणवत्ता वाला स्पीच सिंथेसिस मॉडल

बेहतरीन वॉइस क्लोनिंग क्षमताएं
90+ भाषाएं समर्थित
10,000 कैरेक्टर की सीमा
नैचुरल मल्टी-स्पीकर डायलॉग के लिए सपोर्ट
Eleven v4 Turbo

हमारा सबसे भावपूर्ण, रियल-टाइम स्पीच सिंथेसिस मॉडल

अल्ट्रा-लो लेटेंसी (मीडियन इन्फ़रेंस लेटेंसी ~100ms†)
बेहतरीन वॉइस क्लोनिंग क्षमताएं
90+ भाषाएं समर्थित
बारीक नियंत्रण के लिए ऑडियो टैग्स
Eleven v3

हमारा भावनाओं से भरपूर, एक्सप्रेसिव स्पीच सिंथेसिस मॉडल

नाटकीय डिलीवरी और परफ़ॉर्मेंस
70+ भाषाएं समर्थित
5,000 कैरेक्टर की सीमा
नैचुरल मल्टी-स्पीकर डायलॉग के लिए सपोर्ट
Eleven v3 Conversational

हमारा एक्सप्रेसिव, रियलटाइम स्पीच सिंथेसिस मॉडल

लो लेटेंसी (~280ms)
नाटकीय डिलीवरी और परफ़ॉर्मेंस
70+ भाषाएं समर्थित
बारीक नियंत्रण के लिए ऑडियो टैग्स
Eleven Multilingual v2

जीवंत, एक जैसी गुणवत्ता वाला स्पीच सिंथेसिस मॉडल

स्वाभाविक सुनाई देने वाला आउटपुट
29 भाषाएं समर्थित
10,000 कैरेक्टर की सीमा
लंबे जनरेशन में सबसे स्थिर
Eleven Flash v2.5

हमारा तेज़, किफ़ायती स्पीच सिंथेसिस मॉडल

अल्ट्रा-लो लेटेंसी (~75ms†)
32 भाषाएं समर्थित
40,000 कैरेक्टर की सीमा
तेज़ मॉडल, API जनरेशन के लिए प्रति कैरेक्टर 50% कम कीमत
† ऐप्लिकेशन और नेटवर्क लेटेंसी शामिल नहीं है

क्षमता के अनुसार देखें

टेक्स्ट टू स्पीच

टेक्स्ट को जीवंत स्पीच में बदलें

स्पीच टू टेक्स्ट

बोले गए ऑडियो को टेक्स्ट में ट्रांसक्राइब करें

म्यूज़िक

टेक्स्ट से म्यूज़िक जनरेट करें

टेक्स्ट टू डायलॉग

टेक्स्ट से प्राकृतिक लगने वाला संवाद बनाएं

इमेज और वीडियो

टेक्स्ट से इमेज और वीडियो जनरेट करें

वॉइस चेंजर

वॉइसेज़ को बदलें और रूपांतरित करें

वॉइस आइसोलेटर

बैकग्राउंड नॉइज़ से वॉइसेज़ अलग करें

डबिंग

ऑडियो और वीडियो को आसानी से डब करें

साउंड इफेक्ट्स

सिनेमाई साउंड इफेक्ट्स बनाएं

वॉइसेज़

कस्टम वॉइसेज़ क्लोन और डिज़ाइन करें

वॉइस रीमिक्सिंग

मौजूदा वॉइसेज़ को रूपांतरित और बेहतर बनाएं

फोर्स्ड अलाइनमेंट

टेक्स्ट को ऑडियो से अलाइन करें

स्पीच इंजन

किसी भी चीज़ में वॉइस जोड़ें

ElevenAgents

इंटेलिजेंट वॉइस एजेंट्स डिप्लॉय करें

प्राइवेट डिप्लॉयमेंट्स

ElevenLabs को अपने क्लाउड में चलाएं