ट्रांसक्रिप्शन
ट्रांसक्रिप्शन
ElevenLabs के साथ बोले गए ऑडियो को टेक्स्ट में बदलना सीखें।
परिचय
ElevenLabs स्पीच टू टेक्स्ट (STT) API बोले गए ऑडियो को अत्याधुनिक सटीकता के साथ टेक्स्ट में बदलती है। हमारा Scribe v2 मॉडल 90+ भाषाओं और कई वॉइस स्टाइल्स में टेक्स्ट संकेतों के अनुसार ढल जाता है। लाइव डेमो आज़माने के लिए हमारा स्पीच टू टेक्स्ट शोकेस पेज देखें।
जिन कंपनियों को HIPAA अनुपालन की ज़रूरत है, उन्हें Business Associate Agreement (BAA) पर हस्ताक्षर करने के लिए ElevenLabs Sales से संपर्क करना होगा। HIPAA से जुड़ी किसी भी इंटीग्रेशन या डिप्लॉयमेंट से पहले यह चरण पूरा करना सुनिश्चित करें।
मॉडल्स
API रिस्पॉन्स का उदाहरण
नीचे दिया गया उदाहरण एक सैंपल ऑडियो फ़ाइल के लिए Scribe v2 मॉडल के साथ स्पीच टू टेक्स्ट API का आउटपुट दिखाता है।
पूरा JSON रिस्पॉन्स देखें
आउटपुट को तीन कैटेगरी टाइप्स में वर्गीकृत किया जाता है:
word- ऑडियो की भाषा का एक शब्दspacing- शब्दों के बीच का स्पेस; यह जापानी, मैंडरिन, थाई, लाओ, बर्मी और कैंटोनीज़ जैसी स्पेस का उपयोग न करने वाली भाषाओं पर लागू नहीं होताaudio_event- हँसी या तालियों जैसी गैर-वाक् ध्वनियाँ
कॉन्करेंसी और प्राथमिकता
कॉन्करेंसी का मतलब है कि एक ही समय में कितने अनुरोध प्रोसेस किए जा सकते हैं।
स्पीच टू टेक्स्ट के लिए, प्रोसेसिंग तेज़ करने के लिए 8 मिनट से लंबी फ़ाइलों को आंतरिक रूप से समानांतर तरीके से ट्रांसक्राइब किया जाता है। ऑडियो को एक साथ ट्रांसक्राइब करने के लिए चार सेगमेंट में बाँटा जाता है।
आप इस गणना से कॉन्करेंसी सीमा निकाल सकते हैं:
उदाहरण के लिए, 15 मिनट की ऑडियो फ़ाइल को 2 की कॉन्करेंसी के साथ ट्रांसक्राइब किया जाएगा, जबकि 120 मिनट की ऑडियो फ़ाइल को 4 की कॉन्करेंसी के साथ ट्रांसक्राइब किया जाएगा।
ऊपर दी गई गणना केवल Scribe v2 और Scribe v2 Medical पर लागू होती है। Scribe v2 Realtime के लिए कॉन्करेंसी सीमा चार्ट देखें।
उन्नत सुविधाएँ
Keyterm prompting और transcript editing के लिए अतिरिक्त शुल्क लगता है। विस्तृत मूल्य जानकारी के लिए API प्राइसिंग पेज देखें।
Keyterm prompting
Keyterm prompting, Scribe v2, Scribe v2 Medical (batch) और Scribe v2 Realtime के साथ उपलब्ध है।
मॉडल को उन्हें ट्रांसक्राइब करने की ओर झुकाने के लिए शब्दों या वाक्यांशों को हाइलाइट करें। यह ऐसे खास शब्दों या वाक्यों को ट्रांसक्राइब करने के लिए उपयोगी है जो ऑडियो में आम नहीं होते, जैसे प्रोडक्ट के नाम, नाम या अन्य खास टर्म्स। Keyterms, दूसरे मॉडल्स द्वारा दिए जाने वाले biased keywords या customer vocabularies से ज़्यादा प्रभावी होते हैं, क्योंकि मॉडल संदर्भ के आधार पर तय करता है कि उस टर्म को ट्रांसक्राइब करना है या नहीं। Batch में 1000 तक keyterms (प्रत्येक 50 वर्ण) और realtime में 50 तक keyterms (प्रत्येक 20 वर्ण) समर्थित हैं।
Keyterm prompting इस्तेमाल करने के बारे में अधिक जानने के लिए keyterm prompting दस्तावेज़ देखें।
No verbatim मोड
No verbatim मोड, Scribe v2, Scribe v2 Medical (batch) और Scribe v2 Realtime के साथ उपलब्ध है।
जब no_verbatim सक्षम होता है, तो मॉडल ट्रांसक्रिप्ट से filler words, false starts और disfluencies हटा देता है। इससे साफ़ आउटपुट मिलता है, जो सबटाइटल्स, सारांशों या ऐसे किसी भी उपयोग के लिए उपयुक्त है जहाँ हर बोले गए शब्द को कैप्चर करने से ज़्यादा महत्वपूर्ण पठनीयता हो।
एंटिटी डिटेक्शन
Batch मॉडल्स और Scribe v2 Realtime ट्रांसक्रिप्ट में कई कैटेगरी की एंटिटीज़ पहचान सकते हैं और उनके सटीक टाइमस्टैम्प दे सकते हैं। यह क्रेडिट कार्ड नंबर, नाम, मेडिकल कंडीशंस या SSNs हाइलाइट करने के लिए उपयोगी है।
समर्थित एंटिटीज़ की पूरी सूची के लिए एंटिटी डिटेक्शन दस्तावेज़ देखें।
ट्रांसक्रिप्ट एडिटिंग
ट्रांसक्रिप्ट एडिटिंग एक प्रायोगिक सुविधा है, जो सभी batch मॉडल्स और Scribe v2 Realtime के साथ उपलब्ध है।
transcript_edit पैरामीटर के साथ प्राकृतिक भाषा का निर्देश दें और वह तैयार ट्रांसक्रिप्ट पर लागू हो जाएगा। संपादित टेक्स्ट, मूल ट्रांसक्रिप्ट के साथ edited_transcript में लौटाया जाता है, इसलिए टाइमस्टैम्प और स्पीकर लेबल्स बरकरार रहते हैं। यह तारीखों, समय या यूनिट्स के लिखने के तरीके को सामान्य बनाने, अलग स्टाइल लागू करने या एक ही अनुरोध में ट्रांसक्रिप्ट को फिर से लिखने के लिए उपयोगी है।
अधिक जानने के लिए ट्रांसक्रिप्ट एडिटिंग दस्तावेज़ और रीयलटाइम ट्रांसक्रिप्ट एडिटिंग गाइड देखें।
समर्थित भाषाएँ
Scribe v2 90+ भाषाओं को support करता है, जिनमें शामिल हैं:
अफ़्रीकान्स (afr), अम्हारिक (amh), अरबी (ara), अर्मेनियाई (hye), असमिया (asm), अस्तूरियाई (ast), अज़रबैजानी (aze), बेलारूसी (bel), बांग्ला (ben), बोस्नियाई (bos), बल्गेरियाई (bul), बर्मी (mya), कैंटोनीज़ (yue), कैटलन (cat), सेबुआनो (ceb), चिचेवा (nya), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िलिपीनो (fil), फ़िनिश (fin), फ़्रेंच (fra), फुलाह (ful), गैलिशियन (glg), गांडा (lug), जॉर्जियाई (kat), जर्मन (deu), यूनानी (ell), गुजराती (guj), हौसा (hau), हिब्रू (heb), हिंदी (hin), हंगेरियन (hun), आइसलैंडिक (isl), इग्बो (ibo), इंडोनेशियाई (ind), आयरिश (gle), इतालवी (ita), जापानी (jpn), जावानीज़ (jav), काबुवेर्दियानु (kea), कन्नड़ (kan), कज़ाख़ (kaz), खमेर (khm), कोरियाई (kor), कुर्दिश (kur), किर्गिज़ (kir), लाओ (lao), लातवियाई (lav), लिंगाला (lin), लिथुआनियाई (lit), लुओ (luo), लक्ज़मबर्गिश (ltz), मैसेडोनियाई (mkd), मलय (msa), मलयालम (mal), माल्टीज़ (mlt), मंदारिन चीनी (zho), माओरी (mri), मराठी (mar), मंगोलियाई (mon), नेपाली (nep), उत्तरी सोथो (nso), नॉर्वेजियन (nor), ओक्सितान (oci), ओड़िया (ori), पश्तो (pus), फ़ारसी (fas), पोलिश (pol), पुर्तगाली (por), पंजाबी (pan), रोमानियाई (ron), रूसी (rus), सर्बियाई (srp), शोना (sna), सिंधी (snd), सिंहली (sin), स्लोवाक (slk), स्लोवेनियाई (slv), सोमाली (som), स्पेनिश (spa), स्वाहिली (swa), स्वीडिश (swe), तमिल (tam), ताजिक (tgk), तेलुगु (tel), थाई (tha), तुर्की (tur), यूक्रेनी (ukr), उम्बुंदु (umb), उर्दू (urd), उज़्बेक (uzb), वियतनामी (vie), वेल्श (cym), वोलोफ़ (wol), खोसा (xho) और ज़ुलू (zul)।
भाषा समर्थन का विवरण
Word Error Rate (WER), ट्रांसक्रिप्शन सिस्टम्स की सटीकता का मूल्यांकन करने के लिए इस्तेमाल किया जाने वाला एक प्रमुख मेट्रिक है। यह मापता है कि किसी रेफरेंस ट्रांसक्रिप्ट की तुलना में एक ट्रांसक्रिप्ट में कितनी त्रुटियाँ हैं। नीचे Scribe v2 द्वारा समर्थित प्रत्येक भाषा का WER विवरण दिया गया है।
उत्कृष्ट (≤ 5% WER)
बेलारूसी (bel), बोस्नियाई (bos), बल्गेरियाई (bul), कैटलन (cat), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िनिश (fin), फ़्रेंच (fra), गैलिशियन (glg), जर्मन (deu), यूनानी (ell), हंगेरियन (hun), आइसलैंडिक (isl), इंडोनेशियाई (ind), इतालवी (ita), जापानी (jpn), कन्नड़ (kan), लातवियाई (lav), मैसिडोनियाई (mkd), मलय (msa), मलयालम (mal), नॉर्वेजियन (nor), पोलिश (pol), पुर्तगाली (por), रोमानियाई (ron), रूसी (rus), स्लोवाक (slk), स्पेनिश (spa), स्वीडिश (swe), तुर्की (tur), यूक्रेनी (ukr) और वियतनामी (vie)।
उच्च सटीकता (>5% से ≤10% WER)
आर्मेनियाई (hye), अज़रबैजानी (aze), बांग्ला (ben), कैंटोनीज़ (yue), फ़िलिपीनो (fil), जॉर्जियाई (kat), गुजराती (guj), हिंदी (hin), कज़ाख (kaz), लिथुआनियाई (lit), माल्टीज़ (mlt), मैंडरिन (cmn), मराठी (mar), नेपाली (nep), ओड़िया (ori), फ़ारसी (fas), सर्बियाई (srp), स्लोवेनियाई (slv), स्वाहिली (swa), तमिल (tam) और तेलुगु (tel)
अच्छी (>10% से ≤20% WER)
अफ़्रीकांस (afr), अरबी (ara), असमिया (asm), अस्तूरियाई (ast), बर्मी (mya), हौसा (hau), हिब्रू (heb), जावानीज़ (jav), कोरियाई (kor), किर्गिज़ (kir), लक्ज़मबर्गिश (ltz), माओरी (mri), ऑक्सितान (oci), पंजाबी (pan), ताजिक (tgk), थाई (tha), उज़्बेक (uzb) और वेल्श (cym)।
मध्यम (>25% से ≤50% WER)
अम्हारिक (amh), गांडा (lug), इग्बो (ibo), आयरिश (gle), खमेर (khm), कुर्दिश (kur), लाओ (lao), मंगोलियाई (mon), उत्तरी सोथो (nso), पश्तो (pus), शोना (sna), सिंधी (snd), सिंहली (sin), सोमाली (som), उर्दू (urd), वोलोफ़ (wol), खोसा (xho), योरूबा (yor) और ज़ुलु (zul)।
अक्सर पूछे जाने वाले सवाल
क्या मैं वीडियो फ़ाइलों के साथ स्पीच टू टेक्स्ट API इस्तेमाल कर सकता/सकती हूँ?
हाँ, API ट्रांसक्रिप्शन के लिए ऑडियो और वीडियो, दोनों फ़ाइलें अपलोड करने का समर्थन करती है।
स्पीच टू टेक्स्ट API के लिए फ़ाइल साइज़ और अवधि की सीमाएँ क्या हैं?
3 GB तक की फ़ाइलें समर्थित हैं। अवधि की सीमाएँ ट्रांसक्रिप्शन मोड पर निर्भर करती हैं:
- स्टैंडर्ड मोड (
use_multi_channel=false): 10 घंटे तक - मल्टी-चैनल मोड (
use_multi_channel=true): सभी चैनलों की कुल अवधि 10 घंटे से कम होनी चाहिए
API में कौन-से ऑडियो और वीडियो फ़ॉर्मैट समर्थित हैं?
API निम्नलिखित ऑडियो और वीडियो फ़ॉर्मैट्स का समर्थन करती है:
- audio/aac
- audio/x-aac
- audio/x-aiff
- audio/ogg
- audio/mpeg
- audio/mp3
- audio/mpeg3
- audio/x-mpeg-3
- audio/opus
- audio/wav
- audio/x-wav
- audio/webm
- audio/flac
- audio/x-flac
- audio/mp4
- audio/aiff
- audio/x-m4a
समर्थित वीडियो फ़ॉर्मैट्स में शामिल हैं:
- video/mp4
- video/x-msvideo
- video/x-matroska
- video/quicktime
- video/x-ms-wmv
- video/x-flv
- video/webm
- video/mpeg
- video/3gpp
आप और भाषाओं का समर्थन कब करेंगे?
ElevenLabs अपने मॉडल्स द्वारा समर्थित भाषाओं की संख्या लगातार बढ़ा रहा है। अपडेट्स के लिए नियमित रूप से देखते रहें।
क्या स्पीच टू टेक्स्ट API webhooks का समर्थन करती है?
हाँ, असिंक्रोनस ट्रांसक्रिप्शन परिणाम UI में webhook settings के तहत कॉन्फ़िगर किए गए webhooks पर भेजे जा सकते हैं। webhooks cookbook में अधिक जानें।
क्या API में मल्टीचैनल ट्रांसक्रिप्शन मोड समर्थित है?
हाँ, मल्टीचैनल STT सुविधा आपको ऐसे ऑडियो को ट्रांसक्राइब करने देती है, जिसमें हर चैनल को स्वतंत्र रूप से प्रोसेस किया जाता है और उसके चैनल नंबर के आधार पर एक स्पीकर ID दी जाती है। यह सुविधा 5 तक चैनलों का समर्थन करती है। मल्टीचैनल ट्रांसक्रिप्शन cookbook में अधिक जानें।
स्पीच टू टेक्स्ट API के लिए बिलिंग कैसे काम करती है?
ElevenLabs ट्रांसक्रिप्शन के लिए भेजे गए ऑडियो की अवधि के आधार पर स्पीच टू टेक्स्ट का शुल्क लेता है। बिलिंग प्रति घंटे के ऑडियो के हिसाब से होती है और दरें टियर व मॉडल के अनुसार अलग होती हैं। विस्तृत मूल्य जानकारी के लिए API प्राइसिंग पेज देखें।
मुख्य तथ्य
- समर्थित इनपुट: ऑडियो और वीडियो, दोनों फ़ाइलें स्वीकार की जाती हैं
- अधिकतम फ़ाइल साइज़: 3 GB
- अधिकतम अवधि: 10 घंटे (स्टैंडर्ड मोड), 1 घंटा (मल्टीचैनल मोड)
- मल्टीचैनल मोड: 5 तक चैनल; हर चैनल स्वतंत्र रूप से प्रोसेस होता है और चैनल नंबर के आधार पर स्पीकर ID दी जाती है
- Webhooks: असिंक्रोनस ट्रांसक्रिप्शन परिणाम webhook पर भेजे जा सकते हैं — workspace settings में कॉन्फ़िगर करें
- समर्थित ऑडियो फ़ॉर्मैट्स: AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A, WebM
- समर्थित वीडियो फ़ॉर्मैट्स: MP4, AVI, MKV, MOV, WMV, FLV, WebM, MPEG, 3GPP