ट्रांसक्रिप्शन

ElevenLabs के साथ बोले गए ऑडियो को टेक्स्ट में बदलना सीखें।

परिचय

ElevenLabs स्पीच टू टेक्स्ट (STT) API बोले गए ऑडियो को अत्याधुनिक सटीकता के साथ टेक्स्ट में बदलती है। हमारा Scribe v2 मॉडल 90+ भाषाओं और कई वॉइस स्टाइल्स में टेक्स्ट संकेतों के अनुसार ढल जाता है। लाइव डेमो आज़माने के लिए हमारा स्पीच टू टेक्स्ट शोकेस पेज देखें।

जिन कंपनियों को HIPAA अनुपालन की ज़रूरत है, उन्हें Business Associate Agreement (BAA) पर हस्ताक्षर करने के लिए ElevenLabs Sales से संपर्क करना होगा। HIPAA से जुड़ी किसी भी इंटीग्रेशन या डिप्लॉयमेंट से पहले यह चरण पूरा करना सुनिश्चित करें।

मॉडल्स

API रिस्पॉन्स का उदाहरण

नीचे दिया गया उदाहरण एक सैंपल ऑडियो फ़ाइल के लिए Scribe v2 मॉडल के साथ स्पीच टू टेक्स्ट API का आउटपुट दिखाता है।

{
"language_code": "en",
"language_probability": 1,
"text": "With a soft and whispery American accent, I'm the ideal choice for creating ASMR content, meditative guides, or adding an intimate feel to your narrative projects.",
"words": [
{
"text": "With",
"start": 0.119,
"end": 0.259,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 0.239,
"end": 0.299,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "a",
"start": 0.279,
"end": 0.359,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 0.339,
"end": 0.499,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "soft",
"start": 0.479,
"end": 1.039,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 1.019,
"end": 1.2,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "and",
"start": 1.18,
"end": 1.359,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 1.339,
"end": 1.44,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "whispery",
"start": 1.419,
"end": 1.979,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 1.959,
"end": 2.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "American",
"start": 2.159,
"end": 2.719,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 2.699,
"end": 2.779,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "accent,",
"start": 2.759,
"end": 3.389,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 4.119,
"end": 4.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "I'm",
"start": 4.159,
"end": 4.459,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 4.44,
"end": 4.52,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "the",
"start": 4.5,
"end": 4.599,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 4.579,
"end": 4.699,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "ideal",
"start": 4.679,
"end": 5.099,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 5.079,
"end": 5.219,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "choice",
"start": 5.199,
"end": 5.719,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 5.699,
"end": 6.099,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "for",
"start": 6.099,
"end": 6.199,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 6.179,
"end": 6.279,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "creating",
"start": 6.259,
"end": 6.799,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 6.779,
"end": 6.979,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "ASMR",
"start": 6.959,
"end": 7.739,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 7.719,
"end": 7.859,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "content,",
"start": 7.839,
"end": 8.45,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 9,
"end": 9.06,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "meditative",
"start": 9.04,
"end": 9.64,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 9.619,
"end": 9.699,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "guides,",
"start": 9.679,
"end": 10.359,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 10.359,
"end": 10.409,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "or",
"start": 11.319,
"end": 11.439,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 11.42,
"end": 11.52,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "adding",
"start": 11.5,
"end": 11.879,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 11.859,
"end": 12,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "an",
"start": 11.979,
"end": 12.079,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 12.059,
"end": 12.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "intimate",
"start": 12.179,
"end": 12.579,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 12.559,
"end": 12.699,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "feel",
"start": 12.679,
"end": 13.159,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.139,
"end": 13.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "to",
"start": 13.159,
"end": 13.26,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.239,
"end": 13.3,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "your",
"start": 13.299,
"end": 13.399,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.379,
"end": 13.479,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "narrative",
"start": 13.479,
"end": 13.889,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.919,
"end": 13.939,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "projects.",
"start": 13.919,
"end": 14.779,
"type": "word",
"speaker_id": "speaker_0"
}
]
}

आउटपुट को तीन कैटेगरी टाइप्स में वर्गीकृत किया जाता है:

  • word - ऑडियो की भाषा का एक शब्द
  • spacing - शब्दों के बीच का स्पेस; यह जापानी, मैंडरिन, थाई, लाओ, बर्मी और कैंटोनीज़ जैसी स्पेस का उपयोग न करने वाली भाषाओं पर लागू नहीं होता
  • audio_event - हँसी या तालियों जैसी गैर-वाक् ध्वनियाँ

कॉन्करेंसी और प्राथमिकता

कॉन्करेंसी का मतलब है कि एक ही समय में कितने अनुरोध प्रोसेस किए जा सकते हैं।

स्पीच टू टेक्स्ट के लिए, प्रोसेसिंग तेज़ करने के लिए 8 मिनट से लंबी फ़ाइलों को आंतरिक रूप से समानांतर तरीके से ट्रांसक्राइब किया जाता है। ऑडियो को एक साथ ट्रांसक्राइब करने के लिए चार सेगमेंट में बाँटा जाता है।

आप इस गणना से कॉन्करेंसी सीमा निकाल सकते हैं:

Concurrency=min⁡(4,round_up(audio_ duration_secs480))Concurrency = \min(4, \text{round\_up}(\frac{\text{audio\_ duration\_secs}}{480}))

उदाहरण के लिए, 15 मिनट की ऑडियो फ़ाइल को 2 की कॉन्करेंसी के साथ ट्रांसक्राइब किया जाएगा, जबकि 120 मिनट की ऑडियो फ़ाइल को 4 की कॉन्करेंसी के साथ ट्रांसक्राइब किया जाएगा।

ऊपर दी गई गणना केवल Scribe v2 और Scribe v2 Medical पर लागू होती है। Scribe v2 Realtime के लिए कॉन्करेंसी सीमा चार्ट देखें।

उन्नत सुविधाएँ

Keyterm prompting और transcript editing के लिए अतिरिक्त शुल्क लगता है। विस्तृत मूल्य जानकारी के लिए API प्राइसिंग पेज देखें।

Keyterm prompting

Keyterm prompting, Scribe v2, Scribe v2 Medical (batch) और Scribe v2 Realtime के साथ उपलब्ध है।

मॉडल को उन्हें ट्रांसक्राइब करने की ओर झुकाने के लिए शब्दों या वाक्यांशों को हाइलाइट करें। यह ऐसे खास शब्दों या वाक्यों को ट्रांसक्राइब करने के लिए उपयोगी है जो ऑडियो में आम नहीं होते, जैसे प्रोडक्ट के नाम, नाम या अन्य खास टर्म्स। Keyterms, दूसरे मॉडल्स द्वारा दिए जाने वाले biased keywords या customer vocabularies से ज़्यादा प्रभावी होते हैं, क्योंकि मॉडल संदर्भ के आधार पर तय करता है कि उस टर्म को ट्रांसक्राइब करना है या नहीं। Batch में 1000 तक keyterms (प्रत्येक 50 वर्ण) और realtime में 50 तक keyterms (प्रत्येक 20 वर्ण) समर्थित हैं।

Keyterm prompting इस्तेमाल करने के बारे में अधिक जानने के लिए keyterm prompting दस्तावेज़ देखें।

No verbatim मोड

No verbatim मोड, Scribe v2, Scribe v2 Medical (batch) और Scribe v2 Realtime के साथ उपलब्ध है।

जब no_verbatim सक्षम होता है, तो मॉडल ट्रांसक्रिप्ट से filler words, false starts और disfluencies हटा देता है। इससे साफ़ आउटपुट मिलता है, जो सबटाइटल्स, सारांशों या ऐसे किसी भी उपयोग के लिए उपयुक्त है जहाँ हर बोले गए शब्द को कैप्चर करने से ज़्यादा महत्वपूर्ण पठनीयता हो।

एंटिटी डिटेक्शन

एंटिटी डिटेक्शन सभी batch मॉडल्स और Scribe v2 Realtime के साथ उपलब्ध है।

Batch मॉडल्स और Scribe v2 Realtime ट्रांसक्रिप्ट में कई कैटेगरी की एंटिटीज़ पहचान सकते हैं और उनके सटीक टाइमस्टैम्प दे सकते हैं। यह क्रेडिट कार्ड नंबर, नाम, मेडिकल कंडीशंस या SSNs हाइलाइट करने के लिए उपयोगी है।

समर्थित एंटिटीज़ की पूरी सूची के लिए एंटिटी डिटेक्शन दस्तावेज़ देखें।

ट्रांसक्रिप्ट एडिटिंग

ट्रांसक्रिप्ट एडिटिंग एक प्रायोगिक सुविधा है, जो सभी batch मॉडल्स और Scribe v2 Realtime के साथ उपलब्ध है।

transcript_edit पैरामीटर के साथ प्राकृतिक भाषा का निर्देश दें और वह तैयार ट्रांसक्रिप्ट पर लागू हो जाएगा। संपादित टेक्स्ट, मूल ट्रांसक्रिप्ट के साथ edited_transcript में लौटाया जाता है, इसलिए टाइमस्टैम्प और स्पीकर लेबल्स बरकरार रहते हैं। यह तारीखों, समय या यूनिट्स के लिखने के तरीके को सामान्य बनाने, अलग स्टाइल लागू करने या एक ही अनुरोध में ट्रांसक्रिप्ट को फिर से लिखने के लिए उपयोगी है।

अधिक जानने के लिए ट्रांसक्रिप्ट एडिटिंग दस्तावेज़ और रीयलटाइम ट्रांसक्रिप्ट एडिटिंग गाइड देखें।

समर्थित भाषाएँ

Scribe v2 90+ भाषाओं को support करता है, जिनमें शामिल हैं:

अफ़्रीकान्स (afr), अम्हारिक (amh), अरबी (ara), अर्मेनियाई (hye), असमिया (asm), अस्तूरियाई (ast), अज़रबैजानी (aze), बेलारूसी (bel), बांग्ला (ben), बोस्नियाई (bos), बल्गेरियाई (bul), बर्मी (mya), कैंटोनीज़ (yue), कैटलन (cat), सेबुआनो (ceb), चिचेवा (nya), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िलिपीनो (fil), फ़िनिश (fin), फ़्रेंच (fra), फुलाह (ful), गैलिशियन (glg), गांडा (lug), जॉर्जियाई (kat), जर्मन (deu), यूनानी (ell), गुजराती (guj), हौसा (hau), हिब्रू (heb), हिंदी (hin), हंगेरियन (hun), आइसलैंडिक (isl), इग्बो (ibo), इंडोनेशियाई (ind), आयरिश (gle), इतालवी (ita), जापानी (jpn), जावानीज़ (jav), काबुवेर्दियानु (kea), कन्नड़ (kan), कज़ाख़ (kaz), खमेर (khm), कोरियाई (kor), कुर्दिश (kur), किर्गिज़ (kir), लाओ (lao), लातवियाई (lav), लिंगाला (lin), लिथुआनियाई (lit), लुओ (luo), लक्ज़मबर्गिश (ltz), मैसेडोनियाई (mkd), मलय (msa), मलयालम (mal), माल्टीज़ (mlt), मंदारिन चीनी (zho), माओरी (mri), मराठी (mar), मंगोलियाई (mon), नेपाली (nep), उत्तरी सोथो (nso), नॉर्वेजियन (nor), ओक्सितान (oci), ओड़िया (ori), पश्तो (pus), फ़ारसी (fas), पोलिश (pol), पुर्तगाली (por), पंजाबी (pan), रोमानियाई (ron), रूसी (rus), सर्बियाई (srp), शोना (sna), सिंधी (snd), सिंहली (sin), स्लोवाक (slk), स्लोवेनियाई (slv), सोमाली (som), स्पेनिश (spa), स्वाहिली (swa), स्वीडिश (swe), तमिल (tam), ताजिक (tgk), तेलुगु (tel), थाई (tha), तुर्की (tur), यूक्रेनी (ukr), उम्बुंदु (umb), उर्दू (urd), उज़्बेक (uzb), वियतनामी (vie), वेल्श (cym), वोलोफ़ (wol), खोसा (xho) और ज़ुलू (zul)।

भाषा समर्थन का विवरण

Word Error Rate (WER), ट्रांसक्रिप्शन सिस्टम्स की सटीकता का मूल्यांकन करने के लिए इस्तेमाल किया जाने वाला एक प्रमुख मेट्रिक है। यह मापता है कि किसी रेफरेंस ट्रांसक्रिप्ट की तुलना में एक ट्रांसक्रिप्ट में कितनी त्रुटियाँ हैं। नीचे Scribe v2 द्वारा समर्थित प्रत्येक भाषा का WER विवरण दिया गया है।

बेलारूसी (bel), बोस्नियाई (bos), बल्गेरियाई (bul), कैटलन (cat), क्रोएशियाई (hrv), चेक (ces), डेनिश (dan), डच (nld), अंग्रेज़ी (eng), एस्टोनियाई (est), फ़िनिश (fin), फ़्रेंच (fra), गैलिशियन (glg), जर्मन (deu), यूनानी (ell), हंगेरियन (hun), आइसलैंडिक (isl), इंडोनेशियाई (ind), इतालवी (ita), जापानी (jpn), कन्नड़ (kan), लातवियाई (lav), मैसिडोनियाई (mkd), मलय (msa), मलयालम (mal), नॉर्वेजियन (nor), पोलिश (pol), पुर्तगाली (por), रोमानियाई (ron), रूसी (rus), स्लोवाक (slk), स्पेनिश (spa), स्वीडिश (swe), तुर्की (tur), यूक्रेनी (ukr) और वियतनामी (vie)।

आर्मेनियाई (hye), अज़रबैजानी (aze), बांग्ला (ben), कैंटोनीज़ (yue), फ़िलिपीनो (fil), जॉर्जियाई (kat), गुजराती (guj), हिंदी (hin), कज़ाख (kaz), लिथुआनियाई (lit), माल्टीज़ (mlt), मैंडरिन (cmn), मराठी (mar), नेपाली (nep), ओड़िया (ori), फ़ारसी (fas), सर्बियाई (srp), स्लोवेनियाई (slv), स्वाहिली (swa), तमिल (tam) और तेलुगु (tel)

अफ़्रीकांस (afr), अरबी (ara), असमिया (asm), अस्तूरियाई (ast), बर्मी (mya), हौसा (hau), हिब्रू (heb), जावानीज़ (jav), कोरियाई (kor), किर्गिज़ (kir), लक्ज़मबर्गिश (ltz), माओरी (mri), ऑक्सितान (oci), पंजाबी (pan), ताजिक (tgk), थाई (tha), उज़्बेक (uzb) और वेल्श (cym)।

अम्हारिक (amh), गांडा (lug), इग्बो (ibo), आयरिश (gle), खमेर (khm), कुर्दिश (kur), लाओ (lao), मंगोलियाई (mon), उत्तरी सोथो (nso), पश्तो (pus), शोना (sna), सिंधी (snd), सिंहली (sin), सोमाली (som), उर्दू (urd), वोलोफ़ (wol), खोसा (xho), योरूबा (yor) और ज़ुलु (zul)।

अक्सर पूछे जाने वाले सवाल

हाँ, API ट्रांसक्रिप्शन के लिए ऑडियो और वीडियो, दोनों फ़ाइलें अपलोड करने का समर्थन करती है।

3 GB तक की फ़ाइलें समर्थित हैं। अवधि की सीमाएँ ट्रांसक्रिप्शन मोड पर निर्भर करती हैं:

  • स्टैंडर्ड मोड (use_multi_channel=false): 10 घंटे तक
  • मल्टी-चैनल मोड (use_multi_channel=true): सभी चैनलों की कुल अवधि 10 घंटे से कम होनी चाहिए

API निम्नलिखित ऑडियो और वीडियो फ़ॉर्मैट्स का समर्थन करती है:

  • audio/aac
  • audio/x-aac
  • audio/x-aiff
  • audio/ogg
  • audio/mpeg
  • audio/mp3
  • audio/mpeg3
  • audio/x-mpeg-3
  • audio/opus
  • audio/wav
  • audio/x-wav
  • audio/webm
  • audio/flac
  • audio/x-flac
  • audio/mp4
  • audio/aiff
  • audio/x-m4a

समर्थित वीडियो फ़ॉर्मैट्स में शामिल हैं:

  • video/mp4
  • video/x-msvideo
  • video/x-matroska
  • video/quicktime
  • video/x-ms-wmv
  • video/x-flv
  • video/webm
  • video/mpeg
  • video/3gpp

ElevenLabs अपने मॉडल्स द्वारा समर्थित भाषाओं की संख्या लगातार बढ़ा रहा है। अपडेट्स के लिए नियमित रूप से देखते रहें।

हाँ, असिंक्रोनस ट्रांसक्रिप्शन परिणाम UI में webhook settings के तहत कॉन्फ़िगर किए गए webhooks पर भेजे जा सकते हैं। webhooks cookbook में अधिक जानें।

हाँ, मल्टीचैनल STT सुविधा आपको ऐसे ऑडियो को ट्रांसक्राइब करने देती है, जिसमें हर चैनल को स्वतंत्र रूप से प्रोसेस किया जाता है और उसके चैनल नंबर के आधार पर एक स्पीकर ID दी जाती है। यह सुविधा 5 तक चैनलों का समर्थन करती है। मल्टीचैनल ट्रांसक्रिप्शन cookbook में अधिक जानें।

ElevenLabs ट्रांसक्रिप्शन के लिए भेजे गए ऑडियो की अवधि के आधार पर स्पीच टू टेक्स्ट का शुल्क लेता है। बिलिंग प्रति घंटे के ऑडियो के हिसाब से होती है और दरें टियर व मॉडल के अनुसार अलग होती हैं। विस्तृत मूल्य जानकारी के लिए API प्राइसिंग पेज देखें।

मुख्य तथ्य

  • समर्थित इनपुट: ऑडियो और वीडियो, दोनों फ़ाइलें स्वीकार की जाती हैं
  • अधिकतम फ़ाइल साइज़: 3 GB
  • अधिकतम अवधि: 10 घंटे (स्टैंडर्ड मोड), 1 घंटा (मल्टीचैनल मोड)
  • मल्टीचैनल मोड: 5 तक चैनल; हर चैनल स्वतंत्र रूप से प्रोसेस होता है और चैनल नंबर के आधार पर स्पीकर ID दी जाती है
  • Webhooks: असिंक्रोनस ट्रांसक्रिप्शन परिणाम webhook पर भेजे जा सकते हैं — workspace settings में कॉन्फ़िगर करें
  • समर्थित ऑडियो फ़ॉर्मैट्स: AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A, WebM
  • समर्थित वीडियो फ़ॉर्मैट्स: MP4, AVI, MKV, MOV, WMV, FLV, WebM, MPEG, 3GPP