For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
ऑडियो को एक वॉइस से दूसरी वॉइस में बदलें। भावना, समय और डिलीवरी पर पूरा नियंत्रण रखें।
Path parameters
voice_idstringRequired
इस्तेमाल की जाने वाली वॉइस की ID। सभी उपलब्ध वॉइस सूचीबद्ध करने के लिए [Get voices](/docs/api-reference/voices/search) endpoint इस्तेमाल करें।
Headers
xi-api-keystringOptional
Query parameters
enable_loggingbooleanOptionalDefaults to true
जब enable_logging को false सेट किया जाता है, तो अनुरोध के लिए zero retention mode इस्तेमाल होगा। इसका मतलब है कि इस अनुरोध के लिए history सुविधाएं, जिनमें request stitching भी शामिल है, उपलब्ध नहीं होंगी। zero retention mode केवल enterprise ग्राहक इस्तेमाल कर सकते हैं।
optimize_streaming_latencyinteger or nullOptionalDeprecated
आप क्वालिटी में कुछ कमी के बदले लेटेंसी ऑप्टिमाइज़ेशन चालू कर सकते हैं। सबसे कम संभव अंतिम लेटेंसी मॉडल के अनुसार अलग-अलग होती है। संभावित मान:
0 - डिफ़ॉल्ट मोड (कोई लेटेंसी ऑप्टिमाइज़ेशन नहीं)
1 - सामान्य लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 50%)
2 - मज़बूत लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 75%)
3 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन
4 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन, साथ ही और अधिक लेटेंसी बचाने के लिए टेक्स्ट नॉर्मलाइज़र बंद रहता है (सबसे अच्छी लेटेंसी, लेकिन जैसे नंबर और तारीखों का गलत उच्चारण हो सकता है)।
डिफ़ॉल्ट रूप से None।
output_formatenumOptionalDefaults to mp3_44100_128
जनरेट किए गए ऑडियो का output format। codec_sample_rate_bitrate के रूप में फ़ॉर्मैट किया जाता है। इसलिए, 32kbs पर 22.05kHz sample rate वाले mp3 को mp3_22050_32 के रूप में दर्शाया जाता है। 192kbps bitrate वाले MP3 के लिए Creator tier या उससे ऊपर का subscription चाहिए। 44.1kHz sample rate वाले PCM और WAV formats के लिए Pro tier या उससे ऊपर का subscription चाहिए। ध्यान दें कि μ-law format (कभी-कभी mu-law लिखा जाता है, और अक्सर u-law के रूप में अनुमानित) का उपयोग आमतौर पर Twilio audio inputs के लिए होता है।
Request
This endpoint expects a multipart form containing a file.
audiofileRequired
वह ऑडियो फ़ाइल जिसमें कंटेंट और भावना होती है, जो जनरेट किए गए स्पीच को नियंत्रित करेगी।
model_idstringOptionalDefaults to eleven_english_sts_v2
इस्तेमाल किए जाने वाले मॉडल का पहचानकर्ता। आप GET /v1/models से इनके बारे में क्वेरी कर सकते हैं। मॉडल में स्पीच टू स्पीच का समर्थन होना चाहिए, जिसे आप can_do_voice_conversion प्रॉपर्टी से जांच सकते हैं।
voice_settingsstring or nullOptional
दी गई वॉइस की सेव की गई सेटिंग्स को ओवरराइड करने वाली वॉइस सेटिंग्स। ये सिर्फ़ दिए गए अनुरोध पर लागू होती हैं। इन्हें JSON encoded string के रूप में भेजना होगा।
seedinteger or nullOptional
निर्दिष्ट होने पर, हमारा सिस्टम नियतात्मक रूप से सैंपल करने का सर्वोत्तम प्रयास करेगा, ताकि एक ही seed और पैरामीटर्स वाली बार-बार की गई रिक्वेस्ट से एक ही परिणाम मिले। नियतात्मकता की गारंटी नहीं है। यह 0 से 4294967295 के बीच एक पूर्णांक होना चाहिए।
remove_background_noisebooleanOptionalDefaults to false
सेट होने पर, हमारे ऑडियो आइसोलेशन मॉडल से आपके ऑडियो इनपुट का बैकग्राउंड नॉइज़ हट जाएगा। यह सिर्फ़ वॉइस चेंजर पर लागू होता है।
file_formatenum or nullOptionalDefaults to other
इनपुट ऑडियो का फ़ॉर्मैट। विकल्प हैं 'pcm_s16le_16' या 'other'। `pcm_s16le_16` के लिए, इनपुट ऑडियो 16kHz सैंपल रेट, सिंगल चैनल (मोनो) और लिटल-एंडियन बाइट ऑर्डर वाला 16-बिट PCM होना चाहिए। एन्कोडेड वेवफ़ॉर्म देने की तुलना में लेटेंसी कम होगी।
इस्तेमाल की जाने वाली वॉइस की ID। सभी उपलब्ध वॉइस सूचीबद्ध करने के लिए Get voices endpoint इस्तेमाल करें।
जब enable_logging को false सेट किया जाता है, तो अनुरोध के लिए zero retention mode इस्तेमाल होगा। इसका मतलब है कि इस अनुरोध के लिए history सुविधाएं, जिनमें request stitching भी शामिल है, उपलब्ध नहीं होंगी। zero retention mode केवल enterprise ग्राहक इस्तेमाल कर सकते हैं।
आप क्वालिटी में कुछ कमी के बदले लेटेंसी ऑप्टिमाइज़ेशन चालू कर सकते हैं। सबसे कम संभव अंतिम लेटेंसी मॉडल के अनुसार अलग-अलग होती है। संभावित मान:
0 - डिफ़ॉल्ट मोड (कोई लेटेंसी ऑप्टिमाइज़ेशन नहीं)
1 - सामान्य लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 50%)
2 - मज़बूत लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 75%)
3 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन
4 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन, साथ ही और अधिक लेटेंसी बचाने के लिए टेक्स्ट नॉर्मलाइज़र बंद रहता है (सबसे अच्छी लेटेंसी, लेकिन जैसे नंबर और तारीखों का गलत उच्चारण हो सकता है)।
डिफ़ॉल्ट रूप से None।
जनरेट किए गए ऑडियो का output format। codec_sample_rate_bitrate के रूप में फ़ॉर्मैट किया जाता है। इसलिए, 32kbs पर 22.05kHz sample rate वाले mp3 को mp3_22050_32 के रूप में दर्शाया जाता है। 192kbps bitrate वाले MP3 के लिए Creator tier या उससे ऊपर का subscription चाहिए। 44.1kHz sample rate वाले PCM और WAV formats के लिए Pro tier या उससे ऊपर का subscription चाहिए। ध्यान दें कि μ-law format (कभी-कभी mu-law लिखा जाता है, और अक्सर u-law के रूप में अनुमानित) का उपयोग आमतौर पर Twilio audio inputs के लिए होता है।
इस्तेमाल किए जाने वाले मॉडल का पहचानकर्ता। आप GET /v1/models से इनके बारे में क्वेरी कर सकते हैं। मॉडल में स्पीच टू स्पीच का समर्थन होना चाहिए, जिसे आप can_do_voice_conversion प्रॉपर्टी से जांच सकते हैं।
दी गई वॉइस की सेव की गई सेटिंग्स को ओवरराइड करने वाली वॉइस सेटिंग्स। ये सिर्फ़ दिए गए अनुरोध पर लागू होती हैं। इन्हें JSON encoded string के रूप में भेजना होगा।
निर्दिष्ट होने पर, हमारा सिस्टम नियतात्मक रूप से सैंपल करने का सर्वोत्तम प्रयास करेगा, ताकि एक ही seed और पैरामीटर्स वाली बार-बार की गई रिक्वेस्ट से एक ही परिणाम मिले। नियतात्मकता की गारंटी नहीं है। यह 0 से 4294967295 के बीच एक पूर्णांक होना चाहिए।
इनपुट ऑडियो का फ़ॉर्मैट। विकल्प हैं ‘pcm_s16le_16’ या ‘other’। pcm_s16le_16 के लिए, इनपुट ऑडियो 16kHz सैंपल रेट, सिंगल चैनल (मोनो) और लिटल-एंडियन बाइट ऑर्डर वाला 16-बिट PCM होना चाहिए। एन्कोडेड वेवफ़ॉर्म देने की तुलना में लेटेंसी कम होगी।