वॉइस चेंजर स्ट्रीम

ऑडियो को एक वॉइस से दूसरी वॉइस में स्ट्रीम करें। भावना, टाइमिंग और डिलीवरी पर पूरा नियंत्रण रखें।

Path parameters

voice_idstringRequired
इस्तेमाल की जाने वाली वॉइस की ID। सभी उपलब्ध वॉइस सूचीबद्ध करने के लिए [Get voices](/docs/api-reference/voices/search) endpoint इस्तेमाल करें।

Headers

xi-api-keystringOptional

Query parameters

enable_loggingbooleanOptionalDefaults to true
जब enable_logging को false सेट किया जाता है, तो अनुरोध के लिए zero retention mode इस्तेमाल होगा। इसका मतलब है कि इस अनुरोध के लिए history सुविधाएं, जिनमें request stitching भी शामिल है, उपलब्ध नहीं होंगी। zero retention mode केवल enterprise ग्राहक इस्तेमाल कर सकते हैं।
optimize_streaming_latencyinteger or nullOptionalDeprecated
आप क्वालिटी में कुछ कमी के बदले लेटेंसी ऑप्टिमाइज़ेशन चालू कर सकते हैं। सबसे कम संभव अंतिम लेटेंसी मॉडल के अनुसार अलग-अलग होती है। संभावित मान: 0 - डिफ़ॉल्ट मोड (कोई लेटेंसी ऑप्टिमाइज़ेशन नहीं) 1 - सामान्य लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 50%) 2 - मज़बूत लेटेंसी ऑप्टिमाइज़ेशन (विकल्प 3 से संभव लेटेंसी सुधार का लगभग 75%) 3 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन 4 - अधिकतम लेटेंसी ऑप्टिमाइज़ेशन, साथ ही और अधिक लेटेंसी बचाने के लिए टेक्स्ट नॉर्मलाइज़र बंद रहता है (सबसे अच्छी लेटेंसी, लेकिन जैसे नंबर और तारीखों का गलत उच्चारण हो सकता है)। डिफ़ॉल्ट रूप से None।
output_formatenumOptionalDefaults to mp3_44100_128
जनरेट किए गए ऑडियो का output format। codec_sample_rate_bitrate के रूप में फ़ॉर्मैट किया जाता है। इसलिए, 32kbs पर 22.05kHz sample rate वाले mp3 को mp3_22050_32 के रूप में दर्शाया जाता है। 192kbps bitrate वाले MP3 के लिए Creator tier या उससे ऊपर का subscription चाहिए। 44.1kHz sample rate वाले PCM के लिए Pro tier या उससे ऊपर का subscription चाहिए। ध्यान दें कि μ-law format (कभी-कभी mu-law लिखा जाता है, और अक्सर u-law के रूप में अनुमानित) का उपयोग आमतौर पर Twilio audio inputs के लिए होता है।

Request

This endpoint expects a multipart form containing a file.
audiofileRequired

वह ऑडियो फ़ाइल जिसमें कंटेंट और भावना होती है, जो जनरेट किए गए स्पीच को नियंत्रित करेगी।

model_idstringOptionalDefaults to eleven_english_sts_v2
इस्तेमाल किए जाने वाले मॉडल का पहचानकर्ता। आप GET /v1/models से इनके बारे में क्वेरी कर सकते हैं। मॉडल में स्पीच टू स्पीच का समर्थन होना चाहिए, जिसे आप can_do_voice_conversion प्रॉपर्टी से जांच सकते हैं।
voice_settingsstring or nullOptional
दी गई वॉइस की सेव की गई सेटिंग्स को ओवरराइड करने वाली वॉइस सेटिंग्स। ये सिर्फ़ दिए गए अनुरोध पर लागू होती हैं। इन्हें JSON encoded string के रूप में भेजना होगा।
seedinteger or nullOptional
निर्दिष्ट होने पर, हमारा सिस्टम नियतात्मक रूप से सैंपल करने का सर्वोत्तम प्रयास करेगा, ताकि एक ही seed और पैरामीटर्स वाली बार-बार की गई रिक्वेस्ट से एक ही परिणाम मिले। नियतात्मकता की गारंटी नहीं है। यह 0 से 4294967295 के बीच एक पूर्णांक होना चाहिए।
remove_background_noisebooleanOptionalDefaults to false

सेट होने पर, हमारे ऑडियो आइसोलेशन मॉडल से आपके ऑडियो इनपुट का बैकग्राउंड नॉइज़ हट जाएगा। यह सिर्फ़ वॉइस चेंजर पर लागू होता है।

file_formatenum or nullOptionalDefaults to other
इनपुट ऑडियो का फ़ॉर्मैट। विकल्प हैं 'pcm_s16le_16' या 'other'। `pcm_s16le_16` के लिए, इनपुट ऑडियो 16kHz सैंपल रेट, सिंगल चैनल (मोनो) और लिटल-एंडियन बाइट ऑर्डर वाला 16-बिट PCM होना चाहिए। एन्कोडेड वेवफ़ॉर्म देने की तुलना में लेटेंसी कम होगी।
Allowed values:

Response

स्ट्रीमिंग ऑडियो डेटा

Errors

422
Unprocessable Entity Error