टेक्स्ट टू स्पीच स्ट्रीमिंग

यह गाइड बताती है कि टेक्स्ट टू स्पीच को कैसे स्ट्रीम करें और चाहें तो ऑडियो को AWS S3 पर अपलोड करें।

इस गाइड में तीन तरीके बताए गए हैं: स्पीच को फ़ाइल के रूप में जनरेट करना, ऑडियो रिस्पॉन्स को सीधे स्ट्रीम करना, और वैकल्पिक रूप से जनरेट किए गए ऑडियो को साइन किए गए URL के ज़रिए शेयर करने के लिए AWS S3 बकेट में अपलोड करना।

इस गाइड में माना गया है कि आपने अपनी API कुंजी और SDK सेट अप कर लिए हैं। अगर आपने अभी तक ऐसा नहीं किया है, तो पहले क्विकस्टार्ट पूरा करें। वैकल्पिक S3 अपलोड सेक्शन के लिए S3 एक्सेस वाले AWS अकाउंट की भी ज़रूरत होती है।

जानना चाहते हैं कि स्ट्रीमिंग इस तरह कैसे काम करती है? ऑडियो स्ट्रीमिंग को समझें में प्रोटोकॉल, बफ़रिंग और लेटेंसी के बीच के संतुलन को विस्तार से समझाया गया है।

टेक्स्ट को स्पीच में बदलें (फ़ाइल)

टेक्स्ट को स्पीच में बदलकर फ़ाइल के रूप में सेव करने के लिए, हम ElevenLabs SDK का convert मेथड इस्तेमाल करेंगे और फिर इसे लोकल रूप से .mp3 फ़ाइल में सेव करेंगे।

import os
import uuid
from dotenv import load_dotenv
from elevenlabs import VoiceSettings
from elevenlabs.client import ElevenLabs
load_dotenv()
ELEVENLABS_API_KEY = os.getenv("ELEVENLABS_API_KEY")
elevenlabs = ElevenLabs(
api_key=ELEVENLABS_API_KEY,
)
def text_to_speech_file(text: str) -> str:
# Calling the text_to_speech conversion API with detailed parameters
response = elevenlabs.text_to_speech.convert(
voice_id="pNInz6obpgDQGcFmaJgB", # Adam pre-made voice
output_format="mp3_22050_32",
text=text,
model_id="eleven_flash_v2_5", # use the flash model for low latency
# Optional voice settings that allow you to customize the output
voice_settings=VoiceSettings(
stability=0.0,
similarity_boost=1.0,
style=0.0,
use_speaker_boost=True,
speed=1.0,
),
)
# uncomment the line below to play the audio back
# play(response)
# Generating a unique file name for the output MP3 file
save_file_path = f"{uuid.uuid4()}.mp3"
# Writing the audio to a file
with open(save_file_path, "wb") as f:
for chunk in response:
if chunk:
f.write(chunk)
print(f"{save_file_path}: A new audio file was saved successfully!")
# Return the path of the saved audio file
return save_file_path

फिर आप इस फ़ंक्शन को ऐसे चला सकते हैं:

text_to_speech_file("Hello World")

टेक्स्ट को स्पीच में बदलें (स्ट्रीमिंग)

अगर आप ऑडियो को फ़ाइल में सेव किए बिना सीधे स्ट्रीम करना चाहते हैं, तो हमारी स्ट्रीमिंग सुविधा इस्तेमाल कर सकते हैं।

import os
from typing import IO
from io import BytesIO
from dotenv import load_dotenv
from elevenlabs import VoiceSettings
from elevenlabs.client import ElevenLabs
load_dotenv()
ELEVENLABS_API_KEY = os.getenv("ELEVENLABS_API_KEY")
elevenlabs = ElevenLabs(
api_key=ELEVENLABS_API_KEY,
)
def text_to_speech_stream(text: str) -> IO[bytes]:
# Perform the text-to-speech conversion
response = elevenlabs.text_to_speech.stream(
voice_id="pNInz6obpgDQGcFmaJgB", # Adam pre-made voice
output_format="mp3_22050_32",
text=text,
model_id="eleven_multilingual_v2",
# Optional voice settings that allow you to customize the output
voice_settings=VoiceSettings(
stability=0.0,
similarity_boost=1.0,
style=0.0,
use_speaker_boost=True,
speed=1.0,
),
)
# Create a BytesIO object to hold the audio data in memory
audio_stream = BytesIO()
# Write each chunk of audio data to the stream
for chunk in response:
if chunk:
audio_stream.write(chunk)
# Reset stream position to the beginning
audio_stream.seek(0)
# Return the stream for further use
return audio_stream

फिर आप इस फ़ंक्शन को ऐसे चला सकते हैं:

text_to_speech_stream("This is James")

बोनस - AWS S3 पर अपलोड करना और सुरक्षित शेयरिंग लिंक पाना

जब आपका ऑडियो डेटा फ़ाइल या स्ट्रीम के रूप में बन जाए, तो आप इसे अपने यूज़र्स के साथ शेयर करना चाह सकते हैं। ऐसा करने का एक तरीका इसे AWS S3 बकेट में अपलोड करके एक सुरक्षित शेयरिंग लिंक जनरेट करना है।

डेटा को S3 पर अपलोड करने के लिए, आपको अपनी AWS access key ID, secret access key और AWS region name को अपनी .env फ़ाइल में जोड़ना होगा। क्रेडेंशियल्स पाने के लिए ये चरण अपनाएं:

  1. अपने AWS Management Console में लॉग इन करें: AWS होम पेज पर जाएं और अपने अकाउंट से साइन इन करें।
AWS Console लॉगिन
  1. IAM (Identity and Access Management) डैशबोर्ड खोलें: सर्विसेज़ मेनू में आपको IAM, “Security, Identity, & Compliance” के अंतर्गत मिलेगा। IAM डैशबोर्ड आपके AWS सर्विसेज़ के एक्सेस को सुरक्षित रूप से मैनेज करता है।
AWS IAM डैशबोर्ड
  1. नया यूज़र बनाएं (ज़रूरत होने पर): IAM डैशबोर्ड पर “Users” और फिर “Add user” चुनें। यूज़र का नाम दर्ज करें।
AWS IAM यूज़र जोड़ें
  1. परमिशन सेट करें: जिस स्तर का एक्सेस देना चाहते हैं, उसके अनुसार सीधे यूज़र से पॉलिसीज़ अटैच करें। S3 अपलोड के लिए आप AmazonS3FullAccess पॉलिसी इस्तेमाल कर सकते हैं। हालांकि, न्यूनतम विशेषाधिकार देना सबसे अच्छा तरीका है, यानी किसी काम के लिए केवल ज़रूरी परमिशन ही दें। आप एक कस्टम पॉलिसी बना सकते हैं, जो आपके S3 बकेट पर सिर्फ़ ज़रूरी कार्रवाइयों की अनुमति दे।
AWS IAM यूज़र के लिए परमिशन सेट करें
  1. यूज़र की समीक्षा करें और बनाएं: अपनी सेटिंग्स की समीक्षा करें और यूज़र बनाएं। बनने के बाद आपको access key ID और secret access key दिखेगी। इन क्रेडेंशियल्स को डाउनलोड करके सुरक्षित रूप से सेव करना न भूलें; इस चरण के बाद secret access key फिर से नहीं पाई जा सकती।
AWS एक्सेस सीक्रेट कुंजी
  1. AWS region name पाएं: उदाहरण: us-east-1
AWS Region Name

अगर आपके पास AWS S3 बकेट नहीं है, तो आपको इन चरणों का पालन करके नया बकेट बनाना होगा:

  1. S3 डैशबोर्ड खोलें: सर्विसेज़ मेनू में आपको S3, “Storage” के अंतर्गत मिलेगा।
AWS S3 डैशबोर्ड
  1. नया बकेट बनाएं: S3 डैशबोर्ड पर “Create bucket” बटन पर क्लिक करें।
Create Bucket बटन पर क्लिक करें
  1. बकेट का नाम दर्ज करें और “Create bucket” बटन पर क्लिक करें। आप बकेट के अन्य विकल्पों को डिफ़ॉल्ट पर ही छोड़ सकते हैं। नया जोड़ा गया बकेट सूची में दिखाई देगा।
नया S3 बकेट नाम दर्ज करें
S3 बकेट सूची

pip और npm का इस्तेमाल करके AWS सर्विसेज़ के साथ इंटरैक्ट करने के लिए boto3 इंस्टॉल करें।

pip install boto3

फिर एनवायरनमेंट वेरिएबल्स को .env फ़ाइल में इस तरह जोड़ें:

AWS_ACCESS_KEY_ID=your_aws_access_key_id_here
AWS_SECRET_ACCESS_KEY=your_aws_secret_access_key_here
AWS_REGION_NAME=your_aws_region_name_here
AWS_S3_BUCKET_NAME=your_s3_bucket_name_here

ऑडियो स्ट्रीम को S3 पर अपलोड करने और साइन किया गया URL जनरेट करने के लिए ये फ़ंक्शन जोड़ें।

import os
import boto3
import uuid
AWS_ACCESS_KEY_ID = os.getenv("AWS_ACCESS_KEY_ID")
AWS_SECRET_ACCESS_KEY = os.getenv("AWS_SECRET_ACCESS_KEY")
AWS_REGION_NAME = os.getenv("AWS_REGION_NAME")
AWS_S3_BUCKET_NAME = os.getenv("AWS_S3_BUCKET_NAME")
session = boto3.Session(
aws_access_key_id=AWS_ACCESS_KEY_ID,
aws_secret_access_key=AWS_SECRET_ACCESS_KEY,
region_name=AWS_REGION_NAME,
)
s3 = session.client("s3")
def generate_presigned_url(s3_file_name: str) -> str:
signed_url = s3.generate_presigned_url(
"get_object",
Params={"Bucket": AWS_S3_BUCKET_NAME, "Key": s3_file_name},
ExpiresIn=3600,
) # URL expires in 1 hour
return signed_url
def upload_audiostream_to_s3(audio_stream) -> str:
s3_file_name = f"{uuid.uuid4()}.mp3" # Generates a unique file name using UUID
s3.upload_fileobj(audio_stream, AWS_S3_BUCKET_NAME, s3_file_name)
return s3_file_name

अब आप टेक्स्ट से मिली ऑडियो स्ट्रीम के साथ अपलोडिंग फ़ंक्शन को कॉल कर सकते हैं।

s3_file_name = upload_audiostream_to_s3(audio_stream)

ऑडियो फ़ाइल को S3 पर अपलोड करने के बाद, फ़ाइल का एक्सेस शेयर करने के लिए एक साइन किया गया URL जनरेट करें। यह URL सीमित समय के लिए मान्य होगा, यानी एक तय अवधि बाद समाप्त हो जाएगा, इसलिए अस्थायी शेयरिंग के लिए सुरक्षित है।

अब आप फ़ाइल से URL ऐसे जनरेट कर सकते हैं:

signed_url = generate_presigned_url(s3_file_name)
print(f"Signed URL to access the file: {signed_url}")

अगर आप फ़ाइल को कई बार इस्तेमाल करना चाहते हैं, तो साइन किया हुआ URL सीधे सेव करने के बजाय अपने डेटाबेस में S3 फ़ाइल पाथ सेव करें और ज़रूरत पड़ने पर हर बार साइन किया हुआ URL फिर से जनरेट करें, क्योंकि वह समाप्त हो जाएगा।

सब कुछ एक साथ जोड़ने के लिए, आप नीचे दिया गया स्क्रिप्ट इस्तेमाल कर सकते हैं:

import os
from dotenv import load_dotenv
load_dotenv()
from text_to_speech_stream import text_to_speech_stream
from s3_uploader import upload_audiostream_to_s3, generate_presigned_url
def main():
text = "This is James"
audio_stream = text_to_speech_stream(text)
s3_file_name = upload_audiostream_to_s3(audio_stream)
signed_url = generate_presigned_url(s3_file_name)
print(f"Signed URL to access the file: {signed_url}")
if __name__ == "__main__":
main()

निष्कर्ष

अब आप जानते हैं कि टेक्स्ट को स्पीच में कैसे बदलें और ऑडियो फ़ाइल शेयर करने के लिए साइन किया गया URL कैसे जनरेट करें। यह सुविधा आपको डायनामिक रूप से कंटेंट बनाने और शेयर करने के कई अवसर देती है।

इससे आप ये चीज़ें बना सकते हैं:

  1. शैक्षिक पॉडकास्ट: ऐसा व्यक्तिगत शैक्षिक कंटेंट बनाएं जिसे छात्र ज़रूरत पड़ने पर एक्सेस कर सकें। शिक्षक अपने पाठों को ऑडियो फ़ॉर्मैट में बदल सकते हैं, उन्हें S3 पर अपलोड कर सकते हैं और पारंपरिक कक्षा के बाहर अधिक आकर्षक सीखने के अनुभव के लिए छात्रों के साथ लिंक शेयर कर सकते हैं।

  2. वेबसाइटों के लिए एक्सेसिबिलिटी सुविधाएं: टेक्स्ट कंटेंट को ऑडियो फ़ॉर्मैट में उपलब्ध कराकर वेबसाइट की एक्सेसिबिलिटी बढ़ाएं। इससे वेबसाइट की जानकारी दृष्टिबाधित लोगों या सुनकर सीखना पसंद करने वालों के लिए अधिक सुलभ हो सकती है।

  3. ऑटोमेटेड कस्टमर सपोर्ट मैसेज: कस्टमर सपोर्ट के लिए ऑटोमेटेड और व्यक्तिगत ऑडियो मैसेज बनाएं, जैसे FAQs या ऑर्डर अपडेट। यह पारंपरिक टेक्स्ट ईमेल की तुलना में अधिक आकर्षक ग्राहक अनुभव दे सकता है।

  4. ऑडियोबुक और नैरेशन: पूरी किताबों या छोटी कहानियों को ऑडियो फ़ॉर्मैट में बदलें, जिससे श्रोता साहित्य का आनंद नए तरीके से ले सकें। लेखक और प्रकाशक अपने कंटेंट ऑफ़रिंग में विविधता ला सकते हैं और पढ़ने के बजाय सुनना पसंद करने वाले लोगों तक पहुंच सकते हैं।

  5. भाषा सीखने के टूल: ऐसे भाषा-शिक्षण सहायक बनाएं जो सीखने वालों को ऑडियो लेसन और अभ्यास दें। इससे उच्चारण और सुनने के कौशल का केंद्रित तरीके से अभ्यास करना संभव होता है।

अगले चरण