अभिव्यंजक मोड

ऐसे वॉइस एजेंट बनाएं जो बातचीत के संदर्भ के आधार पर टोन, समय और भावनात्मक अभिव्यक्ति को अनुकूलित करें।

खास जानकारी

अभिव्यंजक मोड एजेंटों को ऐसा भाषण देने में सक्षम बनाता है जो इरादे, भावना और जोर को दर्शाता है। यह यूज़र के बोलने के तरीके और उनकी बातों के अनुसार रीयल टाइम में ढलता है। यह कन्वर्सेशनल स्टैक में दो सिस्टम-स्तरीय सुधारों पर आधारित है:

  1. Eleven v3 Conversational — ElevenAgents में उपलब्ध सबसे भावनात्मक रूप से बुद्धिमान और संदर्भ-सजग टेक्स्ट टू स्पीच मॉडल।
  2. एक नया टर्न-टेकिंग सिस्टम — कम रुकावटों के साथ अधिक सटीक समय पर जवाब।

जब आप अपने एजेंट के TTS मॉडल के रूप में Eleven v3 Conversational चुनते हैं, तो अभिव्यंजक मोड डिफ़ॉल्ट रूप से चालू हो जाता है।

Eleven v3 Conversational

Eleven v3 Conversational, Eleven v3 का बेहद कम-लेटेंसी वाला संस्करण है, जिसे लाइव, दोतरफ़ा बातचीत के लिए ऑप्टिमाइज़ किया गया है। यह टर्न के बीच बातचीत का संदर्भ बनाए रखता है और हर बातचीत के टोन व इरादे के अनुसार अपनी डिलीवरी को ढालता है।

  • संदर्भ-सजग डिलीवरी: एजेंट बातचीत के संदर्भ के आधार पर टोन बदलते हैं — यूज़र के चिंतित लगने पर ज़्यादा शांत और स्पष्टता अहम होने पर ज़्यादा सीधे जवाब देते हैं।
  • स्पष्ट भावनात्मक नियंत्रण: ब्रांड वॉइस और अनुपालन आवश्यकताओं के अनुरूप डिलीवरी के लिए, सटीक ट्रिगर से लेकर व्यापक स्थितियों तक, सिस्टम प्रॉम्प्ट नियमों का इस्तेमाल करें।
  • 70+ भाषाओं का समर्थन: Flash मॉडल की ~32 भाषाओं से बढ़कर 70+ भाषाएं, जिनमें जापानी जैसी उन भाषाओं में बेहतर अभिव्यक्ति शामिल है जहां पहले बारीकियां कमज़ोर थीं।
  • अभिव्यंजक टैग: LLM डिलीवरी के खास क्षणों को नियंत्रित करने के लिए [laughs], [whispers] या [sighs] जैसे टैग आउटपुट कर सकता है।

Eleven v3 Conversational की कीमत Agents में अन्य ElevenLabs TTS मॉडलों के समान है, जो $0.08 प्रति मिनट से शुरू होती है।

टर्न-टेकिंग सिस्टम

नया टर्न-टेकिंग सिस्टम Scribe v2 Realtime के रीयल-टाइम संकेतों — जिनमें भावनात्मक संकेत और बोलने के पैटर्न शामिल हैं — का उपयोग करके तय करता है कि एजेंट को कब बोलना, रुकना या इंतज़ार करना चाहिए। इससे एजेंट ज़्यादा स्वाभाविक ढंग से जवाब दे पाते हैं, खासकर भावनात्मक स्थितियों में।

उदाहरण के लिए, “हाँ” एक पूरा स्वीकारोक्ति जवाब हो सकता है या आगे बोलते रहने की शुरुआत। ट्रांसक्रिप्ट के साथ-साथ इसे किस तरह कहा गया था (प्रोसोडी जैसे भाषण संकेत) का विश्लेषण करके, सिस्टम एजेंट के जवाब का समय अधिक स्वाभाविक बनाता है।

टर्न-टेकिंग व्यवहार को टर्न तत्परता सेटिंग से और बेहतर ढंग से ट्यून किया जा सकता है।

कॉन्फ़िगरेशन

अभिव्यंजक मोड चालू करना

1

TTS मॉडल चुनें

अपने एजेंट का TTS मॉडल V3 Conversational पर सेट करें। इस मॉडल के साथ अभिव्यंजक मोड डिफ़ॉल्ट रूप से चालू रहता है।

डैशबोर्ड में अपना एजेंट खोलें, Agent Voice टैब पर जाएं और अपना टेक्स्ट टू स्पीच मॉडल V3 Conversational चुनें। बदलाव सेव करें।

अभिव्यंजक मोड चालू करना

2

अपने सिस्टम प्रॉम्प्ट में भावनात्मक डिलीवरी को निर्देशित करें

एजेंट के टोन को ढालने के लिए उसके सिस्टम प्रॉम्प्ट में निर्देश जोड़ें। आप व्यापक मार्गदर्शन या खास ट्रिगर का उपयोग कर सकते हैं।

सिस्टम प्रॉम्प्ट के उदाहरण

सिस्टम प्रॉम्प्ट में प्राकृतिक भाषा के निर्देशों से अपने एजेंट की भावनात्मक डिलीवरी को निर्देशित करें। मॉडल इन्हें संदर्भ के अनुसार समझता है, इसलिए हर स्थिति के लिए स्पष्ट टैग ज़रूरी नहीं हैं।

व्यापक मार्गदर्शन

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

खास ट्रिगर

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

अभिव्यंजक टैग का उपयोग

संदर्भ-सजग डिलीवरी के अलावा, LLM खास क्षणों को नियंत्रित करने के लिए स्पष्ट टैग आउटपुट कर सकता है। सामान्य टैग में शामिल हैं:

  • [laughs] — भाषण में हंसी जोड़ता है
  • [whispers] — फुसफुसाने के लिए आवाज़ कम करता है
  • [sighs] — आह भरने का भाव जोड़ता है
  • [slow] — बोलने की गति धीमी करता है
  • [excited] — डिलीवरी में उत्साह जोड़ता है

हर टैग सामान्य डिलीवरी पर लौटने से पहले भाषण के लगभग अगले 4-5 शब्दों को प्रभावित करता है।

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

सर्वोत्तम तरीके

अपने एजेंट को स्थिति के अनुसार भावनात्मक डिलीवरी मिलाने का निर्देश दें। निराश ग्राहक को शांत, सहानुभूतिपूर्ण जवाब सुनना चाहिए। अच्छी खबर साझा करने वाले यूज़र को सच्ची गर्मजोशी सुनाई देनी चाहिए। बेमेल टोन भरोसा कम करता है।

सिर्फ मॉडल के निर्णय पर निर्भर रहने के बजाय, अपने सिस्टम प्रॉम्प्ट में स्पष्ट टोन दिशानिर्देश तय करें। इससे आपके ब्रांड वॉइस और अनुपालन आवश्यकताओं के अनुरूप निरंतर डिलीवरी सुनिश्चित होती है।

अभिव्यंजक डिलीवरी भाषाओं के बीच अलग हो सकती है। हर लक्ष्य भाषा में अपने एजेंट का परीक्षण करें, ताकि भावनात्मक बारीकियां अपेक्षा के अनुसार पहुंचें, खासकर उन भाषाओं में जहां बातचीत के मानदंड अलग हैं।

अभिव्यंजक मोड को उचित टर्न तत्परता सेटिंग के साथ इस्तेमाल करें। धैर्यवान मोड भावनात्मक रूप से संवेदनशील बातचीत में यूज़र्स को ज़्यादा समय देता है, जबकि उत्सुक मोड तेज़ बातचीत के लिए बेहतर है।

अभिव्यंजक डिलीवरी पर यूज़र्स की प्रतिक्रिया को ट्रैक करने के लिए बातचीत विश्लेषण का उपयोग करें। बातचीत के नतीजों और यूज़र फ़ीडबैक के आधार पर अपने टोन दिशानिर्देश बेहतर करें।

सीमाएं

  • Eleven v3 Conversational, Professional Voice Clones (PVCs) की विशेषताओं को सुरक्षित नहीं रखता — आउटपुट मूल PVC वॉइस जैसा नहीं लग सकता।
  • अभिव्यंजक टैग का प्रभाव सामान्य डिलीवरी पर लौटने से पहले लगभग 4-5 शब्दों तक रहता है।
  • वॉइस और भाषाओं के बीच अभिव्यक्ति अलग हो सकती है।

FAQ

नहीं। Eleven v3 Conversational की कीमत Agents में अन्य ElevenLabs TTS मॉडलों के समान है, जो $0.08 प्रति मिनट से शुरू होती है।

अपने एजेंट के TTS मॉडल के रूप में V3 Conversational चुनें। इस मॉडल के साथ अभिव्यंजक मोड डिफ़ॉल्ट रूप से चालू रहता है।

यह सिस्टम एजेंट को कब जवाब देना चाहिए, इसका अनुमान लगाने के लिए Scribe v2 Realtime के रीयल-टाइम संकेतों का उपयोग करता है, जिनमें भावनात्मक संकेत और बोलने के पैटर्न शामिल हैं। यह जवाबों का समय स्वाभाविक बनाने के लिए ट्रांसक्रिप्ट और शब्द कैसे बोले गए थे (प्रोसोडी), दोनों का विश्लेषण करता है।

Eleven v3 Conversational फिलहाल PVC विशेषताओं को अच्छी तरह सुरक्षित नहीं रखता। अगर आपकी PVC वॉइस पहचान बनाए रखना अहम है, तो Flash v2 इस्तेमाल करने पर विचार करें।

Eleven v3 Conversational 70+ भाषाओं को सपोर्ट करता है, जो Flash मॉडलों की ~32 भाषाओं से बढ़ा है। इसमें जापानी जैसी भाषाओं में बेहतर अभिव्यक्ति शामिल है, जहां पहले बारीकियां कमज़ोर थीं।

Eleven v3 Conversational, Flash और Multilingual v2 की तुलना में व्यापक भावनात्मक रेंज देता है और बातचीत के संदर्भ के अनुसार डिलीवरी ढाल सकता है। यह Flash की ~32 भाषाओं के मुकाबले 70+ भाषाओं को सपोर्ट करता है। इसकी कीमत दूसरे मॉडलों के समान है।

संबंधित सुविधाएं