Ausdrucksstarker Modus

Erstellen Sie Sprachagenten, die Tonfall, Timing und emotionale Ausdrucksweise anhand des Gesprächskontexts anpassen.

Überblick

Der ausdrucksstarke Modus ermöglicht Agenten, Sprache mit passender Absicht, Emotion und Betonung auszugeben. Sie passen sich in Echtzeit daran an, wie Nutzer klingen und was sie sagen. Er basiert auf zwei Verbesserungen auf Systemebene im Gesprächs-Stack:

  1. Eleven v3 Conversational — das emotional intelligenteste und kontextbewussteste Text to Speech-Modell in ElevenAgents.
  2. Ein neues System für Sprecherwechsel — präziser getimte Antworten mit weniger Unterbrechungen.

Der ausdrucksstarke Modus ist standardmäßig aktiviert, wenn Sie Eleven v3 Conversational als TTS-Modell Ihres Agenten auswählen.

Eleven v3 Conversational

Eleven v3 Conversational ist eine Version von Eleven v3 mit extrem niedriger Latenz, optimiert für Live-Dialoge im Wechsel. Es behält den Gesprächskontext über mehrere Sprecherwechsel hinweg bei und passt die Ausdrucksweise an Tonfall und Absicht jeder Interaktion an.

  • Kontextbewusste Ausdrucksweise: Agenten passen ihren Tonfall an den Gesprächskontext an — sie reagieren ruhiger, wenn ein Nutzer besorgt klingt, oder direkter, wenn Klarheit wichtig ist.
  • Explizite emotionale Steuerung: Steuern Sie die Ausdrucksweise mit Regeln im System Prompt — von präzisen Auslösern bis zu umfassenderen Szenarien — passend zu Markenstimme und Compliance-Anforderungen.
  • Unterstützung für mehr als 70 Sprachen: Erweitert von etwa 32 Sprachen in Flash-Modellen, mit besserer Ausdruckskraft in Sprachen, in denen Nuancen bisher schwächer waren, einschließlich Japanisch.
  • Ausdrucksstarke Tags: Das LLM kann Tags wie [laughs], [whispers] oder [sighs] ausgeben, um bestimmte Momente der Ausdrucksweise zu steuern.

Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.

System für Sprecherwechsel

Das neue System für Sprecherwechsel nutzt Echtzeitsignale von Scribe v2 Realtime — einschließlich emotionaler Hinweise und Sprachmuster — um zu bestimmen, wann ein Agent sprechen, pausieren oder warten sollte. So reagieren Agenten natürlicher, besonders in emotional aufgeladenen Situationen.

Zum Beispiel kann „ja“ eine vollständige Bestätigung oder der Auftakt zum Weitersprechen sein. Indem das System zusätzlich zum Transkript analysiert, wie es gesagt wurde (Sprachmerkmale wie Prosodie), plant es die Antwort des Agenten natürlicher.

Das Verhalten bei Sprecherwechseln lässt sich mit der Einstellung Reaktionsbereitschaft weiter anpassen.

Konfiguration

Ausdrucksstarken Modus aktivieren

1

TTS-Modell auswählen

Legen Sie das TTS-Modell Ihres Agenten auf V3 Conversational fest. Der ausdrucksstarke Modus ist bei diesem Modell standardmäßig aktiviert.

Öffnen Sie Ihren Agenten im Dashboard, navigieren Sie zum Tab Agent Voice und wählen Sie V3 Conversational als Ihr Text to Speech-Modell. Speichern Sie Ihre Änderungen.

Ausdrucksstarken Modus aktivieren

2

Emotionale Ausdrucksweise im System Prompt steuern

Fügen Sie dem System Prompt Ihres Agenten Anweisungen hinzu, um die Anpassung seines Tonfalls zu steuern. Sie können allgemeine Vorgaben oder spezifische Auslöser verwenden.

Beispiele für System Prompts

Steuern Sie die emotionale Ausdrucksweise Ihres Agenten mit natürlichsprachlichen Anweisungen im System Prompt. Das Modell interpretiert sie kontextabhängig, daher sind explizite Tags nicht in jeder Situation erforderlich.

Allgemeine Vorgaben

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Spezifische Auslöser

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Ausdrucksstarke Tags verwenden

Zusätzlich zur kontextbewussten Ausdrucksweise kann das LLM explizite Tags ausgeben, um bestimmte Momente zu steuern. Häufige Tags sind:

  • [laughs] — Fügt der Sprache Lachen hinzu
  • [whispers] — Verringert die Lautstärke zum Flüstern
  • [sighs] — Fügt einen seufzenden Klang hinzu
  • [slow] — Verlangsamt die Sprachausgabe
  • [excited] — Fügt der Ausdrucksweise Begeisterung hinzu

Jeder Tag wirkt sich auf etwa die nächsten 4–5 gesprochenen Wörter aus, bevor die normale Ausdrucksweise zurückkehrt.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Best Practices

Leiten Sie Ihren Agenten an, seine emotionale Ausdrucksweise an die Situation anzupassen. Ein frustrierter Kunde sollte eine ruhige, einfühlsame Antwort hören. Ein Nutzer, der gute Nachrichten teilt, sollte echte Wärme hören. Ein unpassender Tonfall untergräbt Vertrauen.

Definieren Sie klare Tonfallrichtlinien in Ihrem System Prompt, statt sich nur auf die Einschätzung des Modells zu verlassen. So gewährleisten Sie eine konsistente Ausdrucksweise, die Ihrer Markenstimme und Ihren Compliance-Anforderungen entspricht.

Die ausdrucksstarke Wiedergabe kann je nach Sprache variieren. Testen Sie Ihren Agenten in jeder Zielsprache, um sicherzustellen, dass die emotionale Nuance wie beabsichtigt ankommt — insbesondere in Sprachen mit anderen Gesprächsnormen.

Kombinieren Sie den ausdrucksstarken Modus mit passenden Einstellungen für die Reaktionsbereitschaft. Der geduldige Modus gibt Nutzern in emotional sensiblen Gesprächen mehr Raum, während der eifrige Modus für schnelle Interaktionen geeignet ist.

Nutzen Sie Gesprächsanalysen, um nachzuverfolgen, wie Nutzer auf die ausdrucksstarke Wiedergabe reagieren. Verfeinern Sie Ihre Tonfallrichtlinien anhand von Gesprächsergebnissen und Nutzerfeedback.

Einschränkungen

  • Eleven v3 Conversational bewahrt die Eigenschaften von Professional Voice Clones (PVCs) nicht — die Ausgabe klingt möglicherweise nicht wie die ursprüngliche PVC-Stimme.
  • Effekte ausdrucksstarker Tags halten etwa 4–5 Wörter an, bevor die normale Ausdrucksweise zurückkehrt.
  • Die Ausdruckskraft kann je nach Stimme und Sprache variieren.

FAQ

Nein. Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.

Wählen Sie V3 Conversational als TTS-Modell Ihres Agenten aus. Der ausdrucksstarke Modus ist bei diesem Modell standardmäßig aktiviert.

Das System nutzt Echtzeitsignale von Scribe v2 Realtime, einschließlich emotionaler Hinweise und Sprachmuster, um vorherzusagen, wann der Agent antworten sollte. Es analysiert sowohl das Transkript als auch die Art, wie Wörter gesprochen wurden (Prosodie), um Antworten natürlich zu timen.

Eleven v3 Conversational bewahrt PVC-Eigenschaften derzeit nicht gut. Wenn die Identität Ihrer PVC-Stimme entscheidend ist, sollten Sie stattdessen Flash v2 verwenden.

Eleven v3 Conversational unterstützt mehr als 70 Sprachen, erweitert von etwa 32 in Flash-Modellen. Dazu gehört eine verbesserte Ausdruckskraft in Sprachen wie Japanisch, in denen Nuancen bisher schwächer waren.

Eleven v3 Conversational bietet einen größeren emotionalen Umfang als Flash und Multilingual v2 und kann die Ausdrucksweise anhand des Gesprächskontexts anpassen. Es unterstützt über 70 Sprachen, verglichen mit etwa 32 bei Flash. Der Preis entspricht dem anderer Modelle.

Verwandte Funktionen