Ausdrucksstarker Modus
Erstellen Sie Sprachagenten, die Tonfall, Timing und emotionale Ausdrucksweise anhand des Gesprächskontexts anpassen.
Überblick
Der ausdrucksstarke Modus ermöglicht Agenten, Sprache mit passender Absicht, Emotion und Betonung auszugeben. Sie passen sich in Echtzeit daran an, wie Nutzer klingen und was sie sagen. Er basiert auf zwei Verbesserungen auf Systemebene im Gesprächs-Stack:
- Eleven v3 Conversational — das emotional intelligenteste und kontextbewussteste Text to Speech-Modell in ElevenAgents.
- Ein neues System für Sprecherwechsel — präziser getimte Antworten mit weniger Unterbrechungen.
Der ausdrucksstarke Modus ist standardmäßig aktiviert, wenn Sie Eleven v3 Conversational als TTS-Modell Ihres Agenten auswählen.
Eleven v3 Conversational
Eleven v3 Conversational ist eine Version von Eleven v3 mit extrem niedriger Latenz, optimiert für Live-Dialoge im Wechsel. Es behält den Gesprächskontext über mehrere Sprecherwechsel hinweg bei und passt die Ausdrucksweise an Tonfall und Absicht jeder Interaktion an.
- Kontextbewusste Ausdrucksweise: Agenten passen ihren Tonfall an den Gesprächskontext an — sie reagieren ruhiger, wenn ein Nutzer besorgt klingt, oder direkter, wenn Klarheit wichtig ist.
- Explizite emotionale Steuerung: Steuern Sie die Ausdrucksweise mit Regeln im System Prompt — von präzisen Auslösern bis zu umfassenderen Szenarien — passend zu Markenstimme und Compliance-Anforderungen.
- Unterstützung für mehr als 70 Sprachen: Erweitert von etwa 32 Sprachen in Flash-Modellen, mit besserer Ausdruckskraft in Sprachen, in denen Nuancen bisher schwächer waren, einschließlich Japanisch.
- Ausdrucksstarke Tags: Das LLM kann Tags wie
[laughs],[whispers]oder[sighs]ausgeben, um bestimmte Momente der Ausdrucksweise zu steuern.
Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.
System für Sprecherwechsel
Das neue System für Sprecherwechsel nutzt Echtzeitsignale von Scribe v2 Realtime — einschließlich emotionaler Hinweise und Sprachmuster — um zu bestimmen, wann ein Agent sprechen, pausieren oder warten sollte. So reagieren Agenten natürlicher, besonders in emotional aufgeladenen Situationen.
Zum Beispiel kann „ja“ eine vollständige Bestätigung oder der Auftakt zum Weitersprechen sein. Indem das System zusätzlich zum Transkript analysiert, wie es gesagt wurde (Sprachmerkmale wie Prosodie), plant es die Antwort des Agenten natürlicher.
Das Verhalten bei Sprecherwechseln lässt sich mit der Einstellung Reaktionsbereitschaft weiter anpassen.
Konfiguration
Ausdrucksstarken Modus aktivieren
TTS-Modell auswählen
Legen Sie das TTS-Modell Ihres Agenten auf V3 Conversational fest. Der ausdrucksstarke Modus ist bei diesem Modell standardmäßig aktiviert.
Über das Dashboard aktualisieren
Über die CLI aktualisieren
Über die API aktualisieren
Öffnen Sie Ihren Agenten im Dashboard, navigieren Sie zum Tab Agent Voice und wählen Sie V3 Conversational als Ihr Text to Speech-Modell. Speichern Sie Ihre Änderungen.

Beispiele für System Prompts
Steuern Sie die emotionale Ausdrucksweise Ihres Agenten mit natürlichsprachlichen Anweisungen im System Prompt. Das Modell interpretiert sie kontextabhängig, daher sind explizite Tags nicht in jeder Situation erforderlich.
Allgemeine Vorgaben
Spezifische Auslöser
Ausdrucksstarke Tags verwenden
Zusätzlich zur kontextbewussten Ausdrucksweise kann das LLM explizite Tags ausgeben, um bestimmte Momente zu steuern. Häufige Tags sind:
[laughs]— Fügt der Sprache Lachen hinzu[whispers]— Verringert die Lautstärke zum Flüstern[sighs]— Fügt einen seufzenden Klang hinzu[slow]— Verlangsamt die Sprachausgabe[excited]— Fügt der Ausdrucksweise Begeisterung hinzu
Jeder Tag wirkt sich auf etwa die nächsten 4–5 gesprochenen Wörter aus, bevor die normale Ausdrucksweise zurückkehrt.
Best Practices
Ausdrucksweise an den Kontext anpassen
Leiten Sie Ihren Agenten an, seine emotionale Ausdrucksweise an die Situation anzupassen. Ein frustrierter Kunde sollte eine ruhige, einfühlsame Antwort hören. Ein Nutzer, der gute Nachrichten teilt, sollte echte Wärme hören. Ein unpassender Tonfall untergräbt Vertrauen.
Regeln im System Prompt für Konsistenz nutzen
Definieren Sie klare Tonfallrichtlinien in Ihrem System Prompt, statt sich nur auf die Einschätzung des Modells zu verlassen. So gewährleisten Sie eine konsistente Ausdrucksweise, die Ihrer Markenstimme und Ihren Compliance-Anforderungen entspricht.
Sprachübergreifend testen
Die ausdrucksstarke Wiedergabe kann je nach Sprache variieren. Testen Sie Ihren Agenten in jeder Zielsprache, um sicherzustellen, dass die emotionale Nuance wie beabsichtigt ankommt — insbesondere in Sprachen mit anderen Gesprächsnormen.
Mit Einstellungen zur Reaktionsbereitschaft kombinieren
Kombinieren Sie den ausdrucksstarken Modus mit passenden Einstellungen für die Reaktionsbereitschaft. Der geduldige Modus gibt Nutzern in emotional sensiblen Gesprächen mehr Raum, während der eifrige Modus für schnelle Interaktionen geeignet ist.
Überwachen und iterieren
Nutzen Sie Gesprächsanalysen, um nachzuverfolgen, wie Nutzer auf die ausdrucksstarke Wiedergabe reagieren. Verfeinern Sie Ihre Tonfallrichtlinien anhand von Gesprächsergebnissen und Nutzerfeedback.
Einschränkungen
- Eleven v3 Conversational bewahrt die Eigenschaften von Professional Voice Clones (PVCs) nicht — die Ausgabe klingt möglicherweise nicht wie die ursprüngliche PVC-Stimme.
- Effekte ausdrucksstarker Tags halten etwa 4–5 Wörter an, bevor die normale Ausdrucksweise zurückkehrt.
- Die Ausdruckskraft kann je nach Stimme und Sprache variieren.
FAQ
Kostet der ausdrucksstarke Modus mehr?
Nein. Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.
Wie aktiviere ich den ausdrucksstarken Modus?
Wählen Sie V3 Conversational als TTS-Modell Ihres Agenten aus. Der ausdrucksstarke Modus ist bei diesem Modell standardmäßig aktiviert.
Wie funktioniert das System für Sprecherwechsel?
Das System nutzt Echtzeitsignale von Scribe v2 Realtime, einschließlich emotionaler Hinweise und Sprachmuster, um vorherzusagen, wann der Agent antworten sollte. Es analysiert sowohl das Transkript als auch die Art, wie Wörter gesprochen wurden (Prosodie), um Antworten natürlich zu timen.
Kann ich den ausdrucksstarken Modus mit meinem Professional Voice Clone verwenden?
Eleven v3 Conversational bewahrt PVC-Eigenschaften derzeit nicht gut. Wenn die Identität Ihrer PVC-Stimme entscheidend ist, sollten Sie stattdessen Flash v2 verwenden.
Wie viele Sprachen unterstützt Eleven v3 Conversational?
Eleven v3 Conversational unterstützt mehr als 70 Sprachen, erweitert von etwa 32 in Flash-Modellen. Dazu gehört eine verbesserte Ausdruckskraft in Sprachen wie Japanisch, in denen Nuancen bisher schwächer waren.
Wie schneidet dies im Vergleich zu anderen TTS-Modellen in ElevenAgents ab?
Eleven v3 Conversational bietet einen größeren emotionalen Umfang als Flash und Multilingual v2 und kann die Ausdrucksweise anhand des Gesprächskontexts anpassen. Es unterstützt über 70 Sprachen, verglichen mit etwa 32 bei Flash. Der Preis entspricht dem anderer Modelle.