Experimente

Führen Sie kontrollierte A/B-Tests mit Produktions-Traffic durch, um die Agentenleistung anhand von Daten statt Intuition zu optimieren

Mit Experimenten führen Sie kontrollierte A/B-Tests für jeden Aspekt der Agentenkonfiguration durch — Prompt-Struktur, Workflow-Logik, Stimme, Persönlichkeit, Tools, Wissensdatenbank — indem Sie einen definierten Teil des Traffics an eine Variante leiten, die Auswirkungen auf zentrale Ergebnisse messen und Gewinner in die Produktion übernehmen.

Experimente basieren auf der Agentenversionierung. Die Versionierung muss für Ihren Agenten aktiviert sein, bevor Sie Experimente durchführen können.

Warum experimentieren

Ohne strukturierte Experimente basiert Optimierung auf Intuition. Eine Prompt-Anpassung „fühlt“ sich besser an. Eine Workflow-Anpassung „sollte“ die Containment-Rate verbessern. Ein neuer Eskalationspfad „scheint“ effizienter.

Experimente ersetzen Vermutungen durch Belege. Sie testen Änderungen mit Live-Traffic, messen tatsächliche Ergebnisse und übernehmen, was funktioniert.

So funktioniert es

Experimente folgen einem Workflow in vier Schritten:

1

Variante erstellen

Beginnen Sie mit Ihrer aktuellen Agentenkonfiguration und erstellen Sie einen neuen Branch. Ändern Sie beliebige Elemente — System-Prompt, Workflow, Stimme, Tools, Wissensdatenbank, Guardrails oder Bewertungskriterien. Jede Änderung wird als versionierte Konfiguration erfasst.

Navigieren Sie in den Agenteneinstellungen zum Tab Branches und klicken Sie auf Branch erstellen.

2

Traffic leiten

Legen Sie fest, welcher Prozentsatz der Live-Konversationen an Ihre Variante gehen soll. Beginnen Sie klein (5–10 %), um das Risiko zu begrenzen, und erhöhen Sie den Anteil mit wachsendem Vertrauen.

Klicken Sie auf Traffic-Aufteilung bearbeiten und legen Sie die Prozentsätze für jeden Branch fest. Die Prozentsätze müssen zusammen genau 100 % ergeben.

Traffic-Aufteilung zwischen Branches konfigurieren

3

Auswirkungen messen

Vergleichen Sie die Leistung der Variante mit Ihrer Baseline über das Analytics-Dashboard. Klicken Sie im Branches-Bereich auf Analytics anzeigen, um direkt zu einer nach Branch gefilterten Ansicht zu gelangen.

Branches-Bereich mit Main- und Varianten-Branches, Traffic-Aufteilung und Merge-Optionen

Teams können Ergebnisse messen wie:

  • CSAT
  • Containment-Rate
  • Conversion
  • Durchschnittliche Bearbeitungszeit
  • Mediane Antwortlatenz des Agenten
  • Kosten pro vom Agenten gelöstem Vorgang
4

Gewinner übernehmen

Sobald eine Variante eine messbare Verbesserung zeigt, erhöhen Sie entweder ihren Traffic-Anteil oder mergen Sie sie in den Main-Branch, um sie zum neuen Standard zu machen. Der vollständige Versionsverlauf bleibt erhalten und ermöglicht bei Bedarf Rollbacks.

Traffic-Routing

Der Traffic wird prozentual zwischen Branches aufgeteilt. Das Routing ist anhand der Konversations-ID deterministisch, sodass derselbe Nutzer über Sitzungen hinweg immer denselben Branch erreicht.

Standardmäßig wird der Traffic über die Nutzerbasis hinweg zufällig verteilt. Wenn Sie die API zum Starten von Konversationen verwenden, können Sie bestimmte Kohorten an bestimmte Branches leiten, indem Sie steuern, welche Konversationen mit welcher Branch-Konfiguration gestartet werden.

Alle Traffic-Prozentsätze müssen zusammen genau 100 % ergeben. Ein Deployment schlägt fehl, wenn dies nicht der Fall ist.

Anwendungsfälle

Experimente unterstützen die kontinuierliche Optimierung kundenorientierter und operativer Workflows.

Kundenerlebnis

Testen Sie, ob ein überarbeiteter Eskalationsablauf den CSAT verbessert, ohne die Bearbeitungszeit zu erhöhen. Vergleichen Sie verschiedene Begrüßungsstile, Empathielevel oder Lösungsstrategien.

Umsatz

Testen Sie, ob ein direkterer Ton oder eine andere Qualifizierungslogik die Conversion erhöht. Experimentieren Sie mit Einwandbehandlung, Preispräsentation oder dem Zeitpunkt von Follow-ups.

Betrieb

Messen Sie, ob Änderungen an der Tool-Logik die durchschnittliche Bearbeitungszeit oder Infrastrukturkosten senken. Testen Sie verschiedene Konfigurationen der Wissensdatenbank oder Workflow-Strukturen.

Jedes Experiment ist an eine bestimmte Agentenversion gebunden, sodass jede Leistungsänderung einer definierten Konfigurationsänderung zugeordnet werden kann.

Was Sie testen können

Jeder Aspekt der Agentenkonfiguration kann zwischen Branches variieren:

KategorieBeispiele
System-PromptTon, Anweisungen, Persönlichkeit, Guardrails
WorkflowKnotenstruktur, Verzweigungslogik, Eskalationspfade
StimmeStimmauswahl, TTS-Modell, Geschwindigkeitseinstellungen
ToolsTool-Konfiguration, Webhook-Tool-Logik, MCP-Server
WissensdatenbankUnterschiedliche Dokumente, RAG-Einstellungen
LLMModellauswahl, Temperatur, maximale Tokens
BewertungskriterienUnterschiedliche Erfolgsmetriken pro Branch
SpracheSpracheinstellungen, mehrsprachige Konfigurationen

Best Practices

Definieren Sie vor dem Erstellen einer Variante, was Sie verbessern möchten und wie Sie es messen. Zum Beispiel: „Wenn wir den Eskalations-Prompt um eine Zusammenfassung des Problems ergänzen, verbessert sich unser Bewertungskriterium für die Lösungsrate um 10 %.“

Das Isolieren einer einzelnen Variable macht klar, was Leistungsunterschiede verursacht hat. Wenn Sie Prompt, Stimme und Workflow gleichzeitig ändern, wissen Sie nicht, welche Änderung das Ergebnis bewirkt hat.

Konfigurieren Sie Kriterien für die Erfolgsbewertung, bevor Sie Experimente durchführen. Sie liefern die strukturierten Metriken, die Sie benötigen, um Varianten objektiv zu vergleichen.

Starten Sie mit 5–10 % des Traffics für die Variante. Das begrenzt die Auswirkung, falls etwas schiefläuft, und liefert dennoch aussagekräftige Daten.

Lassen Sie ausreichend Konversationen zusammenkommen, bevor Sie Schlussfolgerungen ziehen. Kleine Stichproben führen zu unzuverlässigen Ergebnissen. Überwachen Sie das Analytics-Dashboard und warten Sie, bis sich Trends stabilisieren.

Mergen oder verwerfen Sie Experimente zeitnah. Lang laufende Branches lassen sich schwerer mergen und können von der Hauptkonfiguration abweichen.

Nächste Schritte