Unterhaltungen simulieren
Erfahren Sie, wie Sie Ihren ElevenLabs-Agenten mit simulierten Unterhaltungen testen und bewerten
Dieser Leitfaden und die verwendeten Endpunkte sind veraltet. Verwenden Sie stattdessen den Agenten-Testtyp Simulation.
Überblick
Mit der ElevenLabs Agents API können Sie textbasierte Unterhaltungen mit Ihrem KI-Agenten simulieren und bewerten. Dieser Leitfaden zeigt Ihnen, wie Sie einen vollständigen Workflow für Simulationstests mit den Endpunkten zum Simulieren von Unterhaltungen (Batch und Streaming) implementieren. So können Sie die Leistung Ihres Agenten gezielt testen und verbessern, damit er Ihre Interaktionsziele erfüllt.
Voraussetzungen
- Ein in ElevenLabs Agents konfigurierter Agent (hier erstellen)
- Ihr ElevenLabs-API-Schlüssel, den Sie im Dashboard erstellen können
Workflow für Simulationstests implementieren
Erste Bewertungsparameter festlegen
Durchsuchen Sie den Gesprächsverlauf Ihres Agenten und finden Sie Fälle, in denen Ihr Agent nicht die gewünschte Leistung erbracht hat. Nutzen Sie diese Gespräche, um verschiedene Prompts für einen simulierten Nutzer zu erstellen, der mit Ihrem Agenten interagiert. Definieren Sie außerdem zusätzliche Bewertungskriterien, die noch nicht in Ihrer Agentenkonfiguration festgelegt sind, um Ergebnisse zu testen, die Sie für einen bestimmten simulierten Nutzer erwarten.
Unterhaltung über das SDK simulieren
Erstellen Sie mit dem ElevenLabs SDK eine Anfrage an den Simulationsendpunkt.
Dies ist ein einfaches Beispiel. Eine vollständige Liste der Eingabeparameter finden Sie in der API- Referenz für die Endpunkte Unterhaltung simulieren und Unterhaltung per Stream simulieren.
Antwort analysieren
Das SDK liefert ein umfassendes JSON-Objekt mit dem vollständigen Gesprächstranskript und einer detaillierten Analyse.
Simulierte Unterhaltung: Erfasst jeden Interaktionsschritt zwischen dem simulierten Nutzer und dem Agenten, einschließlich Nachrichten und Tool-Nutzung.
Analyse: Bietet Einblicke in die Ergebnisse der Bewertungskriterien, Metriken zur Datenerfassung und eine Zusammenfassung des Gesprächstranskripts.
Bewertungskriterien verbessern
Prüfen Sie die simulierten Unterhaltungen sorgfältig, um die Wirksamkeit Ihrer Bewertungskriterien zu beurteilen. Identifizieren Sie Lücken oder Bereiche, in denen die Kriterien bei der Bewertung der Agentenleistung unzureichend sein könnten. Verfeinern und passen Sie die Bewertungskriterien entsprechend an, damit sie Ihren gewünschten Ergebnissen entsprechen und die Fähigkeiten des Agenten präzise messen.
Agenten verbessern
Sobald Sie von der Genauigkeit Ihrer Bewertungskriterien überzeugt sind, nutzen Sie die Erkenntnisse aus simulierten Unterhaltungen, um die Fähigkeiten Ihres Agenten zu erweitern. Erwägen Sie, den System-Prompt zu verfeinern, um die Antworten des Agenten besser zu steuern und sicherzustellen, dass sie Ihren Zielen und den Erwartungen der Nutzer entsprechen. Prüfen Sie außerdem weitere Funktionen oder Konfigurationen, die Sie optimieren könnten, etwa indem Sie den Ton des Agenten anpassen, seine Fähigkeit zur Bearbeitung bestimmter Anfragen verbessern oder zusätzliche Datenquellen integrieren, um seine Antworten anzureichern. Wenn Sie diese Erkenntnisse systematisch anwenden, können Sie einen robusteren und effektiveren Gesprächsagenten erstellen, der eine bessere Nutzererfahrung bietet.
Kontinuierliche Iteration
Nach einem ersten Test- und Verbesserungszyklus kann eine umfassende Testsuite eine gute Möglichkeit sein, ein breites Spektrum möglicher Szenarien abzudecken. Diese Suite kann mehrere simulierte Unterhaltungen mit unterschiedlichen Prompts für simulierte Nutzer und verschiedenen Ausgangsbedingungen untersuchen. Durch kontinuierliche Iteration und Verfeinerung Ihres Ansatzes stellen Sie sicher, dass Ihr Agent effektiv bleibt und auf sich wandelnde Nutzerbedürfnisse reagiert.
Profi-Tipps
Detaillierte Prompts und Kriterien
Detaillierte und ausführliche Prompts für simulierte Nutzer sowie Bewertungskriterien können die Wirksamkeit der Simulationstests verbessern. Je mehr Kontext und Spezifität Sie bereitstellen, desto besser kann der Agent komplexe Interaktionen verstehen und darauf reagieren.
Konfigurationen für Mock-Tools
Nutzen Sie Konfigurationen für Mock-Tools, um den Entscheidungsprozess Ihres Agenten zu testen. So können Sie beobachten, wie der Agent Tool-Aufrufe ausführt und auf unterschiedliche Ergebnisse von Tool-Aufrufen reagiert. Weitere Informationen finden Sie zum Eingabeparameter tool_mock_config in der API-Referenz.
Teilweiser Gesprächsverlauf
Nutzen Sie teilweise Gesprächsverläufe, um zu bewerten, wie Agenten Interaktionen ab einem bestimmten Zeitpunkt handhaben. Das ist besonders nützlich, um die Fähigkeit des Agenten zu beurteilen, Gespräche zu steuern, bei denen der Nutzer eine Frage bereits auf eine bestimmte Weise formuliert hat oder bestimmte Tool-Aufrufe erfolgreich waren oder fehlgeschlagen sind. Weitere Informationen finden Sie zum Eingabeparameter partial_conversation_history in der API-Referenz.