Simulera konversationer
Lär dig testa och utvärdera din ElevenLabs-agent med simulerade konversationer
Den här guiden och de slutpunkter den använder är föråldrade. Använd testtypen Simulation för agenter i stället.
Översikt
Med ElevenLabs Agents API kan du simulera och utvärdera textbaserade konversationer med din AI-agent. Den här guiden visar hur du implementerar ett komplett arbetsflöde för simuleringstester med slutpunkterna för att simulera konversationer (batch och streaming). Det gör att du kan testa och förbättra din agents prestanda på detaljnivå, så att den uppfyller dina mål för interaktioner.
Förutsättningar
- En agent konfigurerad i ElevenLabs Agents (skapa en här)
- Din ElevenLabs API-nyckel, som du kan skapa i kontrollpanelen
Implementera ett arbetsflöde för simuleringstester
Identifiera inledande utvärderingsparametrar
Gå igenom din agents konversationshistorik och hitta exempel där agenten har presterat sämre. Använd dessa konversationer för att skapa olika uppmaningar för en simulerad användare som ska interagera med din agent. Definiera även extra utvärderingskriterier som inte redan anges i din agentkonfiguration, för att testa de resultat du vill ha för en specifik simulerad användare.
Simulera konversationen via SDK:t
Skapa en begäran till simuleringsslutpunkten med ElevenLabs SDK.
Detta är ett grundläggande exempel. En fullständig lista över indataparametrar finns i API- referensen för slutpunkterna Simulera konversation och Streama simulerad konversation.
Analysera svaret
SDK:t tillhandahåller ett omfattande JSON-objekt som innehåller hela konversationstranskriptet och detaljerad analys.
Simulerad konversation: Registrerar varje interaktionstur mellan den simulerade användaren och agenten, med information om meddelanden och verktygsanvändning.
Analys: Ger insikter om resultat för utvärderingskriterier, mätvärden för datainsamling och en sammanfattning av konversationstranskriptet.
Förbättra dina utvärderingskriterier
Gå igenom de simulerade konversationerna noggrant för att bedöma hur effektiva dina utvärderings- kriterier är. Identifiera eventuella luckor eller områden där kriterierna inte räcker till för att utvärdera agentens prestanda. Förfina och justera utvärderingskriterierna efter behov för att säkerställa att de stämmer överens med dina önskade resultat och mäter agentens förmågor korrekt.
Förbättra din agent
När du känner dig säker på att dina utvärderingskriterier är korrekta kan du använda lärdomarna från simulerade konversationer för att förbättra agentens förmågor. Överväg att förfina systemprompten för att bättre vägleda agentens svar, så att de stämmer överens med dina mål och användarnas förväntningar. Utforska även andra funktioner eller konfigurationer som kan optimeras, till exempel genom att justera agentens ton, förbättra dess förmåga att hantera specifika frågor eller integrera ytterligare datakällor för att berika svaren. Genom att systematiskt tillämpa dessa lärdomar kan du skapa en mer robust och effektiv konversationsagent som ger en bättre användarupplevelse.
Kontinuerlig iteration
När du har slutfört en inledande cykel av tester och förbättringar kan en omfattande testsvit vara ett bra sätt att täcka ett brett spektrum av möjliga scenarier. Testsviten kan utforska flera simulerade konversationer med varierade uppmaningar och startvillkor för simulerade användare. Genom att kontinuerligt iterera och förfina ditt arbetssätt kan du se till att din agent fortsätter vara effektiv och lyhörd för användarnas föränderliga behov.
Proffstips
Detaljerade uppmaningar och kriterier
Detaljerade och utförliga uppmaningar för simulerade användare och utvärderingskriterier kan göra simuleringstesterna mer effektiva. Ju mer kontext och specificitet du ger, desto bättre kan agenten förstå och svara på komplexa interaktioner.
Konfigurationer för mockverktyg
Använd konfigurationer för mockverktyg för att testa din agents beslutsprocess. Då kan du se hur agenten beslutar att göra verktygsanrop och reagerar på olika resultat från verktygsanrop. Mer information finns i indataparametern tool_mock_config i API-referensen.
Delvis konversationshistorik
Använd delvis konversationshistorik för att utvärdera hur agenter hanterar interaktioner från en specifik punkt. Det är särskilt användbart för att bedöma agentens förmåga att hantera konversationer där användaren redan har formulerat en fråga på ett specifikt sätt, eller där vissa verktygsanrop har lyckats eller misslyckats. Mer information finns i indataparametern partial_conversation_history i API-referensen.