Hoppa till navigering

Agenttestning

Bygg förtroende för agentens beteende med automatiserade tester

Agenttestning låter dig verifiera konversationssvar, verktygsanvändning och kompletta resultat över flera turer innan du driftsätter. Skapa tester från grunden eller utifrån befintliga konversationer och kör dem sedan från kontrollpanelen, CLI eller API.

Videogenomgång

Översikt

Ramverket innehåller tre kompletterande testtyper:

  • Simuleringstestning — Kör kompletta konversationer över flera turer med en simulerad användare
  • Testning av nästa svar (scenario) — Validerar agentens nästa svar mot framgångskriterier
  • Testning av verktygsanrop — Säkerställer att agenten anropar rätt verktyg med rätt parametrar

När du ska använda vilket test

TesttypAnvänd när du behöver
SimuleringKontrollera att en komplett konversation når ett definierat resultat
Nästa svar (scenario)Kontrollera att agentens nästa meddelande uppfyller kriterier för kvalitet, ton eller policy
VerktygsanropKontrollera att agenten anropar ett specifikt verktyg med förväntade parametrar

Skapa tester från konversationer

Omvandla verkliga konversationer till testfall när du hittar en interaktion där agenten inte presterade som förväntat.

Skapa test från konversation
  1. Öppna konversationen i samtalshistoriken
  2. Klicka på Skapa test från den här konversationen
  3. Granska det förifyllda sammanhanget och definiera sedan det förväntade beteendet
  4. Lägg till testet i din testsvit för att fånga upp liknande fel senare

Simuleringstestning

Simuleringstestning utvärderar din agent genom en komplett konversation över flera turer med en simulerad AI-användare. Till skillnad från tester av nästa svar kontrollerar denna typ om hela interaktionen når ditt definierade resultat.

Skapa ett simuleringstest

Gränssnitt för att skapa simuleringstest
1

Definiera scenariot

Beskriv användarens sammanhang, avsikt och beteende med naturligt språk. Simulatorn använder detta scenario för att driva konversationen.

Exempelscenario:

“En turist som inte behärskar engelska flytande försöker beställa på en restaurang.”

2

Ange framgångsvillkoret

Definiera resultatet som ska räknas som godkänt. Den här prompten används för att utvärdera om hela konversationen lyckades.

Exempel på framgångsvillkor:

“Agenten bekräftade beställningsuppgifterna, hanterade förtydligande frågor och slutförde beställningen utan missförstånd.”

3

Ange maximalt antal turer

Välj hur länge simuleringen kan köras innan den stoppas. Använd ett lägre värde för fokuserade kontroller och ett högre värde för komplexa arbetsflöden.

  • Minsta: 1
  • Högsta: 50
  • Standard: 5
4

Kör och granska resultatet

Kör testet och granska det genererade konversationsutskriften. Granska resultatet godkänt/underkänt mot ditt framgångsvillkor och iterera sedan på din prompt, dina verktyg eller agentkonfiguration.

Valfri konfiguration

Du kan förfina simuleringsbeteendet i testkonfigurationspanelen:

  • Miljö: Välj vilken miljö som ska testas när din agent har flera miljöer konfigurerade. Om endast en miljö är tillgänglig är denna väljare dold.
  • Chatthistorik: Börja från en delvis genomförd konversation i stället för ett tomt läge. Detta är användbart för att testa pågående konversationer och återställningsbeteende.
  • Dynamiska variabler: Injicera testspecifika värden i dina agentvariabler (till exempel användarnamn eller order-ID:n) utan att ändra grundkonfigurationen för agenten.

Simulering av verktyg

Simuleringstester har stöd för att simulera verktyg så att din agent kan få kontrollerade svar under en körning i stället för att anropa aktiva system.

Simuleringsstrategi

  • Simulera inga: Inga verktyg simuleras.
  • Simulera alla verktyg: Varje verktyg som kan simuleras returnerar ett simulerat svar.
  • Simulera valda verktyg: Endast verktyg som du uttryckligen väljer simuleras.

Systemverktyg och arbetsflödesverktyg simuleras aldrig.

Reservbeteende

Om ett simulerat verktyg anropas och inget matchande simulerat svar hittas väljer du ett av följande beteenden:

  • Anropa verkligt verktyg: Kör det verkliga verktygsanropet.
  • Avsluta med fel: Returnerar ett felsvar från verktyget i stället för att anropa det verkliga verktyget.

Reservinställningen visas bara när minst ett verktyg simuleras.

Testning av nästa svar (scenario)

Testning av nästa svar (scenario) utvärderar endast agentens nästa meddelande, inte ett komplett resultat över flera turer. Ange konversationshistoriken som leder fram till svaret du vill utvärdera och betygsätt sedan svaret utifrån framgångskriterier.

För kompletta resultat över flera turer använder du simuleringstestning.

Skapa ett test av nästa svar

Gränssnitt för testning av nästa svar (scenario)
1

Definiera chatthistoriken

Ange konversationshistoriken som leder fram till svaret du vill utvärdera. Det kan vara ett enskilt användarmeddelande eller flera turer med sammanhang.

Exempel på chatthistorik:

User: "I'd like to cancel my subscription. I've been charged twice this month and I'm frustrated."
2

Ange framgångskriterier

Beskriv med vanligt språk vad agentens svar ska uppnå. Var specifik kring förväntat beteende, ton och åtgärder.

Exempel på framgångskriterier:

  • Agenten ska bemöta kundens frustration med empati
  • Agenten ska erbjuda sig att undersöka dubbeldebiteringen
  • Agenten ska ge tydliga nästa steg för uppsägning eller lösning
  • Agenten ska behålla en professionell och hjälpsam ton
3

Ange exempel

Ange både exempel på godkända och underkända svar för att hjälpa utvärderaren att förstå nyanserna i dina kriterier.

Exempel på godkänt svar:

“Jag förstår hur frustrerande dubbeldebiteringar kan vara. Låt mig undersöka detta direkt åt dig. Jag ser att det faktiskt gjordes två debiteringar den här månaden – jag behandlar en återbetalning för dubbeldebiteringen omedelbart. Vill du fortfarande gå vidare med uppsägningen, eller vill du fortsätta när detta har lösts?”

Exempel på underkänt svar:

“Du måste kontakta faktureringsavdelningen för frågor om återbetalning. Din prenumeration kommer att sägas upp.”

4

Kör testet

Kör testet. En LLM-utvärderare jämför agentens nästa svar med dina framgångskriterier och exempel för att avgöra statusen godkänt/underkänt.

Testning av verktygsanrop

Testning av verktygsanrop verifierar att din agent använder verktyg korrekt och skickar rätt parametrar i specifika situationer. Detta är viktigt för åtgärder som samtalsöverföringar, datauppslag eller externa integrationer.

Skapa ett test av verktygsanrop

Gränssnitt för testning av verktygsanrop
1

Välj verktyget

Välj vilket verktyg du förväntar dig att agenten ska anropa i det angivna scenariot (t.ex. transfer_to_number, end_call, lookup_order).

2

Definiera förväntade parametrar

Ange vilka data agenten ska skicka till verktyget. Du har tre valideringsmetoder:

Exakt matchning
Parametern måste exakt matcha det angivna värdet.

Transfer number: +447771117777

Regex-mönster Parametern måste matcha ett specifikt mönster.

Order ID: ^ORD-[0-9]{8}$

LLM-utvärdering En LLM utvärderar om parametern är semantiskt korrekt utifrån sammanhanget.

Message: "Should be a polite message mentioning the connection"
3

Konfigurera dynamiska variabler

Vid testning i utvecklingsmiljön använder du värden för dynamiska variabler som matchar de faktiska värdena i produktion. Exempel: {{ customer_name }} eller {{ order_id }}

4

Kör och validera

Kör testet för att säkerställa att agenten anropar rätt verktyg med korrekta parametrar.

Viktiga användningsfall

Testning av verktygsanrop är avgörande för scenarier med höga insatser:

  • Nödöverföringar: Säkerställ att medicinska nödsituationer alltid kopplas till rätt nummer
  • Datasäkerhet: Verifiera att känslig information aldrig skickas till obehöriga verktyg
  • Affärslogik: Bekräfta att orderuppslag använder giltiga format och autentisering

Köra tester

Skriv tester för nytt beteende eller kända fel, kör dem medan du itererar på prompter och konfiguration och spara sedan när de godkänns.

Gå till fliken Tester i agentens gränssnitt. Där kan du köra enskilda tester, välja flera tester från ditt bibliotek som en batch eller köra hela din testsvit med Kör alla tester.

Köra tester på en agent

Probabilistisk testning

Agentens resultat kan variera mellan körningar. Ett enskilt godkänt resultat visar att agenten kan lyckas; probabilistisk testning visar hur ofta den kommer att lyckas genom att köra samma test flera gånger och rapportera en godkännandegrad.

Köra ett test flera gånger

Kontroll för delade körningar i ett test där du kan välja hur många gånger det ska köras

När du startar ett test från kontrollpanelen använder du kontrollen för delade körningar på körknappen för att välja hur många gånger det ska köras (till exempel 3×, 5× eller 15×). Varje körning är oberoende: agenten får samma chatthistorik, dynamiska variabler och andra indata, men dess svar genereras på nytt varje gång.

Flerkörning fungerar för enskilda tester, mappar och för att köra hela testsviten som är kopplad till en agent. Den är kompatibel med alla tre testtyper – Simulering, Nästa svar (scenario) och Verktygsanrop – och är vanligtvis mest användbar för simuleringstester, där en konversation över flera turer har en större yta som gör svarsvariation mer sannolik.

Godkännandegrader och gruppering av resultat

Resultat från flera körningar grupperade i godkända och underkända grupper med en märkning för godkännandegrad

När en flerkörning är klar sammanfattas resultaten som en godkännandegrad (till exempel 4/5 godkända) med en färgad märkning:

  • Grön — 100 % godkända
  • Gul — minst 80 % godkända
  • Röd — under 80 %

Enskilda körningar grupperas sedan efter felorsak så att du kan se hur agenten misslyckas, inte bara att den misslyckas. I stället för att bläddra igenom fem separata utskrifter för att se vad som skiljde sig åt, ser du grupper som “Kopplade korrekt till fakturering (4 körningar)” och “Hittade på ett supportnummer (1 körning)”, som var och en kan expanderas till underliggande utskrifter och utvärderingsmotivering.

När du ska använda det

  • Innan du släpper en ändring — Kör kopplade tester probabilistiskt igen för att bekräfta att tillförlitligheten inte har sjunkit (till exempel från 95 % till 60 %).
  • Diagnostisera instabilt beteende — Ett enskilt fel kan vara brus; ett fel i 1 av 5 körningar med en tydligt namngiven felgrupp är ett reproducerbart problem att åtgärda.
  • Justera prompter och verktyg — Iterera på konfigurationen och jämför godkännandegrader sida vid sida i stället för att förlita dig på enstaka körningar.

Köra probabilistiskt via API eller SDK

Skicka repeat_count (mellan 2 och 20) i begäran run-tests för att köra varje test så många gånger. Genom att ange repeat_count aktiveras automatiskt gruppering av fel i svaret, så att den returnerade anropningen innehåller gruppering per grupp och den godkännandegrad du ser i kontrollpanelen.

from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
invocation = elevenlabs.conversational_ai.agents.run_tests(
agent_id="<agent-id>",
tests=[{"test_id": "<test-id>"}],
repeat_count=5,
)

Bästa praxis

Utvärdera konsekvens i agentens persona

Testa att agenten behåller sin definierade personlighet, ton och beteendegränser i olika konversationsscenarier och känslomässiga sammanhang.

Verifiera komplexa resonemang över flera turer

Skapa scenarier som testar agentens förmåga att behålla sammanhang, följa villkorslogik och hantera tillståndsövergångar i längre konversationer.

Testa mot försök till promptinjektion

Utvärdera hur din agent svarar på försök att åsidosätta dess instruktioner eller extrahera känslig systeminformation genom antagonistiska indata.

Bedöm hantering av tvetydig avsikt

Testa hur effektivt din agent förtydligar vaga förfrågningar, hanterar motstridig information och navigerar i situationer där användarens avsikt är oklar.

Nästa steg