Agenttestning
Bygg förtroende för agentens beteende med automatiserade tester
Agenttestning låter dig verifiera konversationssvar, verktygsanvändning och kompletta resultat över flera turer innan du driftsätter. Skapa tester från grunden eller utifrån befintliga konversationer och kör dem sedan från kontrollpanelen, CLI eller API.
Videogenomgång
Översikt
Ramverket innehåller tre kompletterande testtyper:
- Simuleringstestning — Kör kompletta konversationer över flera turer med en simulerad användare
- Testning av nästa svar (scenario) — Validerar agentens nästa svar mot framgångskriterier
- Testning av verktygsanrop — Säkerställer att agenten anropar rätt verktyg med rätt parametrar
När du ska använda vilket test
Skapa tester från konversationer
Omvandla verkliga konversationer till testfall när du hittar en interaktion där agenten inte presterade som förväntat.

- Öppna konversationen i samtalshistoriken
- Klicka på Skapa test från den här konversationen
- Granska det förifyllda sammanhanget och definiera sedan det förväntade beteendet
- Lägg till testet i din testsvit för att fånga upp liknande fel senare
Simuleringstestning
Simuleringstestning utvärderar din agent genom en komplett konversation över flera turer med en simulerad AI-användare. Till skillnad från tester av nästa svar kontrollerar denna typ om hela interaktionen når ditt definierade resultat.
Skapa ett simuleringstest

Definiera scenariot
Beskriv användarens sammanhang, avsikt och beteende med naturligt språk. Simulatorn använder detta scenario för att driva konversationen.
Exempelscenario:
“En turist som inte behärskar engelska flytande försöker beställa på en restaurang.”
Ange framgångsvillkoret
Definiera resultatet som ska räknas som godkänt. Den här prompten används för att utvärdera om hela konversationen lyckades.
Exempel på framgångsvillkor:
“Agenten bekräftade beställningsuppgifterna, hanterade förtydligande frågor och slutförde beställningen utan missförstånd.”
Valfri konfiguration
Du kan förfina simuleringsbeteendet i testkonfigurationspanelen:
- Miljö: Välj vilken miljö som ska testas när din agent har flera miljöer konfigurerade. Om endast en miljö är tillgänglig är denna väljare dold.
- Chatthistorik: Börja från en delvis genomförd konversation i stället för ett tomt läge. Detta är användbart för att testa pågående konversationer och återställningsbeteende.
- Dynamiska variabler: Injicera testspecifika värden i dina agentvariabler (till exempel användarnamn eller order-ID:n) utan att ändra grundkonfigurationen för agenten.
Simulering av verktyg
Simuleringstester har stöd för att simulera verktyg så att din agent kan få kontrollerade svar under en körning i stället för att anropa aktiva system.
Simuleringsstrategi
- Simulera inga: Inga verktyg simuleras.
- Simulera alla verktyg: Varje verktyg som kan simuleras returnerar ett simulerat svar.
- Simulera valda verktyg: Endast verktyg som du uttryckligen väljer simuleras.
Systemverktyg och arbetsflödesverktyg simuleras aldrig.
Reservbeteende
Om ett simulerat verktyg anropas och inget matchande simulerat svar hittas väljer du ett av följande beteenden:
- Anropa verkligt verktyg: Kör det verkliga verktygsanropet.
- Avsluta med fel: Returnerar ett felsvar från verktyget i stället för att anropa det verkliga verktyget.
Reservinställningen visas bara när minst ett verktyg simuleras.
Testning av nästa svar (scenario)
Testning av nästa svar (scenario) utvärderar endast agentens nästa meddelande, inte ett komplett resultat över flera turer. Ange konversationshistoriken som leder fram till svaret du vill utvärdera och betygsätt sedan svaret utifrån framgångskriterier.
För kompletta resultat över flera turer använder du simuleringstestning.
Skapa ett test av nästa svar

Definiera chatthistoriken
Ange konversationshistoriken som leder fram till svaret du vill utvärdera. Det kan vara ett enskilt användarmeddelande eller flera turer med sammanhang.
Exempel på chatthistorik:
Ange framgångskriterier
Beskriv med vanligt språk vad agentens svar ska uppnå. Var specifik kring förväntat beteende, ton och åtgärder.
Exempel på framgångskriterier:
- Agenten ska bemöta kundens frustration med empati
- Agenten ska erbjuda sig att undersöka dubbeldebiteringen
- Agenten ska ge tydliga nästa steg för uppsägning eller lösning
- Agenten ska behålla en professionell och hjälpsam ton
Ange exempel
Ange både exempel på godkända och underkända svar för att hjälpa utvärderaren att förstå nyanserna i dina kriterier.
Exempel på godkänt svar:
“Jag förstår hur frustrerande dubbeldebiteringar kan vara. Låt mig undersöka detta direkt åt dig. Jag ser att det faktiskt gjordes två debiteringar den här månaden – jag behandlar en återbetalning för dubbeldebiteringen omedelbart. Vill du fortfarande gå vidare med uppsägningen, eller vill du fortsätta när detta har lösts?”
Exempel på underkänt svar:
“Du måste kontakta faktureringsavdelningen för frågor om återbetalning. Din prenumeration kommer att sägas upp.”
Testning av verktygsanrop
Testning av verktygsanrop verifierar att din agent använder verktyg korrekt och skickar rätt parametrar i specifika situationer. Detta är viktigt för åtgärder som samtalsöverföringar, datauppslag eller externa integrationer.
Skapa ett test av verktygsanrop

Välj verktyget
Välj vilket verktyg du förväntar dig att agenten ska anropa i det angivna scenariot (t.ex.
transfer_to_number, end_call, lookup_order).
Definiera förväntade parametrar
Ange vilka data agenten ska skicka till verktyget. Du har tre valideringsmetoder:
Valideringsmetoder
Exakt matchning
Parametern måste exakt matcha det angivna värdet.
Regex-mönster Parametern måste matcha ett specifikt mönster.
LLM-utvärdering En LLM utvärderar om parametern är semantiskt korrekt utifrån sammanhanget.
Viktiga användningsfall
Testning av verktygsanrop är avgörande för scenarier med höga insatser:
- Nödöverföringar: Säkerställ att medicinska nödsituationer alltid kopplas till rätt nummer
- Datasäkerhet: Verifiera att känslig information aldrig skickas till obehöriga verktyg
- Affärslogik: Bekräfta att orderuppslag använder giltiga format och autentisering
Köra tester
Skriv tester för nytt beteende eller kända fel, kör dem medan du itererar på prompter och konfiguration och spara sedan när de godkänns.
Kör via kontrollpanelen
Kör via CLI
Kör via API
Gå till fliken Tester i agentens gränssnitt. Där kan du köra enskilda tester, välja flera tester från ditt bibliotek som en batch eller köra hela din testsvit med Kör alla tester.

Probabilistisk testning
Agentens resultat kan variera mellan körningar. Ett enskilt godkänt resultat visar att agenten kan lyckas; probabilistisk testning visar hur ofta den kommer att lyckas genom att köra samma test flera gånger och rapportera en godkännandegrad.
Köra ett test flera gånger

När du startar ett test från kontrollpanelen använder du kontrollen för delade körningar på körknappen för att välja hur många gånger det ska köras (till exempel 3×, 5× eller 15×). Varje körning är oberoende: agenten får samma chatthistorik, dynamiska variabler och andra indata, men dess svar genereras på nytt varje gång.
Flerkörning fungerar för enskilda tester, mappar och för att köra hela testsviten som är kopplad till en agent. Den är kompatibel med alla tre testtyper – Simulering, Nästa svar (scenario) och Verktygsanrop – och är vanligtvis mest användbar för simuleringstester, där en konversation över flera turer har en större yta som gör svarsvariation mer sannolik.
Godkännandegrader och gruppering av resultat

När en flerkörning är klar sammanfattas resultaten som en godkännandegrad (till exempel 4/5 godkända) med en färgad märkning:
- Grön — 100 % godkända
- Gul — minst 80 % godkända
- Röd — under 80 %
Enskilda körningar grupperas sedan efter felorsak så att du kan se hur agenten misslyckas, inte bara att den misslyckas. I stället för att bläddra igenom fem separata utskrifter för att se vad som skiljde sig åt, ser du grupper som “Kopplade korrekt till fakturering (4 körningar)” och “Hittade på ett supportnummer (1 körning)”, som var och en kan expanderas till underliggande utskrifter och utvärderingsmotivering.
När du ska använda det
- Innan du släpper en ändring — Kör kopplade tester probabilistiskt igen för att bekräfta att tillförlitligheten inte har sjunkit (till exempel från 95 % till 60 %).
- Diagnostisera instabilt beteende — Ett enskilt fel kan vara brus; ett fel i 1 av 5 körningar med en tydligt namngiven felgrupp är ett reproducerbart problem att åtgärda.
- Justera prompter och verktyg — Iterera på konfigurationen och jämför godkännandegrader sida vid sida i stället för att förlita dig på enstaka körningar.
Köra probabilistiskt via API eller SDK
Skicka repeat_count (mellan 2 och 20) i begäran run-tests för att köra varje test så många gånger. Genom att ange repeat_count aktiveras automatiskt gruppering av fel i svaret, så att den returnerade anropningen innehåller gruppering per grupp och den godkännandegrad du ser i kontrollpanelen.
Bästa praxis
Nästa steg
- Visa CLI-dokumentation för konfiguration av automatiserad testning
- Utforska verktygskonfiguration för att förstå tillgängliga verktyg
- Läs promptguiden för att skriva testbara prompter