Hoppa till navigering

Experiment

Kör kontrollerade A/B-tester på produktionstrafik för att optimera agentprestanda med data, inte magkänsla

Med experiment kan du köra kontrollerade A/B-tester på alla delar av agentkonfigurationen – promptstruktur, workflowlogik, röst, personlighet, verktyg, kunskapsbas – genom att dirigera en definierad andel av trafiken till en variant, mäta effekten på viktiga resultat och flytta vinnarna till produktion.

Experiment bygger på agentversionering. Versionering måste vara aktiverat för agenten innan du kan köra experiment.

Varför experimentera

Utan strukturerade experiment bygger optimering på intuition. En justering av prompten ”känns” bättre. En workflowjustering ”borde” förbättra inneslutningsgraden. En ny eskaleringsväg ”verkar” mer effektiv.

Experiment ersätter gissningar med fakta. Du testar ändringar mot live-trafik, mäter verkliga resultat och flyttar det som fungerar till produktion.

Så fungerar det

Experiment följer ett arbetsflöde i fyra steg:

1

Skapa en variant

Utgå från din nuvarande agentkonfiguration och skapa en ny gren. Ändra vad som helst – systemprompt, workflow, röst, verktyg, kunskapsbas, skyddsräcken eller utvärderingskriterier. Varje ändring spåras som en versionshanterad konfiguration.

Gå till fliken Branches i agentinställningarna och klicka på Create branch.

2

Dirigera trafik

Ange hur stor andel av live-konversationerna som ska gå till varianten. Börja i liten skala (5–10 %) för att begränsa riskerna och öka sedan i takt med att förtroendet växer.

Klicka på Edit traffic split och ange procentandelen för varje gren. Procentandelarna måste sammanlagt bli exakt 100 %.

Konfigurera trafikfördelning mellan grenar

3

Mät effekten

Jämför variantens resultat med din baslinje via analysinstrumentpanelen. Klicka på See analytics i grenpanelen för att gå direkt till en vy filtrerad på grenen.

Grenpanel som visar huvud- och variantgrenar med trafikfördelning och sammanfogningsalternativ

Team kan mäta resultat som:

  • CSAT
  • Inneslutningsgrad
  • Konvertering
  • Genomsnittlig hanteringstid
  • Medianlatens för agentsvar
  • Kostnad per agentlösning
4

Flytta vinnaren till produktion

När en variant visar en mätbar förbättring kan du antingen öka dess trafikandel eller sammanfoga den med huvudgrenen för att göra den till den nya standarden. Hela versionshistoriken bevaras, så att du kan återställa vid behov.

Trafikdirigering

Trafiken delas mellan grenar efter procentandel. Dirigeringen är deterministisk baserat på konversations-ID:t, så samma användare når konsekvent samma gren mellan sessioner.

Som standard fördelas trafiken slumpmässigt över användarbasen. Om du använder API:t för att starta konversationer kan du dirigera specifika kohorter till specifika grenar genom att styra vilka konversationer som startas med vilken grenkonfiguration.

Alla trafikprocent måste tillsammans bli exakt 100 %. En distribution misslyckas om de inte gör det.

Användningsfall

Experiment stöder kontinuerlig optimering av kundinriktade och operativa arbetsflöden.

Kundupplevelse

Testa om ett reviderat eskaleringsflöde förbättrar CSAT utan att öka hanteringstiden. Jämför olika hälsningsstilar, nivåer av empati eller lösningsstrategier.

Intäkter

Testa om en mer direkt ton eller annan kvalificeringslogik ökar konverteringen. Experimentera med hantering av invändningar, prispresentation eller tidpunkt för uppföljning.

Drift

Mät om ändringar i verktygslogiken minskar den genomsnittliga hanteringstiden eller infrastrukturnaden. Testa olika konfigurationer för kunskapsbasen eller workflowstrukturer.

Varje experiment är kopplat till en specifik agentversion, så varje resultatförändring kan tillskrivas en definierad konfigurationsändring.

Vad du kan testa

Alla delar av agentkonfigurationen kan varieras mellan grenar:

KategoriExempel
SystempromptTon, instruktioner, personlighet, skyddsräcken
WorkflowNodstruktur, förgreningslogik, eskaleringsvägar
RöstRöstval, TTS-modell, hastighetsinställningar
VerktygVerktygskonfiguration, webhookverktygslogik, MCP-servrar
KunskapsbasOlika dokument, RAG-inställningar
LLMModellval, temperatur, maximalt antal tokens
UtvärderingskriterierOlika framgångsmått per gren
SpråkSpråkinställningar, konfigurationer för flera språk

Bästa praxis

Definiera vad du förväntar dig ska förbättras och hur du ska mäta det innan du skapar en variant. Till exempel: ”Om vi ändrar eskaleringsprompten så att den innehåller en sammanfattning av problemet förbättras vårt utvärderingskriterium för lösningsgrad med 10 %.”

Genom att isolera en enda variabel blir det tydligt vad som orsakade en resultatskillnad. Om du ändrar prompten, rösten och workflowet samtidigt vet du inte vilken ändring som gav resultatet.

Konfigurera kriterier för framgångsutvärdering innan du kör experiment. De ger dig de strukturerade mått du behöver för att objektivt jämföra varianter.

Börja med 5–10 % av trafiken till varianten. Det begränsar exponeringen om något går fel, samtidigt som du fortfarande samlar in meningsfull data.

Låt tillräckligt många konversationer samlas innan du drar slutsatser. Små urval leder till opålitliga resultat. Följ analysinstrumentpanelen och vänta tills trenderna stabiliseras.

Sammanfoga eller förkasta experiment utan dröjsmål. Grenar som körs länge blir svårare att sammanfoga och kan avvika från huvudkonfigurationen.

Nästa steg