Eksperymenty

Prowadź kontrolowane testy A/B na ruchu produkcyjnym, aby optymalizować działanie agenta na podstawie danych, a nie intuicji

Eksperymenty pozwalają prowadzić kontrolowane testy A/B dowolnego elementu konfiguracji agenta — struktury promptu, logiki workflow, głosu, osobowości, narzędzi, bazy wiedzy — kierując określoną część ruchu do wariantu, mierząc wpływ na kluczowe wyniki i wdrażając zwycięskie warianty na produkcję.

Eksperymenty opierają się na wersjonowaniu agentów. Przed uruchomieniem eksperymentów musisz włączyć wersjonowanie agenta.

Po co eksperymentować

Bez ustrukturyzowanych eksperymentów optymalizacja opiera się na intuicji. Zmiana promptu „wydaje się” lepsza. Korekta workflow „powinna” poprawić wskaźnik samodzielnego rozwiązania sprawy. Nowa ścieżka eskalacji „wygląda” na wydajniejszą.

Eksperymenty zastępują zgadywanie dowodami. Testujesz zmiany na rzeczywistym ruchu, mierzysz realne wyniki i wdrażasz to, co działa.

Jak to działa

Eksperymenty składają się z czterech kroków:

1

Utwórz wariant

Zacznij od obecnej konfiguracji agenta i utwórz nową gałąź. Zmień dowolny element — prompt systemowy, workflow, głos, narzędzia, bazę wiedzy, reguły ochronne lub kryteria oceny. Każda zmiana jest śledzona jako konfiguracja z wersją.

Przejdź do karty Gałęzie w ustawieniach agenta i kliknij Utwórz gałąź.

2

Kieruj ruch

Określ, jaki procent aktywnych rozmów ma trafiać do wariantu. Zacznij od niewielkiego udziału (5–10%), by ograniczyć ryzyko, a potem zwiększaj go wraz ze wzrostem pewności.

Kliknij Edytuj podział ruchu i ustaw wartości procentowe dla każdej gałęzi. Ich suma musi wynosić dokładnie 100%.

Konfigurowanie podziału ruchu między gałęziami

3

Mierz wpływ

Porównaj wyniki wariantu z bazą odniesienia za pomocą panelu analitycznego. W panelu gałęzi kliknij Zobacz analitykę, aby przejść bezpośrednio do widoku filtrowanego według gałęzi.

Panel gałęzi z gałęzią główną i wariantami, podziałem ruchu oraz opcjami scalania

Zespoły mogą mierzyć takie wyniki jak:

  • CSAT
  • Wskaźnik samodzielnego rozwiązania sprawy
  • Konwersja
  • Średni czas obsługi
  • Mediana opóźnienia odpowiedzi agenta
  • Koszt rozwiązania sprawy przez agenta
4

Wdróż zwycięski wariant

Gdy wariant wykaże mierzalną poprawę, zwiększ jego udział w ruchu lub scal go z główną gałęzią, by stał się nowym domyślnym ustawieniem. Pełna historia wersji zostaje zachowana, więc w razie potrzeby możesz cofnąć zmiany.

Kierowanie ruchem

Ruch jest dzielony między gałęzie procentowo. Kierowanie jest deterministyczne i opiera się na ID rozmowy, więc ten sam użytkownik zawsze trafia do tej samej gałęzi w kolejnych sesjach.

Domyślnie ruch jest losowo rozdzielany wśród użytkowników. Jeśli używasz API do rozpoczynania rozmów, możesz kierować konkretne kohorty do konkretnych gałęzi, kontrolując, które rozmowy są inicjowane z daną konfiguracją gałęzi.

Suma wszystkich wartości procentowych ruchu musi wynosić dokładnie 100%. W przeciwnym razie wdrożenie się nie powiedzie.

Przykłady użycia

Eksperymenty wspierają ciągłą optymalizację workflow obsługi klientów i procesów operacyjnych.

Doświadczenie klienta

Sprawdź, czy zmieniony proces eskalacji poprawia CSAT bez wydłużania czasu obsługi. Porównuj różne style powitania, poziomy empatii lub strategie rozwiązywania spraw.

Przychody

Sprawdź, czy bardziej bezpośredni ton lub inna logika kwalifikacji zwiększają konwersję. Eksperymentuj z obsługą obiekcji, prezentacją cen lub momentem kontaktu follow-up.

Operacje

Zmierz, czy zmiany w logice narzędzi skracają średni czas obsługi lub obniżają koszty infrastruktury. Testuj różne konfiguracje bazy wiedzy lub struktury workflow.

Każdy eksperyment jest powiązany z konkretną wersją agenta, więc każdą zmianę wyników można przypisać do określonej zmiany konfiguracji.

Co możesz testować

Między gałęziami możesz zmieniać dowolny element konfiguracji agenta:

KategoriaPrzykłady
Prompt systemowyTon, instrukcje, osobowość, reguły ochronne
WorkflowStruktura węzłów, logika rozgałęzień, ścieżki eskalacji
GłosWybór głosu, model TTS, ustawienia szybkości
NarzędziaKonfiguracja narzędzi, logika narzędzi webhook, serwery MCP
Baza wiedzyRóżne dokumenty, ustawienia RAG
LLMWybór modelu, temperatura, maks. liczba tokenów
Kryteria ocenyRóżne wskaźniki sukcesu dla każdej gałęzi
JęzykUstawienia języka, konfiguracje wielojęzyczne

Dobre praktyki

Zanim utworzysz wariant, określ, co ma się poprawić i jak to zmierzysz. Na przykład: „Zmiana promptu eskalacji tak, by zawierał podsumowanie problemu, poprawi nasze kryterium oceny wskaźnika rozwiązania spraw o 10%”.

Wyizolowanie jednej zmiennej jasno pokazuje, co spowodowało różnicę w wynikach. Jeśli zmienisz jednocześnie prompt, głos i workflow, nie będziesz wiedzieć, która zmiana wpłynęła na wynik.

Skonfiguruj kryteria oceny sukcesu, zanim uruchomisz eksperymenty. Zapewnią one ustrukturyzowane wskaźniki potrzebne do obiektywnego porównania wariantów.

Zacznij od 5–10% ruchu kierowanego do wariantu. Ograniczy to skalę problemu, jeśli coś pójdzie nie tak, a jednocześnie wygeneruje wartościowe dane.

Pozwól, by zebrała się odpowiednia liczba rozmów, zanim wyciągniesz wnioski. Małe próby prowadzą do niewiarygodnych wyników. Monitoruj panel analityczny i poczekaj, aż trendy się ustabilizują.

Szybko scalaj lub odrzucaj eksperymenty. Długo działające gałęzie trudniej scalić i mogą odbiegać od głównej konfiguracji.

Kolejne kroki