Eksperymenty
Prowadź kontrolowane testy A/B na ruchu produkcyjnym, aby optymalizować działanie agenta na podstawie danych, a nie intuicji
Eksperymenty pozwalają prowadzić kontrolowane testy A/B dowolnego elementu konfiguracji agenta — struktury promptu, logiki workflow, głosu, osobowości, narzędzi, bazy wiedzy — kierując określoną część ruchu do wariantu, mierząc wpływ na kluczowe wyniki i wdrażając zwycięskie warianty na produkcję.
Eksperymenty opierają się na wersjonowaniu agentów. Przed uruchomieniem eksperymentów musisz włączyć wersjonowanie agenta.
Po co eksperymentować
Bez ustrukturyzowanych eksperymentów optymalizacja opiera się na intuicji. Zmiana promptu „wydaje się” lepsza. Korekta workflow „powinna” poprawić wskaźnik samodzielnego rozwiązania sprawy. Nowa ścieżka eskalacji „wygląda” na wydajniejszą.
Eksperymenty zastępują zgadywanie dowodami. Testujesz zmiany na rzeczywistym ruchu, mierzysz realne wyniki i wdrażasz to, co działa.
Jak to działa
Eksperymenty składają się z czterech kroków:
Utwórz wariant
Zacznij od obecnej konfiguracji agenta i utwórz nową gałąź. Zmień dowolny element — prompt systemowy, workflow, głos, narzędzia, bazę wiedzy, reguły ochronne lub kryteria oceny. Każda zmiana jest śledzona jako konfiguracja z wersją.
Przejdź do karty Gałęzie w ustawieniach agenta i kliknij Utwórz gałąź.
Kieruj ruch
Określ, jaki procent aktywnych rozmów ma trafiać do wariantu. Zacznij od niewielkiego udziału (5–10%), by ograniczyć ryzyko, a potem zwiększaj go wraz ze wzrostem pewności.
Kliknij Edytuj podział ruchu i ustaw wartości procentowe dla każdej gałęzi. Ich suma musi wynosić dokładnie 100%.

Mierz wpływ
Porównaj wyniki wariantu z bazą odniesienia za pomocą panelu analitycznego. W panelu gałęzi kliknij Zobacz analitykę, aby przejść bezpośrednio do widoku filtrowanego według gałęzi.

Zespoły mogą mierzyć takie wyniki jak:
- CSAT
- Wskaźnik samodzielnego rozwiązania sprawy
- Konwersja
- Średni czas obsługi
- Mediana opóźnienia odpowiedzi agenta
- Koszt rozwiązania sprawy przez agenta
Kierowanie ruchem
Ruch jest dzielony między gałęzie procentowo. Kierowanie jest deterministyczne i opiera się na ID rozmowy, więc ten sam użytkownik zawsze trafia do tej samej gałęzi w kolejnych sesjach.
Domyślnie ruch jest losowo rozdzielany wśród użytkowników. Jeśli używasz API do rozpoczynania rozmów, możesz kierować konkretne kohorty do konkretnych gałęzi, kontrolując, które rozmowy są inicjowane z daną konfiguracją gałęzi.
Suma wszystkich wartości procentowych ruchu musi wynosić dokładnie 100%. W przeciwnym razie wdrożenie się nie powiedzie.
Przykłady użycia
Eksperymenty wspierają ciągłą optymalizację workflow obsługi klientów i procesów operacyjnych.
Każdy eksperyment jest powiązany z konkretną wersją agenta, więc każdą zmianę wyników można przypisać do określonej zmiany konfiguracji.
Co możesz testować
Między gałęziami możesz zmieniać dowolny element konfiguracji agenta:
Dobre praktyki
Zacznij od hipotezy
Zanim utworzysz wariant, określ, co ma się poprawić i jak to zmierzysz. Na przykład: „Zmiana promptu eskalacji tak, by zawierał podsumowanie problemu, poprawi nasze kryterium oceny wskaźnika rozwiązania spraw o 10%”.
Zmieniaj jedną rzecz naraz
Wyizolowanie jednej zmiennej jasno pokazuje, co spowodowało różnicę w wynikach. Jeśli zmienisz jednocześnie prompt, głos i workflow, nie będziesz wiedzieć, która zmiana wpłynęła na wynik.
Najpierw ustaw kryteria oceny
Skonfiguruj kryteria oceny sukcesu, zanim uruchomisz eksperymenty. Zapewnią one ustrukturyzowane wskaźniki potrzebne do obiektywnego porównania wariantów.
Zacznij od małego udziału ruchu
Zacznij od 5–10% ruchu kierowanego do wariantu. Ograniczy to skalę problemu, jeśli coś pójdzie nie tak, a jednocześnie wygeneruje wartościowe dane.
Daj eksperymentom wystarczająco dużo czasu
Pozwól, by zebrała się odpowiednia liczba rozmów, zanim wyciągniesz wnioski. Małe próby prowadzą do niewiarygodnych wyników. Monitoruj panel analityczny i poczekaj, aż trendy się ustabilizują.
Prowadź krótkie eksperymenty
Szybko scalaj lub odrzucaj eksperymenty. Długo działające gałęzie trudniej scalić i mogą odbiegać od głównej konfiguracji.