Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Testowanie agentów Conversational AI

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Gdy konwersacyjni agenci głosowi trafiają do produkcji, jak monitorować ich na dużą skalę? Jak wychwycić sytuacje, gdy nie działają zgodnie z założeniami? I jak je testować po wprowadzeniu zmian?

Te pytania ukształtowały naszą pracę nad El, naszym asystentem dokumentacji opartym na Conversational AI. Wraz z rozwojem El stworzyliśmy system do monitorowania, oceniania i testowania agentów, oparty na kryteriach oceny i symulacjach rozmów.

Solidne podstawy: niezawodne kryteria oceny

Ulepszanie każdego agenta zaczyna się od zrozumienia, jak działa w praktyce. Wymagało to dopracowania naszych kryteriów oceny i upewnienia się, że są wystarczająco dokładne i niezawodne, by monitorować działanie agenta. Za nieudaną rozmowę uznajemy taką, w której agent podaje błędne informacje lub nie pomaga użytkownikowi osiągnąć celu.

Flow chart

Opracowaliśmy następujące kryteria oceny:

  • Interakcja: czy rozmowa jest poprawna, czy użytkownik zadał istotne pytania, czy rozmowa miała sens?
  • Pozytywna interakcja: czy użytkownik odszedł zadowolony, czy był zdezorientowany albo sfrustrowany?
  • Zrozumienie źródła problemu: czy agent prawidłowo rozpoznał główny problem użytkownika?
  • Rozwiązanie problemu użytkownika: czy agent rozwiązał problem użytkownika lub wskazał inną formę pomocy?
  • Halucynacja: czy agent zmyślił informacje, których nie ma w bazie wiedzy?

Jeśli kryterium Interakcja nie zostanie spełnione, sama rozmowa jest nieważna. Jeśli nie zostanie spełnione inne kryterium, analizujemy sprawę dokładniej. Analiza wskazuje, jak ulepszyć agenta. Czasem trzeba dopracować użycie narzędzi lub ich timing. Innym razem dodać zabezpieczenia, które zapobiegają nieobsługiwanym działaniom.

Pewna iteracja: Conversation Simulation API

Gdy już wiemy, co poprawić, kolejnym krokiem są testy. Tu wkracza nasze Conversation Simulation API . Symuluje realistyczne scenariusze użytkowników — zarówno end-to-end, jak i w wybranych fragmentach — a następnie automatycznie ocenia wyniki według tych samych kryteriów, których używamy na produkcji. Obsługuje mockowanie narzędzi i własne oceny, więc pozwala testować konkretne zachowania.

Stosujemy dwa podejścia:

  • Pełne symulacje: Testuj całe rozmowy od początku do końca.
  • Częściowe symulacje: Zacznij w środku rozmowy, by sprawdzić punkty decyzyjne lub podprocesy. To nasza preferowana metoda testów jednostkowych, która pozwala szybko iterować i precyzyjnie debugować.

Jasne, precyzyjne scenariusze pozwalają nam kontrolować, co testujemy w LLM, i zapewniają pokrycie przypadków brzegowych, użycia narzędzi oraz logiki awaryjnej.

Automatyzacja na dużą skalę: testy w CI/CD

Ostatnim elementem jest automatyzacja. Użyliśmy otwartych API ElevenLabs, aby połączyć się z naszym procesem GitHub DevOps i włączyć ocenę oraz symulacje do pipeline’u CI/CD. Każda aktualizacja jest automatycznie testowana przed wdrożeniem. Zapobiega to regresjom i daje nam szybką informację zwrotną o działaniu w praktyce.

Rezultaty: silniejszy i lepszy El

Ten proces zmienił sposób, w jaki tworzymy i utrzymujemy El. Stworzyliśmy pętlę informacji zwrotnej, która łączy realne użycie z uporządkowaną oceną, ukierunkowanymi testami i automatyczną walidacją. Dzięki temu szybciej wdrażamy ulepszenia i robimy to z większą pewnością.

To schemat, który możemy teraz zastosować do każdego agenta, którego tworzymy.

Wdrażaj na dużą skalę przetestowanych agentów gotowych do produkcji

Szukasz czegoś innego? Zajrzyj do Centrum pomocy

Podobne artykuły

Twórz z najwyższej jakości audio AI