Pruebas de agentes

Gana confianza en el comportamiento de tu agente con pruebas automatizadas

Las pruebas de agentes te permiten verificar respuestas conversacionales, uso de herramientas y resultados completos de varios turnos antes de implementar tu agente. Crea pruebas desde cero o a partir de conversaciones existentes y ejecútalas desde el panel, la CLI o la API.

Guía en vídeo

Resumen

El marco incluye tres tipos de pruebas complementarios:

  • Pruebas de simulación — Ejecutan conversaciones completas de varios turnos con un usuario simulado
  • Pruebas de siguiente respuesta (escenario) — Validan la siguiente respuesta del agente según criterios de éxito
  • Pruebas de llamadas a herramientas — Garantizan que el agente llame a la herramienta adecuada con los parámetros correctos

Cuándo usar cada prueba

Tipo de pruebaÚsala cuando necesites
SimulaciónComprobar que una conversación completa alcanza un resultado definido
Siguiente respuesta (escenario)Comprobar que el siguiente mensaje del agente cumple criterios de calidad, tono o políticas
Llamada a herramientaComprobar que el agente invoca una herramienta específica con los parámetros esperados

Crear pruebas a partir de conversaciones

Transforma conversaciones reales en casos de prueba cuando encuentres una interacción en la que el agente no haya tenido el rendimiento esperado.

Crear una prueba a partir de una conversación
  1. Abre la conversación en el historial de llamadas
  2. Haz clic en Crear prueba a partir de esta conversación
  3. Revisa el contexto rellenado previamente y define el comportamiento esperado
  4. Añade la prueba a tu suite para detectar fallos similares más adelante

Pruebas de simulación

Las pruebas de simulación evalúan tu agente en una conversación completa de varios turnos con un usuario de IA simulado. A diferencia de las pruebas de siguiente respuesta, este tipo comprueba si la interacción completa alcanza el resultado que has definido.

Crear una prueba de simulación

Interfaz de creación de pruebas de simulación
1

Define el escenario

Describe el contexto, la intención y el comportamiento del usuario en lenguaje natural. El simulador usa este escenario para dirigir la conversación.

Ejemplo de escenario:

“Un turista que no habla inglés con fluidez intenta hacer un pedido en un restaurante.”

2

Establece la condición de éxito

Define el resultado que debe considerarse aprobado. Este prompt se usa para evaluar si la conversación completa ha tenido éxito.

Ejemplo de condición de éxito:

“El agente confirmó los detalles del pedido, resolvió las preguntas de aclaración y completó el pedido sin malentendidos.”

3

Establece el máximo de turnos

Elige cuánto puede durar la simulación antes de detenerse. Usa un valor más bajo para comprobaciones concretas y uno más alto para workflows complejos.

  • Mínimo: 1
  • Máximo: 50
  • Predeterminado: 5
4

Ejecuta y revisa el resultado

Ejecuta la prueba e inspecciona la transcripción de la conversación generada. Revisa el resultado de aprobado o no aprobado según tu condición de éxito y, después, ajusta tu prompt, herramientas o configuración del agente.

Configuración opcional

Puedes ajustar el comportamiento de la simulación en el panel de configuración de pruebas:

  • Entorno: Selecciona el entorno con el que realizar la prueba cuando tu agente tenga varios entornos configurados. Si solo hay un entorno disponible, este selector se oculta.
  • Historial de chat: Empieza desde una conversación parcial en lugar de un estado en blanco. Es útil para probar conversaciones en curso y el comportamiento de recuperación.
  • Variables dinámicas: Introduce valores específicos de la prueba en las variables de tu agente (por ejemplo, nombres de usuario o ID de pedidos) sin cambiar la configuración base del agente.

Simulación de herramientas

Las pruebas de simulación admiten la simulación de herramientas para que tu agente pueda recibir respuestas controladas durante una ejecución en lugar de llamar a sistemas activos.

Estrategia de simulación

  • No simular ninguna: No se simula ninguna herramienta.
  • Simular todas las herramientas: Todas las herramientas que se pueden simular devuelven una respuesta simulada.
  • Simular las herramientas seleccionadas: Solo se simulan las herramientas que elijas explícitamente.

Las herramientas del sistema y las herramientas de workflow nunca se simulan.

Comportamiento alternativo

Si se llama a una herramienta simulada y no se encuentra una respuesta simulada coincidente, elige uno de estos comportamientos:

  • Llamar a la herramienta real: Ejecuta la llamada a la herramienta real.
  • Finalizar con error: Devuelve una respuesta de error de la herramienta en lugar de llamar a la herramienta real.

La configuración alternativa solo aparece cuando se ha simulado al menos una herramienta.

Pruebas de siguiente respuesta (escenario)

Las pruebas de siguiente respuesta (escenario) evalúan solo el siguiente mensaje del agente, no un resultado completo de varios turnos. Proporciona el historial de conversación que lleva a la respuesta que quieres evaluar y, después, evalúa esa respuesta según criterios de éxito.

Para resultados completos de varios turnos, usa las pruebas de simulación.

Crear una prueba de siguiente respuesta

Interfaz de pruebas de siguiente respuesta (escenario)
1

Define el historial de chat

Proporciona el historial de conversación que lleva a la respuesta que quieres evaluar. Puede ser un único mensaje del usuario o varios turnos de contexto.

Ejemplo de historial de chat:

User: "I'd like to cancel my subscription. I've been charged twice this month and I'm frustrated."
2

Establece los criterios de éxito

Describe en lenguaje sencillo lo que debe conseguir la respuesta del agente. Sé específico sobre el comportamiento, tono y acciones esperados.

Ejemplo de criterios de éxito:

  • El agente debe reconocer con empatía la frustración del cliente
  • El agente debe ofrecerse a investigar el cargo duplicado
  • El agente debe proporcionar los siguientes pasos claros para la cancelación o resolución
  • El agente debe mantener un tono profesional y útil
3

Proporciona ejemplos

Incluye ejemplos tanto de éxito como de fallo para ayudar al evaluador a comprender los matices de tus criterios.

Ejemplo de éxito:

“Entiendo lo frustrantes que pueden ser los cargos duplicados. Voy a revisarlo de inmediato. Veo que efectivamente ha habido dos cargos este mes; tramitaré un reembolso por el cargo duplicado ahora mismo. ¿Aun así quieres continuar con la cancelación o prefieres seguir una vez que esto se haya resuelto?”

Ejemplo de fallo:

“Tienes que contactar con el departamento de facturación para las incidencias de reembolso. Tu suscripción se cancelará.”

4

Ejecuta la prueba

Ejecuta la prueba. Un evaluador LLM compara la siguiente respuesta del agente con tus criterios de éxito y ejemplos para determinar el estado de aprobado o no aprobado.

Pruebas de llamadas a herramientas

Las pruebas de llamadas a herramientas verifican que tu agente use correctamente las herramientas y envíe los parámetros adecuados en situaciones específicas. Esto es fundamental para acciones como transferencias de llamadas, consultas de datos o integraciones externas.

Crear una prueba de llamada a herramienta

Interfaz de pruebas de llamadas a herramientas
1

Selecciona la herramienta

Elige qué herramienta esperas que llame el agente en el escenario dado (p. ej., transfer_to_number, end_call, lookup_order).

2

Define los parámetros esperados

Especifica qué datos debe enviar el agente a la herramienta. Tienes tres métodos de validación:

Coincidencia exacta
El parámetro debe coincidir exactamente con el valor que has especificado.

Transfer number: +447771117777

Patrón de regex El parámetro debe coincidir con un patrón específico.

Order ID: ^ORD-[0-9]{8}$

Evaluación de LLM Un LLM evalúa si el parámetro es semánticamente correcto según el contexto.

Message: "Should be a polite message mentioning the connection"
3

Configura las variables dinámicas

Al realizar pruebas en desarrollo, usa valores de variables dinámicas que coincidan con los que serían valores reales en producción. Ejemplo: {{ customer_name }} o {{ order_id }}

4

Ejecuta y valida

Ejecuta la prueba para asegurarte de que el agente llama a la herramienta correcta con los parámetros adecuados.

Casos de uso críticos

Las pruebas de llamadas a herramientas son esenciales para situaciones de alto riesgo:

  • Transferencias de emergencia: Asegúrate de que las emergencias médicas se dirijan siempre al número correcto
  • Seguridad de los datos: Verifica que la información confidencial nunca se envíe a herramientas no autorizadas
  • Lógica de negocio: Confirma que las consultas de pedidos usan formatos y autenticación válidos

Ejecutar pruebas

Escribe pruebas para comportamientos nuevos o fallos conocidos, ejecútalas mientras ajustas los prompts y la configuración y, después, guárdalas cuando se aprueben.

Ve a la pestaña Pruebas en la interfaz de tu agente. Desde ahí, puedes ejecutar pruebas individuales, seleccionar varias pruebas de tu biblioteca como lote o ejecutar toda tu suite con Ejecutar todas las pruebas.

Ejecutar pruebas en un agente

Pruebas probabilísticas

Las salidas del agente pueden variar entre ejecuciones. Una sola aprobación demuestra que el agente puede tener éxito; las pruebas probabilísticas muestran con qué frecuencia lo hará ejecutando la misma prueba varias veces e informando de una tasa de aprobación.

Ejecutar una prueba varias veces

Control de ejecuciones divididas en una prueba que permite elegir cuántas veces ejecutarla

Al activar una prueba desde el panel, usa el control de ejecuciones divididas del botón de ejecución para elegir cuántas veces quieres ejecutarla (por ejemplo, 3×, 5× o 15×). Cada ejecución es independiente: el agente recibe el mismo historial de chat, variables dinámicas y otras entradas, pero su respuesta se genera de nuevo cada vez.

La ejecución múltiple funciona con pruebas individuales, carpetas y la ejecución de toda la suite de pruebas asociada a un agente. Es compatible con los tres tipos de pruebas —simulación, siguiente respuesta (escenario) y llamada a herramienta— y suele ser más útil para las pruebas de simulación, donde el mayor alcance de una conversación de varios turnos hace más probable la variación en las respuestas.

Tasas de aprobación y agrupación de resultados

Resultados de varias ejecuciones agrupados en categorías de aprobación y fallo con una insignia de tasa de aprobación

Cuando finaliza una ejecución múltiple, los resultados se resumen como una tasa de aprobación (por ejemplo, 4/5 aprobadas) con una insignia de color:

  • Verde — 100 % aprobadas
  • Ámbar — al menos un 80 % aprobadas
  • Rojo — menos de un 80 %

Después, las ejecuciones individuales se agrupan por motivo de fallo para que puedas ver cómo falla el agente, no solo que falla. En lugar de desplazarte por cinco transcripciones distintas para detectar qué ha cambiado, verás grupos como “Se dirigió correctamente a facturación (4 ejecuciones)” y “Inventó un número de asistencia (1 ejecución)”, cada uno ampliable para acceder a las transcripciones subyacentes y al razonamiento de la evaluación.

Cuándo usarlo

  • Antes de lanzar un cambio — Vuelve a ejecutar las pruebas asociadas de forma probabilística para confirmar que la fiabilidad no ha bajado (por ejemplo, del 95 % al 60 %).
  • Diagnosticar comportamientos inestables — Un único fallo podría ser ruido; un fallo de 1 de cada 5 con una categoría de fallo claramente identificada es un problema reproducible que debes corregir.
  • Ajustar prompts y herramientas — Ajusta la configuración y compara las tasas de aprobación lado a lado, en lugar de basarte en ejecuciones puntuales.

Ejecutar de forma probabilística mediante la API o el SDK

Incluye repeat_count (entre 2 y 20) en la solicitud de run-tests para ejecutar cada prueba ese número de veces. Establecer repeat_count activa automáticamente la agrupación de fallos en la respuesta, por lo que la invocación devuelta incluye la agrupación por categoría y la tasa de aprobación que verías en el panel.

from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
invocation = elevenlabs.conversational_ai.agents.run_tests(
agent_id="<agent-id>",
tests=[{"test_id": "<test-id>"}],
repeat_count=5,
)

Buenas prácticas

Evalúa la coherencia de la personalidad del agente

Comprueba que tu agente mantiene su personalidad, tono y límites de comportamiento definidos en distintos escenarios de conversación y contextos emocionales.

Verifica razonamientos complejos de varios turnos

Crea escenarios que prueben la capacidad del agente para mantener el contexto, seguir una lógica condicional y gestionar transiciones de estado a lo largo de conversaciones extensas.

Prueba los intentos de inyección de prompts

Evalúa cómo responde tu agente a intentos de anular sus instrucciones o extraer información confidencial del sistema mediante entradas adversariales.

Evalúa la resolución de intenciones ambiguas

Prueba con qué eficacia tu agente aclara solicitudes imprecisas, gestiona información contradictoria y se desenvuelve en situaciones en las que la intención del usuario no está clara.

Próximos pasos