Pruebas de agentes
Las pruebas de agentes te permiten verificar respuestas conversacionales, uso de herramientas y resultados completos de varios turnos antes de implementar tu agente. Crea pruebas desde cero o a partir de conversaciones existentes y ejecútalas desde el panel, la CLI o la API.
Guía en vídeo
Resumen
El marco incluye tres tipos de pruebas complementarios:
- Pruebas de simulación — Ejecutan conversaciones completas de varios turnos con un usuario simulado
- Pruebas de siguiente respuesta (escenario) — Validan la siguiente respuesta del agente según criterios de éxito
- Pruebas de llamadas a herramientas — Garantizan que el agente llame a la herramienta adecuada con los parámetros correctos
Cuándo usar cada prueba
Crear pruebas a partir de conversaciones
Transforma conversaciones reales en casos de prueba cuando encuentres una interacción en la que el agente no haya tenido el rendimiento esperado.

- Abre la conversación en el historial de llamadas
- Haz clic en Crear prueba a partir de esta conversación
- Revisa el contexto rellenado previamente y define el comportamiento esperado
- Añade la prueba a tu suite para detectar fallos similares más adelante
Pruebas de simulación
Las pruebas de simulación evalúan tu agente en una conversación completa de varios turnos con un usuario de IA simulado. A diferencia de las pruebas de siguiente respuesta, este tipo comprueba si la interacción completa alcanza el resultado que has definido.
Crear una prueba de simulación

Define el escenario
Describe el contexto, la intención y el comportamiento del usuario en lenguaje natural. El simulador usa este escenario para dirigir la conversación.
Ejemplo de escenario:
“Un turista que no habla inglés con fluidez intenta hacer un pedido en un restaurante.”
Establece la condición de éxito
Define el resultado que debe considerarse aprobado. Este prompt se usa para evaluar si la conversación completa ha tenido éxito.
Ejemplo de condición de éxito:
“El agente confirmó los detalles del pedido, resolvió las preguntas de aclaración y completó el pedido sin malentendidos.”
Configuración opcional
Puedes ajustar el comportamiento de la simulación en el panel de configuración de pruebas:
- Entorno: Selecciona el entorno con el que realizar la prueba cuando tu agente tenga varios entornos configurados. Si solo hay un entorno disponible, este selector se oculta.
- Historial de chat: Empieza desde una conversación parcial en lugar de un estado en blanco. Es útil para probar conversaciones en curso y el comportamiento de recuperación.
- Variables dinámicas: Introduce valores específicos de la prueba en las variables de tu agente (por ejemplo, nombres de usuario o ID de pedidos) sin cambiar la configuración base del agente.
Simulación de herramientas
Las pruebas de simulación admiten la simulación de herramientas para que tu agente pueda recibir respuestas controladas durante una ejecución en lugar de llamar a sistemas activos.
Estrategia de simulación
- No simular ninguna: No se simula ninguna herramienta.
- Simular todas las herramientas: Todas las herramientas que se pueden simular devuelven una respuesta simulada.
- Simular las herramientas seleccionadas: Solo se simulan las herramientas que elijas explícitamente.
Las herramientas del sistema y las herramientas de workflow nunca se simulan.
Comportamiento alternativo
Si se llama a una herramienta simulada y no se encuentra una respuesta simulada coincidente, elige uno de estos comportamientos:
- Llamar a la herramienta real: Ejecuta la llamada a la herramienta real.
- Finalizar con error: Devuelve una respuesta de error de la herramienta en lugar de llamar a la herramienta real.
La configuración alternativa solo aparece cuando se ha simulado al menos una herramienta.
Pruebas de siguiente respuesta (escenario)
Las pruebas de siguiente respuesta (escenario) evalúan solo el siguiente mensaje del agente, no un resultado completo de varios turnos. Proporciona el historial de conversación que lleva a la respuesta que quieres evaluar y, después, evalúa esa respuesta según criterios de éxito.
Para resultados completos de varios turnos, usa las pruebas de simulación.
Crear una prueba de siguiente respuesta

Define el historial de chat
Proporciona el historial de conversación que lleva a la respuesta que quieres evaluar. Puede ser un único mensaje del usuario o varios turnos de contexto.
Ejemplo de historial de chat:
Establece los criterios de éxito
Describe en lenguaje sencillo lo que debe conseguir la respuesta del agente. Sé específico sobre el comportamiento, tono y acciones esperados.
Ejemplo de criterios de éxito:
- El agente debe reconocer con empatía la frustración del cliente
- El agente debe ofrecerse a investigar el cargo duplicado
- El agente debe proporcionar los siguientes pasos claros para la cancelación o resolución
- El agente debe mantener un tono profesional y útil
Proporciona ejemplos
Incluye ejemplos tanto de éxito como de fallo para ayudar al evaluador a comprender los matices de tus criterios.
Ejemplo de éxito:
“Entiendo lo frustrantes que pueden ser los cargos duplicados. Voy a revisarlo de inmediato. Veo que efectivamente ha habido dos cargos este mes; tramitaré un reembolso por el cargo duplicado ahora mismo. ¿Aun así quieres continuar con la cancelación o prefieres seguir una vez que esto se haya resuelto?”
Ejemplo de fallo:
“Tienes que contactar con el departamento de facturación para las incidencias de reembolso. Tu suscripción se cancelará.”
Pruebas de llamadas a herramientas
Las pruebas de llamadas a herramientas verifican que tu agente use correctamente las herramientas y envíe los parámetros adecuados en situaciones específicas. Esto es fundamental para acciones como transferencias de llamadas, consultas de datos o integraciones externas.
Crear una prueba de llamada a herramienta

Selecciona la herramienta
Elige qué herramienta esperas que llame el agente en el escenario dado (p. ej.,
transfer_to_number, end_call, lookup_order).
Define los parámetros esperados
Especifica qué datos debe enviar el agente a la herramienta. Tienes tres métodos de validación:
Métodos de validación
Coincidencia exacta
El parámetro debe coincidir exactamente con el valor que has especificado.
Patrón de regex El parámetro debe coincidir con un patrón específico.
Evaluación de LLM Un LLM evalúa si el parámetro es semánticamente correcto según el contexto.
Casos de uso críticos
Las pruebas de llamadas a herramientas son esenciales para situaciones de alto riesgo:
- Transferencias de emergencia: Asegúrate de que las emergencias médicas se dirijan siempre al número correcto
- Seguridad de los datos: Verifica que la información confidencial nunca se envíe a herramientas no autorizadas
- Lógica de negocio: Confirma que las consultas de pedidos usan formatos y autenticación válidos
Ejecutar pruebas
Escribe pruebas para comportamientos nuevos o fallos conocidos, ejecútalas mientras ajustas los prompts y la configuración y, después, guárdalas cuando se aprueben.
Ejecutar desde el panel
Ejecutar mediante la CLI
Ejecutar mediante la API
Ve a la pestaña Pruebas en la interfaz de tu agente. Desde ahí, puedes ejecutar pruebas individuales, seleccionar varias pruebas de tu biblioteca como lote o ejecutar toda tu suite con Ejecutar todas las pruebas.

Pruebas probabilísticas
Las salidas del agente pueden variar entre ejecuciones. Una sola aprobación demuestra que el agente puede tener éxito; las pruebas probabilísticas muestran con qué frecuencia lo hará ejecutando la misma prueba varias veces e informando de una tasa de aprobación.
Ejecutar una prueba varias veces

Al activar una prueba desde el panel, usa el control de ejecuciones divididas del botón de ejecución para elegir cuántas veces quieres ejecutarla (por ejemplo, 3×, 5× o 15×). Cada ejecución es independiente: el agente recibe el mismo historial de chat, variables dinámicas y otras entradas, pero su respuesta se genera de nuevo cada vez.
La ejecución múltiple funciona con pruebas individuales, carpetas y la ejecución de toda la suite de pruebas asociada a un agente. Es compatible con los tres tipos de pruebas —simulación, siguiente respuesta (escenario) y llamada a herramienta— y suele ser más útil para las pruebas de simulación, donde el mayor alcance de una conversación de varios turnos hace más probable la variación en las respuestas.
Tasas de aprobación y agrupación de resultados

Cuando finaliza una ejecución múltiple, los resultados se resumen como una tasa de aprobación (por ejemplo, 4/5 aprobadas) con una insignia de color:
- Verde — 100 % aprobadas
- Ámbar — al menos un 80 % aprobadas
- Rojo — menos de un 80 %
Después, las ejecuciones individuales se agrupan por motivo de fallo para que puedas ver cómo falla el agente, no solo que falla. En lugar de desplazarte por cinco transcripciones distintas para detectar qué ha cambiado, verás grupos como “Se dirigió correctamente a facturación (4 ejecuciones)” y “Inventó un número de asistencia (1 ejecución)”, cada uno ampliable para acceder a las transcripciones subyacentes y al razonamiento de la evaluación.
Cuándo usarlo
- Antes de lanzar un cambio — Vuelve a ejecutar las pruebas asociadas de forma probabilística para confirmar que la fiabilidad no ha bajado (por ejemplo, del 95 % al 60 %).
- Diagnosticar comportamientos inestables — Un único fallo podría ser ruido; un fallo de 1 de cada 5 con una categoría de fallo claramente identificada es un problema reproducible que debes corregir.
- Ajustar prompts y herramientas — Ajusta la configuración y compara las tasas de aprobación lado a lado, en lugar de basarte en ejecuciones puntuales.
Ejecutar de forma probabilística mediante la API o el SDK
Incluye repeat_count (entre 2 y 20) en la solicitud de run-tests para ejecutar cada prueba ese número de veces. Establecer repeat_count activa automáticamente la agrupación de fallos en la respuesta, por lo que la invocación devuelta incluye la agrupación por categoría y la tasa de aprobación que verías en el panel.
Buenas prácticas
Próximos pasos
- Consulta la documentación de la CLI para configurar pruebas automatizadas
- Explora la configuración de herramientas para conocer las herramientas disponibles
- Lee la guía de prompting para escribir prompts que se puedan probar