Experimentos
Ejecuta pruebas A/B controladas con tráfico de producción para optimizar el rendimiento de los agentes con datos, no intuición
Los experimentos te permiten realizar pruebas A/B controladas sobre cualquier aspecto de la configuración del agente —estructura del prompt, lógica del workflow, voz, personalidad, herramientas, base de conocimiento— dirigiendo una parte definida del tráfico a una variante, midiendo el impacto en resultados clave y llevando las opciones ganadoras a producción.
Los experimentos se basan en el versionado de agentes. Debes activar el versionado en tu agente antes de poder realizar experimentos.
Por qué experimentar
Sin una experimentación estructurada, la optimización depende de la intuición. Un ajuste del prompt «parece» mejor. Un cambio en el workflow «debería» mejorar la contención. Una nueva vía de escalado «da la impresión» de ser más eficiente.
Los experimentos sustituyen las conjeturas por evidencias. Pruebas los cambios con tráfico real, mides resultados reales y llevas a producción lo que funciona.
Cómo funciona
Los experimentos siguen un workflow de cuatro pasos:
Crea una variante
Parte de la configuración actual de tu agente y crea una nueva rama. Modifica lo que necesites: prompt del sistema, workflow, voz, herramientas, base de conocimiento, medidas de seguridad o criterios de evaluación. Cada cambio se registra como una configuración versionada.
Ve a la pestaña Ramas en los ajustes de tu agente y haz clic en Crear rama.
Dirige el tráfico
Define qué porcentaje de las conversaciones reales debe ir a tu variante. Empieza con poco (5–10 %) para limitar el riesgo y aumenta el porcentaje a medida que ganes confianza.
Haz clic en Editar reparto de tráfico y establece los porcentajes de cada rama. Los porcentajes deben sumar exactamente el 100 %.

Mide el impacto
Compara el rendimiento de la variante con tu referencia mediante el panel de analíticas. Haz clic en Ver analíticas desde el panel de ramas para ir directamente a una vista filtrada por rama.

Los equipos pueden medir resultados como:
- CSAT
- Tasa de contención
- Conversión
- Tiempo medio de gestión
- Latencia mediana de respuesta del agente
- Coste por resolución del agente
Enrutamiento del tráfico
El tráfico se divide entre ramas por porcentaje. El enrutamiento es determinista según el ID de la conversación, por lo que el mismo usuario llega siempre a la misma rama en distintas sesiones.
De forma predeterminada, el tráfico se distribuye aleatoriamente entre la base de usuarios. Si utilizas la API para iniciar conversaciones, puedes dirigir cohortes específicas a ramas concretas controlando con qué configuración de rama se inicia cada conversación.
Todos los porcentajes de tráfico deben sumar exactamente el 100 %. Un despliegue fallará si no es así.
Casos de uso
Los experimentos permiten una optimización continua de workflows operativos y de atención al cliente.
Cada experimento está vinculado a una versión específica del agente, por lo que cada cambio de rendimiento puede atribuirse a un cambio de configuración definido.
Qué puedes probar
Puedes variar entre ramas cualquier aspecto de la configuración del agente:
Buenas prácticas
Empieza con una hipótesis
Define qué esperas mejorar y cómo lo medirás antes de crear una variante. Por ejemplo: «Cambiar el prompt de escalado para incluir un resumen del problema mejorará nuestro criterio de evaluación de tasa de resolución en un 10 %».
Cambia una cosa cada vez
Aislar una sola variable deja claro qué ha causado cada diferencia de rendimiento. Si cambias el prompt, la voz y el workflow a la vez, no sabrás qué cambio ha generado el resultado.
Configura primero los criterios de evaluación
Configura los criterios de evaluación del éxito antes de realizar experimentos. Te proporcionan las métricas estructuradas que necesitas para comparar variantes objetivamente.
Empieza con porcentajes de tráfico bajos
Comienza con un 5–10 % del tráfico en la variante. Así limitas la exposición si algo sale mal y, al mismo tiempo, generas datos significativos.
Da suficiente tiempo a los experimentos
Deja que se acumulen suficientes conversaciones antes de sacar conclusiones. Las muestras pequeñas dan lugar a resultados poco fiables. Supervisa el panel de analíticas y espera a que las tendencias se estabilicen.
Mantén los experimentos breves
Fusiona o descarta los experimentos sin demora. Las ramas que se mantienen durante mucho tiempo son más difíciles de fusionar y pueden alejarse de la configuración principal.