实验
实验
对生产流量运行受控 A/B 测试,以数据而非直觉优化智能体表现
实验可让你针对智能体配置的任意方面进行受控 A/B 测试——提示词结构、workflow 逻辑、音色、个性、工具、知识库——方法是将特定比例的流量路由至变体,衡量对关键结果的影响,并将胜出方案发布到生产环境。
实验基于智能体版本控制。 运行实验前,必须先为智能体启用版本控制。
为什么要做实验
如果没有结构化实验,优化只能依赖直觉。一次提示词调整“感觉”更好。一次 workflow 调整“应该”能提高自主解决率。新的升级路径“似乎”更高效。
实验用证据取代猜测。你可以在实时流量中测试变更,衡量实际结果,并推广有效方案。
工作原理
实验遵循四步 workflow:
创建变体
从当前智能体配置开始,创建一个新分支。你可以修改任何内容——系统提示词、workflow、音色、工具、知识库、护栏或评估标准。每项变更都会作为版本化配置进行跟踪。
前往智能体设置中的 分支 标签页,然后点击 创建分支。
衡量影响
使用分析仪表板将变体表现与基准版本进行比较。在分支面板中点击 查看分析,可直接跳转到按分支筛选的视图。

团队可衡量以下结果:
- CSAT
- 自主解决率
- 转化率
- 平均处理时长
- 智能体响应延迟中位数
- 每次智能体解决的成本
流量路由
流量按百分比在分支间分配。路由基于对话 ID 确定性执行,因此同一用户在不同会话中会始终进入同一分支。
默认情况下,流量会在用户群中随机分配。如果你使用 API 发起对话,可通过控制不同分支配置发起哪些对话,将特定用户群路由至特定分支。
所有流量百分比之和必须正好为 100%。否则部署将失败。
使用场景
实验支持持续优化面向客户及运营相关的 workflow。
每项实验都关联到特定智能体版本,因此每次性能变化都可归因于明确的配置变更。
可测试的内容
分支之间可改变智能体配置的任何方面:
最佳实践
先提出假设
创建变体前,先明确你预期改善什么以及如何衡量。例如: “将问题摘要加入升级提示词,可使我们的 解决率评估标准提高 10%。 ”
一次只改一项
隔离单一变量可以明确造成性能差异的原因。如果你同时修改 提示词、音色和 workflow,就无法确定是哪项变更带来了结果。
先设置评估标准
运行实验前,先配置成功 评估标准。 这些标准提供比较变体所需的结构化指标, 让你可以进行客观对比。
从较小的流量比例开始
先将 5–10% 的流量分配给变体。这样即使出现问题也能限制影响范围, 同时仍可生成有意义的数据。
给实验足够时间
得出结论前,应积累足够多的对话。样本量太小会导致 结果不可靠。请监控分析仪表板,并等待趋势稳定。
保持实验周期短
及时合并或舍弃实验。长期运行的分支会更难合并,也可能 偏离主配置。
