实验

对生产流量运行受控 A/B 测试,以数据而非直觉优化智能体表现

实验可让你针对智能体配置的任意方面进行受控 A/B 测试——提示词结构、workflow 逻辑、音色、个性、工具、知识库——方法是将特定比例的流量路由至变体,衡量对关键结果的影响,并将胜出方案发布到生产环境。

实验基于智能体版本控制。 运行实验前,必须先为智能体启用版本控制。

为什么要做实验

如果没有结构化实验,优化只能依赖直觉。一次提示词调整“感觉”更好。一次 workflow 调整“应该”能提高自主解决率。新的升级路径“似乎”更高效。

实验用证据取代猜测。你可以在实时流量中测试变更,衡量实际结果,并推广有效方案。

工作原理

实验遵循四步 workflow:

1

创建变体

从当前智能体配置开始,创建一个新分支。你可以修改任何内容——系统提示词、workflow、音色、工具、知识库、护栏或评估标准。每项变更都会作为版本化配置进行跟踪。

前往智能体设置中的 分支 标签页,然后点击 创建分支。

2

路由流量

定义应分配给变体的实时对话百分比。先从较小比例(5–10%)开始以降低风险,随后随着信心提升逐步增加。

点击 编辑流量分配,并设置各分支的百分比。百分比总和必须正好为 100%。

配置分支之间的流量分配

3

衡量影响

使用分析仪表板将变体表现与基准版本进行比较。在分支面板中点击 查看分析,可直接跳转到按分支筛选的视图。

显示主分支和变体分支、流量分配及合并选项的分支面板

团队可衡量以下结果:

  • CSAT
  • 自主解决率
  • 转化率
  • 平均处理时长
  • 智能体响应延迟中位数
  • 每次智能体解决的成本
4

推广胜出方案

变体一旦展现出可衡量的提升,你可以增加其流量占比,或将其合并到主分支,使其成为新的默认配置。完整版本历史会被保留,必要时可回滚。

流量路由

流量按百分比在分支间分配。路由基于对话 ID 确定性执行,因此同一用户在不同会话中会始终进入同一分支。

默认情况下,流量会在用户群中随机分配。如果你使用 API 发起对话,可通过控制不同分支配置发起哪些对话,将特定用户群路由至特定分支。

所有流量百分比之和必须正好为 100%。否则部署将失败。

使用场景

实验支持持续优化面向客户及运营相关的 workflow。

客户体验

测试调整后的升级流程能否在不增加处理时长的情况下提升 CSAT。比较 不同问候方式、共情程度或解决策略。

营收

测试更直接的语气或不同的资格判断逻辑能否提高转化率。 尝试不同的异议处理、价格呈现或跟进时机。

运营

衡量工具逻辑变更能否降低平均处理时长或基础设施成本。测试 不同的知识库配置或 workflow 结构。

每项实验都关联到特定智能体版本,因此每次性能变化都可归因于明确的配置变更。

可测试的内容

分支之间可改变智能体配置的任何方面:

类别示例
系统提示词语气、指令、个性、护栏
Workflow节点结构、分支逻辑、升级路径
音色音色选择、TTS 模型、语速设置
工具工具配置、webhook 工具逻辑、MCP 服务器
知识库不同文档、RAG 设置
LLM模型选择、温度、最大 token 数
评估标准每个分支不同的成功指标
语言语言设置、多语言配置

最佳实践

创建变体前,先明确你预期改善什么以及如何衡量。例如: “将问题摘要加入升级提示词,可使我们的 解决率评估标准提高 10%。 ”

隔离单一变量可以明确造成性能差异的原因。如果你同时修改 提示词、音色和 workflow,就无法确定是哪项变更带来了结果。

运行实验前,先配置成功 评估标准。 这些标准提供比较变体所需的结构化指标, 让你可以进行客观对比。

先将 5–10% 的流量分配给变体。这样即使出现问题也能限制影响范围, 同时仍可生成有意义的数据。

得出结论前,应积累足够多的对话。样本量太小会导致 结果不可靠。请监控分析仪表板,并等待趋势稳定。

及时合并或舍弃实验。长期运行的分支会更难合并,也可能 偏离主配置。

后续步骤