在 Playground 中测试你的 Agent
Playground 是面向客户的 Agent 的交互式测试界面。它让已获授权的团队成员能够尝试逼真的对话,而无需依赖公开店面。B2B 工作区通过安全的短时交接打开 Playground,因此请使用产品内操作,而不要保存旧的测试 URL。 本指南说明如何设计有用的场景、检查完整回复、归类失败情况,并将重要案例转化为可重复的批量测试。它还说明了 Playground 无法证明实时安装的哪些方面。 这如何融入 Humind AI Ag...
Playground 是面向客户的 Agent 的交互式测试界面。它让已获授权的团队成员能够尝试逼真的对话,而无需依赖公开店面。B2B 工作区通过安全的短时交接打开 Playground,因此请使用产品内操作,而不要保存旧的测试 URL。
本指南说明如何设计有用的场景、检查完整回复、归类失败情况,并将重要案例转化为可重复的批量测试。它还说明了 Playground 无法证明实时安装的哪些方面。
这如何融入 Humind
AI Agent 是面向客户的助手的配置空间。Knowledge 和 Catalog 提供事实,Guidance 塑造回复行为,Tools 添加操作,Escalation 定义人工支持,测试界面让你能够在部署前检查结果。
更改可能会影响许多对话,因此每次有意义的更新后,都要测试具有代表性的购买和支持场景。仅仅聊天界面看起来正确还不够:还要一并验证答案、产品上下文、可用操作和交接行为。
开始之前
访问权限:Playground 需要 Agent 配置读取权限。纠正源内容还可能需要 Knowledge、Catalog 或 Agent 配置写入权限。
- 确认当前公司、目录市场、Agent 配置和语言。
- 为产品、政策、支持和边缘情况问题准备预期结果。
- 使用非敏感测试数据,并将测试对话与真实客户工作明确区分开来。
分步工作流程
打开新的 Playground 会话
打开 AI Agent 并选择 Playground。Humind 会为当前公司打开专用界面。在验证源更改时,请开始新的对话,以免之前的消息影响结果。
记录正在测试的配置或内容更改以及准确的问题。像 'Agent 更好了' 这样含糊的说法无法由其他团队成员重复或审查。
运行一组平衡的场景
测试常见的产品发现、特定产品细节、存储在 Knowledge 中的政策、支持请求、不可用或无结果情况、追问,以及根据配置应当被审核或拒绝的输入。
变换措辞,并包含真实的歧义。目标不是强行得到某一句背熟的句子,而是验证正确的事实、诚实的不确定性、相关产品、合适的工具以及预期的交接路径。
检查完整回复
检查文本、引用或链接的内容、推荐产品、变体、价格、工具输出、后续建议和升级行为。如果选择了错误市场、忽略了可用性,或使用了过时政策,那么即使回答流畅也仍然可能是错误的。
当结果失败时,请在编辑之前先确定源区域:Knowledge、Catalog、Guidance、Tools、Escalation、界面或部署。修复源通常比再添加一条宽泛指令更能产生持久结果。
创建可重复的回归检查
对于重要场景,打开 Batch testing。创建或选择一个数据集,手动添加问题,导入 CSV,或在适当情况下从目录生成问题。运行该集合,检查答案状态和评分,并打开单个对话查看细节。
使用一致的标准对结果进行评分或记录。需要已审查工件时,导出 CSV 报告,并在定向更改后重新运行选定问题。
以实时冒烟测试结束
Playground 验证的是 Agent 行为,而不是店面安装。通过 Sales channels 部署后,请在桌面端和移动端的私密浏览器中,针对实际允许的域名测试一组更小的案例。
验证入口点、同意、客户身份收集、产品上下文以及到 Inbox 的交接在实时环境中都能正确运行。
权限和重要注意事项
- 通过 Playground 并不能证明该小部件已在店面正确安装或正确设置样式。
- 对话上下文会影响追问回答,因此进行源级回归检查时请使用新的会话。
- 生成的批量问题只是起始材料,仍需要商家审核。
- 不要在测试提示中使用真实客户个人数据。
验证结果
在认为工作完成之前,请使用此清单:
- 每个场景都有明确的预期事实、产品行为、操作或升级结果。
- 在进行更改之前,失败情况已被归到某个源区域。
- 关键案例存在于可重复的 Batch testing 数据集中。
- 部署后的店面冒烟测试在桌面端和移动端都通过。
故障排查
Playground 无法打开
返回 B2B 工作区,确认当前公司和 Agent 配置访问权限,然后再次使用当前的 Playground 操作。不要依赖之前保存的交接 URL。
已更正的答案看起来仍然很旧
确认源内容已在当前公司中保存或发布,移除冲突,并开始新的 Playground 对话。如果目录数据发生了变化,请等待同步以及任何筛选器具体化完成。
批量结果与交互结果不同
比较公司、语言、产品上下文、数据集问题、对话历史以及每次运行发生的时间。在确认当前配置相同后,重新运行完全相同的所选问题。