创建并运行 Batch Test
使用 Batch Test 一起评估多个可重复场景,而不是只依赖 Playground 中的非正式对话。数据集会成为针对重要客户问题的稳定回归检查清单。 Agent 结合了说明、面向客户的界面设置、Knowledge、目录数据和可选工具。可靠的设置会在部署前通过真实的客户问题进行测试。测试应覆盖预期答案、缺失信息、产品场景、升级处理,以及团队已启用的任何可选交互。 开始之前 访问权限: 打开 Agent 设置和测试,并具有为所选...
使用 Batch Test 一起评估多个可重复场景,而不是只依赖 Playground 中的非正式对话。数据集会成为针对重要客户问题的稳定回归检查清单。
Agent 结合了说明、面向客户的界面设置、Knowledge、目录数据和可选工具。可靠的设置会在部署前通过真实的客户问题进行测试。测试应覆盖预期答案、缺失信息、产品场景、升级处理,以及团队已启用的任何可选交互。
开始之前
访问权限:打开 Agent 设置和测试,并具有为所选 Agent 运行测试的权限。
- 选择要测试的 Agent。
- 定义数据集应覆盖的客户旅程。
- 手动准备问题,使用兼容的 CSV 文件,或根据目录产品生成问题。
请在下文所述的最小责任范围内工作,并在准备更改时保持当前面向客户的状态可用。在点击任何最终操作之前,请确认 Humind 中显示的当前公司、Agent、商店、语言和市场。缺少某个控件可能表示只有只读权限,或者某项功能尚未为该公司配置。在这种情况下,请记录预期任务,并请求管理员检查确切的权限或依赖项。不要通过共享账户、将数据复制到其他区域,或承诺工作区未提供的功能来绕过此边界。
分步工作流程
定义测试目标
为一次发布、一个风险或一段旅程创建一个聚焦的数据集。将预期成功案例与信息缺失案例和边界案例结合起来,这样高分也无法掩盖不安全的行为。
- 为数据集提供一个具体且可重复使用的名称。
- 在每个计划问题旁写下验收预期。
添加测试用例
手动输入问题,导入最多包含 50 个用例的 CSV,或从目录中生成面向产品的用例。运行前请检查导入的文本。
- 删除重复项和客户个人数据。
- 确保每个用例在没有隐藏上下文的情况下也易于理解。
选择 Agent 并运行
确认 Agent 和数据集,然后开始运行。在解读部分结果之前,让运行达到其最终状态。
- 运行期间不要编辑目标配置。
- 记录运行时间和正在评估的配置。
保留数据集用于回归测试
运行后,保留有用的用例并优化含糊不清的用例。在 Knowledge、指导内容、目录或工具发生更改后,重复使用同一数据集。
- 添加新发现的失败用例。
- 避免仅为了提高分数而重写旧用例。
重要限制和操作说明
- 每个数据集的 CSV 导入最多限制为 50 个测试用例。
- 生成的产品用例取决于可用目录。
- 批量结果不能替代实时渠道验证。
- 不要在测试提示中包含真实客户机密或个人信息。
验证结果
- 数据集包含预期数量的不同用例。
- 运行达到已完成或已明确报告的最终状态。
- 每条响应都可以打开并查看。
- 之后可以再次选择该数据集进行回归运行。
简要记录你测试了什么、使用了哪个客户场景以及发生了哪些变化。这样可以让后续故障排查更精确,也能帮助其他团队成员在不依赖记忆的情况下复现结果。
故障排查
CSV 用例未按预期导入
检查文件结构、编码、行数以及所需的问题内容。先从一个小而干净的文件开始,确认可以导入,然后再添加其余用例。
运行一直处于排队状态或失败
保持数据集不变,记下报告的状态,并且仅在确认 Agent 和服务可用后再重试。对于重复失败,应连同运行上下文一起报告。