配置并测试你的第一个Agent
第一个Agent应先解决一小组经过验证的购物者任务,然后再尝试覆盖所有可能的旅程。先从可靠的内容和目录数据开始,添加明确的行为和支持规则,然后在隔离的环境中测试完整回复。 本指南提供了实用的实施顺序和验收门槛。它是为真实商店设计的,在这种环境中,不准确的政策或商品信息比不完整的可选功能危害更大。 这如何融入Humind AI Agent是面向客户的助手的配置空间。Knowledge和Catalog提供事实,Guidance塑造回复...
第一个Agent应先解决一小组经过验证的购物者任务,然后再尝试覆盖所有可能的旅程。先从可靠的内容和目录数据开始,添加明确的行为和支持规则,然后在隔离的环境中测试完整回复。
本指南提供了实用的实施顺序和验收门槛。它是为真实商店设计的,在这种环境中,不准确的政策或商品信息比不完整的可选功能危害更大。
这如何融入Humind
AI Agent是面向客户的助手的配置空间。Knowledge和Catalog提供事实,Guidance塑造回复行为,Tools添加操作,Escalation定义人工支持,测试界面让你在部署前查看结果。
更改可能影响许多对话,因此在每次有意义的更新后,都要测试有代表性的购买和支持场景。仅仅聊天界面看起来正确还不够,还要同时验证答案、商品上下文、可用操作和转交行为。
开始之前
访问权限:初始设置应由管理员或具有Agent配置、Knowledge和Catalog写入权限的自定义角色负责。其他团队成员可根据其分区权限进行审查。
- 选择正确的公司和市场,并连接预期的目录来源。
- 收集已批准的政策、品牌规则、支持目的地和上线域名。
- 为内容、目录、Agent行为、运营和店面部署指定负责人。
分步工作流程
定义首批支持的旅程
选择一组可管理的旅程,例如商品发现、商品详情、配送或退货,以及人工支持。对于每个旅程,写明预期来源、可接受答案、数据不可用时的行为以及升级结果。
包含一个Agent应拒绝或路由到其他位置的案例。清晰的边界会让测试更有意义,并防止宽泛的上线承诺掩盖已知缺口。
准备Knowledge和Catalog
在Knowledge中,为每项受支持的政策创建或导入一个权威来源。使用文件夹提高可维护性,使用public和published状态管理面向客户的内容,使用snippets保存简短的私有指导。在Catalog中,验证有代表性的商品、变体、可见性、集合、促销和有用的筛选条件。
在继续之前先解决矛盾。不要添加一条Guidance规则,指示Agent忽略错误的商品值或重复的政策。
配置行为和操作
在Guidance中,选择个性、回答长度、语言行为、规则和审核。在Tools中,仅启用依赖关系已测试的操作。在Escalation中,配置支持的渠道、转交条件、转交前问题、人工接管和满意度行为。
每次更改后都检查autosave或保存反馈。在启用面向客户的实时帮助承诺之前,请让操作员确认Inbox访问权限和可用性。
自定义界面和入口点
使用Chat interface设置头像、颜色、对比度、气泡和按钮样式、可选的Agent名称以及首页文本。使用Entry point设置启动器类型、位置、大小、页面规则以及桌面端或移动端行为。
预览每条规则,并确保启动器不会遮挡导航、同意、购物车或结账控件。让首次上线足够简单,以便能够可靠验证。
运行验收套件
使用Playground进行探索性对话,使用Test product测试以商品为重点的行为,使用Batch testing测试可重复的数据集。一起检查事实、所选商品、操作、语言、审核和支持状态。
按来源对每个失败进行分类,做一次有针对性的修正,然后重新运行失败案例及其相邻案例。只有在关键旅程通过且剩余限制已记录时,才批准上线。
权限和重要注意事项
- 视觉上精致的界面并不能弥补未经验证的Knowledge或Catalog数据。
- Tools和支持集成可能在Agent页面之外还有前提条件。
- Playground不会验证实时店面安装或域名配置。
- 新的目录或筛选数据在最终测试前可能需要时间同步。
验证结果
在认为工作完成之前,请使用这份检查清单:
- 每个上线旅程都有负责人、来源、预期结果和后备方案。
- 关键问题在全新的Playground会话和可重复的数据集中通过。
- 操作员可以接收、接管并返回已升级的对话。
- 店面smoke-test计划和rollback负责人在部署前已准备就绪。
故障排查
Agent设置感觉不一致
返回旅程列表,确定哪个来源负责每项事实或操作。移除重复权威,然后一次只重新测试一个旅程,而不是添加更宽泛的说明。
某个工具已启用,但在对话中不可用
打开Tools并检查Humind是否标记了缺失的配置,或是否指向另一个设置页面。在再次测试之前,先验证底层的目录、订单、预约或支持依赖项。
测试对一个人通过,但对另一个人不通过
比较当前公司、市场、语言、对话历史、商品上下文、角色和测试时间。使用相同的全新场景和当前配置进行受控比较。