Проверьте своего Agent в Playground

Playground - это интерактивная тестовая среда для клиентского Agent. Она позволяет авторизованным участникам команды пробовать реалистичные диалоги без зависимости от публичной витрины магазина. Рабочая область B2B от...

Playground - это интерактивная тестовая среда для клиентского Agent. Она позволяет авторизованным участникам команды пробовать реалистичные диалоги без зависимости от публичной витрины магазина. Рабочая область B2B открывает Playground через безопасную кратковременную передачу, поэтому используйте действие внутри продукта, а не сохранённый старый тестовый URL.

В этом руководстве показано, как проектировать полезные сценарии, проверять весь ответ целиком, классифицировать сбои и превращать важные случаи в повторяемые пакетные тесты. Также здесь объясняется, что именно Playground не может подтвердить в отношении рабочей установки.

Как это вписывается в Humind

AI Agent - это пространство конфигурации для клиентского помощника. Knowledge и Catalog предоставляют факты, Guidance формирует поведение ответов, Tools добавляют действия, Escalation определяет поддержку человеком, а тестовые поверхности позволяют проверить результат до развертывания.

Изменения могут повлиять на многие разговоры, поэтому после каждого значимого обновления тестируйте репрезентативные сценарии покупки и поддержки. Визуально правильного чата недостаточно: вместе проверяйте ответ, контекст товара, доступное действие и поведение передачи.

Перед началом

Доступ: Playground требует доступ на чтение конфигурации Agent. Для исправления источника также может потребоваться доступ на запись в Knowledge, Catalog или конфигурацию Agent.

  • Подтвердите активную компанию, рынок каталога, конфигурацию Agent и язык.
  • Подготовьте ожидаемые результаты для вопросов о товарах, политике, поддержке и нетипичных случаях.
  • Используйте нечувствительные тестовые данные и чётко отделяйте тестовые разговоры от реальной работы с клиентами.

Пошаговый рабочий процесс

  1. Откройте новую сессию Playground

    Откройте AI Agent и выберите Playground. Humind откроет выделенную среду для активной компании. Начинайте новый разговор при проверке изменения источника, чтобы предыдущие сообщения не влияли на результат.

    Зафиксируйте проверяемое изменение конфигурации или контента и точный вопрос. Расплывчатое утверждение вроде 'Agent стал лучше' нельзя повторить или проверить другому участнику команды.

  2. Запустите сбалансированный набор сценариев

    Проверьте обычный поиск товаров, конкретную деталь товара, политику, хранящуюся в Knowledge, запрос в поддержку, случай недоступности или отсутствия результатов, уточняющий вопрос и ввод, который должен модерироваться или отклоняться согласно конфигурации.

    Меняйте формулировки и включайте реалистичную неоднозначность. Цель не в том, чтобы добиться одной заученной фразы, а в том, чтобы проверить корректные факты, честную неопределённость, релевантные товары, подходящие инструменты и ожидаемый путь передачи.

  3. Проверьте ответ целиком

    Просмотрите текст, процитированный или связанный ссылкой контент, рекомендованные товары, варианты, цены, вывод инструментов, предложения для следующих действий и поведение эскалации. Даже связный ответ может быть неверным, если он выбирает не тот рынок, игнорирует наличие или использует устаревшую политику.

    Если результат неудачный, определите область источника до редактирования: Knowledge, Catalog, Guidance, Tools, Escalation, интерфейс или развертывание. Исправление источника обычно даёт более устойчивый результат, чем добавление ещё одной общей инструкции.

  4. Создайте повторяемую регрессионную проверку

    Для важных сценариев откройте Batch testing. Создайте или выберите набор данных, добавьте вопросы вручную, импортируйте CSV или при необходимости сгенерируйте вопросы из каталога. Запустите набор, проверьте статус ответов и оценки и откройте отдельные разговоры для подробностей.

    Оцените или задокументируйте результат по единообразному стандарту. Экспортируйте отчёт CSV, когда нужен проверенный артефакт, и повторно запускайте выбранные вопросы после целевого изменения.

  5. Завершите живым smoke-тестом

    Playground проверяет поведение Agent, а не установку на витрине магазина. После развертывания через каналы продаж протестируйте меньший набор на фактически разрешённом домене в приватном браузере на компьютере и мобильном устройстве.

    Убедитесь, что точка входа, согласие, сбор идентификационных данных клиента, контекст товара и передача в Inbox корректно работают в рабочей среде.

Разрешения и важные оговорки

  • Успешное прохождение в Playground не доказывает, что виджет установлен или стилизован на витрине магазина правильно.
  • Контекст разговора влияет на ответы на уточняющие вопросы, поэтому используйте новую сессию для регрессионных проверок на уровне источника.
  • Сгенерированные пакетные вопросы являются исходным материалом и всё равно требуют проверки продавцом.
  • Не используйте реальные персональные данные клиентов в тестовых запросах.

Проверьте результат

Используйте этот чек-лист, прежде чем считать работу завершённой:

  • У каждого сценария есть явно ожидаемый факт, поведение товара, действие или результат эскалации.
  • Сбои отнесены к области источника до внесения изменений.
  • Критически важные случаи присутствуют в повторяемом наборе данных Batch testing.
  • Smoke-тест витрины магазина после развертывания проходит на компьютере и мобильном устройстве.

Устранение неполадок

Playground не открывается

Вернитесь в рабочую область B2B, подтвердите активную компанию и доступ к конфигурации Agent, затем снова используйте текущее действие Playground. Не полагайтесь на ранее сохранённый URL передачи.

Исправленный ответ всё ещё выглядит старым

Убедитесь, что источник сохранён или опубликован в активной компании, устраните конфликты и начните новый разговор Playground. Если данные каталога изменились, дождитесь синхронизации и любой материализации фильтров.

Пакетные и интерактивные результаты различаются

Сравните компанию, язык, контекст товара, вопрос из набора данных, историю разговора и время выполнения каждого запуска. Повторно запустите точно тот же выбранный вопрос после подтверждения одинаковой текущей конфигурации.

Связанные руководства

Была ли эта статья полезной?