Test je Agent in Playground
Playground is het interactieve testoppervlak voor de klantgerichte Agent. Het stelt geautoriseerde teamgenoten in staat realistische gesprekken uit te proberen zonder te vertrouwen op de openbare storefront. De B2B-we...
Playground is het interactieve testoppervlak voor de klantgerichte Agent. Het stelt geautoriseerde teamgenoten in staat realistische gesprekken uit te proberen zonder te vertrouwen op de openbare storefront. De B2B-werkruimte opent Playground via een veilige handoff met korte geldigheidsduur, dus gebruik de actie in het product in plaats van een oude test-URL op te slaan.
Deze handleiding laat zien hoe je nuttige scenario's ontwerpt, de volledige reactie inspecteert, fouten classificeert en belangrijke gevallen omzet in herhaalbare batchtests. Ook wordt uitgelegd wat Playground niet kan aantonen over een live installatie.
Hoe dit in Humind past
AI Agent is de configuratieruimte voor de klantgerichte assistent. Knowledge en Catalog leveren feiten, Guidance vormt het reactiegedrag, Tools voegen acties toe, Escalation definieert menselijke ondersteuning, testoppervlakken laten je het resultaat beoordelen vóór implementatie.
Wijzigingen kunnen veel gesprekken beïnvloeden, dus test representatieve koop- en ondersteuningsscenario's na elke betekenisvolle update. Een visueel correcte chat is niet genoeg: verifieer samen het antwoord, de productcontext, de beschikbare actie en het handoff-gedrag.
Voordat je begint
Toegang: Playground vereist leestoegang tot de Agent-configuratie. Het corrigeren van de bron kan ook schrijftoegang vereisen tot Knowledge, Catalog of de Agent-configuratie.
- Bevestig het actieve bedrijf, de catalogusmarkt, de Agent-configuratie en de taal.
- Bereid verwachte uitkomsten voor product-, beleids-, ondersteunings- en edge-case-vragen voor.
- Gebruik niet-gevoelige testgegevens en houd testgesprekken duidelijk gescheiden van echt klantwerk.
Stapsgewijze workflow
Open een nieuwe Playground-sessie
Open AI Agent en kies Playground. Humind opent het speciale oppervlak voor het actieve bedrijf. Start een nieuw gesprek wanneer je een bronwijziging valideert, zodat eerdere berichten het resultaat niet beïnvloeden.
Leg de configuratie- of inhoudswijziging die wordt getest en de exacte vraag vast. Een vage uitspraak zoals 'de Agent is beter' kan niet worden herhaald of door een andere teamgenoot worden beoordeeld.
Voer een evenwichtige set scenario's uit
Test algemene productontdekking, een specifiek productdetail, een beleid dat is opgeslagen in Knowledge, een ondersteuningsverzoek, een niet-beschikbaar of geen-resultaat-geval, een vervolgvraag en een invoer die volgens de configuratie moet worden gemodereerd of afgewezen.
Varieer in formulering en neem realistische ambiguïteit op. Het doel is niet om één uit het hoofd geleerde zin af te dwingen, maar om correcte feiten, eerlijke onzekerheid, relevante producten, passende tools en het verwachte handoff-pad te verifiëren.
Inspecteer de volledige reactie
Controleer tekst, geciteerde of gelinkte inhoud, aanbevolen producten, varianten, prijzen, tooluitvoer, vervolgsuggesties en escalatiegedrag. Een vloeiend antwoord kan nog steeds fout zijn als het de verkeerde markt selecteert, beschikbaarheid negeert of verouderd beleid gebruikt.
Wanneer het resultaat faalt, identificeer dan het brongebied voordat je gaat bewerken: Knowledge, Catalog, Guidance, Tools, Escalation, interface of implementatie. Het corrigeren van de bron levert meestal een duurzamer resultaat op dan nog een brede instructie toe te voegen.
Maak een herhaalbare regressiecontrole
Open voor belangrijke scenario's Batch testing. Maak of selecteer een dataset, voeg handmatig vragen toe, importeer een CSV of genereer waar passend vragen uit de catalogus. Voer de set uit, beoordeel de antwoordstatus en beoordelingen, en open afzonderlijke gesprekken voor details.
Beoordeel of documenteer de uitkomst met een consistente standaard. Exporteer het CSV-rapport wanneer een beoordeeld artefact nodig is, en voer geselecteerde vragen opnieuw uit na een gerichte wijziging.
Rond af met een live rooktest
Playground valideert Agent-gedrag, niet de storefront-installatie. Test na implementatie via verkoopkanalen een kleinere set op het daadwerkelijke toegestane domein in een privébrowser op desktop en mobiel.
Verifieer dat het entry point, toestemming, het verzamelen van klantidentiteit, productcontext en Inbox-handoff correct werken in de live-omgeving.
Machtigingen en belangrijke aandachtspunten
- Een Playground-doorgang bewijst niet dat de widget correct is geïnstalleerd of gestyled op de storefront.
- Gesprekscontext beïnvloedt vervolgantwoorden, gebruik een nieuwe sessie voor regressiecontroles op bronniveau.
- Gegenereerde batchvragen zijn startmateriaal en vereisen nog steeds beoordeling door de handelaar.
- Gebruik geen echte persoonlijke gegevens van klanten in testprompts.
Controleer het resultaat
Gebruik deze checklist voordat je het werk als voltooid beschouwt:
- Elk scenario heeft een expliciet verwacht feit, productgedrag, actie of escalatie-uitkomst.
- Mislukkingen worden toegewezen aan een brongebied voordat wijzigingen worden aangebracht.
- Kritieke gevallen bestaan in een herhaalbare Batch testing-dataset.
- Een storefront-rooktest na implementatie slaagt op desktop en mobiel.
Probleemoplossing
Playground wordt niet geopend
Ga terug naar de B2B-werkruimte, bevestig het actieve bedrijf en de toegangsrechten voor de Agent-configuratie, en gebruik daarna opnieuw de huidige Playground-actie. Vertrouw niet op een eerder opgeslagen handoff-URL.
Een gecorrigeerd antwoord ziet er nog steeds oud uit
Bevestig dat de bron is opgeslagen of gepubliceerd in het actieve bedrijf, verwijder conflicten en start een nieuw Playground-gesprek. Als catalogusgegevens zijn gewijzigd, wacht dan op synchronisatie en eventuele filtermaterialisatie.
Batch- en interactieve resultaten verschillen
Vergelijk bedrijf, taal, productcontext, datasetvraag, gespreksgeschiedenis en het tijdstip waarop elke uitvoering plaatsvond. Voer precies de geselecteerde vraag opnieuw uit nadat je dezelfde huidige configuratie hebt bevestigd.