Umí váš chatbot skutečně odpovídat? Měřte odpovědi, ne nalezené stránky
Že chatbot „našel správnou stránku“, ještě neznamená, že zákazníkovi pomohl. Praktický způsob, jak ověřit, jestli AI asistent nebo bot nad znalostní bází na vašem webu opravdu odpovídá – s malou pevnou sadou otázek, třemi jasnými známkami a bez vymyšlených čísel.
Čím dál víc firem přidává na web chatbota nebo AI asistenta nad vlastní znalostní bází. Otázka, kterou si přitom kladou nejméně často, je ta nejdůležitější: odpovídá to dobře? Dá se to zjistit – ale ne pocitem ani tím, kolikrát bot „našel“ nějaký dokument. Čekat, až si na špatnou odpověď stěžuje zákazník, je nejdražší způsob, jak se to dozvědět.
Proč „našel stránku“ není totéž co „odpověděl“
Většina nástrojů kolem chatbotů a AI asistentů měří především to, jak dobře systém najde relevantní dokument – takzvaný retrieval. Ukazatel typu „jistota vyhledání 80 %“ vypadá důvěryhodně, ale měří něco jiného, než co zajímá zákazníka. Zákazníkovi je jedno, jestli bot našel správný článek. Zajímá ho, jestli dostal odpověď, které rozumí a která mu pomohla, aniž by musel dál hledat nebo psát na podporu znovu.
Bot, který na dotaz „Jak zruším objednávku?“ vypíše celý článek o objednávkách, technicky „našel správnou stránku“. Odpověď to ale není – je to přesměrování práce zpátky na zákazníka. Stejně tak odkaz na dokument bez jediné věty vysvětlení není odpověď, i kdyby odkazoval přesně tam, kam měl.
Postavte si malou pevnou sadu otázek
Základ je jednoduchý: sepsat sadu otázek, které lidé v praxi skutečně pokládají – z historie ticketů, z FAQ, z toho, na co se ptají na chatu nebo po telefonu. Ne vymyšlené ukázkové dotazy, které zní hezky v prezentaci, ale reálné formulace zákazníků, včetně překlepů a hovorové češtiny.
Pro první test stačí řádově dvacet až čtyřicet otázek. Důležitější než počet je to, že sada je pevná a zapsaná – uložená jako soubor, ne jako nápad v hlavě. Ke každé otázce si poznamenejte, odkud je (jaký zdrojový článek by měl bot použít) a jestli je u ní v pořádku, když bot odpoví „to nevím, obraťte se na podporu“.
U každé otázky se vyplatí mít v souboru čtyři věci: samotné znění dotazu tak, jak ho pokládají zákazníci, očekávaný zdroj, informaci, jestli je u ní odmítnutí přípustné, a datum poslední kontroly. Sada se pak dá kdykoli znovu spustit a výsledek je vždy porovnatelný s tím předchozím – ne jen s dojmem, že „to teď vypadá lépe“.
Tři známky pro každou odpověď
Každou odpověď bota na testovací otázku ohodnoťte jednou ze tří známek:
- Plná odpověď. Text, který dává smysl sám o sobě, odpovídá na položenou otázku a je věcně správný. Ne odkaz, ne citace celého článku, ne obecná fráze.
- Mimo téma nebo špatně. Bot odpověděl sebejistě, ale vedle – špatný postup, špatná informace, nebo odpověď na jinou otázku, než jaká padla. Tohle je kategorie, která zákazníka poškodí nejvíc, protože vypadá jako odpověď.
- Správně odmítnuto. Bot řekl, že odpověď nezná, a nasměroval zákazníka na člověka nebo na kontakt. V hodnocení se to často počítá jako neúspěch – je to přesně naopak.
Odmítnutí, které přizná meze systému a ukáže cestu dál, je funkce produktu, ne jeho slabina. Bot, který si u nejasné otázky nevymýšlí a raději odkáže na podporu, je spolehlivější než bot, který odpovídá sebejistě na všechno – i na to, co neví.
Otázky bez odpovědi patří do sady schválně
Součástí testovací sady by měla být i skupina otázek, na které web záměrně žádnou odpověď nemá – něco mimo nabízené služby, osobní údaje, nebo situace, kterou znalostní báze vůbec nepokrývá. Tahle „pastová“ skupina ukáže, jestli bot umí přiznat, že neví, nebo jestli si pod tlakem vymyslí odpověď, která zní věrohodně, ale je smyšlená. Právě tady se nejčastěji pozná rozdíl mezi bezpečným a rizikovým nasazením.
Procento z pár desítek otázek je rozsah, ne přesné číslo
Když sada obsahuje třicet otázek a bot jich dvacet zodpoví plně, „67 %“ zní jako přesné číslo. Není. Na tak malém vzorku je skutečná chybovost v širokém rozmezí a jedna nebo dvě hůř zodpovězené otázky číslo výrazně posunou. Smysluplnější je uvádět syrová čísla – kolik z kolika – a rozmezí, ne jedno desetinné místo za procentem. Číslo, které vypadá přesně, ale není podložené dostatečným vzorkem, je horší než žádné číslo.
Do reportu proto patří spíš věta „18 z 30 otázek zodpovězeno plně, 9 správně odmítnuto, 3 mimo téma nebo špatně“ než jedno souhrnné procento. Syrová čísla se dají zpětně přepočítat, ověřit a v případě pochybností i rozporovat – zaokrouhlené procento bez čitatele a jmenovatele ne.
Spouštějte stejnou sadu po každé změně
Sada otázek má hodnotu hlavně v opakování. Po každé úpravě – nový obsah ve znalostní bázi, změna promptu, jiný poskytovatel modelu, úprava vyhledávání – ji spusťte znovu a porovnejte výsledek s předchozím během. Teprve rozdíl mezi dvěma běhy nad stejnou sadou řekne, jestli změna pomohla, nebo naopak něco pokazila. Jednorázové měření je fotka jednoho okamžiku; opakované měření nad stejnou sadou je jediný způsob, jak vidět trend.
Kdy stačí jiný model a kdy je potřeba ruční hodnocení
U větších sad se dá první třídění zrychlit tak, že odpovědi nejdřív ohodnotí jiný jazykový model – v oboru se tomu říká „LLM jako hodnotitel“. Zvládne to rychle a levně u desítek nebo stovek odpovědí najednou. Existují k tomu i volně dostupné nástroje pro testování a hodnocení AI/RAG systémů, například Ragas – dobrý zdroj i pro terminologii (faithfulness, groundedness, context precision), pokud chcete hodnocení dál zautomatizovat.
Na tohle se ale spoléhat nedá u citlivých témat (peníze, reklamace, osobní údaje) ani u hraničních případů, kde je rozdíl mezi „správně“ a „mimo téma“ jemný – tam patří ruční kontrola člověkem. A každá odpověď spadající do kategorie „mimo téma nebo špatně“ si zaslouží ruční pohled bez ohledu na to, kolik jich je celkem – jedna sebejistě špatná odpověď zákazníkovi váží víc než jakékoli souhrnné procento.
Ať hodnotí člověk, nebo model, uchovávejte si u každé položky i doslovnou odpověď bota, ne jen výslednou známku. Až za pár měsíců budete řešit, jestli se kvalita zlepšila, nebo zhoršila, bez původního textu odpovědi se spor nedá rozhodnout.
Co si z toho odnést
Kvalitu chatbota nepoznáte podle toho, jak sebejistě zní, ani podle toho, kolikrát trefil správný dokument. Pozná se podle toho, kolik ze skutečných otázek zákazníků dostane plnou odpověď, kolik je správně a bezpečně odmítnuto – a jak moc se tahle dvě čísla mění, když sadu spustíte znovu za měsíc.
Chcete vědět, jak na tom je váš chatbot doopravdy?
V auditu sestavíme sadu otázek z vašich reálných dotazů a ukážeme, kde bot odpovídá a kde jen ukazuje na stránku.
Chci vstupní audit →