Тестирование AI-агента — это проверка его ответов на заранее собранном наборе сценариев до того, как с ним заговорит первый настоящий клиент. Пропускают этот шаг почти всегда: агент отвечает связно с первой минуты, и кажется, что проверять нечего. Разберём, что именно проверять и почему связность ответа ничего не говорит о его верности.
Почему «поговорили — вроде отвечает» не проверка
Языковая модель выдаёт связный текст всегда, независимо от того, верен он или нет. Поэтому первое впечатление от агента обманчиво: он звучит уверенно и на правильных ответах, и на выдуманных, и отличить одно от другого на слух невозможно.
Отсюда правило: проверка — это не разговор с агентом, а сверка его ответов с документом. Считается не «понравилось», а доля ответов, совпавших с источником дословно.
Агент, который в десяти диалогах подряд отвечал складно, не проверен никак. Проверен тот, чьи ответы сверили с прайсом, регламентом и условиями договора построчно.
Четыре набора сценариев
Полный тест собирается из четырёх групп, и каждая ловит свой класс ошибок. Пропуск любой из них оставляет дыру, которая обнаружится уже на клиентах.
- Типовые вопросы. Два–три десятка самых частых обращений, взятых из реальных переписок и звонков за последние месяцы, а не придуманных. Проверяют базовую правильность.
- Вопросы без ответа в базе. То, чего в документах заведомо нет. Правильное поведение — признать незнание и передать человеку. Эта группа ловит склонность выдумывать.
- Пограничные и неудобные. Просьба о скидке, спор о сумме, претензия, вопрос о конкуренте. Проверяют, не обещает ли агент того, чего компания не даёт.
- Кривой ввод. Опечатки, обрывки фраз, два вопроса в одном сообщении, переход на другую тему посреди диалога. Проверяют устойчивость, а не вежливость.
Последняя группа даёт больше всего находок и собирается тяжелее всего: придумать кривой ввод сложнее, чем взять его из реальных диалогов, поэтому берите оттуда.
Кто должен тестировать
Не тот, кто настраивал. Человек, собиравший базу знаний, задаёт вопросы теми же словами, какими написаны документы, — и агент отвечает правильно ровно потому, что формулировка совпала.
Рабочий состав проверяющих — сотрудник, который сам ведёт эти разговоры с клиентами, и человек со стороны, не знающий продукта. Первый приносит реальные формулировки, второй задаёт вопросы так, как их задаёт неподготовленный клиент.
Что фиксировать по каждому ответу
| Отметка | Что означает | Что делать |
|---|---|---|
| Верно | Совпадает с документом по смыслу и по цифрам | Ничего |
| Неполно | Правда, но упущено условие или оговорка | Дополнить документ в базе |
| Неверно | Расходится с документом | Блокирует запуск |
| Выдумано | Ответа в документах нет вообще | Блокирует запуск |
| Правильно передал | Признал незнание и позвал человека | Ничего, это норма |
Две последние строки часто путают. Передача человеку — не провал теста, а верный ответ на вопрос вне компетенции; провал — это когда агент вместо передачи что-то сочинил.
Порог запуска
Числа, годного для всех, здесь нет: цена ошибки в записи на стрижку и в согласовании поставки различается на порядки. Но два условия работают всегда.
Ноль выдуманных ответов. Это не процент, а ноль: одна выдумка означает, что агенту не задано право на незнание, и она повторится на любой незнакомой теме.
Ноль неверных на деньгах. Цены, сроки, условия возврата и гарантии проверяются отдельно и должны совпадать полностью. Ошибка в вежливой формулировке стоит извинения, ошибка в цене — сделки.
Пилот на живом потоке
После набора сценариев идёт не полный запуск, а узкий пилот: агент работает на одном канале или в одни часы, а его ответы читает человек — не выборочно, а подряд.
Сплошное чтение здесь важнее, чем кажется. Именно на живом потоке появляются формулировки, которых не было в сценариях, и первые дни дают больше находок, чем весь подготовительный тест.
Расширять пилот стоит тогда, когда за день сплошного чтения не нашлось ни одного ответа с пометкой «выдумано» или «неверно», — а не когда закончилось время, отведённое на пилот.
Что перепроверять после каждого изменения
Набор сценариев — не разовая работа, а актив. Любое изменение базы знаний или настроек способно сломать ответ, который раньше был верным, и заметить это без повторного прогона нельзя.
Поэтому сценарии сохраняются и прогоняются заново после каждого заметного изменения. Это единственный способ отличить «стало лучше» от «починили одно, сломали другое».
Коротко
- Связность ответа не говорит о его верности: модель звучит уверенно и когда выдумывает.
- Четыре группы сценариев: типовые, без ответа в базе, пограничные, кривой ввод.
- Тестирует не тот, кто настраивал: он задаёт вопросы словами из документов.
- Передача человеку — верный ответ, а не провал теста.
- Порог запуска: ноль выдуманных ответов и ноль неверных там, где речь о деньгах.
- Сценарии сохраняются и прогоняются заново после каждого изменения базы.
Откуда агент берёт фактические ответы — в статье про базу знаний AI-агента. Когда он обязан позвать человека — в статье про эскалацию на оператора. Как это устроено у нас — на странице Дирижёра.