Главная
Разработка AI-трансформация Тарифы О нас Подход Кейсы Контакты Блог Интеграции Глоссарий Запросить демо +7 (993) 729-59-59
AI-агенты · Дирижёр · 404ai

Тестирование AI-агента перед запуском

Тестирование AI-агента — это проверка его ответов на заранее собранном наборе сценариев до того, как с ним заговорит первый настоящий клиент. Пропускают этот шаг почти всегда: агент отвечает связно с первой минуты, и кажется, что проверять нечего. Разберём, что именно проверять и почему связность ответа ничего не говорит о его верности.

Почему «поговорили — вроде отвечает» не проверка

Языковая модель выдаёт связный текст всегда, независимо от того, верен он или нет. Поэтому первое впечатление от агента обманчиво: он звучит уверенно и на правильных ответах, и на выдуманных, и отличить одно от другого на слух невозможно.

Отсюда правило: проверка — это не разговор с агентом, а сверка его ответов с документом. Считается не «понравилось», а доля ответов, совпавших с источником дословно.

Суть

Агент, который в десяти диалогах подряд отвечал складно, не проверен никак. Проверен тот, чьи ответы сверили с прайсом, регламентом и условиями договора построчно.

Четыре набора сценариев

Полный тест собирается из четырёх групп, и каждая ловит свой класс ошибок. Пропуск любой из них оставляет дыру, которая обнаружится уже на клиентах.

  • Типовые вопросы. Два–три десятка самых частых обращений, взятых из реальных переписок и звонков за последние месяцы, а не придуманных. Проверяют базовую правильность.
  • Вопросы без ответа в базе. То, чего в документах заведомо нет. Правильное поведение — признать незнание и передать человеку. Эта группа ловит склонность выдумывать.
  • Пограничные и неудобные. Просьба о скидке, спор о сумме, претензия, вопрос о конкуренте. Проверяют, не обещает ли агент того, чего компания не даёт.
  • Кривой ввод. Опечатки, обрывки фраз, два вопроса в одном сообщении, переход на другую тему посреди диалога. Проверяют устойчивость, а не вежливость.

Последняя группа даёт больше всего находок и собирается тяжелее всего: придумать кривой ввод сложнее, чем взять его из реальных диалогов, поэтому берите оттуда.

Кто должен тестировать

Не тот, кто настраивал. Человек, собиравший базу знаний, задаёт вопросы теми же словами, какими написаны документы, — и агент отвечает правильно ровно потому, что формулировка совпала.

Рабочий состав проверяющих — сотрудник, который сам ведёт эти разговоры с клиентами, и человек со стороны, не знающий продукта. Первый приносит реальные формулировки, второй задаёт вопросы так, как их задаёт неподготовленный клиент.

Что фиксировать по каждому ответу

ОтметкаЧто означаетЧто делать
ВерноСовпадает с документом по смыслу и по цифрамНичего
НеполноПравда, но упущено условие или оговоркаДополнить документ в базе
НеверноРасходится с документомБлокирует запуск
ВыдуманоОтвета в документах нет вообщеБлокирует запуск
Правильно передалПризнал незнание и позвал человекаНичего, это норма

Две последние строки часто путают. Передача человеку — не провал теста, а верный ответ на вопрос вне компетенции; провал — это когда агент вместо передачи что-то сочинил.

Порог запуска

Числа, годного для всех, здесь нет: цена ошибки в записи на стрижку и в согласовании поставки различается на порядки. Но два условия работают всегда.

Ноль выдуманных ответов. Это не процент, а ноль: одна выдумка означает, что агенту не задано право на незнание, и она повторится на любой незнакомой теме.

Ноль неверных на деньгах. Цены, сроки, условия возврата и гарантии проверяются отдельно и должны совпадать полностью. Ошибка в вежливой формулировке стоит извинения, ошибка в цене — сделки.

Пилот на живом потоке

После набора сценариев идёт не полный запуск, а узкий пилот: агент работает на одном канале или в одни часы, а его ответы читает человек — не выборочно, а подряд.

Сплошное чтение здесь важнее, чем кажется. Именно на живом потоке появляются формулировки, которых не было в сценариях, и первые дни дают больше находок, чем весь подготовительный тест.

Признак готовности

Расширять пилот стоит тогда, когда за день сплошного чтения не нашлось ни одного ответа с пометкой «выдумано» или «неверно», — а не когда закончилось время, отведённое на пилот.

Что перепроверять после каждого изменения

Набор сценариев — не разовая работа, а актив. Любое изменение базы знаний или настроек способно сломать ответ, который раньше был верным, и заметить это без повторного прогона нельзя.

Поэтому сценарии сохраняются и прогоняются заново после каждого заметного изменения. Это единственный способ отличить «стало лучше» от «починили одно, сломали другое».

Коротко

  • Связность ответа не говорит о его верности: модель звучит уверенно и когда выдумывает.
  • Четыре группы сценариев: типовые, без ответа в базе, пограничные, кривой ввод.
  • Тестирует не тот, кто настраивал: он задаёт вопросы словами из документов.
  • Передача человеку — верный ответ, а не провал теста.
  • Порог запуска: ноль выдуманных ответов и ноль неверных там, где речь о деньгах.
  • Сценарии сохраняются и прогоняются заново после каждого изменения базы.

Откуда агент берёт фактические ответы — в статье про базу знаний AI-агента. Когда он обязан позвать человека — в статье про эскалацию на оператора. Как это устроено у нас — на странице Дирижёра.

Частые вопросы

Если не нашли ответа — напишите нам в Telegram, ответим за 15 минут.

Проверка — это не разговор с агентом, а сверка его ответов с документом. Собирается четыре группы сценариев: типовые вопросы из реальных обращений, вопросы без ответа в базе, пограничные и неудобные (скидка, спор о сумме, претензия) и кривой ввод с опечатками и обрывками фраз. По каждому ответу фиксируется отметка: верно, неполно, неверно, выдумано или правильно передал человеку.
Языковая модель выдаёт связный текст всегда, независимо от того, верен он или нет. Агент звучит уверенно и на правильных ответах, и на выдуманных, и отличить одно от другого на слух невозможно. Агент, который в десяти диалогах подряд отвечал складно, не проверен никак — проверен тот, чьи ответы сверили с прайсом и регламентом построчно.
Не тот, кто его настраивал: человек, собиравший базу знаний, задаёт вопросы теми же словами, какими написаны документы, и агент отвечает правильно ровно потому, что формулировка совпала. Рабочий состав — сотрудник, который сам ведёт такие разговоры с клиентами, и человек со стороны, не знающий продукта: первый приносит реальные формулировки, второй задаёт вопросы как неподготовленный клиент.
Нет. Передача человеку — верный ответ на вопрос вне компетенции агента, и в тесте она отмечается как норма. Провалом считается обратное: когда агент вместо передачи что-то сочинил. Именно поэтому в набор сценариев обязательно входит группа вопросов, ответа на которые в базе заведомо нет.
Универсального процента нет — цена ошибки в записи на стрижку и в согласовании поставки различается на порядки. Но два условия работают всегда: ноль выдуманных ответов (одна выдумка означает, что агенту не задано право на незнание, и она повторится на любой незнакомой теме) и ноль неверных ответов там, где речь о деньгах: цены, сроки, условия возврата и гарантии должны совпадать полностью.
Да, набор сценариев — не разовая работа, а актив. Любое изменение базы знаний или настроек способно сломать ответ, который раньше был верным, и заметить это без повторного прогона нельзя. Сценарии сохраняются и прогоняются заново после каждого заметного изменения — это единственный способ отличить «стало лучше» от «починили одно, сломали другое».

Проверим агента на ваших сценариях

Соберём набор из ваших реальных обращений, включая неудобные, прогоним и покажем долю ответов, совпавших с вашими документами дословно.

Разберём ваши звонкиПилот бесплатно
Обсудить задачу