Главная
Тарифы О нас Подход Кейсы Контакты растИИшкаблог 404ai Интеграции Глоссарий Запросить демо +7 (993) 729-59-59
Внедрение · измерение · 404ai

A/B-тест: AI-агент против человека

«Агент отвечает быстрее» — не аргумент, пока неизвестно, чем закончились разговоры и сколько денег они принесли. A/B-тест AI-агента против человека — это параллельная обработка одного потока обращений двумя способами с заранее зафиксированными метриками, объёмом и сроком. Почти все сравнения, которые приносят на обсуждение, устроены иначе: разные потоки, разные месяцы, разные метрики. После них спорят о выводах, а деньги на внедрение тратятся или не тратятся по впечатлению.

Сравнивают не агента с человеком, а два способа обработать один поток

Формулировка «кто лучше — робот или менеджер» звучит естественно и сразу уводит в сторону. Агент и человек работают в системе: очередь, скрипт, CRM, время суток, источник заявки. Сравнивать нужно два варианта этой системы — с агентом на первой линии и без него, — при том что всё остальное остаётся одинаковым.

Отсюда главное требование: обращения делятся случайно, а не по типу. Отдать роботу простые вопросы, а людям сложные — значит получить результат, который ничего не доказывает ещё до старта. Робот «выиграет» по скорости, люди — по конверсии, и оба вывода будут следствием деления, а не качества работы.

Если случайное деление невозможно — например, агент подключён к мессенджеру, а люди отвечают по телефону, — сравнение всё ещё имеет смысл, но разница может объясняться каналом, а не исполнителем. Такой вывод нужно так и подписывать.

Вердикт: тест, в котором группы получили разные обращения, измеряет сортировку, а не агента.

Скорость, качество и деньги меняются в разные стороны

Метрики сравнения лежат на трёх уровнях, и каждый отвечает на свой вопрос.

Операционные — время первого ответа, доля обращений, закрытых без человека, доля эскалаций. Меняются сразу и показывают, работает ли механика.

Качественные — доля верных ответов на размеченной выборке, повторные обращения по тому же вопросу, оценка клиента после разговора. Их чаще всего забывают, а именно здесь прячется разница между «быстро» и «полезно».

Бизнесовые — конверсия в целевое действие, средний чек, доля дошедших до сделки. Меняются медленнее, требуют большего объёма, но только они решают, продолжать ли.

Что это значит для руководителя: агент может выигрывать по скорости, не отличаться по качеству и проигрывать по конверсии — и все три вывода будут правдой одновременно. Отчёт, в котором есть только первый уровень, обычно готовил тот, кому агент нравится. Отчёт только с третьим — тот, кому не нравится.

Вердикт: до старта договоритесь, какая метрика главная. У нас в пилотах это одна бизнесовая цифра, остальные — контрольные, которые не должны просесть.

Двести обращений дают двадцать событий — этого мало для конверсии

Универсального числа нет, но есть здравые ориентиры. Для операционных метрик разница обычно видна на паре сотен обращений в каждой группе: время ответа или доля эскалаций колеблются слабо, и перевес заметен быстро.

С конверсией иначе. Если целевое действие происходит в одном случае из десяти, две сотни обращений дадут двадцать событий. На двадцати событиях разница в пару сделок — это шум: следующая неделя легко перевернёт картину. Для вывода о конверсии объём нужен кратно больше, и это главная причина, по которой честный тест идёт дольше, чем хочется.

По времени минимум — две полные недели, чтобы захватить обычный цикл: будни и выходные, начало и конец месяца. Если сделка у вас длиннее, срок растягивается до полного цикла. Логика достаточности объёма подробно разобрана в статье про то, сколько звонков нужно для достоверных выводов.

Вердикт: если за месяц поток не набирает нужного объёма, тест на конверсию не ответит на вопрос — и честнее это признать до старта, чем после.

Сравнение с прошлым месяцем измеряет сезон, а не агента

Четыре ошибки встречаются чаще остальных, и каждая сама по себе обесценивает результат.

Сравнение с прошлым периодом вместо параллельного теста. «В июле было так, в августе стало так» — в промежутке изменились сезонность, реклама и состав команды. Параллельные группы устраняют это разом: обе живут в одном и том же месяце.

Люди знают, что их сравнивают. Поведение меняется, и вы измеряете не разницу подходов, а эффект наблюдения: менеджеры, которые знают, что соревнуются с роботом, на время теста могут работать заметно старательнее обычного. Полностью это не убрать, но превращать тест в соревнование с объявленным призом точно не стоит.

Разные условия у групп. Агент отвечает круглосуточно, люди — в рабочие часы. Честно сравнивать тогда можно только внутри рабочих часов, а ночной эффект считать отдельно.

Остановка теста в момент удачного результата. Посмотрели на седьмой день, увидели перевес, объявили победу. Срок и объём определяются до старта — иначе вы измеряете собственное нетерпение.

Вердикт: сравнение «до и после» годится для первого впечатления и не годится для решения о бюджете.

Деление по дням и менеджерам подмешивает посторонние различия

Деление — единственное место, где тест ломается необратимо: если группы изначально разные, никакая обработка данных потом этого не исправит. Правильный способ один — случайное распределение на уровне отдельного обращения, в момент его поступления.

Все удобные альтернативы вносят систематическую разницу. По чётным и нечётным дням — в группы попадают разные дни недели, а понедельник и пятница ведут себя по-разному. По времени суток — утренние и вечерние обращения различаются по типу клиентов. По менеджерам — вы сравниваете не агента с человеком, а агента с конкретными людьми, и лучший продавец отдела легко «побеждает» любую автоматизацию.

После старта стоит проверить, что группы похожи не только по размеру. Сравните их по источникам обращений, среднему чеку и доле повторных клиентов. При случайном делении различия будут небольшими; заметный перекос значит, что случайность где-то нарушена — например, часть заявок обходит распределитель.

Вердикт: пять минут на проверку состава групп дешевле, чем месяц теста на кривом делении.

Каждое подглядывание в данные повышает шанс ложной победы

Соблазн понятен: разница появилась на третий день, результат очевиден, зачем ждать. Проблема в том, что при регулярных проверках разница появляется почти всегда — просто в силу случайных колебаний, и чем чаще смотришь, тем выше шанс её поймать.

Механика простая. Каждое подглядывание — дополнительная возможность увидеть случайное расхождение и принять его за настоящее. Тест, который смотрят каждый день и останавливают при первом различии, регулярно даёт ложный результат, и решение принимается на шуме.

Защита не требует статистического образования: объём и срок фиксируются до старта и не пересматриваются. «Смотрим итог после четырёхсот обращений в каждой группе, не раньше» — этой строки достаточно. Промежуточные значения видеть можно, решения по ним не принимаются.

Вердикт: правило остановки пишется в первый день, а не в тот, когда цифры понравились.

Когда поток не разделить, помогает чередование недель

Иногда разделить поток нельзя технически: один номер, одна очередь, нет способа развести обращения. Это не повод отказываться от измерения, но результат придётся получать иначе и относиться к нему осторожнее.

Рабочий вариант — чередование периодов: неделя с агентом, неделя без, и так несколько раз подряд. Именно чередование, а не один переход: оно усредняет сезонные и рекламные эффекты, которые при сравнении «до и после» отравляют результат полностью.

Длина периода определяется циклом сделки: он должен помещаться в отрезок целиком, иначе конверсия недели с агентом посчитается по сделкам, начатым в предыдущую. Если цикл длиннее пары недель, чередование становится непрактичным — тогда честнее ограничиться операционными метриками и выводов о конверсии не делать.

Вердикт: чередование слабее параллельного теста, но сильнее любого «до и после».

Процент без денег не обосновывает решение

Разница в процентах не сопоставляется ни с затратами, ни с масштабом. Перевод в деньги занимает одну строку и меняет разговор с собственником.

Считается так: разница в конверсии, умноженная на месячный объём обращений и на средний чек, даёт валовый эффект. Из него вычитается разница в стоимости обработки — с одной стороны оплата за разговоры агента, с другой время сотрудников на тот же объём.

Условный пример, чтобы проверить арифметику: 1 000 обращений в месяц, конверсия с агентом выше на 1 процентный пункт, средний чек 20 000 ₽. Это 10 дополнительных продаж и 200 000 ₽ валового эффекта в месяц — до вычета стоимости обработки. Если та же разница в 1 пункт получена на двухстах обращениях, никаких 200 000 ₽ нет: есть две сделки, которые могли случиться и так.

Отдельной строкой считается эффект нерабочего времени — там, где ночью и в выходные заявки лежат без ответа, он бывает крупнее всего остального, и его легче всего потерять в общей цифре. Обращения, которые раньше лежали без ответа до утра, теперь обрабатываются. Это не улучшение конверсии, а новый объём; смешанный с приростом, он завышает оценку самого агента.

Вердикт: в отчёте должно быть три строки — прирост на общем потоке, новый объём ночью, разница в стоимости обработки. Одна цифра «плюс N процентов» — это не отчёт.

Тест не нужен, если ответ виден без статистики

Честный A/B-тест стоит времени: две-четыре недели, дисциплина деления, отложенное решение. Бывают ситуации, где он не окупит этих затрат.

Агент закрывает то, что сейчас не закрывает никто. Если ночью и в выходные на заявки не отвечает ни один человек, сравнивать не с кем. Достаточно посчитать, сколько обращений пришло в нерабочее время и сколько из них дошли до сделки.

Поток слишком мал. При паре обращений в день нужный объём не наберётся за разумный срок, а сама автоматизация, скорее всего, не вернёт вложенного. Мы в таких случаях прямо говорим, что внедрение рано, — это одна из причин отказа, описанных в нашем подходе к проектам.

Агент заменяет механическую операцию. Подтверждение записи, статус заказа, выдача реквизитов — здесь качество проверяется выборочной разметкой ответов, а не тестом на конверсию.

Моя позиция такая: тест нужен там, где агент берёт на себя разговор, влияющий на продажу, и где ошибка стоит денег. Во всех остальных случаях достаточно операционных метрик и выборочной проверки качества.

Честный тест заканчивается разделением зон, а не победителем

Самый частый исход правильно поставленного сравнения — не «победил кто-то», а карта зон. Агент выигрывает на типовых обращениях и в нерабочее время, человек — на сложных и эмоциональных. Вывод из этого не «внедряем» и не «отказываемся», а конструкция, где агент берёт первую линию, а критерии передачи человеку настроены по данным теста.

Эти критерии — самый ценный результат теста. Они говорят, на какой теме, на каком возражении, на какой сумме сделки разговор должен уходить к менеджеру. Как настраивается сам момент передачи и почему он критичен для доверия клиента — в статье про эскалацию на оператора.

Правило остановки пишется до первого обращения

Что это меняет в решении: вопрос «внедрять ли агента» заменяется вопросом «какая цифра должна измениться, на скольких обращениях мы это увидим и при каком результате остановимся». Если на эти три вопроса нет ответа до старта, результат теста будет аргументом в споре, а не основанием для решения.

Проверить на своих данных можно без подрядчика. Возьмите месячный объём обращений, текущую конверсию и средний чек, посчитайте, сколько целевых событий наберётся в каждой группе за две недели. Если меньше нескольких десятков — тест на конверсию не даст ответа, и честнее ограничиться операционными метриками. Если больше — зафиксируйте на одной странице главную метрику, объём, срок и условие остановки, и только потом включайте агента.

Частые вопросы

Если не нашли ответа — напишите нам в Telegram, ответим за 15 минут.

Разделить один и тот же поток обращений случайным образом на две группы и обработать параллельно, оставив все прочие условия одинаковыми. Деление по типу обращений (роботу — простое, людям — сложное) делает сравнение бессмысленным ещё до старта.
Три уровня сразу: операционные (время ответа, доля обработанных без человека, эскалации), качественные (доля верных ответов, повторные обращения, оценка клиента) и бизнесовые (конверсия, средний чек). Агент может выигрывать по скорости и проигрывать по конверсии — и оба факта важны.
Минимум две полные недели, чтобы захватить будни, выходные и разные части месяца. По объёму: для операционных метрик обычно хватает пары сотен обращений в группе, для конверсии нужно кратно больше — иначе отличить реальную разницу от случайности не получится.
Сравнение с прошлым периодом вместо параллельных групп, разные условия работы у групп (круглосуточный агент против рабочих часов у людей), эффект наблюдения и остановка теста в момент, когда результат понравился. Срок и объём фиксируются до старта.

Поставим честный тест на вашем потоке

Разделим обращения, зафиксируем метрики до старта и покажем результат, который выдержит вопросы финансового директора.

Разберём ваши звонкиПилот бесплатно
Обсудить задачу