Голос AI-автозвонщика проверяют не по демо-ролику и не по проценту на сайте подрядчика, а слепым тестом на своей базе: робот и операторы звонят по одному сценарию, а сравнивают не впечатление, а четыре числа — сколько разговоров дошло до сути, сколько оборвалось в первые секунды, что происходит после вопроса «вы робот?» и чем закончился сценарий. Любой процент «неотличимости» без описания выборки и условий ничего не говорит о вашей телефонии, ваших клиентах и вашем скрипте. Ниже — методика, которую можно повторить за время пилота: как собрать выборку и контрольную группу, какие параметры голоса реально двигают результат, где тест врёт и как по его итогам решить, запускать обзвон или нет.
Процент со страницы подрядчика не переносится на вашу базу
Фраза «слушатели не отличили голос от живого менеджера» звучит как измерение, но без условий это рекламный тезис. Чтобы цифра что-то значила, нужно знать, кто слушал, сколько было записей, сколько секунд звучал каждый отрезок, знали ли слушатели, что среди записей есть робот, и через какую телефонию шёл звук. Меняется любое из условий — меняется результат. Тридцать секунд приветствия и пятиминутный разговор с возражениями проверяют разные вещи.
Есть и более важная причина не опираться на чужой процент. Бизнесу не нужно, чтобы голос «не отличили». Бизнесу нужно, чтобы разговор дошёл до цели: клиент подтвердил запись, ответил на вопрос, согласился на звонок менеджера. Голос, который узнают как робота, но который вежливо и быстро решает задачу, полезнее голоса, неотличимого от человека, но теряющего собеседника на второй реплике. Поэтому тест строится вокруг метрики сценария, а узнаваемость — лишь одно из наблюдений.
Я исхожу из простого правила: всё, что нельзя проверить на своих звонках, в решении не участвует. Это касается и цифр на наших собственных страницах.
Что считать до первого звонка: четыре числа вместо одного
Правила счёта фиксируют письменно до запуска, иначе после пилота каждый будет трактовать результат в свою пользу. Для проверки голоса достаточно четырёх показателей.
Доля разговоров, дошедших до сути. Это разговоры, в которых собеседник дослушал вступление и услышал главный вопрос или предложение сценария. Точку «суть прозвучала» задают заранее — например, реплика с датой записи или вопрос об интересе к предложению. Показатель считается от всех соединений, где человек взял трубку.
Ранние сбросы. Доля соединений, где абонент положил трубку или отказался, не дослушав, в первые секунды. Границу тоже фиксируют заранее и одинаково для обеих групп. Именно ранний сброс сильнее всего связан с голосом: до сути разговора собеседник ещё не успел оценить предложение, он оценивает только звучание и первую фразу.
Вопрос «вы робот?». Считают две вещи: как часто вопрос звучит и что происходит после ответа — разговор продолжается или обрывается. Частота вопроса показывает, насколько голос вызывает подозрение. Судьба разговора после честного ответа показывает, мешает ли это подозрение цели.
Итог по сценарию. Целевое действие, ради которого звонок затевался: подтверждение, ответ, согласие на передачу менеджеру. Это главное число, три предыдущих объясняют, почему оно получилось таким.
Как отделить дозваниваемость от контактности и почему стоимость целевого действия — единственное число для сравнения подрядчиков, разобрано в статье о метриках автообзвона; здесь эти понятия используются в том же смысле.
Выборка и контрольная группа: робот и операторы на одной базе
Сравнивать робота с «тем, как было раньше», нельзя: база прошлой кампании была другой, время года другое, скрипт другой. Нужна контрольная группа, которая звонит одновременно с роботом по той же базе.
- Случайное деление базы. Номера перемешивают и делят на две части случайно, а не «первая половина списка роботу, вторая операторам». В списках часто скрыт порядок — по дате заявки, по городу, по источнику, — и неслучайное деление сравнит не голоса, а сегменты.
- Одинаковые окна звонков. Обе группы звонят в одни и те же дни и часы. Время звонка меняет все показатели сильнее, чем кажется, и разница в расписании легко выдаёт себя за разницу в голосе.
- Один сценарий. Операторы работают по тому же тексту, что и робот, с теми же ветками. Если оператор импровизирует, а робот читает скрипт, тест сравнивает сценарии, а не голоса.
- Одинаковые правила повторных попыток. Сколько раз перезванивать недозвону и через какой интервал — одно правило для обеих групп.
- Достаточный объём. Маленькая выборка даёт случайный результат, который выглядит как закономерность.
Про объём стоит сказать отдельно, потому что на нём ошибаются чаще всего. Грубая статистическая оценка: при 400 состоявшихся разговорах в каждой группе разница долей в пять–семь процентных пунктов может оказаться простым шумом. Это не наше наблюдение, а обычная арифметика доверительных интервалов для долей. Значит, если робот и операторы отличаются на два-три пункта по ранним сбросам на паре сотен разговоров, честный вывод — «разницы не видно», а не «робот хуже» или «робот лучше». Если различие нужно поймать тоньше, выборку увеличивают, а не пересчитывают старую до нужного ответа.
Слепое прослушивание: как не подсказать слушателям ответ
Боевой пилот отвечает на вопрос «работает ли», а слепое прослушивание — на вопрос «почему». Его стоит провести до пилота, на тестовых звонках, чтобы не тратить базу на заведомо слабую настройку.
Записи — только тестовые. Для прослушивания не берут разговоры реальных клиентов: сотрудники или привлечённые участники звонят по сценарию и играют роль клиента, в том числе недовольного и перебивающего. Так не возникает вопросов о персональных данных, а сценарий можно прогнать с нужными отклонениями.
Один канал для всех записей. И робот, и операторы записываются через ту телефонию, по которой пойдёт обзвон. Студийная запись оператора рядом с телефонной записью робота — нечестное сравнение, слух заметит разницу канала, а не голоса.
Слушатели не знают пропорцию. Если сказать «здесь половина роботов», люди начнут угадывать по принципу «пора бы уже назвать роботом». Слушателю дают перемешанные отрезки и два вопроса: «человек или автомат» и «дослушали бы вы этот звонок, если бы он был вам». Второй вопрос важнее первого — он ближе к тому, что происходит на реальном звонке.
Два формата отрезков. Сначала короткие фрагменты с начала разговора, потом полные записи с перебиваниями и вопросами не по сценарию. Расхождение между двумя результатами показывает, где голос держится, а где рассыпается.
Слушатели не из проекта. Люди, которые писали сценарий или настраивали голос, узнают реплики, а не звучание. Лучше позвать коллег из других отделов.
Результат такого прослушивания — не исследование, а диагностика: список мест, где слушатели чаще всего замечают автомат. Этот список и становится планом настройки перед пилотом.
Какие параметры голоса двигают результат
Когда слушатели называют запись роботом, редко говорят «тембр неприятный». Чаще звучит «как-то не так отвечает». За этим «не так» стоят несколько параметров, и каждый из них проверяется отдельно.
Паузы внутри фразы. Живой человек делает паузу перед сложным словом и между смысловыми частями предложения. Синтез, который читает фразу ровной лентой, звучит механически даже при чистом звуке. Проверка: дайте голосу длинное предложение с перечислением и послушайте, где он дышит.
Темп. Слишком быстрая речь звучит как заученная, слишком медленная — как неуверенная или машинная. Темп должен меняться: привычная формула приветствия произносится быстрее, дата и сумма — медленнее. Одинаковая скорость на всём разговоре — признак автомата.
Интонация. Вопрос должен звучать вопросом, уточнение — уточнением. Частая ошибка — утвердительная интонация в конце вопроса: собеседник не понимает, что от него ждут ответа, возникает неловкая пауза. Отдельно стоит слушать, как голос реагирует на тон клиента; как устроено распознавание интонации собеседника, разобрано в статье как Фонекс слышит интонацию и меняет тон разговора.
Задержка ответа. Это параметр, который выдаёт автомат быстрее всего. В исследованиях разговорной речи типичный зазор между репликами собеседников измеряется долями секунды — порядка двухсот миллисекунд, и слух к этому ритму привык. Задержка ответа робота складывается из распознавания речи, обработки и телефонии. Когда она доходит до секунды и больше, человек воспринимает паузу как сбой связи или как признак машины и начинает говорить «алло?» поверх ответа. Замерять её нужно на своей телефонии, по записи звонка, от конца реплики клиента до начала ответа.
Перебивания. Клиент перебивает, а голос договаривает заготовленную фразу до точки — так не ведёт себя ни один живой собеседник. Проверка простая, и я бы начинал с неё: на тестовом звонке перебейте голос на середине длинной фразы вопросом не по сценарию. Если он замолкает и отвечает на ваш вопрос, этот слой настроен. Если договаривает, оценивать тембр дальше бессмысленно. Фонекс в таких случаях останавливает текущую реплику и переключается на слушание, но проверять это всё равно стоит на своём сценарии и своей связи.
Числа, имена и повторы: где слух ловит автомат
Отдельный класс ошибок не связан с просодией вообще — это чтение содержимого. Суммы, даты, номера договоров и аббревиатуры произносятся неправильно чаще всего, и одна неверно прочитанная сумма разрушает впечатление сильнее, чем десять правильных фраз.
Имена и названия ещё чувствительнее. Незнакомая фамилия, название компании из двух языков, редкое отчество — человек замечает ошибку мгновенно, потому что речь идёт о нём. Практический приём: выгрузить из базы все уникальные имена, названия и форматы сумм, прогнать их через озвучку заранее и завести словарь произношения для проблемных. Это час работы, который снимает целый класс жалоб.
Третий источник — повтор. Живой человек переспрашивает разными словами, автомат склонен повторять фразу дословно, и второй одинаковый повтор опознаётся почти всеми. В сценарий стоит закладывать две-три формулировки для реплик, которые могут прозвучать повторно. Как писать реплики для уха, а не для глаза, и сколько веток нужно сценарию, разобрано в статье о том, как написать скрипт продаж для AI-автозвонщика.
Телефония портит голос раньше синтеза
Часть претензий к голосу относится не к синтезу, а к каналу связи, и это стоит развести до того, как начинать настройку. Сжатие звука в телефонной сети срезает частоты, и разные кодеки делают это по-разному: один и тот же голос на разных маршрутах звучит по-разному. Задержка в канале добавляется к задержке обработки. Эхо и обрывы делают речь рваной независимо от того, кто говорит.
Проверить, где проблема, можно быстро: сравните одну и ту же реплику в записи на стороне системы и в записи, сделанной на телефоне абонента. Если на стороне системы всё ровно, а у абонента рвано, настраивать нужно телефонию, и никакая работа с голосом этого не исправит. Отсюда же требование к тесту: слепое прослушивание и пилот идут через тот маршрут, который будет в бою, а не через тестовый канал с лучшим качеством.
Длинный разговор проверяют отдельно от первых секунд
Первые секунды и пятая минута разговора — разные экзамены. В начале достаточно уместной интонации и быстрого ответа. Дальше появляются требования, которых в коротком фрагменте просто нет.
Главное из них — согласованность. Собеседник помнит, что говорил в начале: если он назвал имя, а через три минуты его спрашивают снова, разговор рушится независимо от качества звука. Озвученная в начале сумма должна совпадать с той, что прозвучит в конце. Второе — смена темы: человек уходит в сторону, возвращается, вспоминает деталь, и способность удержать нить и вернуться к цели — это уже не синтез речи, а устройство диалога.
Поэтому в отчёте по тесту узнаваемость по коротким фрагментам и по полным записям показывают отдельными строками и не усредняют. Хороший результат на коротких отрезках при слабом на полных — сигнал чинить логику диалога, а не голос.
Вопрос «вы робот?» — часть теста, а не помеха ему
Проверка голоса не должна превращаться в попытку выдать робота за человека. Фонекс на вопрос абонента, говорит ли он с человеком, отвечает честно, и я считаю это правильным условием и для теста, и для боевого обзвона. Естественное звучание нужно не для обмана, а чтобы механическая интонация не отвлекала от сути разговора.
Отсюда два требования к методике. Первое: в тестовые звонки обязательно включают вопрос «вы робот?», и оценивают не только сам ответ, но и то, как робот после него возвращается к цели звонка. Уклончивый ответ портит разговор сильнее честного. Второе: в боевом пилоте считают, что происходит с разговором после этого вопроса. Если после честного ответа разговоры массово обрываются, проблема не в голосе, а в том, что звонок не несёт собеседнику пользы.
Стоит ли представляться роботом сразу, а не только в ответ на вопрос, — отдельный спор с аргументами в обе стороны, он разобран в статье раскрывать ли, что отвечает робот. Для теста важно одно: выбранный вариант раскрытия одинаков на протяжении всего пилота, иначе результаты разных недель нельзя сравнивать.
Закон проверяют до пилота, а не после
Никакой голос не делает допустимым звонок, который запрещён. Часть 2 статьи 18 закона «О рекламе» не допускает распространение рекламы по сетям электросвязи с автоматическим дозваниванием. Поэтому сценарий теста должен решать нерекламную задачу: напомнить о записи, подтвердить заказ, уточнить заявку, провести опрос. Если сценарий по сути продаёт, его нужно переписать или отдать живым операторам, а не надеяться, что естественный голос сгладит вопрос.
Отдельно — персональные данные: звонить можно только по базе, на обработку данных которой есть основание. Как закон разделяет рекламные и нерекламные звонки и что нужно подготовить до запуска, разобрано в статье об автообзвоне и согласии абонента. Юридическую проверку сценария лучше сделать до слепого прослушивания: переписанный после неё скрипт придётся тестировать заново.
Где тонкая настройка голоса не окупится
Естественность голоса важна не везде, и платить за её тонкую настройку имеет смысл не всегда. Короткое уведомление — напоминание о визите, подтверждение доставки — человек слушает ради информации, и ровный синтез его не отталкивает, если сообщение короткое и полезное. Здесь важнее правильно прочитанные дата и адрес, чем живые паузы, и тест можно сократить до проверки чтения.
Голос не спасёт слабый сценарий. Если звонок начинается с длинного рассказа о компании, никакой синтез не удержит собеседника: он кладёт трубку из-за содержания, а не из-за звучания. И автообзвон вообще не окупится там, где база маленькая, а каждый разговор — сложная продажа с вопросами, на которые нужен человек: несколько десятков таких звонков в неделю дешевле и надёжнее отдать менеджеру. В таком случае честный итог разбора — «автозвонщик вам не нужен», и тестировать голос незачем.
Условный пример: как читать итог пилота
Цифры ниже придуманы для иллюстрации методики и не описывают ни одного реального проекта. Допустим, база поделена случайно, в каждой группе по 600 состоявшихся соединений, сценарий — подтверждение записи на приём.
В группе робота ранних сбросов больше, чем у операторов, на четыре процентных пункта. При таком объёме это на границе шума, и по одному этому числу вывода не делают. Доля разговоров, дошедших до сути, отличается на два пункта — тоже в пределах шума. Вопрос «вы робот?» прозвучал в заметной части разговоров, но после честного ответа большинство собеседников дослушали и подтвердили или перенесли запись. Итог по сценарию — доля подтверждённых записей — у групп практически одинаков.
Как это читать. Голос не мешает цели: ранние сбросы чуть выше, но итог по сценарию не страдает. Честный ответ на вопрос о роботе разговор не разрушает. Значит, дальше решает экономика: сколько стоит подтверждённая запись у робота и у операторов. Если бы при том же объёме робот отставал по итогу сценария на десять пунктов, а в записях ранних сбросов слышалась бы пауза перед первым ответом, вывод был бы другим: чинить задержку и повторять пилот, а не запускать обзвон на всю базу.
Решение по итогам: продолжать, настраивать или остановить
Правило решения записывают вместе с метриками, до первого звонка. Удобная форма — три исхода. Продолжать: итог по сценарию у робота не хуже контрольной группы в пределах заранее оговорённого допуска, а стоимость целевого действия ниже. Настраивать: итог хуже, но в записях видна конкретная причина — задержка, чтение сумм, реакция на перебивание, — и её можно исправить и перепроверить на новой части базы. Остановить: итог хуже, причины не локализуются, или после честного ответа на вопрос о роботе разговоры стабильно обрываются.
Так устроены пилоты 404ai: цель и метрика фиксируются до запуска вместе с условием, при котором проект останавливают, — подробнее на странице подхода. Для Фонекса пилот идёт на части реальной базы, первые 500 контактов бесплатны, оплата — 6 ₽ за состоявшийся контакт, а недозвоны и отказ в первые секунды разговора не оплачиваются. Последнее удобно для подсчёта, но не отменяет цену раннего сброса: номер, который бросили на первой фразе, в следующей кампании открывается хуже. Стандартный запуск занимает около трёх недель, и слепое прослушивание разумно уложить в первую из них, до интеграции.
Итог методики простой. Голос автозвонщика оценивают по тому, доводит ли он разговор до цели на вашей базе, вашей телефонии и вашем сценарии, а не по тому, насколько он похож на человека. Процент неотличимости на чужом тесте — повод задать вопросы, а решение принимается по четырём числам своего пилота и правилу, записанному до первого звонка.