Почти любое внедрение сопровождается цифрой роста, и почти любая такая цифра недоказуема. Сравнение «до и после» смешивает эффект внедрения с сезонностью, изменениями в рекламе и обычным разбросом. Разберём, как поставить замер так, чтобы результату можно было верить — и как читать чужие цифры, включая наши.
Почему «до и после» ничего не доказывает
Сравнение периода до внедрения с периодом после — самый распространённый способ отчитаться об эффекте и самый ненадёжный. Между двумя периодами меняется не только внедрённый инструмент: меняется сезон, рекламный бюджет, состав менеджеров, поведение конкурентов.
Отдельная и недооценённая проблема — эффект наблюдения. Отдел, который знает, что его разговоры теперь разбирают, работает лучше в первые недели независимо от того, что именно внедрили. Этот всплеск легко принять за результат и потом долго не понимать, почему он угас.
Разница между двумя периодами — это не эффект внедрения. Это эффект внедрения плюс всё остальное, что изменилось за это время, и разделить их постфактум невозможно.
Контрольная группа: как это выглядит на практике
Надёжный способ один: часть отдела работает по-новому, часть продолжает по-старому, оба периода идут одновременно. Тогда сезонность, реклама и настроение рынка действуют на обе группы одинаково, а разница между ними относится к внедрению.
Делить надо случайно, но с оговоркой. Если в отделе есть явно сильные и явно слабые менеджеры, чистая случайность может собрать всех сильных в одной группе. Практичнее разбить людей на пары по прошлым результатам и в каждой паре бросить монетку.
Что важно не делать: не давать людям выбирать группу самим. Те, кто соглашается на новое добровольно, отличаются от остальных мотивацией, и эта разница попадёт в результат вместо эффекта инструмента.
Что зафиксировать до запуска
Список короткий, но записать его надо письменно и до того, как появятся первые данные. Иначе на выходе всегда найдётся метрика, которая выросла, и именно её объявят целевой.
- Одна главная метрика. Не набор из восьми, а одна, по которой принимается решение. Остальные — наблюдаемые.
- Как она считается. Дословно: что входит в числитель и знаменатель, какие сделки исключаются.
- Срок замера. Заранее заданный, чтобы нельзя было остановиться на удачной неделе.
- Разброс до внедрения. Насколько метрика прыгала от месяца к месяцу раньше — без этого не понять, что считать значимым изменением.
- Что ещё меняется. Запланированные акции, найм, изменения в рекламе — всё, что попадёт в период замера.
Последний пункт часто и обесценивает замер: одновременно с AI запускают новый скрипт и меняют мотивацию, а потом обсуждают, что из этого сработало.
Сколько ждать
Длина замера определяется не терпением, а длиной вашего цикла сделки. Мерить конверсию в оплату за две недели при цикле в полтора месяца бессмысленно: большинство сделок ещё не закрылись, и в выборку попадут только самые быстрые — то есть нетипичные.
Разумный ориентир — не меньше двух полных циклов сделки, и отдельно смотреть на первые две недели как на период эффекта наблюдения, а не как на результат.
| Что мерим | Когда виден честный результат |
|---|---|
| Время первого ответа | Почти сразу: метрика не зависит от цикла сделки |
| Доля дозвонов и охват базы | Первые недели |
| Конверсия в следующий этап | Один цикл сделки |
| Конверсия в оплату и выручка | Не меньше двух циклов сделки |
Как читать чужие цифры
Практический навык, полезный при выборе любого поставщика, включая нас. К заявленному проценту роста стоит задать четыре вопроса: с чем сравнивали, на какой выборке, за какой период и что ещё менялось в это время. Если на первый вопрос ответ «с прошлым периодом», цифра описывает не инструмент.
Отдельно стоит спросить, сколько внедрений вошло в статистику и сколько было всего. Средний результат по успешным внедрениям — это не средний результат.
«У этого клиента метрика выросла на столько-то за такой-то период, контрольной группы не было, одновременно менялось вот это». Такой ответ проверяем. «В среднем наши клиенты получают +35%» — не проверяем ничем.
Когда контрольная группа невозможна
В маленьком отделе делить некого: две группы по два человека не дадут сравнимых чисел. Тогда честный порядок такой — внедрять по одному изменению за раз, фиксировать дату каждого и смотреть на метрику по неделям, а не на две точки.
Это слабее контрольной группы и таковым и должно называться. Наблюдение с одной группой показывает, что изменение совпало по времени с внедрением, но не доказывает причину.
Коротко
- Разница «до и после» — это эффект внедрения плюс сезонность, реклама и разброс, и разделить их постфактум нельзя.
- Первые недели роста — часто эффект наблюдения, а не инструмента.
- Контрольная группа набирается разбиением на пары по прошлым результатам, а не добровольцами.
- Главная метрика, способ её расчёта и срок замера фиксируются письменно до запуска.
- Длина замера — не меньше двух циклов сделки для метрик, связанных с деньгами.
- К чужой цифре роста — четыре вопроса: с чем сравнивали, на какой выборке, за какой период, что ещё менялось.
Сколько разговоров нужно, чтобы вывод не был случайным, разобрано в статье про объём выборки. Как мы ставим замер на внедрениях — в описании подхода и в разборах.