A/B-тест карточки товара — это сравнение двух вариантов карточки на живом трафике маркетплейса: часть покупателей видит вариант А, часть — вариант Б, а площадка потом сравнивает показатели воронки. В инструкции Wildberries «А/Б-тестирование главного фото в карточке товара» (обновлена 27.08.2026, проверял 20 сентября 2026) это описано прямо: аудитория делится на две приблизительно равные группы — 50 на 50, варианты показываются параллельно, примерно половине пользователей только А, другой половине только Б. Звучит как лабораторный эксперимент. На практике это полевой замер в среде, которая сама реагирует на ваши действия, и половина ошибок продавца происходит от того, что он об этом забывает. Ниже — что именно считать, сколько показов набрать, как готовить варианты, где в этой работе помогает ИИ и в каких случаях тест не даст ответа ни при каком бюджете.
Что именно меряем: показы, клики, корзина, заказ
Отчёт по тесту на Wildberries сравнивает четыре величины: сколько раз карточка отобразилась в результатах поиска, сколько было переходов в карточку, сколько раз товар добавили в корзину и сколько оформили заказов. Это не четыре разные метрики на выбор, это одна воронка, и смотреть на неё надо целиком.
CTR карточки — это доля показов в выдаче и каталоге, после которых покупатель открыл карточку. Считается как переходы, делённые на показы. Именно на этот шаг главное фото влияет сильнее всего: в выдаче покупатель видит обложку, название и цену, и решение открывать или пролистнуть принимается за доли секунды. Дальше начинает работать содержимое карточки, и вес фото падает.
Отсюда первое правило: CTR — быстрый сигнал, заказ — ограничитель. Кликабельная обложка с обещанием, которого товар не выполняет, поднимет переходы и уронит конверсию в заказ, а заодно принесёт возвраты и недовольные отзывы. Поэтому гипотеза формулируется парой: «переход в карточку растёт, и конверсия из перехода в заказ не падает». Вариант, который выиграл по CTR и проиграл по заказам, — не победитель, а ловушка.
Wildberries прямо описывает такой исход: если одни показатели лучше у варианта А, а другие у варианта Б, тест получает отметку «Победитель не выявлен», и решение остаётся за продавцом. Площадка честно говорит, что не знает, что для вас важнее. Значит, знать должны вы — до запуска.
Второе правило — считать доли, а не абсолютные числа. Показов у двух вариантов почти никогда не будет ровно поровну, даже при делении 50 на 50: группы отличаются по составу, часть пользователей не доходит до выдачи. Сравнение «у Б 412 заказов, у А 389» без знаменателя не значит ничего. Сравнивать нужно переходы на показ, корзины на переход и заказы на показ.
Третье — держать в голове, что показ не равен просмотру. Карточка «отобразилась в результатах поиска» и тогда, когда покупатель пролистнул экран, не задержав на ней взгляд. Это добавляет шума в знаменатель и делает разницу в CTR менее выразительной, чем ожидаешь. Для решения это не помеха: шум одинаков для обоих вариантов.
И последнее. Метрику решения выбирают до старта, одну, и записывают. Если выбирать после — вы просто найдёте показатель, по которому победил вариант, который вам больше нравится. Общий разговор про то, как метрика превращается в деньги, а не в красивый процент, разобран в статье о метриках, которые действительно двигают выручку.
Почему на маркетплейсе не бывает чистого A/B
В учебниковом A/B-тесте распределение случайное, один параметр меняется, всё остальное заморожено. На маркетплейсе не выполняется ни одно из трёх условий, и это не придирка, а причина большинства неверных выводов.
Площадка реагирует на вариант. Wildberries пишет в той же инструкции: «Главное фото влияет на рейтинг карточки, а значит и на позиции товара в поиске и каталоге. Даже если фото победило, оно может снизить рейтинг» — например, из-за низкого разрешения или слишком яркого фона. То есть вариант Б меняет не только вероятность клика, но и то, сколько показов карточка вообще получит. В лаборатории объём выборки задаёт экспериментатор, здесь его частично задаёт сама система ранжирования.
Выборка ограничена и не совпадает с общей статистикой. Площадка предупреждает: в тесте участвует ограниченная группа посетителей карточки, и результаты теста могут отличаться от данных в других разделах кабинета. Это нормально и это надо объяснить заказчику заранее, иначе на защите отчёта половина времени уйдёт на вопрос «а почему в аналитике другие цифры».
Эксперимент может прерваться извне. Wildberries перечисляет причины, по которым отменяет уже созданный тест: на первом месте в карточке стоит видео вместо фото, изменилось главное фото, в карточке не осталось ни одного фото, карточку заблокировали, на складе не осталось товаров, произошла техническая ошибка. Перезапустить тест можно только после технической ошибки; в остальных случаях нет. Это значит, что тест надо вести как производственный процесс с дежурным, а не как фоновую задачу.
К этому добавляется персонализация выдачи, разные устройства, регионы и время суток. Параллельный сплит эти различия размазывает между группами поровну — в этом его главная ценность. Но он не отменяет того, что мы измеряем эффект в движущейся системе.
Практический вывод один, зато полезный: доверять стоит крупной и устойчивой разнице. Разница в третьем знаке после запятой на маркетплейсе не значит ничего — её съедят ранжирование, сезон и случайность. Если гипотеза даёт прирост, который виден только под микроскопом, она не стоит цикла работы.
Поэтому обещание «поднимем CTR на столько-то процентов» — плохой признак у подрядчика. Обещать можно процедуру: гипотезу, объём показов, срок, правило остановки. Результат обещает трафик.
Сколько показов нужно, чтобы поверить разнице
Это место, где ломается большинство тестов. Продавец смотрит на цифры через три дня, видит у варианта Б CTR 10% против 8% у А, считает это победой и меняет фото. На трёхстах показах такая «победа» получается сама собой.
Посчитаем. При 300 показах и CTR 8% ожидаемое число переходов — 24. Случайный разброс для такого счёта (корень из 300 × 0,08 × 0,92) — около 4,7 перехода, то есть примерно 1,6 процентного пункта CTR. Когда вы сравниваете два варианта, разбросы складываются: типичное случайное расхождение между ними — около 2,2 пункта. Разница в 2 пункта на таком объёме находится внутри обычного шума. Это не слабый результат — это отсутствие результата.
Чтобы не гадать, объём считают заранее. Грубая оценка числа показов на один вариант:
N ≈ 16 × p × (1 − p) / d², где p — текущая конверсия в интересующее событие, d — абсолютная разница, которую вы хотите уверенно различить. В статистике эту прикидку называют правилом шестнадцати (формула Лера); она приближает привычные условия — 80% мощности при 5% уровне значимости. Точность её хватает ровно на то, чтобы понять порядок: десятки тысяч показов или сотни.
Пример расчёта. Пусть переход в карточку сейчас 8%, и вы хотите уверенно поймать прирост в один процентный пункт, до 9%. Подставляем: 16 × 0,08 × 0,92 = 1,1776; делим на 0,01² = 0,0001; получаем примерно 11 800 показов на вариант, то есть около 23 600 показов на весь тест. Если ловить полпункта вместо пункта, знаменатель уменьшается вчетверо, и нужно уже около 47 100 показов на вариант. Чем тоньше эффект, тем квадратично дороже его увидеть.
Пример расчёта для заказа. Конверсия из показа в заказ обычно измеряется долями процента. При p = 0,5% и желании различить прирост 0,1 пункта получаем 16 × 0,005 × 0,995 / 0,000001 ≈ 79 600 показов на вариант. Вот почему по заказам недельный тест почти никогда не закрывается: объёма не хватает. CTR берут как быстрый сигнал именно поэтому, а заказ используют как ограничитель — проверяют, что он хотя бы не просел.
Объём показов переводится в деньги и в срок. Wildberries даёт для этого встроенную арифметику: в инструкции показан пример настройки продвижения теста — бюджет 20 000 ₽, подобранная ставка 200 ₽, где ставка это стоимость 1 000 показов, и прогноз выходит (20 000 ÷ 200) × 1 000 = 100 000 показов. По такой ставке 23 600 показов из нашего расчёта стоили бы около 4 700 ₽ рекламного бюджета. Ставку в вашей категории подберёт площадка, но порядок цифры надо знать до запуска, а не после.
Про подглядывание. Промежуточные результаты на Wildberries появляются уже на второй день после запуска. Соблазн очевиден: зайти, увидеть перевес и остановить тест. Каждая такая проверка с правом остановиться повышает шанс объявить победителем случайный разброс — чем чаще смотришь, тем выше вероятность поймать момент, когда один вариант случайно вырвался вперёд. Лечится одной строчкой в регламенте: срок и объём фиксируются до старта, промежуточные цифры смотрим только чтобы поймать аварию — отменённый тест, кончившиеся остатки, ошибку в фото Б. Эту же механику я разбирал на другом материале в статье про честное сравнение AI-агента и человека, а общую логику «сколько наблюдений нужно под конкретный вопрос» — в статье о достаточном объёме выборки.
И отдельно про формулировку площадки. Отметка «Не стат. значимый результат» на Wildberries означает, по их же тексту, одно из двух: в тестировании приняло участие недостаточное количество пользователей либо разницы между двумя фото нет. Это два разных вывода. В первом случае нужен больший объём — более длинный срок или продвижение. Во втором добирать показы бесполезно, надо разводить варианты сильнее.
Как готовить варианты: правила для главного фото
Хороший тест начинается не в кабинете площадки, а в папке с изображениями. Два требования к паре вариантов: они должны отличаться по одному понятному признаку и отличаться заметно.
Один параметр за раз. Если в варианте Б поменяли ракурс, фон и добавили подпись, то при выигрыше вы узнаете только то, что «Б лучше», и не сможете перенести вывод на другие карточки. Тест с тремя изменениями стоит столько же показов, сколько тест с одним, а знания даёт втрое меньше.
Технические рамки задаёт площадка, и их стоит прочитать до генерации. Wildberries принимает на тест фото в форматах PNG, WEBP и JPG, минимальное разрешение 700 × 900 пикселей, качество сжатия не ниже 65%, размер до 10 Мб; фото вне этих рамок просто не загрузится. Дальше идут рекомендации: без маркетингового текста, необрезанное, без коллажей, с изображением только одного товара, без посторонних предметов, без манекенов вместо моделей, с опрятным товаром. И важная оговорка в той же инструкции: карточка, фото которой не соответствует этим характеристикам, реже попадает в результаты поиска, а значит, её увидит меньше людей — это влияет на результаты тестирования. То есть нарушение рекомендаций бьёт не только по продажам, но и по самой возможности набрать выборку.
У Яндекс Маркета своя рамка, и её тоже стоит держать в голове при подготовке вариантов. Справка продавца (проверял 20 сентября 2026) разрешает .jpg, .jpeg, .png, .heic и .webp весом не больше 10 МБ и размером не меньше 300 × 300 пикселей, в выдаче и на витрине покупатели видят адаптированные изображения в формате 3 × 4, товар должен занимать не менее двух третей картинки, фон лучше белый или прозрачный, а логотипы маркетплейсов, реклама, водяные знаки, ценники, скидки и контактные данные на изображении запрещены.
Отсюда прямое следствие для дизайна варианта: кроп важнее красоты. Если витрина обрезает изображение до пропорции 3 × 4, а товар занимает половину кадра, покупатель в выдаче увидит воздух. Самая дешёвая и самая часто выигрывающая гипотеза — не новая съёмка, а другой масштаб и другой кроп существующего снимка.
Варианты должны отличаться заметно. Wildberries на вопрос «что делать, если победитель не выявлен» отвечает: возможно, эти фото слишком похожи или имеют равную привлекательность для покупателей. Смена оттенка фона на пять процентов не будет поймана никаким объёмом показов. Разводите гипотезы крупно: другой ракурс, товар в применении против товара на белом, комплект в кадре против одной единицы, вертикальный кроп против квадратного.
Вариант Б готовится до старта и не правится по ходу. Это не педантизм: Wildberries отменяет тест, если главное фото в карточке изменилось. Любая правка «на живую» стоит вам всего набранного объёма.
Сюда же — дисциплина хранения. Каждый вариант получает имя с артикулом и номером гипотезы, исходник кладётся рядом с записью в журнале теста. Через квартал вы не вспомните, какой именно из четырёх похожих файлов выиграл в марте.
Где ИИ помогает: генерация вариантов и отбор критиками
Скажу сразу, где ИИ в этой задаче не помогает: он не предсказывает CTR. Ни одна модель не скажет вам, какая обложка выиграет в вашей категории — это решает тест. Поэтому ставить генерацию на место эксперимента бессмысленно, а вот сократить путь до эксперимента она может сильно.
Узкое место A/B-теста на маркетплейсе — не производство картинок, а показы. Показы стоят времени и рекламного бюджета, и тестов в месяц у вас конечное число: подписка «Джем» на Wildberries даёт 5 бесплатных тестов на тарифе «Стандартный» и 10 на «Продвинутом», неизрасходованные не переходят на новый месяц, а сгорают. Значит, ценность ИИ здесь простая: он должен отсеять слабые варианты до того, как они займут слот теста.
Схема, которую я собираю под эту задачу, состоит из трёх шагов.
- Генерация по техзаданию, а не по настроению. В запрос кладутся рамки площадки: пропорция кадра, доля товара в кадре, запрет на текст и водяные знаки, требования к фону и разрешению. На выходе — серия вариантов одного ракурса и несколько заметно разных.
- Отбор критиками. Это набор отдельных ролей, каждая со своим заданием: покупатель категории оценивает, понятно ли за полсекунды, что это за товар; модератор проверяет соответствие требованиям площадки по пунктам; дизайнер смотрит на читаемость в ленте на маленьком экране и на то, не попадает ли важная деталь под бейджи интерфейса. Каждый критик возвращает оценку и причину, а не просто «нравится».
- Сведение к паре. Из серии остаются два варианта: текущее фото и тот кандидат, который максимально не похож на него по выбранному параметру и прошёл всех критиков. Всё остальное отправляется в архив вместе с причинами отказа — это материал для следующих гипотез.
Что этот конвейер реально экономит: цикл модерации. Модерация теста на Wildberries обычно занимает до 3 часов, и отклонённый вариант — это потерянный день и слот. Критик, который ловит текст поверх изображения или обрезанный товар до загрузки, окупается на второй неделе.
Честное ограничение, о котором стоит говорить вслух: товар нельзя «нарисовать». Генерация уместна для фона, кропа, компоновки и обложек, но покупатель должен получить ровно то, что видел. Сгенерированный товар, которого не существует, — это возвраты, плохие отзывы и разговор с площадкой. Где проходит граница между генерацией и съёмкой и почему лицо эксперта фотографируют, а не генерируют, разобрано в статье об ИИ-креативах, которые не выглядят одинаково.
Из наших инструментов эту часть закрывает Везория: она генерирует изображения для карточек, ведёт A/B-тесты и сравнивает варианты набором критиков, а обложки и креативы для внешних каналов делает Кира. Оба инструмента полезны ровно настолько, насколько у вас налажен сам процесс проверки гипотез, — без регламента это просто более быстрый способ наплодить картинок.
Ловушки: сезон, реклама, цена, свои же карточки
Ошибки в этой теме повторяются от продавца к продавцу. Перечислю те, которые чаще всего превращают результат теста в самообман.
Сезон. Сравнение «было до смены фото — стало после» измеряет не фото, а календарь. Любая распродажа, праздник, погода или запуск конкурента попадают целиком в один из периодов. Параллельный сплит от этого защищён: обе группы живут в одном времени. Если у площадки встроенного сплита нет, тест по периодам остаётся, но его выводы слабее, и об этом надо говорить прямо.
Тест по периодам против сравнения похожих SKU. Когда сплит недоступен, есть два обходных пути, и у каждого своя болезнь. Периодный тест лечится чередованием: не «две недели А, потом две недели Б», а А — Б — А — Б по неделям. Чередование гасит плавный тренд, хотя и не спасает от резкого события. Сравнение похожих SKU — это когда берут пары товаров, близких по цене, категории и объёму продаж, одному меняют фото, второму нет, и смотрят разницу по паре. Его болезнь в том, что разброс между разными товарами почти всегда больше, чем эффект обложки: две «одинаковые» карточки живут в разных местах выдачи. Пар нужно много, и вывод всё равно будет мягче, чем при честном сплите.
Реклама. Включённое или изменённое продвижение посреди теста меняет не только объём трафика, но и его состав — приходит другая аудитория. Wildberries разрешает подключать продвижение к тесту и даже подбирает ставку, но настраивать его нужно до старта и не трогать потом. Там же есть бесплатная настройка «Остановить продвижение при остановке теста»; без неё карточка продолжит продвигаться после окончания теста, и вы будете сравнивать свой следующий период с искажённой базой.
Цена и акции. Скидка внутри теста меняет конверсию в заказ на обоих вариантах, но по-разному: чувствительность к цене у аудитории, пришедшей по разным обложкам, не обязана совпадать. Простое правило: цена на время теста фиксируется. Если зафиксировать нельзя — участие в акциях площадки обязательно, — записывайте даты изменений в журнал и не делайте выводов по заказам за эти дни.
Остатки. Товар кончился — тест отменён; Wildberries указывает это прямой причиной отмены. Перед запуском стоит проверить, хватит ли остатков на весь выбранный срок с запасом, иначе вы потратите слот подписки на ничего.
Свои же карточки. Самая незаметная ловушка. Если у вас в одной выдаче несколько похожих карточек одного товара, выигравшая обложка перетягивает показы и клики у соседней вашей же карточки. В отчёте по тестируемому SKU вы увидите прирост, а в выручке по группе — ноль: покупатель просто перешёл из одной вашей карточки в другую. Лечится проверкой на уровне группы товаров: смотрим суммарные показы, заказы и выручку по всем связанным SKU за период теста, а не только по подопытному.
Последнее — количество одновременных тестов. Wildberries разрешает запускать сколько угодно тестов, но периоды тестов одной карточки не должны пересекаться. Это не только правило площадки, это здравый смысл: два эксперимента на одном объекте превращают оба в мусор.
Регламент теста: одна гипотеза, один параметр, срок
Регламент — это одна страница, которая пишется до запуска и которую можно показать заказчику. Без неё любой спор о результате превращается в спор о вкусах.
Что в ней должно быть:
- Гипотеза одной фразой. Не «попробуем другое фото», а «ракурс с открытой крышкой покажет объём контейнера и поднимет переход в карточку».
- Что меняем — ровно один параметр. Ракурс, или кроп, или наличие комплекта в кадре. Остальное в обоих вариантах одинаково.
- Метрика решения и ограничитель. Например: «переход в карточку растёт минимум на пункт, конверсия из перехода в заказ не падает».
- Объём показов из расчёта по формуле выше — и признание, за сколько недель он набирается при текущем трафике.
- Срок и дата старта. На Wildberries длительность выбирается от 1 недели до 2 месяцев, а текущий день стартом выбрать нельзя — тест планируется минимум на завтра.
- Правило остановки. Досрочная остановка допускается только по аварии, не по красивым промежуточным цифрам.
- Что делаем с победителем. Применяем вариант Б в карточке; если тест шёл с продвижением, отдельно решаем, какой вариант участвует в кампании дальше.
Отдельный артефакт — журнал теста. Одна строка на тест, ведётся в общей таблице, а не в переписке. Вот минимальный набор колонок, который потом действительно читают:
| Поле | Что записываем | Зачем это потом |
|---|---|---|
| Дата и срок | дата старта, выбранная длительность, дата фактического завершения | сверить сезон и события периода |
| Карточка | артикул, категория, цена на момент старта | отделить эффект фото от цены |
| Гипотеза | одна фраза: что проверяем и почему | понять через квартал, о чём был тест |
| Что меняли | один параметр и ссылки на оба файла | перенести вывод на другие карточки |
| Показы А / Б | итоговые числа по каждому варианту | проверить, добрали ли расчётный объём |
| Переходы, корзина, заказы | абсолютные значения и доли по каждому шагу | увидеть, где именно разошлись варианты |
| Продвижение | было ли, бюджет, ставка, менялось ли по ходу | объяснить всплески трафика |
| Статус и вывод | отметка площадки и ваше решение одной фразой | отличить «нет разницы» от «мало данных» |
Журнал окупается не на первом тесте, а на десятом. Серия записей превращается в знание о категории: «вертикальный кроп выигрывает у квадратного третий раз из четырёх» — это уже правило для новых карточек, которое экономит будущие слоты тестов. Без журнала каждая новая гипотеза начинается с нуля, а команда спорит о том, что уже проверяли полгода назад.
Пара технических мелочей, которые ломают отчётность, если о них не знать. Результаты, которые видны в день окончания теста, ещё не окончательные: Wildberries обновляет данные в течение 2 календарных дней. Значит, строку в журнале закрывают на третий день, а не в день финиша. И при переносе карточки товара в другой кабинет вся её история A/B-тестов исчезает — ваш журнал остаётся единственной копией.
Сам порядок «цель → метрика → пилот → условие остановки» мы применяем не только к обложкам; как он устроен у нас в проектах, описано на странице «Как мы работаем». Та же дисциплина лежит в основе любого контентного конвейера — об этом в статье о контент-заводе.
Когда тест не нужен
Агентство, которое предлагает тестировать всё и всегда, продаёт часы, а не результат. Случаев, когда A/B-тест карточки не даст ответа, довольно много.
- Показов слишком мало. Если карточка получает десятки показов в день, расчётный объём не наберётся и за квартал. Результат такого теста — подбрасывание монеты с отчётом. Сначала спрос, потом обложка.
- Текущее фото нарушает требования площадки. Это не гипотеза, а дефект: обрезанный товар, коллаж, водяной знак, разрешение ниже минимального. Такое чинят без теста и сразу.
- Варианты отличаются косметически. Оттенок фона, сдвиг тени, другой шрифт подписи. Эффект, который вы не можете описать словами, вы не сможете и измерить.
- Решение уже принято. Если фото всё равно заменят — по требованию бренда, из-за смены упаковки, ради единообразия линейки, — тест становится ритуалом. Меняйте и переходите к следующей задаче.
- Цена вопроса меньше стоимости показов. Для SKU с маленькой маржой и небольшим оборотом рекламный бюджет на набор выборки может превысить всю месячную прибыль по этому товару. Тест должен окупаться, как любая работа.
- Узкое место не в фото. Высокий переход в карточку при низкой конверсии в заказ — сигнал, что проблема в цене, отзывах, сроках доставки, характеристиках или описании. Смена обложки это не лечит; как разбирать отзывы и что с ними делать, разобрано в статье об ответах на отзывы на маркетплейсах.
Когда на разборе видно, что объёма показов не хватит, мы так и говорим: тест не даст ответа, деньги лучше потратить на другое. Это честнее, чем продать процедуру, результат которой известен заранее — «не стат. значимый».
Что сделать завтра, чтобы понять, ваш ли это инструмент. Возьмите показы по ключевому SKU за последние тридцать дней, посчитайте по формуле нужный объём под ту разницу, которую вам интересно ловить, и поделите одно на другое. Получится срок теста в неделях. Если вышло больше квартала — вопрос не в обложке, а в трафике, и решать надо его. Если вышло две-три недели — у вас есть рабочий инструмент, и дальше всё упирается в дисциплину: одна гипотеза, один параметр, зафиксированный срок и строка в журнале.
Общая карта темы — что ИИ реально закрывает в работе на маркетплейсах, а что остаётся человеку, — собрана в обзорной статье об ИИ для маркетплейсов.