Два запроса с общими словами нередко требуют двух разных страниц, а два запроса без единого общего слова — одной. Кластеризация семантики по выдаче — это группировка поисковых запросов по тому, насколько совпадают первые десять результатов поиска по ним: если поисковик показывает по двум запросам одни и те же адреса, значит, он считает, что одна страница может ответить на оба. Метод простой, но в нём есть параметр, который почти всегда берут «как у всех», — порог пересечения, а от него зависит, сколько страниц появится на сайте и будут ли они мешать друг другу. Ниже разберу, как снять сравнимую выдачу, как откалибровать порог на размеченной выборке, где метод ошибается и что делать с готовыми группами.
Группировка по словам строит сайт под словарь, а не под спрос
Самый распространённый способ разложить семантику — по общим словам. Всё, где встречается «стеллаж», идёт в раздел о стеллажах, всё с «ценой» — на страницу цен. Это делается за вечер и выглядит логично, но поисковик группирует запросы не по словам, а по тому, что человек хочет получить.
Условный пример. «Складские стеллажи купить» и «как рассчитать нагрузку на стеллаж» делят слово, но первому нужен каталог с ценами и условиями доставки, второму — объяснение с формулой или калькулятор. Страница на оба будет плохим каталогом и плохой статьёй сразу. И наоборот: «ремонт фасада» и «восстановление штукатурки на доме» не делят ни одного значимого слова, но могут требовать одной страницы услуги.
Ошибка группировки по словам бывает двух видов. Разные намерения склеиваются на одной странице — и она не попадает в выдачу ни по одному из них как следует. Одно намерение разносится по нескольким страницам — и они конкурируют между собой за один запрос. Второе — каннибализация; как найти уже сложившуюся, разобрано в статье о каннибализации запросов, а здесь речь о том, как не заложить её в структуру. На практике ядро, разложенное по словам, даёт план страниц с ошибками до первой строки текста, и при производстве с помощью ИИ эти ошибки множатся быстрее.
На чём держится кластеризация семантики по выдаче
Идея метода — не угадывать намерение пользователя, а посмотреть, как его уже определил поисковик. Как он это делает, снаружи не видно, но итог виден в выдаче. Если по двум запросам показываются во многом одни и те же страницы, поисковик, по сути, говорит: запросы про одно, и одна хорошая страница закроет оба.
Технически это выглядит так. По каждому запросу из ядра снимается первая десятка органической выдачи — список адресов. Для каждой пары запросов считается число адресов, которые есть в обоих списках. Это число от 0 до 10 и есть пересечение. Позиции в базовом варианте не учитываются: адрес на первом месте в одной выдаче и на восьмом в другой считается общим. Пары с пересечением не ниже порога связываются, из связей собираются группы, и каждая группа — кандидат в одну страницу сайта. Десятка — отраслевая договорённость, а не закон: по ТОП-10 сравнивают, например, в кластеризаторе Rush Analytics.
Выдачу снимают в одинаковых условиях, иначе сравнивать нечего
Пересечение имеет смысл, только если обе десятки сняты в одинаковых условиях. Здесь ошибаются чаще, чем в подсчёте, и ошибку не видно: числа получаются, просто про другое. Перед сбором фиксируют пять параметров и записывают их рядом с результатом.
Поисковая система. Выдача Яндекса и Google по одному запросу может заметно различаться. Кластеризуют по той системе, из которой ждут основной спрос; если важны обе, группы собирают отдельно и сравнивают, а не смешивают выдачи.
Регион. Для запросов с локальным смыслом — услуги, доставка, «рядом» — выдача в Москве и в Казани отличается. Выдачу снимают в том регионе, где работает бизнес; Вебмастер Яндекса в справке по мониторингу запросов тоже просит указать регион, в котором продвигается сайт. При продажах по всей стране берут основной регион.
Устройство и персонализация. Выдача на телефоне и компьютере бывает разной, а под личным аккаунтом подстраивается под историю. Снимают без авторизации, в одном типе устройства.
Дата. Если половину ядра снять сегодня, а половину через месяц, часть расхождений объяснит время, а не смысл. Список собирают за один проход и записывают дату.
Нормализация адресов. Одна страница приходит в разных записях: с косой чертой в конце и без, с метками, через http и https, с «www» и без. Без приведения к одному виду общая страница посчитается как две и занизит пересечение. Сравнивают адреса страниц, а не домены: пересечение по доменам склеит всё, где в выдаче есть один и тот же маркетплейс или справочник.
Вердикт: половина плохих кластеров рождается не в алгоритме, а в выдаче, снятой в разных условиях.
Порог пересечения — это ручка настройки, а не проверенная норма
В обсуждениях часто звучит конкретное число — «ставьте три». Порога, верного для любого сайта, нет, и производители кластеризаторов этого не скрывают. В руководстве Rush Analytics этот параметр называется точностью кластеризации: информационным сайтам там рекомендуют 3 или 4, интернет-магазинам — 5, конкурентным тематикам — 6 или 7, а в целом советуют пробовать варианты от 3 до 6 и смотреть, какая группировка получится достаточно полной и точной для вашей семантики. Это параметр с ценой в обе стороны.
Низкий порог — группы крупные: меньше страниц, быстрее производство, но выше риск склеить разные намерения. Высокий порог — группы мелкие: каждая точнее, но страниц больше, и часть из них конкурирует за одно и то же. Выбор порога — фактически выбор числа будущих страниц.
Разница по тематикам объяснима: где выдачу плотно занимают несколько крупных игроков, пересечение высокое просто потому, что одни и те же сайты есть везде, — порог поднимают. Где выдача разнородная, даже близкие запросы пересекаются слабо, и высокий порог разобьёт ядро на пыль. Отсюда вывод: порог не выбирают по совету, а калибруют на своих данных. Это занимает день.
Как подобрать порог на размеченной выборке
Идея калибровки: взять пары запросов, про которые человек уверенно скажет, одна это страница или две, и найти порог, который чаще с ним соглашается.
Шаг 1. Выборка пар. Из уже посчитанных пересечений берут 30–50 пар так, чтобы в выборку попали пары с разным пересечением: и слабым, и средним, и высоким. Если брать пары случайно, большинство окажется с нулевым пересечением и ничего не скажет о границе.
Шаг 2. Разметка. Для каждой пары человек, знающий бизнес, отвечает на один вопрос: «Мог бы один хороший экран ответить на оба запроса?» — и смотрит при этом на обе выдачи, а не только на слова. Лучше, если размечают двое независимо: пары, где они разошлись, и есть пограничные случаи, на которых порог работает хуже всего.
Шаг 3. Подсчёт ошибок. Для каждого возможного порога считают два вида расхождений. Ошибка склейки — пара размечена как «две страницы», а пересечение не ниже порога, и метод их объединит. Ошибка разделения — пара размечена как «одна страница», а пересечение ниже порога, и метод их разнесёт.
Условный пример: 40 размеченных пар, 20 из них — «одна страница», 20 — «две». Счёт ошибок при разных порогах:
| Порог | Ошибки склейки | Ошибки разделения | Всего при равной цене |
|---|---|---|---|
| 3 | 7 | 1 | 8 |
| 4 | 4 | 2 | 6 |
| 5 | 2 | 4 | 6 |
| 6 | 1 | 8 | 9 |
Шаг 4. Цена ошибок. При равной цене пороги 4 и 5 дают одинаковый итог — по шесть ошибок. Но ошибки не равны, и это главное место, где решение принимает человек, а не таблица. Если ошибка склейки для вас вдвое дороже, итог считается с весом: при пороге 4 — 4 × 2 + 2 = 10, при пороге 5 — 2 × 2 + 4 = 8, при пороге 6 — 1 × 2 + 8 = 10. Выигрывает 5. Если вдвое дороже ошибка разделения: при пороге 4 — 4 + 2 × 2 = 8, при пороге 5 — 2 + 4 × 2 = 10. Выигрывает 4.
Какая ошибка дороже, зависит от того, как вы выпускаете и меняете страницы. Склейку исправляют, разделяя страницу: новый адрес, новый текст, перераспределение ссылок. Разделение — объединением с перенаправлением: быстрее, но до этого две страницы успевают мешать друг другу, и обе уже оплачены. Если страницы выпускаются большим потоком, в том числе с помощью ИИ, я бы считал ошибку разделения дороже: лишние страницы множатся быстро. Если сайт небольшой и каждая страница — отдельная работа редактора, дороже обычно склейка.
Вердикт: порог из калибровки — это не «правильное число», а записанное решение о том, какую ошибку вы готовы допускать чаще. Его можно пересмотреть, и видно, почему.
Soft и hard: пересечения превращаются в группы по-разному
Попарные пересечения — ещё не группы. Способ, которым из них собираются кластеры, влияет на результат не меньше порога. В руководстве Rush Analytics два режима названы Soft и Hard.
Soft — от центра. Алгоритм определяет центральные, маркерные, запросы — при группировке по частоте список сначала сортируют по убыванию частотности — и сравнивает остальные с ними, а не между собой. Если пересечение с центром не ниже порога, запрос входит в группу, даже если с другими участниками почти не пересекается. Группы крупнее, а результат зависит от выбора центра.
Hard — общий набор для всех. Запросы объединяются, только если у всех участников группы есть общий набор адресов в выдаче. Сгруппировать удаётся меньше запросов, больше остаётся одиночками, зато группы мельче и однороднее.
Между ними есть промежуточный вариант, который удобно считать самому в таблице: запрос входит в группу, если его пересечение с каждым участником не ниже порога. Он мягче hard, потому что не требует одних и тех же адресов у всех, но жёстче soft.
Условный пример на шести запросах. A — «стеллажи для склада», B — «складские стеллажи купить», C — «паллетные стеллажи», D — «стеллажи для склада цена», E — «как рассчитать нагрузку на стеллаж», F — «нагрузка на полку стеллажа». Пересечения выдач, условные: A–B 7, A–D 6, B–D 8, A–C 4, B–C 3, C–D 3, E–F 6, все остальные пары — 0 или 1. Самый частотный запрос — A.
Soft с порогом 4 и центром A собирает группу {A, B, C, D}: пересечения с центром 7, 4 и 6 — все не ниже четырёх. E и F дают вторую группу. Soft с порогом 6 даёт {A, B, D}, запрос C остаётся один, E и F — вместе. Попарная проверка с порогом 4 тоже даёт {A, B, D}: у C с B пересечение 3, и C не проходит, хотя с центром A у него было 4. А если бы центром в soft оказался B, запрос C не вошёл бы в группу и при пороге 4.
Один и тот же набор чисел даёт разные структуры сайта в зависимости от режима и центра. Паллетным стеллажам, отдельному типу товара, скорее всего, нужна своя страница, но решает это не алгоритм, а проверка намерения.
Интент проверяют по типам страниц в выдаче, а не по числу пересечений
Пересечение отвечает на вопрос «одна ли это страница», но не отвечает, какая. Для этого выдачу по главному запросу группы смотрят глазами и записывают типы страниц в десятке: каталоги, услуги, статьи, калькуляторы, маркетплейсы и справочники, видео, форумы.
Интент — это намерение за запросом: купить, узнать, сравнить, найти компанию. Тип страниц в выдаче — самый прямой его признак. Если в десятке восемь каталогов, статья туда не пробьётся, какой бы хорошей ни была; если восемь статей, не попадёт каталог.
Смешанная выдача — половина каталогов, половина статей — значит, что поисковик видит оба намерения. Выбор: одна страница того типа, что ближе к деньгам, ценой части спроса — или две страницы разного типа с разными формулировками, если объём запроса это окупает.
Ещё одна ловушка — агрегаторы. Если по многим запросам в десятке стоят одни и те же страницы справочников или маркетплейсов, пересечение завышено, хотя запросы разные. Проверка: открыть пары с высоким пересечением; если общие адреса — страницы агрегаторов, а остальная выдача разная, пару перепроверяют вручную или пересчитывают без этих адресов.
Вердикт: пересечение говорит, что объединять, тип выдачи — что строить.
Частота решает очередь страниц, а не состав групп
Частоту для Яндекса берут из Вордстата, а по уже видимому сайту — из отчётов поисковиков. Отчёт «Поисковые запросы» в Вебмастере Яндекса показывает показы, клики, позицию, CTR и спрос, данные можно смотреть по запросам или по адресам страниц, а запросы — объединять в группы. Отчёт «Эффективность» в Search Console даёт клики, показы, CTR и среднюю позицию с разбивкой по запросам, страницам, странам, устройствам и датам.
Отрезать низкочастотное до кластеризации, чтобы сэкономить на сборе выдачи, в B2B часто ошибка: запрос с несколькими показами в месяц может ввести закупщик с бюджетом, а вместе такие запросы дают группе вес. Частота нужна позже — чтобы решить, какие страницы делать первыми. Для очереди смотрят на три признака: суммарный спрос группы, близость к деньгам и то, есть ли у компании что сказать по существу. Как расставлять приоритеты среди недостающих страниц, разобрано в статье о контентных разрывах сайта.
Запросов, которых нет ни в Вордстате, ни в отчётах, много в звонках и переписке с клиентами — и эти формулировки ближе к тому, что человек потом вводит в поиск или спрашивает у нейросети. Как собирать их системно, разобрано в статье про голос клиента; если звонки уже разбирает Эхо в Эхолитиксе, материал для расширения ядра готов. Через выдачу их прогоняют, как любые другие.
Группа превращается в страницу через сверку с тем, что уже есть
Готовые группы сверяют с сайтом: по запросам группы в Вебмастере или Search Console смотрят, какие адреса уже показываются. Исходов четыре.
Показывается одна страница. Это её группа. Страницу дорабатывают: главный запрос — в заголовок и H1, остальные формулировки — в подзаголовки и текст, вопросы — в блок ответов.
Не показывается ничего. Это разрыв: спрос есть, страницы нет. Группа уходит в очередь на создание.
Показываются две страницы или больше. Признак каннибализации: страницы объединяют, разводят по формулировкам или переписывают одну.
Много однотипных групп вроде «стеллажи для» плюс отрасль, где различаются только данные. Это кандидаты в шаблонные страницы из данных; где это польза, а где размножение пустых страниц, разобрано в статье о программатик SEO.
На группу, которая идёт в работу, сразу пишут задание: главный запрос, остальные формулировки, тип страницы по выдаче, вопросы из группы и звонков, нужные данные компании. Если пишет ИИ с редактором, именно оно превращает «напиши про стеллажи» в текст под конкретный спрос. Как устроена вся цепочка от данных до замера — в обзорной статье о генеративном SEO.
Метод ошибается там, где выдача шумит или её нет
Нестабильная выдача. По новым и редким запросам выдача может заметно меняться от недели к неделе, и пересечение одного дня отражает момент, а не устойчивое мнение поисковика. Такие группы проверяют повторным сбором через пару недель, прежде чем строить на них структуру.
Выдача отражает то, что есть, а не то, что нужно. Если в десятке только слабые страницы одного типа, метод честно сгруппирует запросы под этот тип. Он повторяет рынок и не подскажет, что людям нужен калькулятор, которого ещё никто не сделал, — это решает человек.
Нет выдачи — нет метода. Где поисковик почти ничего не показывает, пересечение считать не из чего: группируют по смыслу вручную и возвращаются к выдаче, когда она сложится.
Нейросети не показывают десятку. У ответов ChatGPT, Алисы или Perplexity нет списка из десяти результатов, и пересечение для них не посчитать. Структуру это не ломает: такие системы часто опираются на результаты поиска. Но вопросы к нейросетям длиннее и разговорнее — их добавляют на страницу отдельными вопросами с прямыми ответами. Как готовить текст к цитированию, разобрано в статье о GEO-оптимизации.
Смысловая кластеризация вместо выдачи. Способ дешевле — разложить запросы по смысловой близости с помощью языковой модели или векторных представлений текста, вообще без сбора выдачи. Для первичной сортировки большого сырого списка он полезен, но группирует по тому, что запросы значат, а не по тому, как их ранжирует поисковик: «монтаж стеллажей» и «демонтаж стеллажей» модель объединит уверенно, даже если поисковик считает это разными задачами. Для окончательной структуры я бы на него не опирался.
Возражение: кластеризация по выдаче — это копирование конкурентов
Серьёзный контраргумент: если строить структуру по тому, что уже в выдаче, сайт становится копией тех, кто там стоит, и никогда не станет лучше их.
В этом есть правда. Выдача задаёт, какие вопросы объединять и какой тип страницы ожидается, но молчит о содержании. Две страницы под одну группу могут отличаться как справочник и отписка.
Моя позиция: выдача — это карта спроса, а не образец текста. Структуру разумно брать у поисковика: спорить с ним, какие запросы про одно, дорого и бесполезно. А содержание — место, где компания отличается своими данными, ценами, сроками и вопросами своих клиентов. Повторять конкурентов в группировке так же нормально, как ставить кассу у выхода из магазина: люди ищут её там.
Когда кластеризация по выдаче не нужна
Маленький сайт с ясной структурой. Пять услуг, у каждой своя страница, ядро в несколько десятков запросов — их раскладывают вручную за час, глядя в выдачу только по спорным парам.
Спрос брендовый или сайт не будут менять. Если клиенты ищут компанию по названию, а общих запросов мало, кластеризовать нечего. А если в ближайшие месяцы никто не будет создавать и объединять страницы, самая аккуратная группировка останется таблицей.
Поиск — не тот канал. Если продажи идут через партнёров, тендеры или по базе, работа может не окупиться. Сначала проверьте, приносит ли поиск обращения; как отделить в аналитике источники, включая нейросети, разобрано в статье о трафике из нейросетей.
Цель, метрика и пилот для новой структуры
Результат кластеризации не мерят числом групп: проверяют, стали ли страницы получать спрос своих групп. Так устроен метод «Цель → метрика», по которому работает 404ai: договориться, какой показатель изменится, затем пилот на данных компании и заранее записанное условие остановки — подробнее на странице о том, как мы работаем.
Цель: чтобы у каждой группы в выбранном разделе была одна страница, которая показывается по её запросам.
Опережающие метрики: доля групп, по запросам которых показывается ровно одна страница сайта, и число групп без единой страницы — по отчётам Вебмастера или Search Console с фильтром по страницам. Итоговые: показы и клики по запросам групп, затем обращения со страниц раздела; они меняются медленнее, и в них вмешивается сезонность.
Ограничитель: трафик страниц, которые приносили посетителей до перестройки, не должен упасть. Если после объединения страница потеряла свои запросы, изменение откатывают.
Условие остановки: срок и порог задают до старта. Например: если через два-три месяца доля групп с одной показывающейся страницей не выросла, а итоговые показатели стоят, пилот останавливают и разбирают, в чём дело — в пороге, типе страниц или содержании. Срок выбирают по истории сайта: он зависит от того, как быстро поисковики его обходят.
Разумный масштаб пилота — один раздел, а не всё ядро. Если работу хочется отдать целиком, от семантики до публикации и замера, её закрывает услуга «Генеративное SEO», где пилот тоже начинают с одного раздела.
Как повторить кластеризацию на своём сайте за неделю
Дни 1–2: ядро и выдача. Запросы одного раздела из Вордстата, отчётов Вебмастера или Search Console и из звонков; мусор убрать, низкочастотное оставить. Зафиксировать систему, регион, устройство и дату, снять десятку за один проход, нормализовать адреса, посчитать пересечения — в кластеризаторе или в таблице.
Дни 3–4: порог и группы. Разметить 30–50 пар, посчитать ошибки склейки и разделения, записать порог вместе с причиной. Собрать группы в выбранном режиме и открыть глазами пограничные: пересечение ровно на пороге, общие адреса-агрегаторы, смешанная выдача.
День 5: сверка с сайтом. Разложить группы на четыре исхода — доработать, создать, объединить, делать шаблоном — и выбрать раздел для пилота.
Если при любом разумном пороге структура почти не меняется, это тоже результат: разделы разложены правильно, и силы стоит тратить на содержание. Если же страницы разрезают группы пополам или склеивают разные намерения, у вас в руках список страниц, которые мешают сайту получать спрос, — и записанный порог, по которому любой в команде проверит, почему группировка именно такая.