Главное за 30 секунд
- Дубль — это когда одно и то же содержимое доступно по разным адресам. Не обязательно копия слово в слово: две страницы, отвечающие на один и тот же запрос, поисковик тоже считает дублирующими друг друга.
- Главная беда не в «санкциях», а в размывании. Поисковик выбирает из нескольких адресов один, и не всегда тот, который вы продвигаете. Позиции скачут, ссылочный вес и поведенческие делятся между копиями.
- Большинство дублей создаёт сама CMS. Слеши, параметры сортировки, метки, товар в нескольких категориях, версия для печати — это настройки движка, а не чья-то ошибка в контенте.
- Инструментов для поиска хватает бесплатных. Яндекс Вебмастер, Google Search
Console, любой настольный краулер и оператор
site:в выдаче закрывают почти все случаи. - Удалённый товар должен отдавать 404. Не 301 на категорию и не 301 на похожий товар: это самая частая ошибка при чистке каталога, и она порождает новые проблемы вместо решения старых.
Что считается дублем
Дубли делят на два вида, и работают с ними по-разному.
Полные дубли — одно и то же содержимое по разным адресам. Классика: страница
открывается и со слешем, и без, и с www, и без, и по http,
и по https. Технически это четыре и более разных URL с одинаковым содержимым.
Для поисковика — четыре разные страницы, между которыми надо выбирать.
Частичные дубли — страницы разные, но отвечают на один и тот же запрос. Две статьи про одно и то же, написанные с разницей в год. Категория и страница фильтра с почти одинаковым набором товаров. Услуга, описанная и на общей странице, и на отдельной. Здесь нет технической копии, но конкуренция за запрос реальная, и называется это каннибализацией.
Откуда они берутся
| Откуда | Как выглядит | Решение |
|---|---|---|
| Слеш в конце | /uslugi и /uslugi/ | 301 на выбранный вариант, один и тот же по всему сайту |
| www и без www | site.ru и www.site.ru | 301 на основное зеркало, главное зеркало указано в Вебмастере |
| http и https | http://site.ru и https://site.ru | 301 на https по всему сайту |
| Главная в двух видах | / и /index.php | 301 с index.php на корень |
| UTM и прочие метки | /tovar/?utm_source=direct | rel="canonical" на адрес без параметров |
| Параметры сортировки | /katalog/?sort=price | canonical на базовую категорию |
| Пагинация | /katalog/page/2/ | Оставить в индексе, уникальные title, canonical на саму страницу |
| Страницы фильтра | /katalog/?color=red&size=50 | Спрос есть — отдельная страница с ЧПУ и своим текстом; спроса нет — закрыть |
| Товар в двух категориях | /mebel/divany/tovar/ и /akcii/tovar/ | Один канонический адрес товара, остальные — canonical на него |
| Версия для печати | /stati/materialy/?print=1 | canonical на основную версию или закрыть от индексации |
Отдельно стоит сказать про страницы фильтра. Их часто закрывают целиком, и это ошибка: часть фильтров соответствует реальному спросу. «Диваны угловые» ищут, и если у вас есть такой фильтр, из него стоит сделать полноценную посадочную страницу с человекопонятным адресом, своим заголовком и описанием. А вот сочетание из четырёх параметров, которое никто не ищет, в индексе не нужно.
Чем они мешают
Прямых санкций за дубли нет — это не нарушение. Мешают они иначе.
Поисковик выбирает не тот адрес. Из нескольких копий в выдачу попадает одна, и выбирает её алгоритм, а не вы. Сегодня в выдаче страница со слешем, завтра — без, позиции при этом скачут, и понять причину по отчётам тяжело.
Сигналы делятся. Внешние ссылки ведут на один вариант, внутренние — на другой, люди заходят на третий. Вместо одной сильной страницы получается три слабых.
Тратится бюджет обхода. Робот ходит по сайту ограниченное время. Если половина этого времени уходит на пересортировки каталога, новые товары попадают в индекс медленнее.
Статистика врёт. Позиции и трафик размазываются по нескольким адресам, и любой отчёт приходится собирать вручную, сводя данные по копиям.
Как найти
Четыре способа, от быстрого к подробному.
Яндекс Вебмастер. Раздел «Индексирование» → «Страницы в поиске», фильтр по
статусу «Дубль». Там же в «Заголовки и описания» видно страницы с одинаковыми
title — это почти всегда указывает на дубли.
Google Search Console. Отчёт «Индексирование страниц», строки «Страница является копией» и «Обнаружена, не проиндексирована». Отдельно полезна проверка конкретного URL: там видно, какой адрес Google считает каноническим, и совпадает ли он с вашим.
Краулер. Любой настольный сканер обойдёт сайт и покажет повторяющиеся
title, h1 и совпадающее содержимое. Это единственный способ
увидеть дубли, которые ещё не попали в индекс.
Руками в выдаче. Оператор site: с куском текста со страницы
показывает, сколько копий поисковик знает. Грубо, но за минуту даёт понять, есть
ли проблема вообще.
Чем закрывать: четыре инструмента
301-редирект. Когда старый адрес не нужен и не должен открываться.
Слеши, зеркала, index.php, смена структуры адресов. Самый надёжный
способ: адрес физически перестаёт существовать.
rel="canonical". Когда обе страницы должны открываться, но в индексе нужна
одна. Сортировки, метки, товар в нескольких категориях. Важно помнить, что
canonical — это рекомендация, а не команда: поисковик может её
проигнорировать, если содержимое страниц заметно различается.
robots.txt. Запрещает обход, но не гарантирует отсутствие в индексе: страница, на которую ведут ссылки, может попасть в выдачу и будучи закрытой. Годится для технических разделов, служебных скриптов и заведомо мусорных параметров.
Мета-тег noindex. Убирает страницу из индекса надёжнее, чем robots.txt,
но робот должен страницу увидеть — значит, в robots.txt она должна быть открыта.
Закрывать одну и ту же страницу и там, и там бессмысленно: робот не дойдёт
до noindex.
Три ошибки, которые встречаются чаще всего
301 вместо 404 для удалённых товаров. Товар кончился, его переадресуют на категорию или на похожую позицию. Кажется логичным, на деле вредит: поисковик получает сотни редиректов на одну страницу, человек попадает не туда, куда шёл, и уходит. Удалённая позиция должна отдавать 404 — это нормальный, ожидаемый ответ. Если товар вернётся, адрес просто снова заработает.
Canonical на другую страницу при разном содержимом. Если указать каноническим адрес страницы, где другой набор товаров или другой текст, поисковик рекомендацию проигнорирует. Получится ощущение, что дубли закрыты, а по факту они остались.
Закрыть фильтры целиком. Быстро решает проблему дублей и заодно убивает десятки страниц с реальным спросом. Правильнее разобрать фильтры по частотности и оставить те, которые люди действительно ищут.
Порядок работ
Если дублей много, разбирать их лучше по очереди, а не всё сразу.
Сначала полные технические дубли — зеркала, слеши, index.php. Это
настройки сервера, они закрываются одним разом и дают сразу заметный эффект.
Потом параметры: метки, сортировки, версии для печати — через
canonical. Дальше каталог: товары в нескольких категориях, фильтры,
пагинация. В последнюю очередь — частичные дубли в контенте: там, где две страницы
конкурируют за один запрос, нужно решать, какую оставить, а какую объединить
или переориентировать.
После каждого этапа стоит подождать переобхода и посмотреть Вебмастер: число страниц в поиске должно приближаться к числу реально нужных, а скачки позиций — прекращаться.
Источники
Опираемся на документацию поисковых систем: решения по дублям не стоит принимать по советам с форумов, формулировки в справке регулярно меняются.
- Дубли страниц — справка Яндекс Вебмастера: как поисковик определяет дубли и что с ними делает.
- Google: объединение повторяющихся URL — о канонических адресах и способах их указания.
- robots.txt в справке Яндекса — что директивы действительно запрещают, а что нет.
Поможем с этим
Услуги агентства, которые закрывают задачи из этой статьи.
Скачки позиций без видимой причины — частый спутник дублей. Мы разбирали, как расходятся позиции и трафик на одних и тех же сайтах: у 8 проектов из 15 позиции не ухудшились, а трафик упал — смотреть исследование.
Частые вопросы
За дубли понижают сайт в выдаче?
Прямых санкций за дубли нет. Вред в другом: поисковик сам выбирает, какой из адресов показывать, ссылочные и поведенческие сигналы делятся между копиями, а робот тратит время обхода на лишние страницы.
Что лучше — canonical или 301?
Зависит от того, нужен ли второй адрес людям. Если не нужен — 301, адрес просто перестаёт существовать. Если нужен, как сортировка или ссылка с меткой, — canonical: страница открывается, но в индексе остаётся одна.
Можно ли закрыть дубли только через robots.txt?
Ненадёжно. robots.txt запрещает обход, но страница может попасть в индекс по внешним ссылкам. Для гарантированного исключения нужен noindex, причём страница при этом должна быть открыта для робота, иначе он не увидит мета-тег.
Что делать с пагинацией?
Оставлять в индексе, задавать каждой странице свой title с номером и ставить canonical на саму себя. Схлопывать всю пагинацию на первую страницу не стоит: товары с дальних страниц тогда выпадут из индекса.
Товара больше нет. Поставить 301 на категорию?
Нет. Удалённый товар должен отдавать 404. Редирект уместен, только если содержимое реально переехало по другому адресу. Массовые 301 на категорию создают новую проблему вместо решения старой.
Как быстро дубли уйдут из индекса?
После правок нужен переобход. Обычно картина в Вебмастере выравнивается за две-четыре недели, на крупных каталогах дольше. Ускорить можно переобходом вручную и корректной картой сайта.
Продвигаем сайты с 2014 года, более 300 выполненных проектов. О компании · Кейсы


