Короткий ответ

Один и тот же текст, доступный по нескольким адресам, поисковая система считает разными страницами и выбирает из них одну сама. Выбор часто оказывается не в вашу пользу: в поиске остаётся адрес с рекламной меткой или страница фильтра, а не та, которую вы продвигали. Разбираем, откуда берутся дубли, как найти их без платных сервисов и чем склеивать в каждом случае.

Команда Будин

Три вида дублей, которые постоянно путают

Инструменты для них разные, и ошибка в выборе обходится дороже самой проблемы.

Полные дубли это один и тот же документ, доступный по разным адресам. Возникают сами, без чьего-либо участия: так устроены веб-сервер и система управления сайтом. Владелец о них обычно не подозревает, потому что сам ходит по одному адресу из закладки.

Частичные дубли совпадают на большую часть, но не целиком. Сюда попадают страницы пагинации, результаты фильтров и сортировок, карточка товара, доступная по пути каждой категории, версия для печати. Текст вокруг один и тот же, меняется середина.

Смысловые дубли устроены иначе: адреса разные, тексты разные, а отвечают они на один и тот же запрос. Это не техническая ошибка, а следствие того, как задумали структуру сайта. Техникой они не лечатся вообще.

Путаница здесь дорого стоит. Постоянная переадресация там, где нужна была каноническая ссылка, убивает нужный людям раздел. Каноническая там, где нужна была переадресация, оставляет проблему адресов на месте и добавляет к ней вторую.

Откуда берутся адреса-близнецы

Список короткий, и почти каждый пункт хоть раз встречался на любом живом сайте.

Большинство дублей появляется не от небрежности, а от того, что сервер и система управления допускают несколько написаний одного адреса. Человек разницы не замечает, а робот получает два документа с одинаковым содержимым и вынужден решать, какой из них настоящий.

Варианты написания адреса

  • с www и без www
  • http и https, если старый протокол не переадресуется
  • со слешем на конце и без него
  • с index.html или index.php в конце пути
  • с разным регистром букв в пути
  • с параметром сортировки, который порядок меняет, а состав нет

Метки и параметры

  • рекламные метки, приклеенные к адресу при переходе из объявления
  • идентификаторы сессий, которые сервер подставляет сам
  • параметры партнёрских и реферальных ссылок
  • параметры фильтров, не меняющие набор товаров
  • хвосты от внешних сервисов, дописанные к адресу при переходе

Структурные повторы

  • товар доступен по пути каждой категории, в которой он числится
  • статья лежит сразу в двух рубриках и открывается по обоим путям
  • тестовая копия сайта, забытая открытой для индексации
  • отдельный поддомен под мобильную версию
  • версия для печати и страница отзыва, собранные из того же текста

Как найти дубли без платных сервисов

Шесть способов, каждый занимает минуты и не требует подписки.

Панель вебмастера

Раздел страниц в поиске, вкладка исключённых, фильтр по причине. Дубли там названы прямо, с указанием адреса, который поисковик считает основным.

Оператор site

Запрос с оператором site и адресом сайта показывает, что вообще попало в базу. Пролистав список, вы увидите адреса с метками, параметрами и лишними хвостами.

Поиск по куску текста

Возьмите предложение со страницы в кавычки и поищите его вместе с оператором site. Все адреса, где эта фраза встречается, и есть кандидаты в дубли.

Сверка заголовков

Соберите title всех страниц в таблицу и отсортируйте по алфавиту. Одинаковые заголовки собираются рядом и почти всегда означают одинаковые страницы.

Обход краулером

Бесплатные версии обходчиков проходят небольшой сайт целиком и показывают повторяющиеся title и description, коды ответа и цепочки переадресаций.

Карта против факта

Сравните адреса из карты сайта с тем, что реально отдаёт сервер. Расхождения показывают адреса, о существовании которых вы не знали.

Чем дубли мешают на самом деле

Вред не в том, что робот обидится, а в четырёх вполне измеримых вещах.

Первое: обход. У каждого сайта есть предел того, сколько страниц робот забирает за проход. Копии съедают этот предел, и до новых страниц очередь доходит позже. На сайте из десятка страниц незаметно, на каталоге ощутимо.

Второе: выбор основного адреса делаете не вы. Поисковая система склеивает копии сама и оставляет ту, которая ей показалась главной. Регулярно в выдаче остаётся адрес с рекламной меткой или страница фильтра, а продвигаемая страница уходит в исключённые.

Третье: сигналы размазываются. Внешние ссылки, переходы и поведение делятся между копиями вместо того, чтобы накапливаться на одном адресе. Каждая копия по отдельности выглядит слабее, чем выглядела бы одна страница.

Четвёртое: отчёты врут. Статистика по странице разбивается по адресам, и вы принимаете решения по неполным данным, считая работающий раздел провальным.

Отдельный эффект: массив почти одинаковых документов подтягивает сайт к статусу малоценных страниц, и часть адресов вылетает из поиска. Про этот статус есть отдельный разбор: малоценная или маловостребованная страница.

Четыре инструмента склейки и когда какой брать

Выбор зависит от одного вопроса: нужен ли второй адрес живым людям.

Если второй адрес людям не нужен, его убирают переадресацией. Если нужен, но в поиске должен быть один, ставят каноническую ссылку. Если адрес не должен попадать в поиск вовсе, закрывают от индексации. Если разница только в приклеенном параметре, объявляют параметр незначащим.

Постоянная переадресация

Берут, когда старый адрес больше не нужен: переезд, смена структуры, склейка написаний с www и без, удаление устаревшего раздела. Из всех способов этот передаёт накопленные сигналы полнее остальных.

Главная ошибка тут цепочки: один адрес ведёт на второй, второй на третий. Каждое звено теряет часть веса и часть терпения робота. Переадресация должна вести на конечный адрес сразу, даже если исторически путь был длиннее.

Каноническая ссылка

Берут, когда обе страницы нужны людям, но в поиске должна остаться одна: пагинация, карточка товара в нескольких категориях, сортировки, адреса с метками. Каноническая ссылка это рекомендация, а не команда, и поисковая система вправе её не послушать.

Типовые поломки: каноническая указывает на страницу, которая сама указывает на третью; на странице одновременно стоят каноническая ссылка и запрет индексации; на всех страницах сайта прописана главная. Последнее выносит из поиска весь сайт разом, и такое встречается чаще, чем кажется.

Запрет индексации

Для служебного, чему в поиске делать нечего: корзина, оформление заказа, личный кабинет, результаты внутреннего поиска, страницы благодарности после отправки формы.

Закрытие в robots.txt и мета-тег работают по-разному, и разницу стоит держать в голове. Закрытая в robots страница может остаться в выдаче без описания, потому что робот до мета-тега просто не дошёл. Если задача убрать страницу из поиска, нужен мета-тег, а доступ роботу оставляют открытым.

Очистка параметров

Метки и параметры, не меняющие содержание страницы, объявляются незначащими в панели вебмастера. После этого адреса с ними склеиваются с чистым адресом сами, без правок в коде.

Способ выручает там, где параметры плодятся быстрее, чем вы успеваете их разбирать: рекламные кампании, партнёрские ссылки, внешние сервисы. Разово настроили, и целый класс дублей перестал появляться.

Пагинация, фильтры и сортировки

Самая спорная зона: у одного сайта это дубли, у другого посадочные страницы.

Сортировка почти всегда дубль. Набор товаров тот же, меняется только порядок вывода, и отдельного смысла для поиска у такого адреса нет. Тут каноническая ссылка на страницу без сортировки закрывает вопрос.

Пагинация дублем в полном смысле не является: вторая страница списка содержит другие товары. Её держат в индексе с канонической ссылкой на саму себя. Ломается она в другом месте: когда у всех страниц списка одинаковые title и description, они превращаются в мусор. Номер страницы должен попадать в заголовок и описание.

Фильтры делятся по спросу, и это единственный рабочий критерий. Комбинации, которые действительно ищут, стоит превращать в отдельные страницы со своим заголовком, своим описанием и парой абзацев текста. Остальные комбинации закрывать.

Правило короткое: если под комбинацию фильтров есть запрос и вы готовы написать под неё осмысленный текст, это посадочная страница. Если запроса нет или писать нечего, это дубль, и держать его в индексе незачем.

Смысловые дубли: две страницы под один запрос

Техникой не лечится, потому что технически всё в порядке.

Адреса разные, тексты разные, а запрос один, и поисковая система мечется между страницами. Ни одна не закрепляется, обе показываются нестабильно, суммарно они собирают меньше, чем собрала бы одна.

Признак первый: по одному и тому же запросу в выдаче оказывается то одна страница, то другая, а позиции скачут без видимой причины. Признак второй: в статистике запросов у двух страниц пересекающиеся формулировки, и ни у одной нет своего ядра.

Разводить можно двумя способами. Первый: объединить, оставив сильнейшую и переадресовав на неё остальные. Второй: развести по намерению, когда одна страница отвечает на общий запрос, а вторая на узкий, и каждая переписана так, чтобы целиться в свою формулировку.

Второй способ работает только при честном разведении. Если после правки в статистике у страниц опять общие запросы, разведения не произошло, и лучше склеить.

Шаблонные страницы направлений: частый смысловой дубль

Формально дублей нет, тексты разные. Фактически совпадение доходит до восьмидесяти процентов.

Речь про случай, когда под каждое направление сделана страница по одному макету. Проверка на заимствования проходит, а поисковая система всё равно оставляет одну страницу из группы: она сравнивает не буквы, а то, о чём страница, и не с чужими сайтами, а в первую очередь с вашими соседними.

Мера тут та же, что и в разборе малоценных страниц: доля дословных повторов между страницами. Берут текст без шапки и подвала, режут на цепочки по четыре-пять слов и считают пересечение. Выше половины означает, что вы сделали одну страницу несколько раз.

Переписывать начинают не с вводных абзацев, а с блоков, которые повторяются на всех страницах: этапы работы, преимущества, описание процесса, ответы на вопросы. Вводная часть обычно и так разная, а вес имеет как раз повторяющаяся середина.

Как сделать общий блок разным по существу

Блок «как проходит работа» одинаков не по лени, а потому что работа и правда похожа. Отличается наполнение шагов. На странице сайта для зоомагазина на этапе подготовки данных обсуждают выгрузку остатков по фасовкам и сроки годности кормов. На странице сайта для ветклиники на том же этапе речь идёт про график смен врачей и карточку питомца. На странице сайта для турагентства про подгрузку туров и параметры заявки.

Шаг называется одинаково, содержание внутри разное, и этого достаточно: робот читает содержание, а не название шага.

Проверка простая. Возьмите абзац и мысленно перенесите его на соседнюю страницу. Если он встанет туда без единой правки, он не работает ни здесь, ни там, и его надо переписывать первым.

Порядок разбора дублей

Восемь шагов, после которых список закрывается и перестаёт расти.

  1. Собрать все адреса

    Карта сайта, выгрузка из панели вебмастера, обход краулером. Три источника дают разные списки, и объединение как раз показывает лишнее.

  2. Свести в таблицу

    Рядом с адресом столбцы: title, код ответа сервера, каноническая ссылка, число внутренних ссылок на него.

  3. Отсортировать по title

    Одинаковые заголовки собираются рядом, и группы дублей проявляются сами, без анализа содержимого.

  4. Разметить группы

    По каждой группе пометить тип: полный дубль, частичный, смысловой. От типа зависит инструмент, и без разметки выбор будет случайным.

  5. Выбрать основной адрес

    В каждой группе основным берут тот, что уже в поиске, короче остальных и на который ведут внутренние ссылки.

  6. Применить инструмент

    Переадресация, каноническая ссылка, запрет индексации или очистка параметров. По одному инструменту на группу, не по два сразу.

  7. Починить внутренние ссылки

    Меню, перелинковка и карта сайта должны вести на основной адрес напрямую, без прохода через переадресацию.

  8. Отправить на переобход

    Обновить карту сайта, отправить изменённые адреса на переобход и записать дату, чтобы было от чего считать.

Что проверить после склейки

Половина проблем возвращается из-за того, что проверку пропустили.

Коды ответа: старый адрес отдаёт постоянную переадресацию, новый отвечает нормальным кодом. Цепочек быть не должно ни одной, даже короткой.

Каноническая ссылка в исходном коде совпадает с адресом, который вы выбрали основным. Частая поломка: система управления сайтом подставляет каноническую сама и молча перебивает вашу настройку при следующем обновлении.

Карта сайта содержит только основные адреса. Склеенные оттуда убирают: держать в карте адрес, который вы сами переадресовали, значит посылать роботу противоречивый сигнал.

Дальше наблюдение. Число страниц в поиске сначала падает, и это ожидаемо: копий стало меньше. Расти должны показы у оставшихся адресов, а не общее количество страниц. Первые недели картина в панели выглядит хуже, чем была, и это не повод откатывать работу.

Если разбираться с этим некогда, мы делаем разбор отдельной работой: собираем адреса, размечаем группы, склеиваем и чиним внутренние ссылки. Смежные вещи разбираем там же, в рамках технического SEO.