Качество Сайта

Похожие страницы плохо индексируются: как это выявить и починить

Похожие страницы плохо индексируются: как это выявить и починить
Содержание

Если из тридцати опубликованных статей в индексе застряло пятнадцать — почти всегда причина не в «слабом сайте», а в том, что несколько текстов отвечают на один и тот же вопрос почти одинаковыми словами. Google это видит быстрее, чем кажется: у него нет задачи хранить десять версий одного ответа, поэтому он выбирает одну страницу канонической, а остальные откладывает или вовсе не берёт в индекс. Разберём, как это выглядит в Search Console, как найти такие страницы и что с ними делать — с конкретными статусами, командами и шагами.

Какой статус в Search Console выдаёт дубли

Заходите в Search Console → «Страницы» (в старом интерфейсе — «Покрытие») → блок «Почему страницы не индексируются». Вас интересуют четыре статуса, и у каждого свой смысл и своё действие:

Статус в GSCЧто реально произошлоЧто делать
Duplicate without user-selected canonicalGoogle нашёл несколько одинаковых страниц, вы не указали canonical, система выбрала сама — не факт, что ту, что нужна вамПроставить rel=canonical на нужную версию явно
Duplicate, Google chose different canonical than userВы указали canonical, но Google с вами не согласился и индексирует другую страницуПроверить, действительно ли выбранная Google страница сильнее (больше ссылок, старше) — часто проще смириться и обновить canonical у себя под неё
Duplicate, submitted URL not selected as canonicalСтраница из sitemap не выбрана канонической — почти всегда это и есть «похожая страница» из этой статьиОбъединить с канонической или переписать под другую задачу
Crawled — currently not indexedРобот страницу посетил, прочитал и решил не индексировать — типичный итог для тонкого дубляЛибо радикально усилить уникальным контентом, либо склеить 301-редиректом

Если у статьи стоит статус «Crawled — currently not indexed » дольше трёх недель и она явно пересекается по смыслу с другой опубликованной страницей — почти наверняка это дубль, и ждать дальше бессмысленно: Google уже принял решение, само по себе оно не изменится.

Как искать похожие страницы вручную, не дожидаясь GSC

GSC покажет проблему постфактум, когда страница уже потеряла время в очереди. Быстрее ловить дубли до публикации:

  1. Оператор site:site:вашдомен.ru интитл:ключевая фраза в Google покажет все проиндексированные страницы по теме. Если их три-четыре с одинаковым интентом — новая четвёртая не нужна.
  2. Просмотр Ctrl+U двух черновиков рядом — если первый экран (до 300 символов) у обеих страниц пересказывает одно и то же другими словами, это уже сигнал.
  3. Табличная сверка для существующего корпуса: заголовок → главная польза страницы → чем отличается от ближайшей соседней → какой следующий шаг даёт читателю. Если у двух строк совпадают колонки «польза» и «отличие» — это дубль по сути, а не только по тексту.
  4. Массовая проверка статусов — когда статей десятки и сверять вручную долго, выгружаете список URL в Rush Analytics и смотрите статус индексации пачкой: сразу видно, какие страницы застряли в «Crawhed — currently not indexed» и требуют разбора в первую очередь, а не по одной через интерфейс GSC.

Пример на нише «индексация в Google»

Возьмём типичный кластер: несколько статей вокруг темы «Google не индексирует страницу».

  • Статья «почему Google не индексирует» — общий разбор для человека, который вообще не понимает, что происходит: куда смотреть в первую очередь, с чего начать диагностику.
  • Статья про статус «Crawled — currently not indexed» — не общий случай, а разбор конкретной ситуации в GSC: что делать именно с этим статусом и почему он отличается от «Discovered — currently not indexed».
  • Обзор конкретного инструмента для переобхода — третий, более узкий слой: что за сервис, как он подаёт страницы, кому подходит.

Если содержание всех трёх материалов сводится к одному и тому же чек-листу «проверьте robots.txt, отправьте через GSC, подождите» — заголовки и адреса разные, а страница по сути одна. Проверка простая: после какой строки в тексте читателю понятно, что он попал не туда и ему нужна другая статья кластера? Если такой строки нет ни в одном материале — роли существуют только на бумаге.

Что делать с уже опубликованными дублями

Три рабочих сценария, в порядке от простого к трудозатратному:

1. Склеить редиректом. Если две страницы реально отвечают на один вопрос — оставляете более сильную (больше ссылок, выше позиция, старше по дате), на вторую ставите 301 на первую. Проверить, что редирект действительно отдаётся, а не завис на промежуточном статусе:

curl -IL https://вашдомен.ru/старая-страница/

В ответе должно быть 301 → далее 200 на целевом URL. Если видите 200 без редиректа — значит правило не подключилось, и Google продолжит видеть две живые страницы.

2. Проставить canonical явно. Если обе версии страницы нужны (например, печатная и обычная), но конкурируют за индекс — не удаляете вторую, а ставите <link rel="canonical" href="..."> на первой в пользу главной. Через 1–2 недели статус в GSC должен смениться на «Alternate page with proper canonical tag» — это нормальный, не проблемный статус.

3. Радикально дифференцировать. Если обе страницы нужны как отдельные материалы, но написаны похоже — переписываете один из текстов под конкретную узкую задачу: добавляете кейс, таблицу, сценарий, которого нет на соседней странице. Когда нужно быстро перегенерировать большой блок текста под новый угол, ускоряет процесс Turbotext — но черновик всё равно нужно проверять на пересечение с уже опубликованным материалом, а не публиковать как есть.

После склейки — ускорить переиндексацию

Когда вы сделали редирект или обновили canonical, само по себе изменение статуса в GSC может занять недели — Google обходит страницы не мгновенно. Чтобы ускорить:

  • В Search Console → «Проверка URL» → вставляете адрес канонической страницы → «Запросить индексирование». Работает, но с лимитом в несколько запросов в день.
  • Если у старой (редиректнутой) страницы были обратные ссылки — они формально продолжают вести на неё, и переобход этих ссылок ускоряет обновление у Google карты редиректов. Здесь помогает индексатор — SpeedyIndex или 2Index.Ninja подают URL пачкой, не по одному через ручную панель, что особенно ощутимо, если склеиваете не одну пару страниц, а десяток.
  • После массовой чистки корпуса имеет смысл повторно прогнать те же URL через Rush Analytics через 2–3 недели — так вы увидите, действительно ли статус сменился с «Duplicate» на «canonical» или проблема осталась.

Короткий чек-лист

  • Статус «Crawled — currently not indexed » держится больше трёх недель + страница пересекается по теме с другой → это дубль, ждать бессмысленно.
  • Перед публикацией новой страницы — чек-лист перед публикацией : site: поиск по ключевой фразе и сверка первого экрана с уже вышедшими материалами.
  • Решили, что страницы дублируют друг друга → редирект или явный canonical, не «удалить и забыть».
  • После склейки — не полагаться на автоматический переобход, ускорять через «Проверку URL» или индексатор, особенно если на старую страницу вели внешние ссылки.
  • Для сайта из десятков статей — сверять статусы пачкой, а не по одной, иначе проблемные страницы находятся случайно и поздно.

Похожие страницы не нужно прятать «на всякий случай» — их нужно либо явно развести по разным задачам, либо честно склеить в одну. Сайт из десяти статей с понятной ролью каждой индексируется быстрее и полнее, чем двадцать похожих друг на друга материалов, размноженных ради объёма.