Проверка Индексации

Чек-лист перед индексацией сайта: что реально проверяют Google, Яндекс и Bing

Чек-лист перед индексацией сайта: что реально проверяют Google, Яндекс и Bing
Содержание

Большинство статей про «готовность сайта к индексации» сводятся к общим фразам вроде «сайт должен быть понятным». На практике Google, Яндекс и Bing судят не по ощущениям, а по конкретным техническим сигналам, и часть из них можно проверить за пять минут до отправки сайта в поиск. Ниже — чек-лист с точными действиями: что открыть, что ввести в адресную строку, на какой статус в Search Console смотреть и что делать, если страница неделями не индексируется.

Технический минимум — проверяется раньше контента

Прежде чем разбирать тексты, закройте четыре технические дыры, из-за которых сайт вообще не попадёт в индекс, сколько бы вы ни правили статьи.

  1. robots.txt. Откройте сайт.ру/robots.txt в браузере. Частая история после переноса со staging: строка Disallow: / осталась с тестового окружения и блокирует весь сайт целиком. Проверить из терминала: curl -IL https://сайт.ру/robots.txt — код должен быть 200, а не 404 (файл нужен обязательно, пустого Disallow без пути достаточно).
  2. sitemap.xml. Файл должен существовать по адресу /sitemap.xml, быть валидным XML (без битых тегов) и не содержать черновики, страницы пагинации без контента и дубли. Загрузите его в Search Console → раздел «Файлы Sitemap» → вставьте адрес → «Отправить». Через 1–2 дня сравните две цифры в том же разделе: «Обнаружено URL» и «Проиндексировано». Разрыв в 2 раза и больше — сигнал, что с картой или с контентом что-то не так, ещё до всех остальных проверок.
  3. Канонические адреса. На каждой ключевой странице нажмите Ctrl+U (просмотр исходного кода) и найдите rel="canonical". Он должен указывать на текущий адрес страницы на боевом домене — если там остался адрес staging-поддомена или версия с ?utm=, Google не будет считать страницу самостоятельной единицей, даже если она отлично написана.
  4. Коды ответа. Прогоните ключевые URL через curl -IL https://сайт.ру/страница — если видите цепочку из двух-трёх редиректов подряд (301 → 301 → 200) или случайный 404 на живой странице, это чинится до отправки, а не после.

Для сайта с 50+ страницами вручную проверять каждую по отдельности — не вариант. Быстрее выгрузить список URL из карты сайта и прогнать массовую проверку в Rush Analytics — сервис за один прогон показывает статус индексации по всему списку в Google и Яндексе, а не по одной странице через site:.

Контентный чек-лист: что смотрит алгоритм, а не только человек

Техническая часть — необходимое условие, но не достаточное. Вот что реально топит первые публикации на новых сайтах:

  • Шаблонные вступления. Если первые 2–3 абзаца в разных статьях начинаются с одинаковой конструкции («в современном мире важно понимать…»), для алгоритма это выглядит как машинный шаблон, а не редакционная работа. Проверка: выпишите первое предложение каждой статьи в один список — если три и больше совпадают по структуре, перепишите вступления вручную.
  • Тонкий контент без уникального угла. Статья на 300–400 слов, пересказывающая справку сервиса своими словами, не имеет причин ранжироваться выше самой справки. Признак готовности — в тексте есть то, чего нет в топ-10 по этому запросу: конкретный сценарий, таблица сравнения, разбор ошибки с примером.
  • Дубли по смыслу между статьями. Выпишите заголовки всех готовых материалов в столбик. Если два заголовка разными словами отвечают на один вопрос («как ускорить индексацию» и «что делать, если страница долго не индексируется») — один из них лишний либо нужно развести их по разным углам (первый — про новые страницы, второй — про технические причины у старых).
  • Признаки доверия. Автор с именем (не «Редакция» без единой живой странички «О нас»), реальный способ связи, политика конфиденциальности — это база E-E-A-T, без которой даже технически безупречная страница индексируется медленнее.

Для точечной проверки одной статьи перед публикацией — не всего сайта, а конкретной страницы — быстрее прогнать её через экспресс-анализ PR-CY: за пару минут сервис покажет технические огрехи страницы (дубли meta, битые ссылки, скорость), которые иначе пришлось бы ловить руками по каждому пункту чек-листа. Также полезен чек‑лист — Чек‑лист перед публикацией: что проверить, чтобы страница попала в индекс с первого раза .

Сценарий: страница висит в «Обнаружена, не проиндексирована» три недели

Это самый частый статус в Search Console у новых сайтов, и с ним чаще всего работают неправильно — жмут «Запросить индексирование» повторно каждые несколько дней. Разберём статусы по отдельности.

Статус в Search ConsoleЧто это значит на самом делеЧто делать
«Обнаружена — в настоящее время не проиндексирована»Google знает про URL (нашёл в sitemap или по ссылке), но не считает приоритетным её сканироватьДобавьте внутреннюю ссылку с уже проиндексированной сильной страницы, не спамьте кнопкой запроса — это не ускоряет, а иногда снижает приоритет
«Просканирована, не проиндексирована»Робот зашёл на страницу, прочитал контент и решил не индексироватьЭто сигнал качества, а не технической ошибки — усильте текст, уберите совпадения с другими страницами сайта
«Страница является копией. Канонические URL не выбраны пользователем»Алгоритм посчитал страницу дублем другой (своей или чужой)Проверьте rel=canonical, добавьте уникальные абзацы и данные, отличающие страницу от похожих
«Проиндексирована, несмотря на блокировку в файле robots.txt»Страница уже в индексе, но правило robots мешает Google обновлять сведения о нейОткройте robots.txt и снимите блокировку для этого раздела

Практическое правило: если статус не меняется 3+ недели, а контент вы уже реально доработали — не давите повторными запросами вручную. Проверьте сначала внутреннюю перелинковку (ссылается ли на страницу хоть одна уже проиндексированная), и только после этого имеет смысл ускорять сканирование внешним индексатором вроде SpeedyIndex — он прогоняет URL через собственную сеть переходов и уведомления, что для зависших страниц работает быстрее, чем повторные ручные запросы в GSC. Подробнее о том, почему Google не индексирует страницу, можно узнать в статье — Почему Google не индексирует страницу: диагностика по статусам Search Console .

Порядок проверки перед отправкой в индексацию

Идите по пунктам последовательно, не перескакивая — каждый следующий шаг теряет смысл, если не закрыт предыдущий:

  1. Проверьте robots.txt и sitemap.xml по методике из первого раздела (curl -IL, ручной просмотр).
  2. Отправьте sitemap в трёх местах: Google Search Console → «Файлы Sitemap», Яндекс.Вебмастер → «Индексирование → Файлы Sitemap», Bing Webmaster Tools → «Sitemaps».
  3. Пройдитесь по готовым статьям и сверьте заголовки на дубли по смыслу (список в столбик, как описано выше).
  4. Проверьте канонические теги и коды ответа на 5–10 ключевых страницах через Ctrl+U и curl -IL.
  5. Через неделю после отправки откройте Search Console → «Страницы» → «Не проиндексировано» и сверьте статусы с таблицей выше — не ждите молча, разбирайте каждую причину отдельно.
  6. Если страниц много (интернет-магазин, каталог), не проверяйте вручную — прогоните весь список через массовую проверку индексации и только для реально зависших URL точечно разбирайтесь по таблице статусов.

Короткий вывод

Готовность к индексации — это не «сайт выглядит неплохо», а закрытый список конкретных проверок: рабочий robots.txt, валидная карта сайта без черновиков, канонические адреса без мусора, статьи без шаблонных дублей и с уникальным углом. Если после отправки страница неделями висит в статусе «Обнаружена — не проиндексирована» или «Просканирована, не проиндексирована» — это почти всегда сигнал про качество и перелинковку, а не повод жать кнопку повторного запроса. Сначала чините причину, потом ускоряете сканирование — в этом порядке, а не наоборот.