Чек-лист перед индексацией сайта: что реально проверяют Google, Яндекс и Bing

Содержание
Большинство статей про «готовность сайта к индексации» сводятся к общим фразам вроде «сайт должен быть понятным». На практике Google, Яндекс и Bing судят не по ощущениям, а по конкретным техническим сигналам, и часть из них можно проверить за пять минут до отправки сайта в поиск. Ниже — чек-лист с точными действиями: что открыть, что ввести в адресную строку, на какой статус в Search Console смотреть и что делать, если страница неделями не индексируется.
Технический минимум — проверяется раньше контента
Прежде чем разбирать тексты, закройте четыре технические дыры, из-за которых сайт вообще не попадёт в индекс, сколько бы вы ни правили статьи.
- robots.txt. Откройте
сайт.ру/robots.txtв браузере. Частая история после переноса со staging: строкаDisallow: /осталась с тестового окружения и блокирует весь сайт целиком. Проверить из терминала:curl -IL https://сайт.ру/robots.txt— код должен быть 200, а не 404 (файл нужен обязательно, пустогоDisallowбез пути достаточно). - sitemap.xml. Файл должен существовать по адресу
/sitemap.xml, быть валидным XML (без битых тегов) и не содержать черновики, страницы пагинации без контента и дубли. Загрузите его в Search Console → раздел «Файлы Sitemap» → вставьте адрес → «Отправить». Через 1–2 дня сравните две цифры в том же разделе: «Обнаружено URL» и «Проиндексировано». Разрыв в 2 раза и больше — сигнал, что с картой или с контентом что-то не так, ещё до всех остальных проверок. - Канонические адреса. На каждой ключевой странице нажмите Ctrl+U (просмотр исходного кода) и найдите
rel="canonical". Он должен указывать на текущий адрес страницы на боевом домене — если там остался адрес staging-поддомена или версия с?utm=, Google не будет считать страницу самостоятельной единицей, даже если она отлично написана. - Коды ответа. Прогоните ключевые URL через
curl -IL https://сайт.ру/страница— если видите цепочку из двух-трёх редиректов подряд (301 → 301 → 200) или случайный 404 на живой странице, это чинится до отправки, а не после.
Для сайта с 50+ страницами вручную проверять каждую по отдельности — не вариант. Быстрее выгрузить список URL из карты сайта и прогнать массовую проверку в Rush Analytics — сервис за один прогон показывает статус индексации по всему списку в Google и Яндексе, а не по одной странице через site:.
Контентный чек-лист: что смотрит алгоритм, а не только человек
Техническая часть — необходимое условие, но не достаточное. Вот что реально топит первые публикации на новых сайтах:
- Шаблонные вступления. Если первые 2–3 абзаца в разных статьях начинаются с одинаковой конструкции («в современном мире важно понимать…»), для алгоритма это выглядит как машинный шаблон, а не редакционная работа. Проверка: выпишите первое предложение каждой статьи в один список — если три и больше совпадают по структуре, перепишите вступления вручную.
- Тонкий контент без уникального угла. Статья на 300–400 слов, пересказывающая справку сервиса своими словами, не имеет причин ранжироваться выше самой справки. Признак готовности — в тексте есть то, чего нет в топ-10 по этому запросу: конкретный сценарий, таблица сравнения, разбор ошибки с примером.
- Дубли по смыслу между статьями. Выпишите заголовки всех готовых материалов в столбик. Если два заголовка разными словами отвечают на один вопрос («как ускорить индексацию» и «что делать, если страница долго не индексируется») — один из них лишний либо нужно развести их по разным углам (первый — про новые страницы, второй — про технические причины у старых).
- Признаки доверия. Автор с именем (не «Редакция» без единой живой странички «О нас»), реальный способ связи, политика конфиденциальности — это база E-E-A-T, без которой даже технически безупречная страница индексируется медленнее.
Для точечной проверки одной статьи перед публикацией — не всего сайта, а конкретной страницы — быстрее прогнать её через экспресс-анализ PR-CY: за пару минут сервис покажет технические огрехи страницы (дубли meta, битые ссылки, скорость), которые иначе пришлось бы ловить руками по каждому пункту чек-листа. Также полезен чек‑лист — Чек‑лист перед публикацией: что проверить, чтобы страница попала в индекс с первого раза .
Сценарий: страница висит в «Обнаружена, не проиндексирована» три недели
Это самый частый статус в Search Console у новых сайтов, и с ним чаще всего работают неправильно — жмут «Запросить индексирование» повторно каждые несколько дней. Разберём статусы по отдельности.
| Статус в Search Console | Что это значит на самом деле | Что делать |
|---|---|---|
| «Обнаружена — в настоящее время не проиндексирована» | Google знает про URL (нашёл в sitemap или по ссылке), но не считает приоритетным её сканировать | Добавьте внутреннюю ссылку с уже проиндексированной сильной страницы, не спамьте кнопкой запроса — это не ускоряет, а иногда снижает приоритет |
| «Просканирована, не проиндексирована» | Робот зашёл на страницу, прочитал контент и решил не индексировать | Это сигнал качества, а не технической ошибки — усильте текст, уберите совпадения с другими страницами сайта |
| «Страница является копией. Канонические URL не выбраны пользователем» | Алгоритм посчитал страницу дублем другой (своей или чужой) | Проверьте rel=canonical, добавьте уникальные абзацы и данные, отличающие страницу от похожих |
| «Проиндексирована, несмотря на блокировку в файле robots.txt» | Страница уже в индексе, но правило robots мешает Google обновлять сведения о ней | Откройте robots.txt и снимите блокировку для этого раздела |
Практическое правило: если статус не меняется 3+ недели, а контент вы уже реально доработали — не давите повторными запросами вручную. Проверьте сначала внутреннюю перелинковку (ссылается ли на страницу хоть одна уже проиндексированная), и только после этого имеет смысл ускорять сканирование внешним индексатором вроде SpeedyIndex — он прогоняет URL через собственную сеть переходов и уведомления, что для зависших страниц работает быстрее, чем повторные ручные запросы в GSC. Подробнее о том, почему Google не индексирует страницу, можно узнать в статье — Почему Google не индексирует страницу: диагностика по статусам Search Console .
Порядок проверки перед отправкой в индексацию
Идите по пунктам последовательно, не перескакивая — каждый следующий шаг теряет смысл, если не закрыт предыдущий:
- Проверьте robots.txt и sitemap.xml по методике из первого раздела (
curl -IL, ручной просмотр). - Отправьте sitemap в трёх местах: Google Search Console → «Файлы Sitemap», Яндекс.Вебмастер → «Индексирование → Файлы Sitemap», Bing Webmaster Tools → «Sitemaps».
- Пройдитесь по готовым статьям и сверьте заголовки на дубли по смыслу (список в столбик, как описано выше).
- Проверьте канонические теги и коды ответа на 5–10 ключевых страницах через Ctrl+U и
curl -IL. - Через неделю после отправки откройте Search Console → «Страницы» → «Не проиндексировано» и сверьте статусы с таблицей выше — не ждите молча, разбирайте каждую причину отдельно.
- Если страниц много (интернет-магазин, каталог), не проверяйте вручную — прогоните весь список через массовую проверку индексации и только для реально зависших URL точечно разбирайтесь по таблице статусов.
Короткий вывод
Готовность к индексации — это не «сайт выглядит неплохо», а закрытый список конкретных проверок: рабочий robots.txt, валидная карта сайта без черновиков, канонические адреса без мусора, статьи без шаблонных дублей и с уникальным углом. Если после отправки страница неделями висит в статусе «Обнаружена — не проиндексирована» или «Просканирована, не проиндексирована» — это почти всегда сигнал про качество и перелинковку, а не повод жать кнопку повторного запроса. Сначала чините причину, потом ускоряете сканирование — в этом порядке, а не наоборот.