Экспертиза

Как попасть в ChatGPT Search: OAI-SearchBot и robots.txt

Как попасть в ChatGPT Search: OAI-SearchBot и robots.txt
Содержание

ChatGPT Search в 2026 году — уже не экспериментальная фича, а полноценный источник трафика для тех, кто настроил доступ правильно, и чёрная дыра для тех, кто заблокировал не того бота. Разбираем по шагам: как проверить, кто из ботов OpenAI реально заходит на ваш сайт, как прописать robots.txt под каждый сценарий и что делать, если страница ранжируется в Google, но не появляется в ответах ChatGPT.

Кратко

  • OAI-SearchBot индексирует контент именно для выдачи в ChatGPT Search — это не GPTBot, который качает тексты для обучения моделей. Блокировать GPTBot можно, OAI-SearchBot — нельзя, если нужен трафик.
  • Проверять факт захода бота нужно через логи сервера или Cloudflare Bot Analytics — в Search Console и Яндекс.Вебмастере данных по OAI-SearchBot нет.
  • Bing Webmaster Tools — не опция, а обязательный шаг: ChatGPT Search тянет часть выдачи из индекса Microsoft, и без индексации там трафика будет заметно меньше.

Три бота OpenAI — кто есть кто и что с ними делать

Путаница в user-agent’ах OpenAI — причина №1, почему сайты случайно теряют видимость в ChatGPT Search. Вот разбор с конкретными действиями по каждому:

БотЗадачаЧто делать в robots.txt
GPTBotСкачивает контент для обучения будущих моделей GPTМожно закрыть Disallow: /, если не хотите отдавать тексты на обучение
OAI-SearchBotИндексирует страницы под живой поиск в ChatGPT SearchДержать Allow: /, иначе страница пропадёт из выдачи
ChatGPT-UserРазовый переход по конкретной ссылке, когда пользователь в чате просит «открой этот сайт»Обычно не трогают — блокировка не даёт эффекта в вашу пользу, только ломает конкретные пользовательские запросы

Частая ошибка новичков: закрывают User-agent: * целиком, думая, что так «защитятся от AI». На практике это одной строкой убивает видимость в ChatGPT Search вместе со всем остальным AI‑трафиком — проверяйте правило User-agent: * отдельно от специфичных директив для каждого бота, иначе общий запрет перекроет разрешение для OAI-SearchBot.

Как проверить, заходил ли OAI-SearchBot на сайт

Это первый шаг диагностики, и его почти никто не делает — вместо этого сразу лезут править robots.txt вслепую.

Через логи сервера (если есть доступ по SSH):

grep "OAI-SearchBot" /var/log/nginx/access.log | tail -50

Если строк нет за последние 2–4 недели — бот либо не находит сайт (нет ссылок/упоминаний), либо блокируется на уровне robots.txt или WAF.

Через Cloudflare (если сайт на Cloudflare): зайдите в Security → Bots → Bot Analytics, отфильтруйте по user-agent «OAI-SearchBot». Если видите записи со статусом «Blocked» — смотрите правила в разделе AI Audit / Bot Fight Mode, они блокируют краулеры OpenAI до того, как те вообще прочитают robots.txt. В этом случае правка самого robots.txt ничего не даст — нужно снимать блок на уровне WAF‑правила.

Проверка вручную через curl (эмулируем запрос бота):

curl -A "OAI-SearchBot" -IL https://ваш-сайт.ru/robots.txt

Смотрите код ответа: 200 — файл доступен, 403/406 — сервер режет бота на уровне заголовков ещё до чтения правил, ищите проблему в WAF или .htaccess.

Если у вас десятки или сотни URL и нужно быстро понять, какие из них вообще попадают в индекс поисковых систем (не только Google, но и Bing, откуда частично тянет ChatGPT Search) — вручную это долго. Массовую проверку индексации по списку адресов удобно гонять через Rush Analytics: загружаете список URL, получаете статус по каждому без захода в панели вручную.

Настройка robots.txt: три рабочих сценария

Сценарий 1 — разрешить всё OpenAI (и обучение, и поиск):

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

Сценарий 2 — только поиск, без обучения (рекомендуемый для большинства сайтов на 2026 год: получаете трафик из ChatGPT Search, но не отдаёте тексты бесплатно на тренировку моделей):

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Сценарий 3 — полная блокировка (если вообще не хотите присутствия в продуктах OpenAI):

User-agent: OAI-SearchBot
Disallow: /

После любого изменения обязательно проверьте синтаксис — лишний пробел или неверный порядок директив ломает всё правило целиком. Дайте роботам 3–7 дней на переобход и повторите curl‑проверку выше, чтобы убедиться, что новые правила реально отдаются сервером (иногда кэш CDN или Nginx отдаёт старую версию файла ещё неделю).

Bing Webmaster Tools — обязательная часть, не опция

ChatGPT Search активно опирается на индекс Bing, особенно для страниц, которые OAI-SearchBot ещё не обошёл напрямую. Если ваш сайт плохо виден в Bing, шансы попасть в ответы ChatGPT падают ощутимо, даже при идеальном robots.txt.

Пошагово:

  1. Зайдите на bing.com/webmasters, добавьте сайт (можно импортировать верификацию прямо из Google Search Console — Bing предлагает это в один клик).
  2. Отправьте sitemap.xml через раздел Sitemaps.
  3. Используйте URL Inspection (аналог инструмента проверки URL в Google) для ключевых страниц — проверьте, что статус «Indexed», а не «Discovered — not indexed» или «Crawled — currently not indexed».
  4. Подключите протокол IndexNow — это отдельный API‑ключ, который вы генерируете в кабинете Bing Webmaster Tools и кладёте файлом в корень сайта. После этого при публикации или обновлении страницы отправляете один запрос — и об этом узнают сразу несколько поддерживающих IndexNow поисковиков, не только Bing. Документация: indexnow.org/documentation.

Если после настройки IndexNow страницы всё равно долго не появляются в индексе Bing — это тот случай, когда пассивное ожидание обхода не работает и нужен внешний толчок. Для ускорения индексации именно в Bing (и параллельно в Google) удобно использовать индексатор SpeedyIndex — он отправляет URL через собственные каналы и API индексирования, что быстрее, чем просто ждать органического обхода в течение нескольких недель.

Кейс: страница ранжируется в Google, но не появляется в ChatGPT Search 3 недели

Реальный сценарий диагностики, разбираем по шагам:

  1. Проверьте robots.txt на предмет Disallow для OAI-SearchBot — самая частая причина. Команда: curl -A "OAI-SearchBot" -IL https://сайт.ru/robots.txt, ищите строку Disallow: / под этим user-agent.
  2. Если robots.txt чист — проверьте логи на факт захода бота (см. раздел выше). Нет заходов за 3+ недели → страница либо не найдена ботом (нет внутренних ссылок с проиндексированных разделов, нет упоминаний в других источниках), либо блокируется WAF до чтения robots.txt.
  3. Если бот заходил, но страницы нет в выдаче ChatGPT — проверьте статус в Bing Webmaster Tools через URL Inspection. Статус «Crawled — currently not indexed» в Bing часто означает, что страница признана низкоценной или дублирующей более крупные источники — модель предпочитает давать 1–2 лучших ответа, а не длинный список ссылок.
  4. Проверьте технические факторы: скорость загрузки (LCP на мобильных — команда Ctrl+U откроет исходный код, но для реальных метрик нужен PageSpeed Insights), наличие структурированных данных Schema.org для сущностей (Article, Organization, FAQPage — где применимо).
  5. Если всё технически чисто, но контент дублирует уже проиндексированные крупные площадки — модель скорее процитирует источник с большим доверием. Здесь помогает не правка robots.txt, а усиление уникальности материала и наращивание цитируемости через внешние упоминания.

Таблица факторов и приоритетов

ФакторВлияние на попадание в ChatGPT SearchЧто делать
robots.txt (OAI-SearchBot: Allow)КритическоеПроверить curl‑запросом, держать Allow: /
Индексация в BingВысокоеBing Webmaster Tools + IndexNow + ускоряющий индексатор при задержках
Блокировка на уровне WAF/CloudflareКритическое (перекрывает robots.txt)Проверить Bot Analytics, снять блок для OAI-SearchBot
Скорость загрузки (LCP mobile)СреднееОптимизация изображений, кэш, минимум блокирующего JS
Микроразметка Schema.orgВысокоеArticle/FAQPage/Organization для ключевых сущностей
Уникальность vs дублирование крупных источниковВысокоеЭкспертные детали, кейсы, а не пересказ чужих текстов

Если нужно быстро прогнать технический аудит страницы (скорость, микроразметка, базовые SEO‑факторы) без ручного копания в исходном коде — экспресс‑анализ через PR‑CY закрывает это за пару минут и показывает, какие из пунктов таблицы выше у вас уже провалены.

Частые ошибки

  • Блокировка через общий User-agent: * вместо точечных правил — убивает видимость в ChatGPT Search вместе со всем остальным.
  • Игнорирование WAF/Cloudflare Bot Fight Mode — правите robots.txt, а бота режут раньше, на уровне прокси. Проверяйте оба слоя.
  • Сложная JS‑отрисовка контента — если основной текст рендерится только на клиенте и бот не может его получить без выполнения JS, часть контента для AI‑поиска попросту не существует. Чем проще серверный HTML — тем выше шанс корректного цитирования.
  • Ожидание мгновенного результата — это не Google Indexing API. OAI-SearchBot может прийти через неделю или месяц после разрешения в robots.txt, особенно если у сайта мало внешних сигналов и низкая частота обхода в принципе.

Что не делать

Не пытайтесь показывать боту один контент, а пользователям — другой (клоакинг). В эпоху AI‑поиска это вычисляется быстрее, чем в классическом SEO: модель сопоставляет смысл страницы с тем, что реально видит пользователь при переходе, и расхождение — прямой сигнал для понижения доверия к источнику.

Открытые вопросы

OpenAI не публикует исчерпывающий и обновляемый список IP‑адресов для каждого из ботов (OAI-SearchBot, GPTBot, ChatGPT-User) — это ограничивает настройку доступа на уровне файрвола, приходится полагаться на user-agent и robots.txt. Долгосрочное влияние блокировки OAI-SearchBot на общий SEO‑вес сайта в глазах других систем пока не подтверждено официально — но тренд на интеграцию AI‑ответов в классический поиск (Google AI Overviews и аналоги) делает цитируемость в AI‑среде фактором, который стоит отслеживать уже сейчас, а не откладывать на потом.

См. также: