Экспертиза

GPTBot, OAI-SearchBot, ChatGPT-User: как в 2026 году разделить доступ ИИ-ботов OpenAI без потери трафика

GPTBot, OAI-SearchBot, ChatGPT-User: как в 2026 году разделить доступ ИИ-ботов OpenAI без потери трафика
Содержание

Статья:

Статья:

OpenAI развела своих краулеров на три независимых User-Agent — и это больше не теоретический вопрос «пускать ИИ или нет». Один и тот же robots.txt может одновременно кормить чужую модель бесплатным контентом, обрубать вам приток из ChatGPT Search и портить UX тем, кто просто кинул вашу ссылку в чат. Ниже — конкретные команды, конфиги и решения по каждому боту, а не пересказ документации OpenAI.

Кратко: что делает каждый бот и что с ним делать

БотUser-AgentЧто делаетЧто с ним делать по умолчанию в 2026
GPTBotGPTBotСобирает данные для обучения будущих моделейБлокировать, если контент уникальный и монетизируется напрямую
OAI-SearchBotOAI-SearchBotИндексирует страницы для ответов ChatGPT SearchРазрешать почти всегда — это канал трафика, аналог Google
ChatGPT-UserChatGPT-UserЗаходит по конкретной ссылке, когда пользователь сам её вставил в чатРазрешать, блокировка ломает UX для ваших же посетителей

Шаг 1. Проверьте, кто реально ходит на сайт — не верьте robots.txt на слово

Правило robots.txt в файле — это декларация. Реальное поведение проверяется по логам сервера и прямым запросом. Быстрый тест с любой машины:

curl -A "GPTBot" -IL https://ваш-сайт.ru/
curl -A "OAI-SearchBot" -IL https://ваш-сайт.ru/
curl -A "ChatGPT-User" -IL https://ваш-сайт.ru/

Если вы прописали Allow: / для OAI-SearchBot, но curl возвращает 403 — дело не в robots.txt, а в WAF/CDN. Частый сценарий: в Cloudflare включён переключатель «Block AI-ботов » или «Bot Fight Mode» в разделе Security → Bots, и он режет запрос на уровне edge ещё до того, как сервер вообще посмотрит на robots.txt. Итог — сайт месяцами не появляется в ChatGPT Search, а вебмастер уверен, что всё разрешено, потому что смотрел только в текстовый файл. Проверяйте оба уровня: robots.txt и настройки CDN/хостинга отдельно.

Дальше смотрите логи на реальную частоту заходов:

grep "GPTBot" access.log | wc -l
grep "OAI-SearchBot" access.log | wc -l
grep "ChatGPT-User" access.log | wc -l

Типичная картина: GPTBot появляется рывками — молчит неделями, потом за один день выкачивает целый раздел сайта, создавая пиковую нагрузку на сервер без единого перехода читателя. OAI-SearchBot ведёт себя ровнее — регулярно обходит sitemap.xml и часто обновляемые страницы, как обычный поисковый краулер.

Шаг 2. Решайте по каждому боту отдельно — вот рабочая матрица

Не думайте «ИИ» одним блоком. Решение зависит от бизнес-модели страницы:

  1. Продаёте доступ к контенту (платный гайд, курс, закрытая база) → GPTBot закрыть всегда, OAI-SearchBot — по ситуации (для лендингов открыть, для платного контента закрыть тоже).
  2. Монетизация через рекламу/партнёрки, трафик = деньги → GPTBot закрыть, OAI-SearchBot и ChatGPT-User держать открытыми — это дополнительный канал, аналогичный органике из Google и Яндекса.
  3. PBN/инфосайт, задача — максимальный охват и цитируемость → всё открыть, включая GPTBot, если для вас важнее упоминания и косвенный трафик через бренд, чем защита текста.

robots.txt для сценария «трафик из ИИ-поиска, но не отдаём данные на обучение» (самый частый выбор в 2026)

# Разрешаем поиск ChatGPT — это канал трафика
User-agent: OAI-SearchBot
Allow: /

# Запрещаем обучение будущих моделей на нашем контенте
User-agent: GPTBot
Disallow: /

# Разрешаем действия по прямому запросу пользователя
User-agent: ChatGPT-User
Allow: /

Если решили закрыться полностью (например, сайт с платным авторским контентом) — меняете первый и третий блок на Disallow: /. Если хотите максимум охвата — везде Allow: /, но тогда закладывайтесь на рост нагрузки от GPTBot без ответного трафика.

Robots.txt разрешил — это не значит, что вас реально показывают. Проверка руками:

  1. Откройте ChatGPT с включённым поиском, задайте 5–10 запросов из вашей тематики, по которым страница должна ранжироваться.
  2. Смотрите, попадает ли домен в список источников внизу ответа. Если нет спустя 3–4 недели после открытия OAI-SearchBot — проверьте sitemap.xml на актуальность и убедитесь, что страница вообще проиндексирована в обычном поиске (у OpenAI есть косвенная связь с индексом Bing).
  3. Проверьте referrer в логах: заходы с chat.openai.com или chatgpt.com в Referer — это переходы из диалогов, а не сам краулер.

Если у вас не один сайт, а десяток доменов на PBN, вручную гонять этот чек-лист по каждому — трата времени. Для массовой проверки технического состояния (доступность robots.txt, коды ответа, статус индексации по списку URL сразу по всем доменам) удобнее прогнать пачку через Rush Analytics — быстрее находите домены, где директивы для ботов слетели после обновления CMS или смены хостинга. Для разового точечного разбора одной посадочной — заголовки ответа, robots-директивы, базовые технические ошибки — хватает экспресс‑проверки через PR‑CY.

Типичные ошибки, которые стоят трафика

  • Disallow: / без указания конкретного User-agent. Такое правило в общем блоке User-agent: * блокирует не только GPTBot, но и Googlebot с YandexBot. Проверяйте, что директивы для ИИ‑ботов прописаны в отдельных блоках, а не в общем.
  • SEO‑плагин перезаписывает robots.txt при каждом обновлении. Yoast и аналоги в WordPress иногда сбрасывают кастомные правила при плановых апдейтах — после любого обновления плагина сверяйте файл заново.
  • Блок на уровне CDN не совпадает с блоком в robots.txt. См. шаг 1 — Cloudflare, Sucuri и другие WAF могут иметь собственный переключатель «AI bots», который выигрывает у robots.txt.
  • Путаница ChatGPT-User и OAI-SearchBot в логах. Оба могут идти с похожим IP‑диапазоном OpenAI — разделяйте строго по строке User-Agent, а не по IP.
  • Забыли про Google‑Extended и GoogleOther. Если настраиваете политику для всех ИИ‑краулеров разом, у Google тоже есть отдельный бот для обучения Gemini (Google-Extended) — логика та же, что с GPTBot, но это другая директива в отдельном блоке.

Для масштабной проверки набора технических параметров

Если управляете сетью сайтов и нужно быстро прогнать проверку robots.txt, кодов ответа и базовых технических параметров без ручного захода на каждый домен — держите под рукой набор инструментов вроде Арсенкин: там есть готовые проверки ответа сервера и синтаксиса robots.txt, которые экономят время при аудите десятков доменов.

Мониторинг: что делать раз в месяц и раз в квартал

  • Раз в месяц: считайте хиты по каждому боту через grep из шага 1, сравнивайте с прошлым месяцем — резкий скачок GPTBot без роста трафика от OAI-SearchBot сигнализирует, что кто‑то агрессивно выкачивает раздел.
  • Раз в квартал: сверяйте список актуальных User-Agent и IP‑диапазонов на странице https://platform.openai.com/docs/bots — OpenAI добавляет новых ботов без широкого анонса. Также полезно периодически перечитывать Как читать логи сервера для диагностики проблем индексации для уточнения методов.
  • После любого редизайна или смены CMS/хостинга: заново проверяйте robots.txt и настройки CDN — это самая частая точка, где правила откатываются к дефолту.

Итог

Решение принимается не «ИИ да/нет», а по каждому из трёх ботов отдельно: GPTBot — вопрос про обучение чужой модели вашими данными, OAI-SearchBot — вопрос про канал трафика, ChatGPT-User — вопрос про удобство ваших читателей. Проверяйте robots.txt и настройки CDN раздельно, тестируйте curl‑запросами, а не верьте файлу на слово, и раз в квартал сверяйтесь с актуальным списком ботов у OpenAI — список расширяется.