Статья:
Статья:
OpenAI развела своих краулеров на три независимых User-Agent — и это больше не теоретический вопрос «пускать ИИ или нет». Один и тот же robots.txt может одновременно кормить чужую модель бесплатным контентом, обрубать вам приток из ChatGPT Search и портить UX тем, кто просто кинул вашу ссылку в чат. Ниже — конкретные команды, конфиги и решения по каждому боту, а не пересказ документации OpenAI.
Кратко: что делает каждый бот и что с ним делать
| Бот | User-Agent | Что делает | Что с ним делать по умолчанию в 2026 |
|---|---|---|---|
| GPTBot | GPTBot | Собирает данные для обучения будущих моделей | Блокировать, если контент уникальный и монетизируется напрямую |
| OAI-SearchBot | OAI-SearchBot | Индексирует страницы для ответов ChatGPT Search | Разрешать почти всегда — это канал трафика, аналог Google |
| ChatGPT-User | ChatGPT-User | Заходит по конкретной ссылке, когда пользователь сам её вставил в чат | Разрешать, блокировка ломает UX для ваших же посетителей |
Шаг 1. Проверьте, кто реально ходит на сайт — не верьте robots.txt на слово
Правило robots.txt в файле — это декларация. Реальное поведение проверяется по логам сервера и прямым запросом. Быстрый тест с любой машины:
curl -A "GPTBot" -IL https://ваш-сайт.ru/
curl -A "OAI-SearchBot" -IL https://ваш-сайт.ru/
curl -A "ChatGPT-User" -IL https://ваш-сайт.ru/
Если вы прописали Allow: / для OAI-SearchBot, но curl возвращает 403 — дело не в robots.txt, а в WAF/CDN. Частый сценарий: в Cloudflare включён переключатель «Block AI-ботов
» или «Bot Fight Mode» в разделе Security → Bots, и он режет запрос на уровне edge ещё до того, как сервер вообще посмотрит на robots.txt. Итог — сайт месяцами не появляется в ChatGPT Search, а вебмастер уверен, что всё разрешено, потому что смотрел только в текстовый файл. Проверяйте оба уровня: robots.txt и настройки CDN/хостинга отдельно.
Дальше смотрите логи на реальную частоту заходов:
grep "GPTBot" access.log | wc -l
grep "OAI-SearchBot" access.log | wc -l
grep "ChatGPT-User" access.log | wc -l
Типичная картина: GPTBot появляется рывками — молчит неделями, потом за один день выкачивает целый раздел сайта, создавая пиковую нагрузку на сервер без единого перехода читателя. OAI-SearchBot ведёт себя ровнее — регулярно обходит sitemap.xml и часто обновляемые страницы, как обычный поисковый краулер.
Шаг 2. Решайте по каждому боту отдельно — вот рабочая матрица
Не думайте «ИИ» одним блоком. Решение зависит от бизнес-модели страницы:
- Продаёте доступ к контенту (платный гайд, курс, закрытая база) → GPTBot закрыть всегда, OAI-SearchBot — по ситуации (для лендингов открыть, для платного контента закрыть тоже).
- Монетизация через рекламу/партнёрки, трафик = деньги → GPTBot закрыть, OAI-SearchBot и ChatGPT-User держать открытыми — это дополнительный канал, аналогичный органике из Google и Яндекса.
- PBN/инфосайт, задача — максимальный охват и цитируемость → всё открыть, включая GPTBot, если для вас важнее упоминания и косвенный трафик через бренд, чем защита текста.
robots.txt для сценария «трафик из ИИ-поиска, но не отдаём данные на обучение» (самый частый выбор в 2026)
# Разрешаем поиск ChatGPT — это канал трафика
User-agent: OAI-SearchBot
Allow: /
# Запрещаем обучение будущих моделей на нашем контенте
User-agent: GPTBot
Disallow: /
# Разрешаем действия по прямому запросу пользователя
User-agent: ChatGPT-User
Allow: /
Если решили закрыться полностью (например, сайт с платным авторским контентом) — меняете первый и третий блок на Disallow: /. Если хотите максимум охвата — везде Allow: /, но тогда закладывайтесь на рост нагрузки от GPTBot без ответного трафика.
Нишевый разбор: как проверить, что вас реально цитирует ChatGPT Search
Robots.txt разрешил — это не значит, что вас реально показывают. Проверка руками:
- Откройте ChatGPT с включённым поиском, задайте 5–10 запросов из вашей тематики, по которым страница должна ранжироваться.
- Смотрите, попадает ли домен в список источников внизу ответа. Если нет спустя 3–4 недели после открытия OAI-SearchBot — проверьте sitemap.xml на актуальность и убедитесь, что страница вообще проиндексирована в обычном поиске (у OpenAI есть косвенная связь с индексом Bing).
- Проверьте referrer в логах: заходы с
chat.openai.comилиchatgpt.comв Referer — это переходы из диалогов, а не сам краулер.
Если у вас не один сайт, а десяток доменов на PBN, вручную гонять этот чек-лист по каждому — трата времени. Для массовой проверки технического состояния (доступность robots.txt, коды ответа, статус индексации по списку URL сразу по всем доменам) удобнее прогнать пачку через Rush Analytics — быстрее находите домены, где директивы для ботов слетели после обновления CMS или смены хостинга. Для разового точечного разбора одной посадочной — заголовки ответа, robots-директивы, базовые технические ошибки — хватает экспресс‑проверки через PR‑CY.
Типичные ошибки, которые стоят трафика
Disallow: /без указания конкретного User-agent. Такое правило в общем блокеUser-agent: *блокирует не только GPTBot, но и Googlebot с YandexBot. Проверяйте, что директивы для ИИ‑ботов прописаны в отдельных блоках, а не в общем.- SEO‑плагин перезаписывает robots.txt при каждом обновлении. Yoast и аналоги в WordPress иногда сбрасывают кастомные правила при плановых апдейтах — после любого обновления плагина сверяйте файл заново.
- Блок на уровне CDN не совпадает с блоком в robots.txt. См. шаг 1 — Cloudflare, Sucuri и другие WAF могут иметь собственный переключатель «AI bots», который выигрывает у robots.txt.
- Путаница ChatGPT-User и OAI-SearchBot в логах. Оба могут идти с похожим IP‑диапазоном OpenAI — разделяйте строго по строке User-Agent, а не по IP.
- Забыли про Google‑Extended и GoogleOther. Если настраиваете политику для всех ИИ‑краулеров разом, у Google тоже есть отдельный бот для обучения Gemini (
Google-Extended) — логика та же, что с GPTBot, но это другая директива в отдельном блоке.
Для масштабной проверки набора технических параметров
Если управляете сетью сайтов и нужно быстро прогнать проверку robots.txt, кодов ответа и базовых технических параметров без ручного захода на каждый домен — держите под рукой набор инструментов вроде Арсенкин: там есть готовые проверки ответа сервера и синтаксиса robots.txt, которые экономят время при аудите десятков доменов.
Мониторинг: что делать раз в месяц и раз в квартал
- Раз в месяц: считайте хиты по каждому боту через grep из шага 1, сравнивайте с прошлым месяцем — резкий скачок GPTBot без роста трафика от OAI-SearchBot сигнализирует, что кто‑то агрессивно выкачивает раздел.
- Раз в квартал: сверяйте список актуальных User-Agent и IP‑диапазонов на странице https://platform.openai.com/docs/bots — OpenAI добавляет новых ботов без широкого анонса. Также полезно периодически перечитывать Как читать логи сервера для диагностики проблем индексации для уточнения методов.
- После любого редизайна или смены CMS/хостинга: заново проверяйте robots.txt и настройки CDN — это самая частая точка, где правила откатываются к дефолту.
Итог
Решение принимается не «ИИ да/нет», а по каждому из трёх ботов отдельно: GPTBot — вопрос про обучение чужой модели вашими данными, OAI-SearchBot — вопрос про канал трафика, ChatGPT-User — вопрос про удобство ваших читателей. Проверяйте robots.txt и настройки CDN раздельно, тестируйте curl‑запросами, а не верьте файлу на слово, и раз в квартал сверяйтесь с актуальным списком ботов у OpenAI — список расширяется.
