Как настроить robots.txt для AI-краулеров GPTBot и OAI-SearchBot?

ai kraulery robots txt cover Без рубрики
Пошаговый гайд: разделите search- и training-ботов, добавьте Allow для OAI-SearchBot и PerplexityBot, проверьте curl и закройте GPTBot без потери цитирования.

Клиент полгода держится в топ-3 Google, а в ChatGPT о его компании ни слова. В логах сервера GPTBot, ClaudeBot и PerplexityBot стабильно получают 403: в robots.txt разрешены только Googlebot и YandexBot. Search Console зелёный, а нейропоиск молчит. За 15 минут вы откроете robots.txt, разделите ботов на «цитирование» и «обучение», добавите явные Allow для search-краулеров и проверите ответ сервера одной командой curl.

Сайт может быть в индексе Google и оставаться невидимым для ChatGPT, Perplexity и Claude. OpenAI и Anthropic разделяют training и search на уровне robots.txt: GPTBot и OAI-SearchBot настраиваются независимо. Разрешите OAI-SearchBot, PerplexityBot и Claude-SearchBot для цитирования, а GPTBot и ClaudeBot закройте, если не хотите отдавать контент на обучение моделей.

Типичная ошибка: считать, что SEO-аудит закрывает видимость в нейросетях. Вебмастер не покажет, что AI-боты бьются о Disallow. Неожиданный нюанс из docs OpenAI: ChatGPT-User может не подчиняться robots.txt так строго, как автоматические краулеры. Зато OAI-SearchBot, GPTBot, PerplexityBot и Claude-SearchBot правила читают — их вы и настраиваете в корне сайта.

Разберите, почему топ Google не равен цитированию в нейросетях

Сравнение: топ Google и отсутствие цитирования в нейросетях — search vs training краулеры

Боль звучит так: «В Google всё ок, ChatGPT меня не знает». Причина часто в старом robots.txt: User-agent: * плюс Disallow: / или whitelist только для Googlebot и YandexBot. AI-краулеры не получают явного Allow и уходят с 403. В Search Console этого не видно — там другая аудитория ботов.

Две категории, которые маркетологу важно не смешивать:

  • Search-краулеры — собирают страницы для ответов в AI-поиске (цитирование, ссылки в ответе). Примеры: OAI-SearchBot, PerplexityBot, Claude-SearchBot.
  • Training-краулеры — качают контент для обучения foundation models. Примеры: GPTBot, ClaudeBot, Google-Extended (токен для Gemini training).

На практике пять строк Allow для search-ботов занимают 15 минут — сделайте это первым шагом после аудита. Используйте таблицу ниже как ориентир: эффект в AI-поиске часто виден через ~2 недели, Google при этом не страдает.

Сравните карту AI-ботов 2026: кого пускать, кого закрыть

Таблица AI-ботов 2026: кого пускать в robots.txt, кого закрыть

Ниже — рабочая таблица на август 2026. Токены User-agent берите дословно: одна опечатка, и бот читает файл как «не для меня».

Бот (User-agent) Задача Рекомендация маркетологу
OAI-SearchBot Индекс для ChatGPT Search, цитирование в ответах Allow, если нужна видимость в OpenAI-поиске
GPTBot Обучение foundation models OpenAI Disallow, если не хотите отдавать контент на обучение
PerplexityBot Индексация для ответов Perplexity Allow для GEO; при блоке возможен только заголовок страницы
Claude-SearchBot Поиск и цитирование в Claude Allow для видимости в search results Claude
ClaudeBot Обучение моделей Anthropic Отдельное решение: Disallow без вреда для Claude-SearchBot
Google-Extended Training и grounding Gemini (нет отдельного HTTP user-agent) Disallow, если не хотите участвовать в обучении Gemini; на Google Search не влияет
Googlebot Классический поиск Google Не трогать без веской причины — это ваш SEO

Итог по таблице: для GEO чаще всего выбирают схему «цитировать без обучения» — Allow search-ботам, Disallow training-ботам. Googlebot и YandexBot оставляют как есть.

На GitHub ai.robots.txt (4000+ stars) — актуальный список user-agents; сверяйтесь, если копировали чужой шаблон 2024 года.

Проведите аудит robots.txt за пять минут без разработчика

Чек-лист аудита robots.txt за 5 минут: curl-тесты и красные флаги

Откройте в браузере ваш-сайт.ru/robots.txt и проверьте красные флаги. Не делайте выводы только по Search Console — там другая аудитория ботов:

  • User-agent: * с Disallow: / внизу файла без явных Allow выше — режет всех, включая AI.
  • Whitelist только Googlebot и YandexBot — остальные боты по умолчанию не приглашены.
  • Скопированный «анти-AI» шаблон с GitHub, где Disallow на десятки ботов — вы могли закрыть и search-краулеры.

Проверка ответа сервера (скопируйте в терминал Mac или в онлайн-консоль хостинга, подставьте свой домен):

curl -A «OAI-SearchBot» -I https://ваш-домен.ru/
curl -A «GPTBot» -I https://ваш-домен.ru/
curl -A «PerplexityBot» -I https://ваш-домен.ru/

Нужен код 200, не 403. Если robots.txt выглядит открытым, а curl даёт 403 — избегайте паники: сначала проверьте CDN и WAF. У Cloudflare есть переключатель Block AI Bots, который игнорирует ваши Allow. IP-блокировка Anthropic-ботов ненадёжна — официально рекомендуют именно robots.txt.

Ловушка: страницы только через JS без серверного HTML — краулеры их часто не видят.

Выберите один из трёх шаблонов robots.txt под вашу политику

Шаблон A — полный GEO-доступ (все search- и training-боты могут ходить):

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)

User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /

Шаблон B — цитировать без обучения (самый частый выбор для блога и лендингов):

User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /

Шаблон C — селективный доступ (только блог открыт, админка и корзина закрыты):

User-agent: OAI-SearchBot
Allow: /blog/
Disallow: /admin/
Disallow: /cart/
User-agent: PerplexityBot
Allow: /blog/
Disallow: /admin/
Disallow: /cart/

На WordPress и Tilda правят файл в SEO-плагине или через панель хостинга. OpenAI применяет правила ~24 часа.

Убедитесь, что правки сработали: тесты, сроки и ложные блокировки

Критерии успеха: по ним вы поймёте, что получите видимость в AI-поиске, и сможете отличить «цитирование» от «обучения»:

  1. В robots.txt есть отдельные блоки User-agent для OAI-SearchBot, PerplexityBot и Claude-SearchBot с Allow.
  2. curl -A «OAI-SearchBot» -I https://ваш-домен/ возвращает 200, не 403.
  3. В логах сервера за две недели видны заходы GPTBot, PerplexityBot или OAI-SearchBot с кодом 200 (если вы их не закрывали полностью).
  4. Вы понимаете разницу: Disallow для GPTBot не блокирует цитирование через OAI-SearchBot — это разные настройки.
  5. Google-Extended отключён осознанно и вы не ждёте просадки в Google Search — product token не влияет на ранжирование.

OpenAI публикует IP в searchbot.json и gptbot.json. Свяжите robots.txt с llms.txt и GEO-чеклистом — это дополнение к Allow, не замена (href на материалы B09 и B04 восстановите после публикации на сайте).

Пройдите чек-лист маркетолога перед публикацией правок

  1. Открыли /robots.txt и сохранили копию до правок.
  2. Проверили User-agent: * с Disallow: / без исключений.
  3. Добавили Allow для OAI-SearchBot, PerplexityBot, Claude-SearchBot.
  4. Отдельно решили по GPTBot, ClaudeBot и Google-Extended.
  5. Не перепутали Googlebot с Google-Extended.
  6. Запустили curl-тесты с тремя user-agent.
  7. Проверили Cloudflare и WAF на Block AI Bots.
  8. Убедились, что страницы отдают HTML, а не чистый JS.
  9. Сверили ботов с ai.robots.txt на GitHub.
  10. Добавили Google-GeminiNotebook в шаблон 2026.
  11. Проверили логи через 24 часа и через 2 недели.
  12. Обновили llms.txt при смене структуры сайта.
  13. Пересмотр файла раз в квартал.
  14. Disallow для /admin/ не перекрывает Allow для /blog/.
  15. robots.txt доступен по HTTPS без редиректа в петлю.
  16. Сравнили ответ для главной и статьи блога.
  17. Зафиксировали: SEO-индекс и AI-видимость — разные метрики.
  18. Проверили селективный шаблон C на типовой статье.
  19. Согласовали политику с юристом при персональных данных.
  20. Нужен внешний GEO-аудит — заявка или Telegram.

Без открытого robots.txt даже сильная SEO-статья остаётся за бортом AI-поиска, пока search-боты видят 403.

Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Достоверность данных: OpenAI Crawlers docs (developers.openai.com/api/docs/bots), Anthropic Privacy Center, Google Developers (Google-Extended), Perplexity Help Center, Habr (кейс 403, август 2026), GitHub ai.robots.txt; частотность запросов — по Яндекс Вордстат на август 2026 (MCP недоступен, LSI через WebSearch).

Частые вопросы

Чем GPTBot отличается от OAI-SearchBot?

GPTBot качает страницы для обучения моделей OpenAI. OAI-SearchBot строит индекс для ChatGPT Search и цитирования в ответах. В robots.txt это независимые блоки: можно Disallow GPTBot и оставить Allow для OAI-SearchBot.

Блокирует ли Disallow для GPTBot цитирование в ChatGPT?

Нет, если OAI-SearchBot разрешён. Блок GPTBot закрывает только training. Для ответов в поиске ChatGPT нужен именно OAI-SearchBot.

Как разрешить PerplexityBot на сайте?

Добавьте блок User-agent: PerplexityBot и строку Allow: / (или Allow для нужных разделов). Сохраните файл и проверьте curl -A «PerplexityBot» -I https://ваш-домен/ — должен быть 200.

Нужно ли разрешать Google-Extended?

Только если вы хотите участвовать в обучении и grounding Gemini. На позиции в Google Search Google-Extended не влияет — это отдельный product token, не путайте с Googlebot.

Чем PerplexityBot отличается от Perplexity-User?

PerplexityBot — автоматический краулер для индекса, он следует robots.txt. Perplexity-User похож на запрос по ссылке от пользователя и может вести себя иначе. Для GEO настраивайте в первую очередь PerplexityBot.

Как часто пересматривать robots.txt для AI-ботов?

Минимум раз в квартал и сразу после смены CMS, CDN или копирования чужого шаблона. Список user-agents в 2026 обновляется быстро — сверяйтесь с официальными docs OpenAI, Anthropic и community-списком на GitHub.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)
Новый маркетинг с искусственным интеллектом
Добавить комментарий