Клиент полгода держится в топ-3 Google, а в ChatGPT о его компании ни слова. В логах сервера GPTBot, ClaudeBot и PerplexityBot стабильно получают 403: в robots.txt разрешены только Googlebot и YandexBot. Search Console зелёный, а нейропоиск молчит. За 15 минут вы откроете robots.txt, разделите ботов на «цитирование» и «обучение», добавите явные Allow для search-краулеров и проверите ответ сервера одной командой curl.
Сайт может быть в индексе Google и оставаться невидимым для ChatGPT, Perplexity и Claude. OpenAI и Anthropic разделяют training и search на уровне robots.txt: GPTBot и OAI-SearchBot настраиваются независимо. Разрешите OAI-SearchBot, PerplexityBot и Claude-SearchBot для цитирования, а GPTBot и ClaudeBot закройте, если не хотите отдавать контент на обучение моделей.
Типичная ошибка: считать, что SEO-аудит закрывает видимость в нейросетях. Вебмастер не покажет, что AI-боты бьются о Disallow. Неожиданный нюанс из docs OpenAI: ChatGPT-User может не подчиняться robots.txt так строго, как автоматические краулеры. Зато OAI-SearchBot, GPTBot, PerplexityBot и Claude-SearchBot правила читают — их вы и настраиваете в корне сайта.
- Разберите, почему топ Google не равен цитированию в нейросетях
- Сравните карту AI-ботов 2026: кого пускать, кого закрыть
- Проведите аудит robots.txt за пять минут без разработчика
- Выберите один из трёх шаблонов robots.txt под вашу политику
- Убедитесь, что правки сработали: тесты, сроки и ложные блокировки
- Пройдите чек-лист маркетолога перед публикацией правок
- Частые вопросы
- Чем GPTBot отличается от OAI-SearchBot?
- Блокирует ли Disallow для GPTBot цитирование в ChatGPT?
- Как разрешить PerplexityBot на сайте?
- Нужно ли разрешать Google-Extended?
- Чем PerplexityBot отличается от Perplexity-User?
- Как часто пересматривать robots.txt для AI-ботов?
Разберите, почему топ Google не равен цитированию в нейросетях

Боль звучит так: «В Google всё ок, ChatGPT меня не знает». Причина часто в старом robots.txt: User-agent: * плюс Disallow: / или whitelist только для Googlebot и YandexBot. AI-краулеры не получают явного Allow и уходят с 403. В Search Console этого не видно — там другая аудитория ботов.
Две категории, которые маркетологу важно не смешивать:
- Search-краулеры — собирают страницы для ответов в AI-поиске (цитирование, ссылки в ответе). Примеры: OAI-SearchBot, PerplexityBot, Claude-SearchBot.
- Training-краулеры — качают контент для обучения foundation models. Примеры: GPTBot, ClaudeBot, Google-Extended (токен для Gemini training).
На практике пять строк Allow для search-ботов занимают 15 минут — сделайте это первым шагом после аудита. Используйте таблицу ниже как ориентир: эффект в AI-поиске часто виден через ~2 недели, Google при этом не страдает.
Сравните карту AI-ботов 2026: кого пускать, кого закрыть

Ниже — рабочая таблица на август 2026. Токены User-agent берите дословно: одна опечатка, и бот читает файл как «не для меня».
| Бот (User-agent) | Задача | Рекомендация маркетологу |
|---|---|---|
| OAI-SearchBot | Индекс для ChatGPT Search, цитирование в ответах | Allow, если нужна видимость в OpenAI-поиске |
| GPTBot | Обучение foundation models OpenAI | Disallow, если не хотите отдавать контент на обучение |
| PerplexityBot | Индексация для ответов Perplexity | Allow для GEO; при блоке возможен только заголовок страницы |
| Claude-SearchBot | Поиск и цитирование в Claude | Allow для видимости в search results Claude |
| ClaudeBot | Обучение моделей Anthropic | Отдельное решение: Disallow без вреда для Claude-SearchBot |
| Google-Extended | Training и grounding Gemini (нет отдельного HTTP user-agent) | Disallow, если не хотите участвовать в обучении Gemini; на Google Search не влияет |
| Googlebot | Классический поиск Google | Не трогать без веской причины — это ваш SEO |
Итог по таблице: для GEO чаще всего выбирают схему «цитировать без обучения» — Allow search-ботам, Disallow training-ботам. Googlebot и YandexBot оставляют как есть.
На GitHub ai.robots.txt (4000+ stars) — актуальный список user-agents; сверяйтесь, если копировали чужой шаблон 2024 года.
Проведите аудит robots.txt за пять минут без разработчика

Откройте в браузере ваш-сайт.ru/robots.txt и проверьте красные флаги. Не делайте выводы только по Search Console — там другая аудитория ботов:
- User-agent: * с Disallow: / внизу файла без явных Allow выше — режет всех, включая AI.
- Whitelist только Googlebot и YandexBot — остальные боты по умолчанию не приглашены.
- Скопированный «анти-AI» шаблон с GitHub, где Disallow на десятки ботов — вы могли закрыть и search-краулеры.
Проверка ответа сервера (скопируйте в терминал Mac или в онлайн-консоль хостинга, подставьте свой домен):
curl -A «OAI-SearchBot» -I https://ваш-домен.ru/
curl -A «GPTBot» -I https://ваш-домен.ru/
curl -A «PerplexityBot» -I https://ваш-домен.ru/
Нужен код 200, не 403. Если robots.txt выглядит открытым, а curl даёт 403 — избегайте паники: сначала проверьте CDN и WAF. У Cloudflare есть переключатель Block AI Bots, который игнорирует ваши Allow. IP-блокировка Anthropic-ботов ненадёжна — официально рекомендуют именно robots.txt.
Ловушка: страницы только через JS без серверного HTML — краулеры их часто не видят.
Выберите один из трёх шаблонов robots.txt под вашу политику
Шаблон A — полный GEO-доступ (все search- и training-боты могут ходить):
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
Шаблон B — цитировать без обучения (самый частый выбор для блога и лендингов):
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Шаблон C — селективный доступ (только блог открыт, админка и корзина закрыты):
User-agent: OAI-SearchBot
Allow: /blog/
Disallow: /admin/
Disallow: /cart/
User-agent: PerplexityBot
Allow: /blog/
Disallow: /admin/
Disallow: /cart/
На WordPress и Tilda правят файл в SEO-плагине или через панель хостинга. OpenAI применяет правила ~24 часа.
Убедитесь, что правки сработали: тесты, сроки и ложные блокировки
Критерии успеха: по ним вы поймёте, что получите видимость в AI-поиске, и сможете отличить «цитирование» от «обучения»:
- В robots.txt есть отдельные блоки User-agent для OAI-SearchBot, PerplexityBot и Claude-SearchBot с Allow.
- curl -A «OAI-SearchBot» -I https://ваш-домен/ возвращает 200, не 403.
- В логах сервера за две недели видны заходы GPTBot, PerplexityBot или OAI-SearchBot с кодом 200 (если вы их не закрывали полностью).
- Вы понимаете разницу: Disallow для GPTBot не блокирует цитирование через OAI-SearchBot — это разные настройки.
- Google-Extended отключён осознанно и вы не ждёте просадки в Google Search — product token не влияет на ранжирование.
OpenAI публикует IP в searchbot.json и gptbot.json. Свяжите robots.txt с llms.txt и GEO-чеклистом — это дополнение к Allow, не замена (href на материалы B09 и B04 восстановите после публикации на сайте).
Пройдите чек-лист маркетолога перед публикацией правок
- Открыли /robots.txt и сохранили копию до правок.
- Проверили User-agent: * с Disallow: / без исключений.
- Добавили Allow для OAI-SearchBot, PerplexityBot, Claude-SearchBot.
- Отдельно решили по GPTBot, ClaudeBot и Google-Extended.
- Не перепутали Googlebot с Google-Extended.
- Запустили curl-тесты с тремя user-agent.
- Проверили Cloudflare и WAF на Block AI Bots.
- Убедились, что страницы отдают HTML, а не чистый JS.
- Сверили ботов с ai.robots.txt на GitHub.
- Добавили Google-GeminiNotebook в шаблон 2026.
- Проверили логи через 24 часа и через 2 недели.
- Обновили llms.txt при смене структуры сайта.
- Пересмотр файла раз в квартал.
- Disallow для /admin/ не перекрывает Allow для /blog/.
- robots.txt доступен по HTTPS без редиректа в петлю.
- Сравнили ответ для главной и статьи блога.
- Зафиксировали: SEO-индекс и AI-видимость — разные метрики.
- Проверили селективный шаблон C на типовой статье.
- Согласовали политику с юристом при персональных данных.
- Нужен внешний GEO-аудит — заявка или Telegram.
Без открытого robots.txt даже сильная SEO-статья остаётся за бортом AI-поиска, пока search-боты видят 403.
Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Достоверность данных: OpenAI Crawlers docs (developers.openai.com/api/docs/bots), Anthropic Privacy Center, Google Developers (Google-Extended), Perplexity Help Center, Habr (кейс 403, август 2026), GitHub ai.robots.txt; частотность запросов — по Яндекс Вордстат на август 2026 (MCP недоступен, LSI через WebSearch).
Частые вопросы
Чем GPTBot отличается от OAI-SearchBot?
GPTBot качает страницы для обучения моделей OpenAI. OAI-SearchBot строит индекс для ChatGPT Search и цитирования в ответах. В robots.txt это независимые блоки: можно Disallow GPTBot и оставить Allow для OAI-SearchBot.
Блокирует ли Disallow для GPTBot цитирование в ChatGPT?
Нет, если OAI-SearchBot разрешён. Блок GPTBot закрывает только training. Для ответов в поиске ChatGPT нужен именно OAI-SearchBot.
Как разрешить PerplexityBot на сайте?
Добавьте блок User-agent: PerplexityBot и строку Allow: / (или Allow для нужных разделов). Сохраните файл и проверьте curl -A «PerplexityBot» -I https://ваш-домен/ — должен быть 200.
Нужно ли разрешать Google-Extended?
Только если вы хотите участвовать в обучении и grounding Gemini. На позиции в Google Search Google-Extended не влияет — это отдельный product token, не путайте с Googlebot.
Чем PerplexityBot отличается от Perplexity-User?
PerplexityBot — автоматический краулер для индекса, он следует robots.txt. Perplexity-User похож на запрос по ссылке от пользователя и может вести себя иначе. Для GEO настраивайте в первую очередь PerplexityBot.
Как часто пересматривать robots.txt для AI-ботов?
Минимум раз в квартал и сразу после смены CMS, CDN или копирования чужого шаблона. Список user-agents в 2026 обновляется быстро — сверяйтесь с официальными docs OpenAI, Anthropic и community-списком на GitHub.
