Маркетолог скопировал robots.txt с прошлого проекта: там разрешены только Googlebot и YandexBot, а GPTBot, ClaudeBot и PerplexityBot получают 403. Search Console зелёный, конкуренты цитируются в ChatGPT, а его сайт — нет. Он думал, что «индексация = видимость в нейросетях», и боялся трогать файл: вдруг сломается SEO. На практике хватает 15 минут: найти Disallow, который молча режет AI-краулеры, и добавить пять строк Allow для retrieval-ботов, не меняя правила Googlebot и YandexBot.
robots.txt для AI-краулеров — это не «открыть всё ИИ», а разделить training-ботов (обучение моделей) и retrieval-ботов (поиск и цитирование). Для ChatGPT Search нужен OAI-SearchBot, для Perplexity — PerplexityBot, для Claude — Claude-SearchBot. GPTBot можно заблокировать и остаться в нейропоиске. Googlebot и YandexBot не трогаем — классический SEO сохраняется.
На Habr в 2026 году описали кейс: полгода невидимости в трёх из четырёх AI-поисковиков при идеальной индексации. Причина — whitelist «только Googlebot/YandexBot». Нюанс: ChatGPT-User и Perplexity-User могут игнорировать robots.txt, а Google-Extended не влияет на AI Overviews — они строятся на индексе Googlebot.
AI-краулер заходит на страницы, чтобы обучить модель (training) или собрать факты для нейропоиска (retrieval). robots.txt — текстовый файл в корне сайта: вы правите его в браузере или панели хостинга без программиста.
- Разберите, почему Google в топе, а ChatGPT молчит
- Сравните training-ботов и retrieval-ботов в одной таблице
- Проведите 15-минутный аудит robots.txt без программиста
- Добавьте готовый шаблон: retrieval открыт, training на ваш выбор
- Настройте Яндекс Нейро и Алису без отдельного «нейро-бота»
- Проверьте правки curl-ом и дождитесь обновления индекса
- Частые вопросы
- Чем GPTBot отличается от OAI-SearchBot?
- Можно ли заблокировать GPTBot и остаться в ChatGPT?
- Какие AI-краулеры обязательно разрешить в robots.txt в 2026 году?
- Влияет ли Google-Extended на AI Overviews в Google?
- Как проверить, что PerplexityBot видит сайт?
- Нужен ли отдельный бот для Яндекс Нейро?
Разберите, почему Google в топе, а ChatGPT молчит

Главная боль: сайт в топе Google, но ChatGPT и Perplexity не цитируют бренд. Типичная ошибка — Disallow: / для User-agent: * или whitelist только Googlebot/YandexBot. Retrieval-боты получают 403. На пальцах: Googlebot — курьер в Google, OAI-SearchBot — отдельный курьер в ChatGPT Search. Старый шаблон часто закрывает всем сразу.
Что делать: не трогайте блоки Googlebot и YandexBot. Добавьте отдельные Allow для retrieval-ботов. Классический поиск и AI-настройки живут в разных строках файла.
Сравните training-ботов и retrieval-ботов в одной таблице

Вторая боль — непонятно, кого блокировать, чтобы защитить контент, и кого открыть, чтобы попасть в ответы нейросетей. OpenAI, Anthropic и Perplexity в 2026 году разделяют user-agent по задачам. Настройки независимы: можно запретить обучение и оставить поиск.
| User-agent | Задача | Что делать новичку |
|---|---|---|
| GPTBot | Обучение моделей OpenAI (training) | Disallow, если не хотите отдавать контент в training |
| OAI-SearchBot | ChatGPT Search (retrieval) | Allow — без него сайт не цитируют в поиске ChatGPT |
| PerplexityBot | Индекс Perplexity (retrieval) | Allow — иначе пропадёте из выдачи Perplexity |
| Claude-SearchBot | Поиск в Claude (retrieval) | Allow для видимости в search Claude |
| ClaudeBot | Обучение Anthropic (training) | Disallow по желанию владельца контента |
| Google-Extended | Gemini training/grounding, не отдельный HTTP-бот | Отдельное решение: не влияет на AI Overviews и ранжирование в Google Search |
ChatGPT-User и Perplexity-User могут игнорировать robots.txt — они идут по запросу пользователя. Индекс для цитирования всё равно строят retrieval-боты. По devformat.tools, в июне 2026 года 25 из 107 крупных сайтов блокировали Google-Extended (23,4%), думая, что так отключат AI Overviews.
Проведите 15-минутный аудит robots.txt без программиста

Третья боль — не знаете, с чего начать и боитесь сломать SEO. Аудит — это чеклист, а не разработка. Например, откройте файл, выпишите все User-agent и Disallow, отметьте, кого режет общее правило для *.
- Шаг 1: Откройте https://ваш-домен.ru/robots.txt в браузере и сохраните копию «до правок».
- Шаг 2: Найдите User-agent: * с Disallow: / — это закрывает всех, кроме явно разрешённых ботов.
- Шаг 3: Проверьте, есть ли отдельные блоки для OAI-SearchBot, PerplexityBot, Claude-SearchBot.
- Шаг 4: Убедитесь, что Googlebot и YandexBot по-прежнему Allow: /.
- Шаг 5: Решите про training: GPTBot и ClaudeBot — Disallow или Allow по вашей политике контента.
На GitHub проект ai.robots.txt (4000+ stars) держит актуальный список AI user-agents. CLI robots-txt-validator проверяет allow/disallow для GPTBot и PerplexityBot — если терминал пугает, хватит чеклиста выше.
Добавьте готовый шаблон: retrieval открыт, training на ваш выбор
Четвёртая боль — «дайте строки, которые можно вставить». Ниже блок из официальных рекомендаций OpenAI, Perplexity, Anthropic и кейса Habr. Скопируйте в конец robots.txt, не удаляя существующие правила для Googlebot и YandexBot.
Шаблон robots.txt для GEO:
# Классический поиск — не трогаем
User-agent: Googlebot
Allow: /
User-agent: YandexBot
Allow: /
# GEO: разрешаем цитирование в AI search
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Опционально: блокируем обучение моделей
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Gemini training — отдельно от Google Search
User-agent: Google-Extended
Allow: /
Типичная ошибка — Disallow для OAI-SearchBot вместо GPTBot. Это разные user-agent. Дополните robots.txt файлом llms.txt (гайд B09, href после стабильной отдачи на сайте) и общий чек-лист GEO-оптимизации 2026 (B04).
Настройте Яндекс Нейро и Алису без отдельного «нейро-бота»
Пятая боль — «какой user-agent у Яндекс Нейро?». Отдельного краулера нет: Нейро и Алиса строятся на страницах, которые уже проиндексировал YandexBot. Значит, не блокируйте YandexBot, если хотите попадать в AI-ответы Яндекса.
Opt-out — через YandexAdditionalBot на конкретные URL. Обновление robots.txt для Yandex AI: 2-14 дней на переобход.
Проверьте правки curl-ом и дождитесь обновления индекса
Шестая боль — непонятно, сработало ли. Проверка без разработчика: имитация запроса от имени бота и просмотр кода ответа HTTP.
Схема проверки:
Правка robots.txt → curl с User-Agent OAI-SearchBot/PerplexityBot → ожидаем HTTP 200 на ключевую страницу → ждём ~24 ч (OpenAI/Perplexity) или 2-14 дней (Яндекс AI) → тестовый запрос в ChatGPT/Perplexity с уникальной фразой со страницы
Команды для терминала Mac/Linux или панели хостинга (замените домен):
- curl -A «OAI-SearchBot» -I https://ваш-домен.ru/
- curl -A «PerplexityBot» -I https://ваш-домен.ru/
- curl -A «GPTBot» -I https://ваш-домен.ru/ — смотрите, 200 или 403 по вашей политике training
Часто ломается CDN или WAF: 403 AI user-agents при Allow в файле. Проверьте логи: grep по GPTBot, OAI-SearchBot, PerplexityBot.
Результат, который получите до FAQ: в robots.txt разрешены OAI-SearchBot, PerplexityBot, Claude-SearchBot; curl даёт 200; вы понимаете, что блок GPTBot не убирает сайт из ChatGPT Search. Раз в квартал пересматривайте список ботов.
Вопросы по настройке под ваш сайт — через форму на сайте или в Telegram канале про AI-маркетинг.
Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Источники и ограничения: OpenAI Crawlers docs (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic Help Center (ClaudeBot, Claude-SearchBot), Google Developers (Google-Extended), Perplexity Crawlers docs, справка Яндекс Вебмастера (Yandex AI, Алиса), кейс Habr 1063216, статистика devformat.tools (июнь 2026); частотность запросов — Яндекс Вордстат недоступен на 06.08.2026 (MCP auth).
Частые вопросы
Чем GPTBot отличается от OAI-SearchBot?
GPTBot собирает контент для обучения foundation models. OAI-SearchBot — для ChatGPT Search и цитирования в ответах. Это разные user-agent: можно Disallow для GPTBot и Allow для OAI-SearchBot, чтобы защитить контент от training и остаться в нейропоиске OpenAI.
Можно ли заблокировать GPTBot и остаться в ChatGPT?
Да, если открыт OAI-SearchBot. Блокировка GPTBot не убирает сайт из ChatGPT Search. Не путайте training-бота и search-бота — в robots.txt нужны отдельные строки для каждого.
Какие AI-краулеры обязательно разрешить в robots.txt в 2026 году?
Минимум для GEO: OAI-SearchBot (ChatGPT Search), PerplexityBot, Claude-SearchBot. Googlebot и YandexBot — для классического поиска. GPTBot, ClaudeBot и Google-Extended — по вашей политике training, не по принципу «закрыть всё».
Влияет ли Google-Extended на AI Overviews в Google?
Нет. AI Overviews строятся на индексе Googlebot. Google-Extended — product token для Gemini training/grounding, не отдельный HTTP-краулер и не рычаг ранжирования в Google Search.
Как проверить, что PerplexityBot видит сайт?
Выполните curl -A «PerplexityBot» -I https://ваш-домен.ru/ и убедитесь в HTTP 200 на публичную страницу. Проверьте, что в robots.txt есть Allow для PerplexityBot и что CDN/WAF не отдаёт 403. Обновление у Perplexity — до 24 часов.
Нужен ли отдельный бот для Яндекс Нейро?
Нет. Нейро и Алиса используют страницы из индекса YandexBot. Не блокируйте YandexBot. Для opt-out из AI-ответов на отдельные URL используйте YandexAdditionalBot по справке Вебмастера.
