Как настроить robots.txt для AI-краулеров: чек-лист для попадания в ответы ChatGPT и Perplexity

ai kraulery robots txt dlya geo cover Без рубрики
Пошаговый чек-лист robots.txt для AI-краулеров: разделите training и retrieval, добавьте Allow для OAI-SearchBot и PerplexityBot, проверьте curl без программиста.

Маркетолог скопировал robots.txt с прошлого проекта: там разрешены только Googlebot и YandexBot, а GPTBot, ClaudeBot и PerplexityBot получают 403. Search Console зелёный, конкуренты цитируются в ChatGPT, а его сайт — нет. Он думал, что «индексация = видимость в нейросетях», и боялся трогать файл: вдруг сломается SEO. На практике хватает 15 минут: найти Disallow, который молча режет AI-краулеры, и добавить пять строк Allow для retrieval-ботов, не меняя правила Googlebot и YandexBot.

robots.txt для AI-краулеров — это не «открыть всё ИИ», а разделить training-ботов (обучение моделей) и retrieval-ботов (поиск и цитирование). Для ChatGPT Search нужен OAI-SearchBot, для Perplexity — PerplexityBot, для Claude — Claude-SearchBot. GPTBot можно заблокировать и остаться в нейропоиске. Googlebot и YandexBot не трогаем — классический SEO сохраняется.

На Habr в 2026 году описали кейс: полгода невидимости в трёх из четырёх AI-поисковиков при идеальной индексации. Причина — whitelist «только Googlebot/YandexBot». Нюанс: ChatGPT-User и Perplexity-User могут игнорировать robots.txt, а Google-Extended не влияет на AI Overviews — они строятся на индексе Googlebot.

AI-краулер заходит на страницы, чтобы обучить модель (training) или собрать факты для нейропоиска (retrieval). robots.txt — текстовый файл в корне сайта: вы правите его в браузере или панели хостинга без программиста.

Разберите, почему Google в топе, а ChatGPT молчит

Дашборд: Google индексирует, ChatGPT молчит — причина в robots.txt

Главная боль: сайт в топе Google, но ChatGPT и Perplexity не цитируют бренд. Типичная ошибка — Disallow: / для User-agent: * или whitelist только Googlebot/YandexBot. Retrieval-боты получают 403. На пальцах: Googlebot — курьер в Google, OAI-SearchBot — отдельный курьер в ChatGPT Search. Старый шаблон часто закрывает всем сразу.

Что делать: не трогайте блоки Googlebot и YandexBot. Добавьте отдельные Allow для retrieval-ботов. Классический поиск и AI-настройки живут в разных строках файла.

Сравните training-ботов и retrieval-ботов в одной таблице

Таблица сравнения training-ботов и retrieval-ботов для robots.txt

Вторая боль — непонятно, кого блокировать, чтобы защитить контент, и кого открыть, чтобы попасть в ответы нейросетей. OpenAI, Anthropic и Perplexity в 2026 году разделяют user-agent по задачам. Настройки независимы: можно запретить обучение и оставить поиск.

User-agent Задача Что делать новичку
GPTBot Обучение моделей OpenAI (training) Disallow, если не хотите отдавать контент в training
OAI-SearchBot ChatGPT Search (retrieval) Allow — без него сайт не цитируют в поиске ChatGPT
PerplexityBot Индекс Perplexity (retrieval) Allow — иначе пропадёте из выдачи Perplexity
Claude-SearchBot Поиск в Claude (retrieval) Allow для видимости в search Claude
ClaudeBot Обучение Anthropic (training) Disallow по желанию владельца контента
Google-Extended Gemini training/grounding, не отдельный HTTP-бот Отдельное решение: не влияет на AI Overviews и ранжирование в Google Search

ChatGPT-User и Perplexity-User могут игнорировать robots.txt — они идут по запросу пользователя. Индекс для цитирования всё равно строят retrieval-боты. По devformat.tools, в июне 2026 года 25 из 107 крупных сайтов блокировали Google-Extended (23,4%), думая, что так отключат AI Overviews.

Проведите 15-минутный аудит robots.txt без программиста

Чеклист 15-минутного аудита robots.txt для AI-краулеров

Третья боль — не знаете, с чего начать и боитесь сломать SEO. Аудит — это чеклист, а не разработка. Например, откройте файл, выпишите все User-agent и Disallow, отметьте, кого режет общее правило для *.

  1. Шаг 1: Откройте https://ваш-домен.ru/robots.txt в браузере и сохраните копию «до правок».
  2. Шаг 2: Найдите User-agent: * с Disallow: / — это закрывает всех, кроме явно разрешённых ботов.
  3. Шаг 3: Проверьте, есть ли отдельные блоки для OAI-SearchBot, PerplexityBot, Claude-SearchBot.
  4. Шаг 4: Убедитесь, что Googlebot и YandexBot по-прежнему Allow: /.
  5. Шаг 5: Решите про training: GPTBot и ClaudeBot — Disallow или Allow по вашей политике контента.

На GitHub проект ai.robots.txt (4000+ stars) держит актуальный список AI user-agents. CLI robots-txt-validator проверяет allow/disallow для GPTBot и PerplexityBot — если терминал пугает, хватит чеклиста выше.

Добавьте готовый шаблон: retrieval открыт, training на ваш выбор

Четвёртая боль — «дайте строки, которые можно вставить». Ниже блок из официальных рекомендаций OpenAI, Perplexity, Anthropic и кейса Habr. Скопируйте в конец robots.txt, не удаляя существующие правила для Googlebot и YandexBot.

Шаблон robots.txt для GEO:
# Классический поиск — не трогаем
User-agent: Googlebot
Allow: /
User-agent: YandexBot
Allow: /
# GEO: разрешаем цитирование в AI search
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Опционально: блокируем обучение моделей
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Gemini training — отдельно от Google Search
User-agent: Google-Extended
Allow: /

Типичная ошибка — Disallow для OAI-SearchBot вместо GPTBot. Это разные user-agent. Дополните robots.txt файлом llms.txt (гайд B09, href после стабильной отдачи на сайте) и общий чек-лист GEO-оптимизации 2026 (B04).

Настройте Яндекс Нейро и Алису без отдельного «нейро-бота»

Пятая боль — «какой user-agent у Яндекс Нейро?». Отдельного краулера нет: Нейро и Алиса строятся на страницах, которые уже проиндексировал YandexBot. Значит, не блокируйте YandexBot, если хотите попадать в AI-ответы Яндекса.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)

Opt-out — через YandexAdditionalBot на конкретные URL. Обновление robots.txt для Yandex AI: 2-14 дней на переобход.

Проверьте правки curl-ом и дождитесь обновления индекса

Шестая боль — непонятно, сработало ли. Проверка без разработчика: имитация запроса от имени бота и просмотр кода ответа HTTP.

Схема проверки:
Правка robots.txt → curl с User-Agent OAI-SearchBot/PerplexityBot → ожидаем HTTP 200 на ключевую страницу → ждём ~24 ч (OpenAI/Perplexity) или 2-14 дней (Яндекс AI) → тестовый запрос в ChatGPT/Perplexity с уникальной фразой со страницы

Команды для терминала Mac/Linux или панели хостинга (замените домен):

  • curl -A «OAI-SearchBot» -I https://ваш-домен.ru/
  • curl -A «PerplexityBot» -I https://ваш-домен.ru/
  • curl -A «GPTBot» -I https://ваш-домен.ru/ — смотрите, 200 или 403 по вашей политике training

Часто ломается CDN или WAF: 403 AI user-agents при Allow в файле. Проверьте логи: grep по GPTBot, OAI-SearchBot, PerplexityBot.

Результат, который получите до FAQ: в robots.txt разрешены OAI-SearchBot, PerplexityBot, Claude-SearchBot; curl даёт 200; вы понимаете, что блок GPTBot не убирает сайт из ChatGPT Search. Раз в квартал пересматривайте список ботов.

Вопросы по настройке под ваш сайт — через форму на сайте или в Telegram канале про AI-маркетинг.

Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Источники и ограничения: OpenAI Crawlers docs (GPTBot, OAI-SearchBot, ChatGPT-User), Anthropic Help Center (ClaudeBot, Claude-SearchBot), Google Developers (Google-Extended), Perplexity Crawlers docs, справка Яндекс Вебмастера (Yandex AI, Алиса), кейс Habr 1063216, статистика devformat.tools (июнь 2026); частотность запросов — Яндекс Вордстат недоступен на 06.08.2026 (MCP auth).

Частые вопросы

Чем GPTBot отличается от OAI-SearchBot?

GPTBot собирает контент для обучения foundation models. OAI-SearchBot — для ChatGPT Search и цитирования в ответах. Это разные user-agent: можно Disallow для GPTBot и Allow для OAI-SearchBot, чтобы защитить контент от training и остаться в нейропоиске OpenAI.

Можно ли заблокировать GPTBot и остаться в ChatGPT?

Да, если открыт OAI-SearchBot. Блокировка GPTBot не убирает сайт из ChatGPT Search. Не путайте training-бота и search-бота — в robots.txt нужны отдельные строки для каждого.

Какие AI-краулеры обязательно разрешить в robots.txt в 2026 году?

Минимум для GEO: OAI-SearchBot (ChatGPT Search), PerplexityBot, Claude-SearchBot. Googlebot и YandexBot — для классического поиска. GPTBot, ClaudeBot и Google-Extended — по вашей политике training, не по принципу «закрыть всё».

Влияет ли Google-Extended на AI Overviews в Google?

Нет. AI Overviews строятся на индексе Googlebot. Google-Extended — product token для Gemini training/grounding, не отдельный HTTP-краулер и не рычаг ранжирования в Google Search.

Как проверить, что PerplexityBot видит сайт?

Выполните curl -A «PerplexityBot» -I https://ваш-домен.ru/ и убедитесь в HTTP 200 на публичную страницу. Проверьте, что в robots.txt есть Allow для PerplexityBot и что CDN/WAF не отдаёт 403. Обновление у Perplexity — до 24 часов.

Нужен ли отдельный бот для Яндекс Нейро?

Нет. Нейро и Алиса используют страницы из индекса YandexBot. Не блокируйте YandexBot. Для opt-out из AI-ответов на отдельные URL используйте YandexAdditionalBot по справке Вебмастера.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)
Новый маркетинг с искусственным интеллектом
Добавить комментарий