Как настроить robots.txt для AI-краулеров: чек-лист GEO-видимости в ChatGPT и Perplexity

robots txt ai kraulery geo cover Без рубрики
Пошаговый чек-лист robots.txt для AI-ботов: GPTBot vs OAI-SearchBot, шаблон «цитирование да, обучение нет», проверка Cloudflare и curl без программиста.

Клиент в топ-3 Google по ключу, а ChatGPT на брендовый запрос отвечает «не нашёл информации». В Вебмастере и Search Console всё зелёное, но в robots.txt давно стоит Disallow для всех, кроме Googlebot и YandexBot, а хостинг тихо отдаёт 403 AI-ботам. Страшно трогать файл, чтобы не сломать SEO. За 30-45 минут вы откроете robots.txt в браузере, разделите ботов «для ответов» и «для обучения», вставите готовый шаблон и проверите, что CDN не режет доступ.

robots.txt для AI-краулеров в 2026 году – это не одна кнопка «закрыть нейросети». GPTBot и OAI-SearchBot у OpenAI независимы: можно запретить обучение и оставить цитирование в ChatGPT Search. PerplexityBot и Claude-SearchBot тоже читают файл отдельно. Google-Extended – токен без HTTP user-agent, его не увидите в логах. После правки ждите до 24 часов и отдельно проверьте Cloudflare или WAF.

На практике владелец полгода винит контент, а оказалось – пять строк в robots.txt и AI Crawl Control в Cloudflare. Search Console смотрит классическую индексацию, а не то, пускает ли edge OAI-SearchBot. Типичная ошибка с Habr: User-agent: * Disallow: / с исключением только Googlebot и YandexBot закрывает все AI search-боты – вы в топе Google, но для ChatGPT сайт как будто не существует.

Разделите ботов для обучения и ботов для поиска

Таблица сравнения training- и search-ботов для robots.txt

AI-краулер – программа, которая скачивает страницы сайта. Одни боты собирают текст, чтобы обучать модели. Другие – чтобы цитировать вас в ответах ChatGPT, Perplexity или Claude. robots.txt – текстовый файл в корне сайта, куда вы пишете правила «можно / нельзя» для каждого имени бота.

Сюрприз, который ломает половину настроек: блокировка GPTBot не закрывает сайт от ChatGPT Search. За цитирование отвечает отдельный OAI-SearchBot со своим user-agent и IP-диапазоном. Многие «закрыли OpenAI» и случайно убили видимость, а не обучение.

Бот Задача Что делать в robots.txt
OAI-SearchBot Цитирование в ChatGPT Search Allow, если нужен GEO
GPTBot Обучение моделей OpenAI Disallow, если не хотите отдавать контент на training
PerplexityBot Поиск и цитирование в Perplexity Allow для видимости в ответах
Claude-SearchBot Поиск и цитирование в Claude Allow для GEO
ClaudeBot Обучение моделей Anthropic Disallow по политике компании
Google-Extended Политика для Gemini, не отдельный HTTP-бот Токен в файле; в логах не появится

Рекомендация 2026: Allow для OAI-SearchBot, PerplexityBot и Claude-SearchBot. GPTBot и ClaudeBot закройте, если не хотите training crawl. Google-Extended – токен без HTTP user-agent: в логах не появится, но Disallow ограничит Gemini, не ломая Google Search.

Проведите аудит robots.txt за пять минут в браузере

Workflow аудита robots.txt за пять минут в браузере

Откройте https://ваш-домен.ru/robots.txt и скопируйте содержимое в заметку – это точка отката. Ищите три красных флага: User-agent: * с Disallow: /, списки Disallow только для GPTBot без Allow для OAI-SearchBot, устаревшие имена вроде Claude-Web вместо Claude-SearchBot.

Например, Allow только для Googlebot и YandexBot при Disallow: / для остальных режет AI-поиск, даже при сильном контенте. Список ai.robots.txt на GitHub – 150+ имён для сверки.

  1. Шаг 1: Откройте robots.txt в браузере и сохраните копию «как было».
  2. Шаг 2: Найдите строки User-agent: * и Disallow: / – они часто режут всех AI-ботов.
  3. Шаг 3: Проверьте, есть ли отдельные блоки для OAI-SearchBot, PerplexityBot, Claude-SearchBot.
  4. Шаг 4: Убедитесь, что YandexBot не заблокирован – без него пропадёт и обычный поиск, и Нейро.
  5. Шаг 5: Отметьте устаревшие имена ботов и замените на актуальные из docs вендоров.

Если файл отдаёт 404 или HTML вместо текста – бот не прочитает правила. Сохраните копию перед правкой: откат за минуту спасает от паники «я сломал SEO».

Вставьте шаблон «цитирование да, обучение нет»

Чек-лист шаблона robots.txt: цитирование да, обучение нет

Для WordPress файл правят через SEO-плагин или корень хостинга. Для Tilda и конструкторов – через настройки robots или в поддержку. Главное правило: отдельный блок User-agent для каждого имени, а не одна строка «OpenAI».

Шаблон robots.txt (фрагмент):
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /

Perplexity-User при запросе пользователя часто игнорирует robots.txt – для него нужен WAF. После сохранения ждите до 24 часов: OpenAI и Perplexity не применяют правила мгновенно.

Сверьте CDN, Cloudflare и WAF с файлом на диске

robots.txt – добровольный протокол. Реальный запрет сильнее на CDN или WAF: GPTBot и PerplexityBot получают 403, хотя в файле Allow – типично для Cloudflare, где training-боты режут на edge по умолчанию.

Проверка без SSH: в терминале Mac или через онлайн-сервис curl выполните запрос с user-agent бота. Ожидаем HTTP 200, не 403:

curl -sI https://ваш-домен.ru/ -A «GPTBot/1.0» → статус 200 OK

Если Cloudflare: зайдите в AI Crawl Control, выберите «Do not block» для нужных ботов и отключите managed robots.txt, если он переписывает ваш файл блоком BEGIN Cloudflare Managed content. Файл на сервере и то, что видит бот на edge, должны совпадать.

Часто ломается кэш CDN – очистите зону или подождите TTL.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)

Пройдите чек-лист ботов OpenAI, Anthropic, Perplexity, Google и Яндекс

Ниже – сжатый чек-лист. Полный перечень имён растёт: в июле 2026 community-списки обновлялись, сверяйтесь с github.com/ai-robots-txt/ai.robots.txt раз в квартал.

  • OAI-SearchBot, PerplexityBot, Claude-SearchBot – Allow для GEO.
  • GPTBot, ClaudeBot, CCBot – Disallow, если не хотите training.
  • ChatGPT-User – не главный рычаг search eligibility.
  • Claude-Web и anthropic-ai – устарели.
  • Google-Extended – токен без HTTP user-agent.
  • Googlebot и YandexBot – не блокировать.
  • YandexAdditional – опциональный Disallow для Поиска с Алисой.
  • curl GPTBot/PerplexityBot – не 403; IP сверить с json вендоров.

YandexAdditional – осознанный выбор по Нейро, не случайная строка.

Контролируйте результат через 24-48 часов и свяжите с llms.txt

Как понять, что настройка сработала: на site.ru/robots.txt видны Allow для OAI-SearchBot, PerplexityBot и Claude-SearchBot; GPTBot и ClaudeBot закрыты по желанию; curl с User-Agent GPTBot даёт 200; через 1-2 недели ChatGPT или Perplexity хотя бы иногда цитируют сайт.

Workflow после правки: сохранить robots.txt → очистить CDN-кэш → curl-проверка → через 24-48 ч тест в ChatGPT Search и Perplexity → квартальный повтор аудита имён ботов.

robots.txt открывает дверь ботам, llms.txt подсказывает, какие страницы читать. Свяжите с спецификацией llms.txt, AEO-оптимизацией для нейроответов и примером SEO-статьи (href после публикации B01) – так закрываете и доступ, и смысл для нейропоиска.

Вопросы по GEO – на странице контактов или в Telegram канале про AI-маркетинг.

Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Достоверность данных: OpenAI Crawlers (developers.openai.com/api/docs/bots), Anthropic Privacy Center, Perplexity Crawlers Docs, справка Яндекс Вебмастера по YandexAdditional, Trakkr по Google-Extended, кейсы Habr и CitationDesk по Cloudflare; LSI-кластер запросов – по Яндекс Вордстат на 2026-08-09 (точные показы через MCP недоступны, сверка по SERP).

Частые вопросы

Чем GPTBot отличается от OAI-SearchBot?

GPTBot собирает страницы для обучения моделей OpenAI. OAI-SearchBot отвечает за цитирование в ChatGPT Search. Это независимые user-agent: можно Disallow для GPTBot и Allow для OAI-SearchBot в одном файле.

Нужно ли блокировать GPTBot для GEO?

Нет. Для видимости в ответах ChatGPT как раз нужен Allow для OAI-SearchBot. GPTBot блокируют, когда не хотят отдавать контент на обучение, а не ради GEO.

Как проверить robots.txt для ChatGPT без программиста?

Откройте site.ru/robots.txt в браузере, найдите блок OAI-SearchBot с Allow. Через сутки после правки задайте брендовый запрос в ChatGPT Search. Дополнительно проверьте curl с User-Agent GPTBot – ответ должен быть 200, не 403.

Влияет ли robots.txt на Яндекс Нейро?

Да, косвенно. YandexBot индексирует сайт для обычного поиска и Нейро. Отдельно YandexAdditional управляет показом в Поиске с Алисой. Не блокируйте YandexBot, если нужен хотя бы классический трафик из Яндекса.

Почему правки в robots.txt не работают?

Чаще всего мешает CDN или Cloudflare: edge отдаёт 403, кэширует старый файл или подменяет его managed-блоком. Проверьте AI Crawl Control и curl с user-agent бота до того, как переписывать контент «для нейросетей».

Что такое Google-Extended и зачем он в файле?

Это токен политики для использования контента в Gemini и связанных продуктах Google. Отдельного HTTP-бота с таким именем в логах не будет. Disallow Google-Extended не ломает ранжирование в Google Search.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)
Новый маркетинг с искусственным интеллектом
Добавить комментарий