Как настроить robots.txt для AI-краулеров: чек-лист GPTBot, PerplexityBot и ChatGPT-User

robots txt ai kraulery 2026 cover Без рубрики
Пошаговый чек-лист robots.txt для AI-краулеров: таблица user-agent 2026, готовый шаблон Allow/Disallow, проверка CDN и WAF без разработчика.

В Search Console всё зелёное, а ChatGPT о вашей компании молчит. На Habr разобрали кейс: полгода в топе Google, но в robots.txt стояло Disallow: / для всех, кроме Googlebot и YandexBot – AI-боты получали отказ, а в Вебмастере это не горело. Боитесь одной строкой убить Яндекс? Ниже – отдельные блоки Allow и Disallow только для AI-ботов. Сегодня вы откроете robots.txt, вставите шаблон и увидите, что поисковые AI разрешены, а обучающие закрыты.

robots.txt для AI-краулеров – это не «война с нейросетями», а диспетчерская с тремя дверями: обучение моделей, поиск в ChatGPT и Perplexity, запрос, который инициирует человек. Googlebot и Yandex не трогаем. Для видимости в AI-поиске открываем OAI-SearchBot, PerplexityBot, Claude-SearchBot и ChatGPT-User. Для защиты от обучения закрываем GPTBot, ClaudeBot и Google-Extended. Эффект поисковых ботов у OpenAI – примерно сутки, мгновенной магии нет.

Тут важный нюанс, который ломает интуицию. OpenAI прямо пишет: ChatGPT-User может не подчиняться robots.txt, потому что запрос инициирует человек. А Anthropic для Claude-User заявляет обратное – их боты robots.txt соблюдают. Одинаковая «дверь пользователя», разные правила у разных компаний. Поэтому шаблон ниже – не гарантия, а понятная просьба к тем ботам, которые её читают.

Маркетологу на WordPress хватит 30 минут: скопировать файл, добавить блоки и проверить yoursite.ru/robots.txt в браузере.

Разберите три «двери» AI-ботов перед правкой файла

Сравнительная таблица трёх категорий AI-ботов: обучение, поиск, запрос пользователя

Главная боль – непонятно, кого блокировать из длинного списка из 20+ user-agent. На практике достаточно трёх категорий, как в обзоре AI User-Agent Landscape 2026.

Обучение – бот качает страницы, чтобы тренировать модель. Примеры: GPTBot, ClaudeBot, Google-Extended, CCBot. Поиск в реальном времени – бот ищет свежие факты для ответа в ChatGPT Search или Perplexity. Примеры: OAI-SearchBot, PerplexityBot, Claude-SearchBot. Запрос пользователя – человек попросил ИИ открыть ссылку; бот идёт как браузер. Примеры: ChatGPT-User, Perplexity-User, Claude-User.

Типичная ошибка – одним Disallow: / закрыть всех AI и потерять цитирование в нейропоиске. Другое крайнее решение – разрешить всё и кормить модели своим контентом. Для малого бизнеса разумный компромисс: видимость без обучения.

Рекомендация: решайте по каждой «двери» отдельно. Не смешивайте GPTBot (обучение) с OAI-SearchBot (поиск) – у OpenAI это независимые настройки.

Проверьте текущий robots.txt, не трогая Google и Яндекс

Скриншот проверки robots.txt: 5 шагов без правки Googlebot и Yandex

Боль номер один – «боюсь одной строкой убить Google или Яндекс». Правило простое: блоки User-agent: Googlebot и User-agent: Yandex не редактируем, если там уже Allow: /. Добавляем новые секции ниже.

  1. Шаг 1: Откройте https://ваш-домен.ru/robots.txt в браузере и сохраните копию в заметку – до правок.
  2. Шаг 2: Найдите User-agent: * с Disallow: /. Если есть глобальный запрет, проверьте, что ниже явно разрешены Googlebot и Yandex.
  3. Шаг 3: Поищите старые строки Claude-Web или anthropic-ai – это устаревшие токены, их заменяют на ClaudeBot, Claude-User, Claude-SearchBot.
  4. Шаг 4: Убедитесь, что нет случайного Disallow для OAI-SearchBot или PerplexityBot – частая ошибка при копировании block-all списков.
  5. Шаг 5: На WordPress проверьте, не генерирует ли SEO-плагин «виртуальный» robots.txt поверх файла на диске – иногда правите не тот.

В реальном проекте клиент полгода не появлялся в ChatGPT именно из-за Disallow: / для всех, кроме двух поисковиков. Классический SEO был в порядке, AI-двери – закрыты.

Сравните user-agent 2026: кого пускать, кого закрыть

Схема user-agent 2026: кого пускать Allow, кого закрыть Disallow

Ниже – рабочая матрица для чек-листа из H1. Источники: OpenAI crawlers, Perplexity, Google-Extended.

User-agent Задача Стратегия «видимость без обучения»
GPTBot Обучение моделей OpenAI Disallow: /
OAI-SearchBot ChatGPT Search, цитирование Allow: /
ChatGPT-User Запрос пользователя в ChatGPT Allow: / (может игнорироваться)
PerplexityBot Поиск и ссылки в Perplexity Allow: /
ClaudeBot Обучение Anthropic Disallow: /
Claude-SearchBot Поиск в Claude Allow: /
Google-Extended Обучение Gemini, не Google Search Disallow: / (поиск Google не страдает)

Google-Extended не управляет обычной выдачей и AI Overviews – это отдельный токен только для обучения. Блокировка GPTBot не закрывает OAI-SearchBot – типичная ошибка из SEO-гайдов 2025 года.

Вставьте готовый шаблон robots.txt под вашу стратегию

Три варианта: «видимость без обучения» (рекомендуем малому бизнесу), «полный запрет AI» и «открыть всё». Копируйте блок целиком в конец файла, замените домен в строке Sitemap.

Шаблон «видимость без обучения»:
User-agent: Googlebot
Allow: /
User-agent: Yandex
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Sitemap: https://ваш-домен.ru/sitemap.xml

Сохраните файл в корень сайта: FTP, панель хостинга или раздел robots.txt в SEO-плагине WordPress. Перезагрузите страницу robots.txt – правки должны быть видны сразу. OpenAI обновляет поисковые правила примерно за 24 часа, не ждите эффекта за пять минут.

Полный запрет AI – через Disallow для всех ботов из реестра ai.robots.txt, но тогда пропадёте из AI-ответов.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)

Убедитесь, что CDN и WAF не отменяют ваши правила

Часто ломается так: robots.txt открыт, а боты получают 403. Причина – Cloudflare, антибот или WAF режет user-agent раньше, чем сервер читает файл.

  • Зайдите в панель CDN → Security → Bots или AI Crawl Control.
  • Убедитесь, что OAI-SearchBot и PerplexityBot не в blacklist.
  • Для Perplexity при необходимости добавьте IP из официального JSON в whitelist WAF.
  • Сравните «физический» robots.txt на диске и то, что отдаёт сайт – плагины иногда подменяют.

IP-блокировка Anthropic ненадёжна: бот может не дочитать robots.txt. Правильный путь – отдельные User-agent блоки, а не бан по адресу.

Схема проверки: правка robots.txt → сохранение в корне → просмотр в браузере → снятие блокировки на CDN → через 24–48 ч поиск user-agent OAI-SearchBot или PerplexityBot в access-логах.

Примите реалистичные ожидания: что файл не обещает

robots.txt – вежливая просьба, не замок. Он не защищает текст от копирования, не даёт юридической гарантии и не заменяет авторизацию на закрытых разделах. Для защиты – логин, paywall, WAF.

llms.txt на сотнях тысяч доменов в 2026 году не дал измеримого роста цитирования – это дополнение, не замена robots.txt. Если интересует карта для AI-агентов, смотрите гайд «как создать llms.txt» (slug sozdat-llms-txt-dlya-sajta — href восстановить после publish на сайте), но сначала закройте базовую диспетчерскую для ботов.

ChatGPT-User может обойти файл – учитывайте это в ожиданиях. Claude-User, по заявлению Anthropic, robots.txt уважает. Разные компании, разные правила – сверяйтесь с официальными docs, а не с форумными списками 2024 года.

Пройдите чек-лист после правок и зафиксируйте результат

Как понять, что всё сработало – критерии до паники:

  1. По адресу yoursite.ru/robots.txt видны отдельные блоки для OAI-SearchBot, PerplexityBot, ChatGPT-User (Allow) и GPTBot (Disallow).
  2. Googlebot и Yandex остались без изменений – Allow: / на месте.
  3. Через 1–2 недели в логах или AI-проверке появляются разрешённые боты, а не только 403.
  4. Раз в квартал сверяете список с GitHub ai-crawler-user-agents – появляются новые токены.

Для общей GEO-стратегии полезно связать robots.txt с контентом и разметкой – обзор в материале про GEO-оптимизацию сайта в 2026 (slug geo-optimizaciya-sajta-2026 — href восстановить после publish на сайте). Вопросы по настройке под ваш проект – через форму на сайте или Telegram @DikiiTelegram.

Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Достоверность данных: OpenAI Crawlers docs, Anthropic Help Center, Perplexity Crawlers docs, Google-Extended reference, кейс Habr и реестр ai.robots.txt на GitHub; частотность запросов – по Яндекс Вордстат (MCP недоступен, LSI из SERP) на 04.08.2026.

Частые вопросы

Чем GPTBot отличается от OAI-SearchBot?

GPTBot качает сайт для обучения моделей. OAI-SearchBot – для поиска и цитирования в ChatGPT Search. Блокируйте первого, если не хотите кормить обучение; второго оставляйте Allow, если нужна видимость в AI-ответах.

Нужно ли разрешать PerplexityBot?

Да, если хотите ссылки и цитаты в Perplexity. PerplexityBot уважает Disallow – при блокировке сайт пропадёт из ответов. Perplexity-User – отдельный user-agent для запросов пользователя.

Блокирует ли Google-Extended обычный поиск Google?

Нет. Google-Extended – токен только для обучения Gemini. Обычная индексация Googlebot и выдача не зависят от этой строки. Disallow для Google-Extended не убивает SEO в Google.

Как проверить, что AI-краулер зашёл на сайт?

Откройте access-логи хостинга или аналитику и найдите user-agent OAI-SearchBot, PerplexityBot или GPTBot. Первые визиты поисковых ботов часто через 24–48 часов после правки. Отсутствие GPTBot при Disallow – нормальный знак.

Можно ли одной строкой закрыть всех AI и оставить Google?

Технически да через User-agent: * и исключения, но легко ошибиться и закрыть OAI-SearchBot. Безопаснее – отдельные блоки по таблице выше, без глобального Disallow: /.

Заменяет ли robots.txt файл llms.txt?

Нет. robots.txt говорит ботам, куда можно ходить. llms.txt подсказывает AI-агенту, какие страницы читать в первую очередь. Сначала настройте доступ, потом при желании добавьте карту контента.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)
Новый маркетинг с искусственным интеллектом
Добавить комментарий