Robots txt для нейросетей: чек-лист GPTBot, OAI-SearchBot и PerplexityBot

robots txt dlya ai krawlerov cover Без рубрики
Как настроить robots txt для нейросетей: разделите GPTBot (обучение) и OAI-SearchBot (цитаты ChatGPT), настройте PerplexityBot. Три готовых сценария и проверка в браузере за 20 минут.

SMM-щик скопировал шаблон «заблокировать всех AI-ботов» после поста про защиту контента. Через месяц владелец спросил, почему бренд не цитируют в ChatGPT и Perplexity, хотя в Яндексе и Google всё ок. Боль знакомая: robots txt для нейросетей кажется делом программистов, а одна строка Disallow может отрезать цитирование, не защитив от обучения. За 20–30 минут вы откроете файл, разделите GPTBot, OAI-SearchBot и PerplexityBot и проверите результат в браузере без SSH.

OpenAI официально разделяет GPTBot (обучение моделей) и OAI-SearchBot (поиск ChatGPT) как независимые настройки robots.txt. PerplexityBot отвечает за индекс в ответах Perplexity, а не за обучение foundation models. Файл robots.txt – это вежливая просьба к роботам, не юридический замок: он управляет будущими обходами, а не уже скачанными данными. Изменения у крупных платформ обычно вступают в силу в течение примерно 24 часов.

Вы не настраиваете сервер – вы решаете, кому из AI-гостей можно зайти в витрину. Файл лежит по адресу https://ваш-домен.ru/robots.txt и читается в браузере. Это не sitemap и не llms.txt – только вопрос «пускать робота или нет». Типичная ошибка – скопировать из GitHub сотни User-agent с Disallow: / и думать, что закрыли только обучение. Ниже – чек-лист на три бота и готовые блоки для вставки.

Разберите, кто из ботов учится, а кто цитирует

Таблица training vs search ботов: GPTBot, OAI-SearchBot, PerplexityBot

Главная путаница в gptbot robots txt: OpenAI шлёт разных «посетителей» с разными задачами. ChatGPT-User – запрос по клику в чате, не фоновый обход. Для маркетолога достаточно трёх имён из H1 плюс Google-Extended для Gemini.

User-agent Задача Что даёт бизнесу Что обычно делают
GPTBot Обучение моделей OpenAI Контент может попасть в датасет Disallow, если не хотите обучение
OAI-SearchBot Поиск и цитаты в ChatGPT Search Бренд в ответах ChatGPT со ссылкой Allow для GEO-видимости
PerplexityBot Индекс для ответов Perplexity Ссылки в Perplexity на ваши страницы Allow, если нужны цитаты
Google-Extended Gemini и grounding Google Участие в AI-функциях Google Отдельно от Googlebot; на классический SEO не влияет
YandexAdditionalBot Быстрые ответы YandexGPT Показ в нейроответах Яндекса Disallow, если не хотите нейроцитаты; YandexBot не трогать

Итоговый вердикт: если цель – цитирование без обучения, блокируйте training-ботов (GPTBot, Google-Extended), но оставляйте search-ботов (OAI-SearchBot, PerplexityBot). Не делайте: один Disallow: / на User-agent: * – это закроет и Googlebot, и Яндекс.

Проверьте текущий robots.txt до любых правок

Чеклист проверки robots.txt перед правками: 5 шагов

На практике, например, на Habr описан кейс: robots.txt выглядел правильно, а WAF резал ботов 403 – цитат не было. Сначала снимите слепок.

  1. Шаг 1: Откройте файл в браузере. Введите https://ваш-домен.ru/robots.txt – должен быть plain text и код 200, не HTML-страница 404.
  2. Шаг 2: Сохраните копию. Скопируйте весь текст в Google Doc или Notion – одна опечатка легко закрывает весь сайт.
  3. Шаг 3: Найдите опасные строки. Поиск по Ctrl+F: GPTBot, OAI-SearchBot, PerplexityBot, User-agent: *, Disallow: /.
  4. Шаг 4: Отметьте, где править. WordPress – Yoast SEO или Rank Math (раздел «Файл robots.txt»); Tilda – поддержка или файл в корне хостинга; без CMS – панель хостинга «Файловый менеджер».
  5. Шаг 5: Зафиксируйте цель. Запишите одной фразой: «хочу цитирование», «хочу запретить обучение» или «полный запрет AI-обхода» – от этого зависит сценарий ниже.

Google не поддерживает crawl-delay в robots.txt. Для YandexAdditionalBot срок вступления – 2–14 дней, дольше ~24 часов у OpenAI и Perplexity.

Выберите сценарий и вставьте готовые блоки

Схема трёх сценариев robots.txt: GEO, запрет, гибрид

Три рецепта copy-paste для oai-searchbot настройка и соседних ботов. Вставляйте в конец существующего файла или замените старые блоки с теми же User-agent. Каждый сценарий – отдельный User-agent на группу правил, как требует синтаксис REP (Robots Exclusion Protocol).

Сценарий A: GEO-видимость без обучения (рекомендуемый для блога и витрины)

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

ChatGPT Search и Perplexity цитируют разрешённые страницы. Явный Disallow для GPTBot важен: OpenAI может объединять обход search- и training-ботов. Perplexity предупреждает: при блокировке PerplexityBot домен и заголовок могут остаться в индексе без полного текста.

Сценарий B: полный запрет AI-обхода

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: ClaudeBot
Disallow: /

Для политики «ни обучение, ни AI-поиск». Вы теряете цитаты в ChatGPT и Perplexity, но SEO в Google и Яндексе живёт, если не трогали Googlebot и YandexBot.

Сценарий C: гибрид – витрина открыта, /private/ закрыт

User-agent: OAI-SearchBot
Allow: /
Disallow: /private/
Disallow: /cart/
Disallow: /wp-admin/

User-agent: PerplexityBot
Allow: /
Disallow: /private/
Disallow: /cart/

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Типичная схема для интернет-магазина и личного кабинета: публичные статьи и каталог – в AI-поиске, корзина и админка – закрыты точечно, без глобального Disallow: / для всех ботов.

Настройте три бота по отдельности и не путайте их с SEO

PerplexityBot robots txt – отдельный блок, не путайте с Perplexity-User. Для robots txt chatgpt критичны GPTBot и OAI-SearchBot: если цитат нет при закрытом GPTBot – проверьте Disallow у OAI-SearchBot. OpenAI публикует IP-диапазоны в JSON (searchbot.json, gptbot.json) – сверяйте с официальным списком.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)

Связка с GEO-кластером: robots.txt открывает дверь краулеру, но не гарантирует цитату. Имеет смысл актуальный llms.txt для сайта, FAQ-страницы со Schema.org FAQPage и общий чек-лист GEO-оптимизации. После настройки ботов проверьте цитирование через гайд по мониторингу ChatGPT и Perplexity – это соседний шаг после robots.txt.

Убедитесь, что WAF и CDN не отменяют ваш файл

Часто robots.txt правильный, но Cloudflare или антибот хостинга режет user-agent до чтения Allow. Спросите поддержку: приходят ли запросы от OAI-SearchBot и PerplexityBot. Перепроверьте через 24–72 часа – контур обновляется с лагом до суток.

Как понять, что настройка сработала

Критерии готовности без гадания на кофейной гуще:

  • По адресу /robots.txt видны отдельные блоки для GPTBot, OAI-SearchBot и PerplexityBot.
  • GPTBot и Google-Extended закрыты осознанно, если вы против обучения; OAI-SearchBot и PerplexityBot – Allow, если нужны цитаты.
  • Нет User-agent: * с Disallow: / и нет случайного закрытия search-ботов.
  • Вы можете объяснить коллеге разницу между «обучение модели» и «поиск с цитатой».
  • Служебные пути (/cart/, /admin/, /private/) закрыты точечно, а не всем ботам сразу.

Если после проверки остались вопросы по политике видимости в нейропоиске, напишите через форму на сайте или в Telegram-канале – разберём ваш домен без обещания «гарантированных цитат».

Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Источники и оговорки: документация OpenAI Crawlers (developers.openai.com/api/docs/bots), Perplexity Help Center и docs.perplexity.ai, Google robots.txt spec и Google-Extended FAQ, Яндекс Вебмастер (YandexAdditionalBot); частотность запросов – LSI-кластер по WebSearch/SERP, точные показы Яндекс Вордстат на 2026-08-13 не верифицированы (MCP недоступен).

Частые вопросы

Чем GPTBot отличается от OAI-SearchBot?

GPTBot собирает контент для обучения моделей OpenAI. OAI-SearchBot индексирует страницы для поиска и цитат в ChatGPT Search. Это независимые настройки robots.txt: можно запретить обучение и оставить поиск открытым.

Как разрешить ChatGPT, но запретить обучение?

Добавьте Allow: / для User-agent: OAI-SearchBot и Disallow: / для User-agent: GPTBot. Сохраните файл, проверьте в браузере и подождите до 24 часов. Не блокируйте OAI-SearchBot вместе с GPTBot.

Нужен ли Allow для PerplexityBot?

Если хотите ссылки в ответах Perplexity – да, явный Allow: / или отсутствие Disallow: / для PerplexityBot. Для запрета индексации полного текста используйте Disallow, помня, что домен и заголовок могут остаться в индексе.

Блокирует ли Cloudflare GPTBot автоматически?

Не по умолчанию для всех сайтов. Проверьте правила WAF, Bot Fight Mode и кастомные firewall rules. Даже идеальный robots.txt бесполезен, если CDN отдаёт 403 до чтения файла.

Влияет ли Google-Extended на обычный Google Search?

Нет. Google-Extended – отдельный product token для Gemini и grounding. На ранжирование в классическом Google Search он не влияет. Googlebot для SEO не трогайте.

Чем robots.txt отличается от llms.txt?

robots.txt говорит роботу «можно ли заходить». llms.txt подсказывает, какие страницы и факты показывать агенту после входа. Для GEO нужны оба инструмента, но ни один не гарантирует цитату.

Как закрыть Яндекс-нейроответы, не убив SEO?

Используйте отдельный блок User-agent: YandexAdditionalBot с Disallow для нужных путей. Основной YandexBot для индексации в Поиске не блокируйте. Изменения по нейроответам могут занять 2–14 дней.

*Instagram,Facebook (принадлежит компании Meta, признанной экстремистской и запрещённой на территории РФ)
Новый маркетинг с искусственным интеллектом
Добавить комментарий