SMM-щик скопировал шаблон «заблокировать всех AI-ботов» после поста про защиту контента. Через месяц владелец спросил, почему бренд не цитируют в ChatGPT и Perplexity, хотя в Яндексе и Google всё ок. Боль знакомая: robots txt для нейросетей кажется делом программистов, а одна строка Disallow может отрезать цитирование, не защитив от обучения. За 20–30 минут вы откроете файл, разделите GPTBot, OAI-SearchBot и PerplexityBot и проверите результат в браузере без SSH.
OpenAI официально разделяет GPTBot (обучение моделей) и OAI-SearchBot (поиск ChatGPT) как независимые настройки robots.txt. PerplexityBot отвечает за индекс в ответах Perplexity, а не за обучение foundation models. Файл robots.txt – это вежливая просьба к роботам, не юридический замок: он управляет будущими обходами, а не уже скачанными данными. Изменения у крупных платформ обычно вступают в силу в течение примерно 24 часов.
Вы не настраиваете сервер – вы решаете, кому из AI-гостей можно зайти в витрину. Файл лежит по адресу https://ваш-домен.ru/robots.txt и читается в браузере. Это не sitemap и не llms.txt – только вопрос «пускать робота или нет». Типичная ошибка – скопировать из GitHub сотни User-agent с Disallow: / и думать, что закрыли только обучение. Ниже – чек-лист на три бота и готовые блоки для вставки.
- Разберите, кто из ботов учится, а кто цитирует
- Проверьте текущий robots.txt до любых правок
- Выберите сценарий и вставьте готовые блоки
- Сценарий A: GEO-видимость без обучения (рекомендуемый для блога и витрины)
- Сценарий B: полный запрет AI-обхода
- Сценарий C: гибрид – витрина открыта, /private/ закрыт
- Настройте три бота по отдельности и не путайте их с SEO
- Убедитесь, что WAF и CDN не отменяют ваш файл
- Как понять, что настройка сработала
- Частые вопросы
- Чем GPTBot отличается от OAI-SearchBot?
- Как разрешить ChatGPT, но запретить обучение?
- Нужен ли Allow для PerplexityBot?
- Блокирует ли Cloudflare GPTBot автоматически?
- Влияет ли Google-Extended на обычный Google Search?
- Чем robots.txt отличается от llms.txt?
- Как закрыть Яндекс-нейроответы, не убив SEO?
Разберите, кто из ботов учится, а кто цитирует

Главная путаница в gptbot robots txt: OpenAI шлёт разных «посетителей» с разными задачами. ChatGPT-User – запрос по клику в чате, не фоновый обход. Для маркетолога достаточно трёх имён из H1 плюс Google-Extended для Gemini.
| User-agent | Задача | Что даёт бизнесу | Что обычно делают |
|---|---|---|---|
| GPTBot | Обучение моделей OpenAI | Контент может попасть в датасет | Disallow, если не хотите обучение |
| OAI-SearchBot | Поиск и цитаты в ChatGPT Search | Бренд в ответах ChatGPT со ссылкой | Allow для GEO-видимости |
| PerplexityBot | Индекс для ответов Perplexity | Ссылки в Perplexity на ваши страницы | Allow, если нужны цитаты |
| Google-Extended | Gemini и grounding Google | Участие в AI-функциях Google | Отдельно от Googlebot; на классический SEO не влияет |
| YandexAdditionalBot | Быстрые ответы YandexGPT | Показ в нейроответах Яндекса | Disallow, если не хотите нейроцитаты; YandexBot не трогать |
Итоговый вердикт: если цель – цитирование без обучения, блокируйте training-ботов (GPTBot, Google-Extended), но оставляйте search-ботов (OAI-SearchBot, PerplexityBot). Не делайте: один Disallow: / на User-agent: * – это закроет и Googlebot, и Яндекс.
Проверьте текущий robots.txt до любых правок

На практике, например, на Habr описан кейс: robots.txt выглядел правильно, а WAF резал ботов 403 – цитат не было. Сначала снимите слепок.
- Шаг 1: Откройте файл в браузере. Введите https://ваш-домен.ru/robots.txt – должен быть plain text и код 200, не HTML-страница 404.
- Шаг 2: Сохраните копию. Скопируйте весь текст в Google Doc или Notion – одна опечатка легко закрывает весь сайт.
- Шаг 3: Найдите опасные строки. Поиск по Ctrl+F: GPTBot, OAI-SearchBot, PerplexityBot, User-agent: *, Disallow: /.
- Шаг 4: Отметьте, где править. WordPress – Yoast SEO или Rank Math (раздел «Файл robots.txt»); Tilda – поддержка или файл в корне хостинга; без CMS – панель хостинга «Файловый менеджер».
- Шаг 5: Зафиксируйте цель. Запишите одной фразой: «хочу цитирование», «хочу запретить обучение» или «полный запрет AI-обхода» – от этого зависит сценарий ниже.
Google не поддерживает crawl-delay в robots.txt. Для YandexAdditionalBot срок вступления – 2–14 дней, дольше ~24 часов у OpenAI и Perplexity.
Выберите сценарий и вставьте готовые блоки

Три рецепта copy-paste для oai-searchbot настройка и соседних ботов. Вставляйте в конец существующего файла или замените старые блоки с теми же User-agent. Каждый сценарий – отдельный User-agent на группу правил, как требует синтаксис REP (Robots Exclusion Protocol).
Сценарий A: GEO-видимость без обучения (рекомендуемый для блога и витрины)
User-agent: OAI-SearchBot
Allow: /User-agent: PerplexityBot
Allow: /User-agent: GPTBot
Disallow: /User-agent: Google-Extended
Disallow: /
ChatGPT Search и Perplexity цитируют разрешённые страницы. Явный Disallow для GPTBot важен: OpenAI может объединять обход search- и training-ботов. Perplexity предупреждает: при блокировке PerplexityBot домен и заголовок могут остаться в индексе без полного текста.
Сценарий B: полный запрет AI-обхода
User-agent: GPTBot
Disallow: /User-agent: OAI-SearchBot
Disallow: /User-agent: PerplexityBot
Disallow: /User-agent: Google-Extended
Disallow: /User-agent: anthropic-ai
Disallow: /User-agent: ClaudeBot
Disallow: /
Для политики «ни обучение, ни AI-поиск». Вы теряете цитаты в ChatGPT и Perplexity, но SEO в Google и Яндексе живёт, если не трогали Googlebot и YandexBot.
Сценарий C: гибрид – витрина открыта, /private/ закрыт
User-agent: OAI-SearchBot
Allow: /
Disallow: /private/
Disallow: /cart/
Disallow: /wp-admin/User-agent: PerplexityBot
Allow: /
Disallow: /private/
Disallow: /cart/User-agent: GPTBot
Disallow: /User-agent: Google-Extended
Disallow: /
Типичная схема для интернет-магазина и личного кабинета: публичные статьи и каталог – в AI-поиске, корзина и админка – закрыты точечно, без глобального Disallow: / для всех ботов.
Настройте три бота по отдельности и не путайте их с SEO
PerplexityBot robots txt – отдельный блок, не путайте с Perplexity-User. Для robots txt chatgpt критичны GPTBot и OAI-SearchBot: если цитат нет при закрытом GPTBot – проверьте Disallow у OAI-SearchBot. OpenAI публикует IP-диапазоны в JSON (searchbot.json, gptbot.json) – сверяйте с официальным списком.
Связка с GEO-кластером: robots.txt открывает дверь краулеру, но не гарантирует цитату. Имеет смысл актуальный llms.txt для сайта, FAQ-страницы со Schema.org FAQPage и общий чек-лист GEO-оптимизации. После настройки ботов проверьте цитирование через гайд по мониторингу ChatGPT и Perplexity – это соседний шаг после robots.txt.
Убедитесь, что WAF и CDN не отменяют ваш файл
Часто robots.txt правильный, но Cloudflare или антибот хостинга режет user-agent до чтения Allow. Спросите поддержку: приходят ли запросы от OAI-SearchBot и PerplexityBot. Перепроверьте через 24–72 часа – контур обновляется с лагом до суток.
Как понять, что настройка сработала
Критерии готовности без гадания на кофейной гуще:
- По адресу /robots.txt видны отдельные блоки для GPTBot, OAI-SearchBot и PerplexityBot.
- GPTBot и Google-Extended закрыты осознанно, если вы против обучения; OAI-SearchBot и PerplexityBot – Allow, если нужны цитаты.
- Нет User-agent: * с Disallow: / и нет случайного закрытия search-ботов.
- Вы можете объяснить коллеге разницу между «обучение модели» и «поиск с цитатой».
- Служебные пути (/cart/, /admin/, /private/) закрыты точечно, а не всем ботам сразу.
Если после проверки остались вопросы по политике видимости в нейропоиске, напишите через форму на сайте или в Telegram-канале – разберём ваш домен без обещания «гарантированных цитат».
Материал проверен: Андрей Дикий (эксперт по AI-маркетингу и маркетинговой автоматизации).
Источники и оговорки: документация OpenAI Crawlers (developers.openai.com/api/docs/bots), Perplexity Help Center и docs.perplexity.ai, Google robots.txt spec и Google-Extended FAQ, Яндекс Вебмастер (YandexAdditionalBot); частотность запросов – LSI-кластер по WebSearch/SERP, точные показы Яндекс Вордстат на 2026-08-13 не верифицированы (MCP недоступен).
Частые вопросы
Чем GPTBot отличается от OAI-SearchBot?
GPTBot собирает контент для обучения моделей OpenAI. OAI-SearchBot индексирует страницы для поиска и цитат в ChatGPT Search. Это независимые настройки robots.txt: можно запретить обучение и оставить поиск открытым.
Как разрешить ChatGPT, но запретить обучение?
Добавьте Allow: / для User-agent: OAI-SearchBot и Disallow: / для User-agent: GPTBot. Сохраните файл, проверьте в браузере и подождите до 24 часов. Не блокируйте OAI-SearchBot вместе с GPTBot.
Нужен ли Allow для PerplexityBot?
Если хотите ссылки в ответах Perplexity – да, явный Allow: / или отсутствие Disallow: / для PerplexityBot. Для запрета индексации полного текста используйте Disallow, помня, что домен и заголовок могут остаться в индексе.
Блокирует ли Cloudflare GPTBot автоматически?
Не по умолчанию для всех сайтов. Проверьте правила WAF, Bot Fight Mode и кастомные firewall rules. Даже идеальный robots.txt бесполезен, если CDN отдаёт 403 до чтения файла.
Влияет ли Google-Extended на обычный Google Search?
Нет. Google-Extended – отдельный product token для Gemini и grounding. На ранжирование в классическом Google Search он не влияет. Googlebot для SEO не трогайте.
Чем robots.txt отличается от llms.txt?
robots.txt говорит роботу «можно ли заходить». llms.txt подсказывает, какие страницы и факты показывать агенту после входа. Для GEO нужны оба инструмента, но ни один не гарантирует цитату.
Как закрыть Яндекс-нейроответы, не убив SEO?
Используйте отдельный блок User-agent: YandexAdditionalBot с Disallow для нужных путей. Основной YandexBot для индексации в Поиске не блокируйте. Изменения по нейроответам могут занять 2–14 дней.
