← Все статьи Блог

ИИ-краулеры и robots.txt: каких ботов пускать, а каких блокировать

Коротко: решайте по задаче бота, а не по названию компании. Пускайте тех, кто заводит вас в ответы ИИ — OAI-SearchBot, Claude-SearchBot, PerplexityBot, и в первую очередь Googlebot и Bingbot (они кормят Google AI Overviews, Copilot и косвенно ChatGPT). Блокировать обучающий бот (GPTBot, ClaudeBot, Google-Extended) — отдельное и законное решение, которое не убирает вас из ИИ-поиска. И помните: robots.txt — это просьба. Боты, заходящие по запросу пользователя, и скрейперы (боты, что выкачивают контент сайта) вроде Bytespider могут её игнорировать — для них нужны правила на уровне сервера.

Мы держим хостинг клиентских сайтов и видим этих краулеров в собственных логах, поэтому ниже — та самая шпаргалка, которой пользуемся сами. Построена на официальной документации платформ, ссылки — по тексту.

Сначала главное: для чего этот бот

Любой ИИ-краулер делает одну из четырёх задач. Пускать его или нет — решает именно задача, а не бренд.

  1. Поиск / индексация для ответов. Собирает индекс, из которого ИИ берёт ответ. Заблокируете — пропадёте из ответов этого движка. Таких пускаем.
  2. Обучение моделей. Собирает контент для обучения будущих моделей. Это вопрос контента и прав, а не SEO — блокировка на видимость в ИИ-поиске не влияет.
  3. Заход по запросу пользователя. Скачивает одну страницу, потому что пользователь спросил про неё ассистента. Такие часто игнорируют robots.txt, ведь действуют от лица человека.
  4. Реклама / превью / прочее. Проверяют рекламные лендинги, строят превью ссылок и так далее.

Поэтому у вопроса «блокировать ли ИИ-ботов?» нет одного ответа. Поисковые боты почти всегда нужны, а обучающие — на ваше усмотрение.

Шпаргалка

КраулерВладелец (страна)Зачем нуженСлушается robots.txt?Наша рекомендация
GooglebotGoogle (США)Поисковый индекс — кормит и AI Overviews, и AI ModeДаПускать (обязательно)
BingbotMicrosoft (США)Поисковый индекс — кормит Copilot и косвенно ChatGPTДаПускать (обязательно)
OAI-SearchBotOpenAI (США)Поисковый индекс ChatGPTДаПускать
Claude-SearchBotAnthropic (США)Поисковые результаты ClaudeДаПускать
Claude-UserAnthropic (США)Заходит на страницу, когда спрашивает пользователь ClaudeДаПускать (не блокировать)
PerplexityBotPerplexity (США)Строит индекс ответов PerplexityДаПускать
Meta-WebIndexerMeta (США)Поисковые результаты Meta AIДаПускать ради видимости в Meta AI
GPTBotOpenAI (США)Обучение моделей OpenAIДаНа ваше усмотрение — блок = отказ от обучения (на поиск не влияет)
ClaudeBotAnthropic (США)Обучение моделей AnthropicДа (+ Crawl-delay)На ваше усмотрение — блок = отказ от обучения
Google-ExtendedGoogle (США)Управляющий токен обучения Gemini / Vertex AIДа (это управляющий токен)Блок = отказ от обучения; на ранжирование в Поиске не влияет
AmazonbotAmazon (США)Улучшает продукты Amazon; может обучать ИИ AmazonДаНа ваше усмотрение
Meta-ExternalAgentMeta (США)Обучает модели Meta / индексирует контентДаНа ваше усмотрение — блок = отказ
ChatGPT-UserOpenAI (США)Заходит на страницу по запросу пользователя ChatGPT«может не применяться»На robots.txt полагаться нельзя — режьте на сервере
Meta-ExternalFetcherMeta (США)Достаёт ссылки по запросу пользователяМожет игнорироватьПо необходимости — на уровне сервера
facebookexternalhitMeta (США)Строит превью ссылок в приложениях MetaМожет игнорироватьОбычно оставляют (превью ссылок)
Perplexity-UserPerplexity (США)Скачивает в реальном времени по вопросу пользователяОбычно игнорирует (по запросу пользователя)На robots.txt полагаться нельзя — режьте на сервере
GoogleOtherGoogle (США)Общий служебный обход Google (R&D), не ранжированиеДаНейтрально — пускать
OAI-AdsBotOpenAI (США)Проверяет присланные рекламные лендингиТолько рекламные страницыНе трогать
BytespiderByteDance (Китай)Массовый скрейпинг, по сообщениям — для обученияЧёткого офиц. обязательства нетБлокировать на сервере, если грузит

Источники: краулеры OpenAI, краулеры Anthropic, краулеры Google, Amazonbot, краулеры Meta, краулеры Perplexity.

Страны и фаервол. Почти все ИИ-краулеры работают из США — Google, Microsoft, OpenAI, Anthropic, Amazon, Meta, Perplexity. Единственный крупный не-американский — Bytespider (ByteDance, Китай), и он же нередко самый агрессивный. Оговорка для блокировки по ipset / GeoIP: краулеры ходят с облачных IP, которые не всегда совпадают со страной компании, — поэтому режьте по официальным опубликованным диапазонам IP (их публикуют Google, OpenAI, Perplexity и др.) и проверяйте reverse DNS, а не «по стране», иначе вместе со страной срежете нужный поисковый бот.

Готовый robots.txt — можно копировать

Если в вашем robots.txt нет общего Disallow на весь сайт, поисковые боты и так разрешены — задача просто не добавлять для них Disallow. Блок ниже — это то, чего обычно и хотят: отказаться от использования контента в обучении, оставаясь полностью видимым в ИИ-поиске.

# Оставляем разрешёнными ИИ-боты поиска/ответов (НЕ ставим им Disallow):
#   Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot,
#   Claude-User, PerplexityBot

# ПО ЖЕЛАНИЮ — отказ только от *обучения*.
# Это НЕ убирает вас из ИИ-поиска и ответов.
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: Bytespider
Disallow: /

Google-Extended стоит выделить: по словам Google, он управляет тем, обучается ли на вашем контенте Gemini и Vertex AI, и не влияет на попадание и ранжирование в Google Поиске — то есть AI Overviews всё равно берут вас из обычного индекса.

robots.txt просит, но не заставляет

Две группы краулеров robots.txt не остановит:

  • Заходящие по запросу пользователя. Когда кто-то спрашивает ChatGPT или Perplexity про вашу страницу, ассистент скачивает её от лица пользователя. OpenAI прямо пишет, что для ChatGPT-User «правила robots.txt могут не применяться», а Perplexity — что Perplexity-User «обычно игнорирует правила robots.txt». (Claude-User — вежливое исключение: Anthropic говорит, что он robots.txt уважает.) Если такие заходы реально нужно остановить — это делается на сервере, а не в robots.txt.
  • Скрейперы, которые его просто игнорируют. У Bytespider (ByteDance) нет внятного публичного обязательства соблюдать стандарт исключений, и по многим сообщениям он обходит сайты агрессивно. Если он съедает трафик — блокируйте на уровне веб-сервера или фаервола: на nginx это отдача 403 по совпадению User-Agent или правило Fail2ban.

Именно здесь хостинг с обслуживанием себя оправдывает: нужные для видимости боты остаются разрешёнными в robots.txt, а агрессивные отсекаются на входе, чтобы не тормозили сайт.

Дорогая ошибка: заблокировать тех, кто нужен

На практике сайт куда чаще случайно закрывается от ИИ-поиска сам, чем реально страдает от скрейперов. Вот как это обычно выходит:

  • общий Disallow: /, оставшийся от тестовой версии сайта;
  • WAF (защитный экран перед сайтом) или «защита от ботов» (bot-fight mode), которая режет неизвестные user-agent (подпись, которой бот себя называет) — включая OAI-SearchBot и PerplexityBot;
  • блокировка GPTBot в расчёте, что это закроет и поиск ChatGPT (нет — за поиск отвечает OAI-SearchBot).

Если не уверены, в какой вы группе, начните с парного материала — мифы про ответы ИИ: что Google и OpenAI реально говорят — там про индексацию и сниппеты, от которых зависит, можете ли вы вообще попасть в цитаты.

Частые вопросы

Если заблокировать GPTBot, пропаду ли я из ChatGPT? Нет. GPTBot — только обучение. За поиск ChatGPT отвечает OAI-SearchBot. Блокировка GPTBot лишь отключает использование в обучении.

Google-Extended меняет моё ранжирование в Google? Нет. По словам Google, он управляет только использованием контента для обучения Gemini и Vertex AI; на попадание и ранжирование в Поиске не влияет, а AI Overviews берут данные из обычного индекса.

Остановит ли robots.txt Bytespider? Возможно, нет. Внятного обязательства соблюдать его нет, и по сообщениям он его игнорирует — блокируйте на nginx, фаерволе или WAF, если он грузит сайт.

Можно ли заблокировать ChatGPT-User или Claude-User? Claude-User robots.txt уважает; ChatGPT-User — может не уважать. Чтобы надёжно остановить заходы по запросу пользователя, блокируйте на сервере.

Блокировать ли все обучающие ИИ-боты? Это вопрос контента и прав, а не SEO. Блокировка обучающих ботов не вредит видимости в ИИ-поиске — так что блокируйте их только если не хотите, чтобы ваш контент шёл в обучение моделей.


Мы настраиваем это клиентам в рамках хостинга с обслуживанием и работы по SEO и GEO — нужные боты разрешены, агрессивные отсекаются на сервере, всё по документации платформ выше. Хотите быстро понять, что краулит ваш сайт и не блокируете ли вы не тех ботов — напишите нам.

Связаться

Покажите ваш сайт. Скажем, что реально не так.

Бесплатный 30-минутный разговор в WhatsApp, Telegram или по звонку. Без презентаций, без навязывания дополнительных услуг. Если мы не подходим — подскажем, кто подойдёт.

Связаться