Коротко: решайте по задаче бота, а не по названию компании. Пускайте тех, кто заводит вас в ответы ИИ — OAI-SearchBot, Claude-SearchBot, PerplexityBot, и в первую очередь Googlebot и Bingbot (они кормят Google AI Overviews, Copilot и косвенно ChatGPT). Блокировать обучающий бот (GPTBot, ClaudeBot, Google-Extended) — отдельное и законное решение, которое не убирает вас из ИИ-поиска. И помните: robots.txt — это просьба. Боты, заходящие по запросу пользователя, и скрейперы (боты, что выкачивают контент сайта) вроде Bytespider могут её игнорировать — для них нужны правила на уровне сервера.
Мы держим хостинг клиентских сайтов и видим этих краулеров в собственных логах, поэтому ниже — та самая шпаргалка, которой пользуемся сами. Построена на официальной документации платформ, ссылки — по тексту.
Сначала главное: для чего этот бот
Любой ИИ-краулер делает одну из четырёх задач. Пускать его или нет — решает именно задача, а не бренд.
- Поиск / индексация для ответов. Собирает индекс, из которого ИИ берёт ответ. Заблокируете — пропадёте из ответов этого движка. Таких пускаем.
- Обучение моделей. Собирает контент для обучения будущих моделей. Это вопрос контента и прав, а не SEO — блокировка на видимость в ИИ-поиске не влияет.
- Заход по запросу пользователя. Скачивает одну страницу, потому что пользователь спросил про неё ассистента. Такие часто игнорируют
robots.txt, ведь действуют от лица человека. - Реклама / превью / прочее. Проверяют рекламные лендинги, строят превью ссылок и так далее.
Поэтому у вопроса «блокировать ли ИИ-ботов?» нет одного ответа. Поисковые боты почти всегда нужны, а обучающие — на ваше усмотрение.
Шпаргалка
| Краулер | Владелец (страна) | Зачем нужен | Слушается robots.txt? | Наша рекомендация |
|---|---|---|---|---|
Googlebot | Google (США) | Поисковый индекс — кормит и AI Overviews, и AI Mode | Да | Пускать (обязательно) |
Bingbot | Microsoft (США) | Поисковый индекс — кормит Copilot и косвенно ChatGPT | Да | Пускать (обязательно) |
OAI-SearchBot | OpenAI (США) | Поисковый индекс ChatGPT | Да | Пускать |
Claude-SearchBot | Anthropic (США) | Поисковые результаты Claude | Да | Пускать |
Claude-User | Anthropic (США) | Заходит на страницу, когда спрашивает пользователь Claude | Да | Пускать (не блокировать) |
PerplexityBot | Perplexity (США) | Строит индекс ответов Perplexity | Да | Пускать |
Meta-WebIndexer | Meta (США) | Поисковые результаты Meta AI | Да | Пускать ради видимости в Meta AI |
GPTBot | OpenAI (США) | Обучение моделей OpenAI | Да | На ваше усмотрение — блок = отказ от обучения (на поиск не влияет) |
ClaudeBot | Anthropic (США) | Обучение моделей Anthropic | Да (+ Crawl-delay) | На ваше усмотрение — блок = отказ от обучения |
Google-Extended | Google (США) | Управляющий токен обучения Gemini / Vertex AI | Да (это управляющий токен) | Блок = отказ от обучения; на ранжирование в Поиске не влияет |
Amazonbot | Amazon (США) | Улучшает продукты Amazon; может обучать ИИ Amazon | Да | На ваше усмотрение |
Meta-ExternalAgent | Meta (США) | Обучает модели Meta / индексирует контент | Да | На ваше усмотрение — блок = отказ |
ChatGPT-User | OpenAI (США) | Заходит на страницу по запросу пользователя ChatGPT | «может не применяться» | На robots.txt полагаться нельзя — режьте на сервере |
Meta-ExternalFetcher | Meta (США) | Достаёт ссылки по запросу пользователя | Может игнорировать | По необходимости — на уровне сервера |
facebookexternalhit | Meta (США) | Строит превью ссылок в приложениях Meta | Может игнорировать | Обычно оставляют (превью ссылок) |
Perplexity-User | Perplexity (США) | Скачивает в реальном времени по вопросу пользователя | Обычно игнорирует (по запросу пользователя) | На robots.txt полагаться нельзя — режьте на сервере |
GoogleOther | Google (США) | Общий служебный обход Google (R&D), не ранжирование | Да | Нейтрально — пускать |
OAI-AdsBot | OpenAI (США) | Проверяет присланные рекламные лендинги | Только рекламные страницы | Не трогать |
Bytespider | ByteDance (Китай) | Массовый скрейпинг, по сообщениям — для обучения | Чёткого офиц. обязательства нет | Блокировать на сервере, если грузит |
Источники: краулеры OpenAI, краулеры Anthropic, краулеры Google, Amazonbot, краулеры Meta, краулеры Perplexity.
Страны и фаервол. Почти все ИИ-краулеры работают из США — Google, Microsoft, OpenAI, Anthropic, Amazon, Meta, Perplexity. Единственный крупный не-американский — Bytespider (ByteDance, Китай), и он же нередко самый агрессивный. Оговорка для блокировки по ipset / GeoIP: краулеры ходят с облачных IP, которые не всегда совпадают со страной компании, — поэтому режьте по официальным опубликованным диапазонам IP (их публикуют Google, OpenAI, Perplexity и др.) и проверяйте reverse DNS, а не «по стране», иначе вместе со страной срежете нужный поисковый бот.
Готовый robots.txt — можно копировать
Если в вашем robots.txt нет общего Disallow на весь сайт, поисковые боты и так разрешены — задача просто не добавлять для них Disallow. Блок ниже — это то, чего обычно и хотят: отказаться от использования контента в обучении, оставаясь полностью видимым в ИИ-поиске.
# Оставляем разрешёнными ИИ-боты поиска/ответов (НЕ ставим им Disallow):
# Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot,
# Claude-User, PerplexityBot
# ПО ЖЕЛАНИЮ — отказ только от *обучения*.
# Это НЕ убирает вас из ИИ-поиска и ответов.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Bytespider
Disallow: /
Google-Extended стоит выделить: по словам Google, он управляет тем, обучается ли на вашем контенте Gemini и Vertex AI, и не влияет на попадание и ранжирование в Google Поиске — то есть AI Overviews всё равно берут вас из обычного индекса.
robots.txt просит, но не заставляет
Две группы краулеров robots.txt не остановит:
- Заходящие по запросу пользователя. Когда кто-то спрашивает ChatGPT или Perplexity про вашу страницу, ассистент скачивает её от лица пользователя. OpenAI прямо пишет, что для
ChatGPT-User«правила robots.txt могут не применяться», а Perplexity — чтоPerplexity-User«обычно игнорирует правила robots.txt». (Claude-User— вежливое исключение: Anthropic говорит, что онrobots.txtуважает.) Если такие заходы реально нужно остановить — это делается на сервере, а не вrobots.txt. - Скрейперы, которые его просто игнорируют. У
Bytespider(ByteDance) нет внятного публичного обязательства соблюдать стандарт исключений, и по многим сообщениям он обходит сайты агрессивно. Если он съедает трафик — блокируйте на уровне веб-сервера или фаервола: на nginx это отдача403по совпадениюUser-Agentили правило Fail2ban.
Именно здесь хостинг с обслуживанием себя оправдывает: нужные для видимости боты остаются разрешёнными в robots.txt, а агрессивные отсекаются на входе, чтобы не тормозили сайт.
Дорогая ошибка: заблокировать тех, кто нужен
На практике сайт куда чаще случайно закрывается от ИИ-поиска сам, чем реально страдает от скрейперов. Вот как это обычно выходит:
- общий
Disallow: /, оставшийся от тестовой версии сайта; - WAF (защитный экран перед сайтом) или «защита от ботов» (bot-fight mode), которая режет неизвестные user-agent (подпись, которой бот себя называет) — включая
OAI-SearchBotиPerplexityBot; - блокировка
GPTBotв расчёте, что это закроет и поиск ChatGPT (нет — за поиск отвечаетOAI-SearchBot).
Если не уверены, в какой вы группе, начните с парного материала — мифы про ответы ИИ: что Google и OpenAI реально говорят — там про индексацию и сниппеты, от которых зависит, можете ли вы вообще попасть в цитаты.
Частые вопросы
Если заблокировать GPTBot, пропаду ли я из ChatGPT? Нет. GPTBot — только обучение. За поиск ChatGPT отвечает OAI-SearchBot. Блокировка GPTBot лишь отключает использование в обучении.
Google-Extended меняет моё ранжирование в Google? Нет. По словам Google, он управляет только использованием контента для обучения Gemini и Vertex AI; на попадание и ранжирование в Поиске не влияет, а AI Overviews берут данные из обычного индекса.
Остановит ли robots.txt Bytespider? Возможно, нет. Внятного обязательства соблюдать его нет, и по сообщениям он его игнорирует — блокируйте на nginx, фаерволе или WAF, если он грузит сайт.
Можно ли заблокировать ChatGPT-User или Claude-User? Claude-User robots.txt уважает; ChatGPT-User — может не уважать. Чтобы надёжно остановить заходы по запросу пользователя, блокируйте на сервере.
Блокировать ли все обучающие ИИ-боты? Это вопрос контента и прав, а не SEO. Блокировка обучающих ботов не вредит видимости в ИИ-поиске — так что блокируйте их только если не хотите, чтобы ваш контент шёл в обучение моделей.
Мы настраиваем это клиентам в рамках хостинга с обслуживанием и работы по SEO и GEO — нужные боты разрешены, агрессивные отсекаются на сервере, всё по документации платформ выше. Хотите быстро понять, что краулит ваш сайт и не блокируете ли вы не тех ботов — напишите нам.