← Усі статті Блог

ШІ-краулери і robots.txt: яких ботів пускати, а яких блокувати

Коротко: вирішуйте за задачею бота, а не за назвою компанії. Пускайте тих, хто заводить вас у відповіді ШІ — OAI-SearchBot, Claude-SearchBot, PerplexityBot, і насамперед Googlebot та Bingbot (вони живлять Google AI Overviews, Copilot і опосередковано ChatGPT). Заблокувати навчальний бот (GPTBot, ClaudeBot, Google-Extended) — окреме й законне рішення, яке не прибирає вас із ШІ-пошуку. І пам’ятайте: robots.txt — це прохання. Боти, що заходять на запит користувача, і скрейпери (боти, що викачують контент сайту) на кшталт Bytespider можуть його ігнорувати — для них потрібні правила на рівні сервера.

Ми тримаємо хостинг клієнтських сайтів і бачимо цих краулерів у власних логах, тож нижче — та сама шпаргалка, якою користуємось самі. Побудована на офіційній документації платформ, посилання — за текстом.

Спершу головне: для чого цей бот

Будь-який ШІ-краулер виконує одну з чотирьох задач. Пускати його чи ні — вирішує саме задача, а не бренд.

  1. Пошук / індексація для відповідей. Будує індекс, з якого ШІ бере відповідь. Заблокуєте — зникнете з відповідей цього рушія. Таких пускаємо.
  2. Навчання моделей. Збирає контент для навчання майбутніх моделей. Це питання контенту й прав, а не SEO — блокування на видимість у ШІ-пошуку не впливає.
  3. Захід на запит користувача. Завантажує одну сторінку, бо користувач спитав про неї асистента. Такі часто ігнорують robots.txt, адже діють від імені людини.
  4. Реклама / прев’ю / інше. Перевіряють рекламні лендинги, будують прев’ю посилань тощо.

Тому у питання «чи блокувати ШІ-ботів?» немає однієї відповіді. Пошукові боти майже завжди потрібні, а навчальні — на ваш розсуд.

Шпаргалка

КраулерВласник (країна)Для чогоСлухається robots.txt?Наша рекомендація
GooglebotGoogle (США)Пошуковий індекс — живить і AI Overviews, і AI ModeТакПускати (обов’язково)
BingbotMicrosoft (США)Пошуковий індекс — живить Copilot і опосередковано ChatGPTТакПускати (обов’язково)
OAI-SearchBotOpenAI (США)Пошуковий індекс ChatGPTТакПускати
Claude-SearchBotAnthropic (США)Пошукові результати ClaudeТакПускати
Claude-UserAnthropic (США)Заходить на сторінку, коли питає користувач ClaudeТакПускати (не блокувати)
PerplexityBotPerplexity (США)Будує індекс відповідей PerplexityТакПускати
Meta-WebIndexerMeta (США)Пошукові результати Meta AIТакПускати заради видимості в Meta AI
GPTBotOpenAI (США)Навчання моделей OpenAIТакНа ваш розсуд — блок = відмова від навчання (на пошук не впливає)
ClaudeBotAnthropic (США)Навчання моделей AnthropicТак (+ Crawl-delay)На ваш розсуд — блок = відмова від навчання
Google-ExtendedGoogle (США)Керівний токен навчання Gemini / Vertex AIТак (це керівний токен)Блок = відмова від навчання; на ранжування в Пошуку не впливає
AmazonbotAmazon (США)Покращує продукти Amazon; може навчати ШІ AmazonТакНа ваш розсуд
Meta-ExternalAgentMeta (США)Навчає моделі Meta / індексує контентТакНа ваш розсуд — блок = відмова
ChatGPT-UserOpenAI (США)Заходить на сторінку на запит користувача ChatGPT«може не застосовуватись»На robots.txt покладатися не можна — ріжте на сервері
Meta-ExternalFetcherMeta (США)Дістає посилання на запит користувачаМоже ігноруватиЗа потреби — на рівні сервера
facebookexternalhitMeta (США)Будує прев’ю посилань у застосунках MetaМоже ігноруватиЗазвичай лишають (прев’ю посилань)
Perplexity-UserPerplexity (США)Завантажує в реальному часі на запит користувачаЗазвичай ігнорує (на запит користувача)На robots.txt покладатися не можна — ріжте на сервері
GoogleOtherGoogle (США)Загальний службовий обхід Google (R&D), не ранжуванняТакНейтрально — пускати
OAI-AdsBotOpenAI (США)Перевіряє надіслані рекламні лендингиЛише рекламні сторінкиНе чіпати
BytespiderByteDance (Китай)Масовий скрейпінг, за повідомленнями — для навчанняЧіткого офіц. зобов’язання немаєБлокувати на сервері, якщо вантажить

Джерела: краулери OpenAI, краулери Anthropic, краулери Google, Amazonbot, краулери Meta, краулери Perplexity.

Країни і фаервол. Майже всі ШІ-краулери працюють зі США — Google, Microsoft, OpenAI, Anthropic, Amazon, Meta, Perplexity. Єдиний великий не-американський — Bytespider (ByteDance, Китай), і він же нерідко найагресивніший. Застереження для блокування по ipset / GeoIP: краулери ходять з хмарних IP, що не завжди збігаються з країною компанії, — тож ріжте за офіційними опублікованими діапазонами IP (їх публікують Google, OpenAI, Perplexity та ін.) і перевіряйте reverse DNS, а не «за країною», інакше разом із країною зріжете потрібний пошуковий бот.

Готовий robots.txt — можна копіювати

Якщо у вашому robots.txt немає загального Disallow на весь сайт, пошукові боти й так дозволені — задача просто не додавати для них Disallow. Блок нижче — це те, чого зазвичай і хочуть: відмовитись від використання контенту в навчанні, лишаючись повністю видимим у ШІ-пошуку.

# Лишаємо дозволеними ШІ-боти пошуку/відповідей (НЕ ставимо їм Disallow):
#   Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot,
#   Claude-User, PerplexityBot

# ЗА БАЖАННЯМ — відмова лише від *навчання*.
# Це НЕ прибирає вас із ШІ-пошуку та відповідей.
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: Bytespider
Disallow: /

Google-Extended варто виділити: за словами Google, він керує тим, чи навчаються на вашому контенті Gemini та Vertex AI, і не впливає на потрапляння та ранжування в Google Пошуку — тобто AI Overviews все одно беруть вас зі звичайного індексу.

robots.txt просить, але не змушує

Дві групи краулерів robots.txt не зупинить:

  • Ті, що заходять на запит користувача. Коли хтось питає ChatGPT чи Perplexity про вашу сторінку, асистент завантажує її від імені користувача. OpenAI прямо пише, що для ChatGPT-User «правила robots.txt можуть не застосовуватись», а Perplexity — що Perplexity-User «зазвичай ігнорує правила robots.txt». (Claude-User — ввічливий виняток: Anthropic каже, що він robots.txt поважає.) Якщо такі заходи справді треба зупинити — це робиться на сервері, а не в robots.txt.
  • Скрейпери, що його просто ігнорують. У Bytespider (ByteDance) немає виразного публічного зобов’язання дотримуватись стандарту винятків, і за багатьма повідомленнями він обходить сайти агресивно. Якщо він з’їдає трафік — блокуйте на рівні веб-сервера чи фаервола: на nginx це віддача 403 за збігом User-Agent або правило Fail2ban.

Саме тут хостинг з обслуговуванням себе виправдовує: потрібні для видимості боти лишаються дозволеними в robots.txt, а агресивні відсікаються на вході, щоб не гальмували сайт.

Дорога помилка: заблокувати тих, хто потрібен

На практиці сайт куди частіше випадково закривається від ШІ-пошуку сам, ніж реально потерпає від скрейперів. Ось як це зазвичай стається:

  • загальний Disallow: /, що лишився від тестової версії сайту;
  • WAF (захисний екран перед сайтом) чи «захист від ботів» (bot-fight mode), який ріже невідомі user-agent (підпис, яким бот себе називає) — зокрема OAI-SearchBot і PerplexityBot;
  • блокування GPTBot у розрахунку, що це закриє й пошук ChatGPT (ні — за пошук відповідає OAI-SearchBot).

Якщо не впевнені, у якій ви групі, почніть із парного матеріалу — міфи про відповіді ШІ: що Google і OpenAI насправді кажуть — там про індексацію та сніпети, від яких залежить, чи можете ви взагалі потрапити в цитати.

Часті запитання

Якщо заблокувати GPTBot, чи зникну я з ChatGPT? Ні. GPTBot — лише навчання. За пошук ChatGPT відповідає OAI-SearchBot. Блокування GPTBot лише вимикає використання в навчанні.

Google-Extended змінює моє ранжування в Google? Ні. За словами Google, він керує лише використанням контенту для навчання Gemini та Vertex AI; на потрапляння та ранжування в Пошуку не впливає, а AI Overviews беруть дані зі звичайного індексу.

Чи зупинить robots.txt Bytespider? Можливо, ні. Виразного зобов’язання дотримуватись його немає, і за повідомленнями він його ігнорує — блокуйте на nginx, фаерволі чи WAF, якщо він вантажить сайт.

Чи можна заблокувати ChatGPT-User або Claude-User? Claude-User robots.txt поважає; ChatGPT-User — може не поважати. Щоб надійно зупинити заходи на запит користувача, блокуйте на сервері.

Чи блокувати всі навчальні ШІ-боти? Це питання контенту й прав, а не SEO. Блокування навчальних ботів не шкодить видимості у ШІ-пошуку — тож блокуйте їх лише якщо не хочете, щоб ваш контент ішов у навчання моделей.


Ми налаштовуємо це клієнтам у межах хостингу з обслуговуванням і роботи з SEO та GEO — потрібні боти дозволені, агресивні відсікаються на сервері, усе за документацією платформ вище. Хочете швидко зрозуміти, що краулить ваш сайт і чи не блокуєте ви не тих ботів — напишіть нам.

Зв'язатися

Покажіть ваш сайт. Скажемо, що насправді не так.

Безкоштовна 30-хвилинна розмова у WhatsApp, Telegram або дзвінком. Без презентацій, без нав'язування додаткових послуг. Якщо ми не підходимо — підкажемо, хто підійде.

Зв'язатись