Коротко: вирішуйте за задачею бота, а не за назвою компанії. Пускайте тих, хто заводить вас у відповіді ШІ — OAI-SearchBot, Claude-SearchBot, PerplexityBot, і насамперед Googlebot та Bingbot (вони живлять Google AI Overviews, Copilot і опосередковано ChatGPT). Заблокувати навчальний бот (GPTBot, ClaudeBot, Google-Extended) — окреме й законне рішення, яке не прибирає вас із ШІ-пошуку. І пам’ятайте: robots.txt — це прохання. Боти, що заходять на запит користувача, і скрейпери (боти, що викачують контент сайту) на кшталт Bytespider можуть його ігнорувати — для них потрібні правила на рівні сервера.
Ми тримаємо хостинг клієнтських сайтів і бачимо цих краулерів у власних логах, тож нижче — та сама шпаргалка, якою користуємось самі. Побудована на офіційній документації платформ, посилання — за текстом.
Спершу головне: для чого цей бот
Будь-який ШІ-краулер виконує одну з чотирьох задач. Пускати його чи ні — вирішує саме задача, а не бренд.
- Пошук / індексація для відповідей. Будує індекс, з якого ШІ бере відповідь. Заблокуєте — зникнете з відповідей цього рушія. Таких пускаємо.
- Навчання моделей. Збирає контент для навчання майбутніх моделей. Це питання контенту й прав, а не SEO — блокування на видимість у ШІ-пошуку не впливає.
- Захід на запит користувача. Завантажує одну сторінку, бо користувач спитав про неї асистента. Такі часто ігнорують
robots.txt, адже діють від імені людини. - Реклама / прев’ю / інше. Перевіряють рекламні лендинги, будують прев’ю посилань тощо.
Тому у питання «чи блокувати ШІ-ботів?» немає однієї відповіді. Пошукові боти майже завжди потрібні, а навчальні — на ваш розсуд.
Шпаргалка
| Краулер | Власник (країна) | Для чого | Слухається robots.txt? | Наша рекомендація |
|---|---|---|---|---|
Googlebot | Google (США) | Пошуковий індекс — живить і AI Overviews, і AI Mode | Так | Пускати (обов’язково) |
Bingbot | Microsoft (США) | Пошуковий індекс — живить Copilot і опосередковано ChatGPT | Так | Пускати (обов’язково) |
OAI-SearchBot | OpenAI (США) | Пошуковий індекс ChatGPT | Так | Пускати |
Claude-SearchBot | Anthropic (США) | Пошукові результати Claude | Так | Пускати |
Claude-User | Anthropic (США) | Заходить на сторінку, коли питає користувач Claude | Так | Пускати (не блокувати) |
PerplexityBot | Perplexity (США) | Будує індекс відповідей Perplexity | Так | Пускати |
Meta-WebIndexer | Meta (США) | Пошукові результати Meta AI | Так | Пускати заради видимості в Meta AI |
GPTBot | OpenAI (США) | Навчання моделей OpenAI | Так | На ваш розсуд — блок = відмова від навчання (на пошук не впливає) |
ClaudeBot | Anthropic (США) | Навчання моделей Anthropic | Так (+ Crawl-delay) | На ваш розсуд — блок = відмова від навчання |
Google-Extended | Google (США) | Керівний токен навчання Gemini / Vertex AI | Так (це керівний токен) | Блок = відмова від навчання; на ранжування в Пошуку не впливає |
Amazonbot | Amazon (США) | Покращує продукти Amazon; може навчати ШІ Amazon | Так | На ваш розсуд |
Meta-ExternalAgent | Meta (США) | Навчає моделі Meta / індексує контент | Так | На ваш розсуд — блок = відмова |
ChatGPT-User | OpenAI (США) | Заходить на сторінку на запит користувача ChatGPT | «може не застосовуватись» | На robots.txt покладатися не можна — ріжте на сервері |
Meta-ExternalFetcher | Meta (США) | Дістає посилання на запит користувача | Може ігнорувати | За потреби — на рівні сервера |
facebookexternalhit | Meta (США) | Будує прев’ю посилань у застосунках Meta | Може ігнорувати | Зазвичай лишають (прев’ю посилань) |
Perplexity-User | Perplexity (США) | Завантажує в реальному часі на запит користувача | Зазвичай ігнорує (на запит користувача) | На robots.txt покладатися не можна — ріжте на сервері |
GoogleOther | Google (США) | Загальний службовий обхід Google (R&D), не ранжування | Так | Нейтрально — пускати |
OAI-AdsBot | OpenAI (США) | Перевіряє надіслані рекламні лендинги | Лише рекламні сторінки | Не чіпати |
Bytespider | ByteDance (Китай) | Масовий скрейпінг, за повідомленнями — для навчання | Чіткого офіц. зобов’язання немає | Блокувати на сервері, якщо вантажить |
Джерела: краулери OpenAI, краулери Anthropic, краулери Google, Amazonbot, краулери Meta, краулери Perplexity.
Країни і фаервол. Майже всі ШІ-краулери працюють зі США — Google, Microsoft, OpenAI, Anthropic, Amazon, Meta, Perplexity. Єдиний великий не-американський — Bytespider (ByteDance, Китай), і він же нерідко найагресивніший. Застереження для блокування по ipset / GeoIP: краулери ходять з хмарних IP, що не завжди збігаються з країною компанії, — тож ріжте за офіційними опублікованими діапазонами IP (їх публікують Google, OpenAI, Perplexity та ін.) і перевіряйте reverse DNS, а не «за країною», інакше разом із країною зріжете потрібний пошуковий бот.
Готовий robots.txt — можна копіювати
Якщо у вашому robots.txt немає загального Disallow на весь сайт, пошукові боти й так дозволені — задача просто не додавати для них Disallow. Блок нижче — це те, чого зазвичай і хочуть: відмовитись від використання контенту в навчанні, лишаючись повністю видимим у ШІ-пошуку.
# Лишаємо дозволеними ШІ-боти пошуку/відповідей (НЕ ставимо їм Disallow):
# Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot,
# Claude-User, PerplexityBot
# ЗА БАЖАННЯМ — відмова лише від *навчання*.
# Це НЕ прибирає вас із ШІ-пошуку та відповідей.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Bytespider
Disallow: /
Google-Extended варто виділити: за словами Google, він керує тим, чи навчаються на вашому контенті Gemini та Vertex AI, і не впливає на потрапляння та ранжування в Google Пошуку — тобто AI Overviews все одно беруть вас зі звичайного індексу.
robots.txt просить, але не змушує
Дві групи краулерів robots.txt не зупинить:
- Ті, що заходять на запит користувача. Коли хтось питає ChatGPT чи Perplexity про вашу сторінку, асистент завантажує її від імені користувача. OpenAI прямо пише, що для
ChatGPT-User«правила robots.txt можуть не застосовуватись», а Perplexity — щоPerplexity-User«зазвичай ігнорує правила robots.txt». (Claude-User— ввічливий виняток: Anthropic каже, що вінrobots.txtповажає.) Якщо такі заходи справді треба зупинити — це робиться на сервері, а не вrobots.txt. - Скрейпери, що його просто ігнорують. У
Bytespider(ByteDance) немає виразного публічного зобов’язання дотримуватись стандарту винятків, і за багатьма повідомленнями він обходить сайти агресивно. Якщо він з’їдає трафік — блокуйте на рівні веб-сервера чи фаервола: на nginx це віддача403за збігомUser-Agentабо правило Fail2ban.
Саме тут хостинг з обслуговуванням себе виправдовує: потрібні для видимості боти лишаються дозволеними в robots.txt, а агресивні відсікаються на вході, щоб не гальмували сайт.
Дорога помилка: заблокувати тих, хто потрібен
На практиці сайт куди частіше випадково закривається від ШІ-пошуку сам, ніж реально потерпає від скрейперів. Ось як це зазвичай стається:
- загальний
Disallow: /, що лишився від тестової версії сайту; - WAF (захисний екран перед сайтом) чи «захист від ботів» (bot-fight mode), який ріже невідомі user-agent (підпис, яким бот себе називає) — зокрема
OAI-SearchBotіPerplexityBot; - блокування
GPTBotу розрахунку, що це закриє й пошук ChatGPT (ні — за пошук відповідаєOAI-SearchBot).
Якщо не впевнені, у якій ви групі, почніть із парного матеріалу — міфи про відповіді ШІ: що Google і OpenAI насправді кажуть — там про індексацію та сніпети, від яких залежить, чи можете ви взагалі потрапити в цитати.
Часті запитання
Якщо заблокувати GPTBot, чи зникну я з ChatGPT? Ні. GPTBot — лише навчання. За пошук ChatGPT відповідає OAI-SearchBot. Блокування GPTBot лише вимикає використання в навчанні.
Google-Extended змінює моє ранжування в Google? Ні. За словами Google, він керує лише використанням контенту для навчання Gemini та Vertex AI; на потрапляння та ранжування в Пошуку не впливає, а AI Overviews беруть дані зі звичайного індексу.
Чи зупинить robots.txt Bytespider? Можливо, ні. Виразного зобов’язання дотримуватись його немає, і за повідомленнями він його ігнорує — блокуйте на nginx, фаерволі чи WAF, якщо він вантажить сайт.
Чи можна заблокувати ChatGPT-User або Claude-User? Claude-User robots.txt поважає; ChatGPT-User — може не поважати. Щоб надійно зупинити заходи на запит користувача, блокуйте на сервері.
Чи блокувати всі навчальні ШІ-боти? Це питання контенту й прав, а не SEO. Блокування навчальних ботів не шкодить видимості у ШІ-пошуку — тож блокуйте їх лише якщо не хочете, щоб ваш контент ішов у навчання моделей.
Ми налаштовуємо це клієнтам у межах хостингу з обслуговуванням і роботи з SEO та GEO — потрібні боти дозволені, агресивні відсікаються на сервері, усе за документацією платформ вище. Хочете швидко зрозуміти, що краулить ваш сайт і чи не блокуєте ви не тих ботів — напишіть нам.