AI crawler (GPTBot, ClaudeBot)
AI crawlery jsou roboti jazykových modelů, kteří sbírají obsah webů: GPTBot pro OpenAI, ClaudeBot pro Anthropic, PerplexityBot, Amazonbot a další; u Googlu jde o token Google-Extended v robots.txt. Když se na váš web nedostanou, vaše značka pro danou AI přestává existovat: model o vás nemá co vědět a v odpovědích vás nahradí konkurence, kterou crawler přečíst mohl.
V kostce
| Co to je | Roboti sbírající obsah pro trénink a odpovědi jazykových modelů |
| Dva druhy | Indexační crawler plní znalostní bázi. Crawler pro odpovědi načítá stránku až při konkrétní odpovědi |
| Kde se blokují | V robots.txt vědomě, často ale nevědomě na firewallu nebo WAF hostingu |
| Jak to ověřit | Přímým dotazem na server s identifikací bota. Kontrola robots.txt nestačí |
Jak to funguje
Tři role, tři různí roboti
Každý velký provozovatel modelů provozuje několik robotů a každý z nich má jinou úlohu. Rozlišení podle jména (user agenta) je základ, protože pravidla v robots.txt i ve firewallu se píší právě na jméno.
| Trénink modelu | GPTBot, ClaudeBot, Amazonbot, Bytespider, CCBot. Sbírají obsah do tréninkových dat, výsledek se projeví až v příští generaci modelu. |
| Index pro vyhledávání asistenta | OAI-SearchBot, Claude-SearchBot, PerplexityBot. Plní index, ze kterého asistent vybírá zdroje pro odpovědi s citacemi. |
| Načtení na pokyn uživatele | ChatGPT-User, Claude-User, Perplexity-User. Stáhnou konkrétní stránku ve chvíli, kdy ji uživatel vloží nebo kdy ji asistent potřebuje pro právě psanou odpověď. |
| Řídicí token bez vlastního robota | Google-Extended, Applebot-Extended. Nemají vlastní user agent. Jen říkají Googlebotu a Applebotu, zda smí už stažený obsah použít: Google-Extended pro trénink a grounding Gemini, Applebot-Extended pro trénink modelů Apple. |
Praktický důsledek: zákaz Google-Extended nezmění nic na vyhledávání Google ani na AI Overviews, ty běží na Googlebotu. A povolený ChatGPT-User bez OAI-SearchBota znamená, že vás asistent přečte jen tehdy, když na vaši URL narazí jinde.
Cesta požadavku a kde se přeruší
Robot, který dodržuje pravidla, si nejdřív stáhne robots.txt, najde skupinu se svým jménem a řídí se řádky Allow a Disallow. Pak posílá běžné HTTP požadavky na jednotlivé URL. Každý z nich prochází stejnou cestou jako návštěvník: CDN a firewall (WAF, bot management), pravidla na serveru (.htaccess, bezpečnostní plugin) a teprve potom aplikace, která vrátí HTML. Blokace na kterékoli vrstvě před aplikací vrací 403, výzvu pro prohlížeč nebo prázdnou stránku a robots.txt v tu chvíli nehraje roli. Cloudflare se navíc od července 2025 u nově přidaných domén ptá, zda AI crawlery pustit, a výchozí volba je blokace. K zákazu tak často stačí založit účet u CDN. Druhé omezení: AI crawlery zpravidla nespouštějí JavaScript. Ceny, popisy a recenze, které se vykreslují až v prohlížeči, pro ně nemusí existovat.
Modelový příklad: e-shop s 5 000 URL nastaví pro AI roboty limit 1 požadavek za sekundu. Celý web robot načte za 5 000 sekund, tedy zhruba za 83 minut, a zátěž serveru je zanedbatelná. Limit je proto rozumnější než blok.
Ověření: dvě otázky, dva postupy
První otázka zní, zda se robot na web dostane. Odpověď dá jen požadavek zvenčí s user agentem konkrétního bota na několik typů stránek (homepage, kategorie, produkt, článek), protože pravidla WAF bývají odstupňovaná podle cesty. Vedle návratového kódu se kontroluje i tělo odpovědi: kód 200 s výzvou k ověření prohlížeče je pro robota stejná překážka jako 403. Druhá otázka zní, zda návštěvník v logu, který se hlásí jako GPTBot, je opravdu GPTBot. Řetězec user agenta si může nastavit kdokoli. Provozovatelé proto zveřejňují rozsahy IP adres svých robotů (OpenAI například jako veřejný soubor JSON) a shoda IP s tímto seznamem je jediný spolehlivý důkaz. Bez ní nedává smysl počítat návštěvy AI robotů ani na ně stavět pravidla.
Dva crawlery, dvě různé škody
Poskytovatelé modelů používají oddělené roboty. Indexační crawler, například ClaudeBot nebo GPTBot, plní znalostní bázi modelu: bez něj se o vás model nedozví sám od sebe. Crawler pro odpovědi, například Claude-User nebo ChatGPT-User, načítá stránku až ve chvíli, kdy na ni v konkrétní odpovědi přijde řada. Blokace každého z nich má jiný důsledek a může nastat nezávisle.
Z naší praxe: blokovaní roboti, o kterých nikdo neví
Při auditech testujeme crawlery jazykových modelů přímým dotazem. Část z nich běžně dostává HTTP 403, přestože je robots.txt výslovně povoluje. Blokuje je firewall na úrovni hostingu nebo CDN, vrstva, do které se běžně nikdo nedívá. Typický detail: crawler pro odpovědi téhož poskytovatele projde, blokovaný je jen indexační.
Blokovat AI crawlery vědomě je konkurenční nevýhoda, ne opatrnost. A kdo je blokuje, obvykle o tom ani neví: blokace vzniká na firewallu nebo v CDN, ne rozhodnutím.
Časté chyby
- Kontrolovat jen robots.txt. Skutečnou dostupnost určuje server. Firewall může robots.txt tiše přebít.
- Blokovat všechno z opatrnosti. Ochrana obsahu před tréninkem je legitimní volba, ale musí být vědomá, ne vedlejší efekt bezpečnostního pravidla.
- Ověřit jednou a už nikdy. Hostingy mění pravidla bez oznámení. Měsíční test patří do rutiny.
Časté otázky
Které crawlery mám pustit?
Minimálně GPTBot, ClaudeBot, PerplexityBot, Google-Extended a OAI-SearchBot. Kdo chce viditelnost v AI, pouští všechny. Kdo chce chránit obsah před tréninkem, rozhoduje se bot po botovi.
Jak si dostupnost ověřím?
Dotazem na vlastní web s user agentem daného bota a kontrolou návratového kódu. Očekávaný výsledek je 200, cokoli jiného znamená problém na cestě.
Zpomalí crawlery web?
Běžně ne. Když ano, správná odpověď je rate limit, ne blokace: bot dostane data pomaleji, ale dostane je.
Kde vám pomůžeme
Audit dostupnosti pro AI crawlery je první krok naší služby GEO optimalizace pro AI.