Pokud provozujete osobní blog, portfolio, rodinný web nebo malou tvůrčí stránku, blokování crawlerů začíná pojmenováním správných user agentů a pochopením, že robots.txt je žádost, nikoli zámek.
Blokujte AI crawlery, aniž byste zničili užitečnou viditelnost.
Oddělte vyhledávání
Nekopírujte náhodný seznam blokovaných botů do produkce. Vyhledávací crawlery, AI vyhledávací crawlery, tréninkové crawlery a fetchery spouštěné uživatelem mohou mít různé účely. Zablokování nesprávného agenta může skrýt vaše stránky před nástroji, které stále chcete využívat.
Sledujte logy
Serverové logy ukazují, kdo skutečně navštěvuje. Udržujte krátký cyklus kontroly: přidejte pravidla, sledujte provoz, zkontrolujte, zda se důležité stránky stále zobrazují tam, kde očekáváte, a poté upravte.
User agent
Společnost
Proč na tom záleží
Upozornění na opatrnost
GPTBot
OpenAI
Běžně používaný pro ovládání webového crawlingu OpenAI.
Zablokujte, pokud nechcete, aby tento crawler stahoval vaše veřejné stránky pro účely související s AI. Ověřte aktuální dokumentaci OpenAI.
ChatGPT-User
OpenAI
Agent pro prohlížení/stahování spouštěný uživatelem, o kterém se často diskutuje.
Zablokování může zabránit uživatelům ChatGPT požádat jej o přečtení vaší stránky. To není stejný záměr jako plošný tréninkový crawling.
Google-Extended
Google
Ovládací prvek, který Google dokumentuje pro některé případy generativní AI.
Není to totéž jako zablokování Google Search. Neblokujte Googlebota, pokud nechcete ovlivnit viditelnost ve vyhledávání.
ClaudeBot
Anthropic
Název crawleru Anthropic, který se objevuje v diskusích o ovládání crawlerů.
Používejte až po kontrole nejnovější dokumentace Anthropic.
Claude-SearchBot
Anthropic
Název vyhledávacího crawleru Claude, který se objevuje ve veřejných pokynech.
Před zablokováním agentů vyhledávacího typu zvažte kompromis ve viditelnosti.
PerplexityBot
Perplexity
Crawler/user agent Perplexity, o kterém diskutují vydavatelé.
Zablokování může ovlivnit, jak je váš obsah objevován nebo citován odpovídacími systémy typu Perplexity.
CCBot
Common Crawl
Veřejný webový crawler používaný pro velké webové datové sady.
Často blokovaný vydavateli, kteří nechtějí, aby byly stránky kopírovány do veřejných crawl korpusů.
Bytespider
ByteDance
Crawler spojený se společností ByteDance.
Užitečné zvážit, pokud chcete široký seznam blokovaných AI crawlerů.
Jak vás crawlery najdou
Jak AI crawlery objevují a stahují váš web.
Než můžete crawler zablokovat, pomůže vědět, jak přichází. Automatizované fetchery jen zřídka narazí na stránku náhodně; sledují poměrně předvídatelný řetězec objevování. Popisy níže jsou obecné a zjednodušené a přesné chování jakéhokoli konkrétního bota se může měnit, proto před jednáním ověřte oficiální dokumentaci každého poskytovatele.
Objevování
Crawlery nacházejí URL sledováním odkazů z jiných stránek, čtením vašeho XML sitemap, kontrolou vašeho robots.txt a čerpáním z velkých veřejných datových sad odkazů. Zbrusu nová stránka se obvykle stane dosažitelnou ve chvíli, kdy na ni něco veřejného odkáže.
Stahování
Crawler odesílá HTTP požadavek, ve kterém se identifikuje řetězcem user agent. Váš server může tento řetězec prozkoumat a rozhodnout, jak odpovědět, ačkoli user agenty lze napodobit, proto s nimi zacházejte jako se signálem, nikoli jako s důkazem.
Frekvence
Slušně se chovající crawlery se pravidelně vracejí, aby zachytily změny, a mnohé respektují pokyny crawl-delay nebo vlastní limity rychlosti. Špatně se chovající mohou stahovat agresivně, což je jeden z důvodů, proč je omezování rychlosti vedle zdvořilých pravidel důležité.
Tři druhy botů
Vyhledávací crawlery, AI tréninkové crawlery a boty pro živé získávání dat nejsou totéž.
Mnoho chyb při blokování pramení z toho, že se s každým botem zachází stejně. Tři níže uvedené kategorie se v mechanice překrývají, ale liší se účelem, a zablokování jedné může mít velmi odlišné důsledky než zablokování jiné. Názvosloví a chování se vyvíjejí, proto před tím, než se na tento rámec spolehnete, potvrďte aktuální roli jakéhokoli konkrétního agenta.
Typ
Co dělá
Účinek zablokování
Vyhledávací crawler
Indexuje stránky, aby se mohly objevit ve výsledcích vyhledávače.
Zablokování vás může odstranit z daného vyhledávače. Obvykle to není to, co chcete.
AI tréninkový crawler
Stahuje stránky pro tvorbu nebo vylepšování tréninkových datových sad pro AI modely.
Zablokování žádá poskytovatele, aby vaše veřejné stránky nepoužíval k tréninku. To je hlavní cíl pro většinu lidí zde.
Bot pro živé získávání dat AI
Stáhne stránku na vyžádání, když uživatel požádá AI asistenta o její přečtení nebo citaci.
Zablokování může zabránit tomu, aby byla vaše stránka čtena nebo citována v reálném čase, což ovlivňuje viditelnost v odpovídacích systémech spíše než trénink.
Kompromis, který stojí za pojmenování.
Tréninkové crawlery a boty pro živé získávání dat jsou ty, které většina lidí míní pojmem „AI boti“, ale některé také pohánějí objevování a citaci. Rozhodněte se uvážlivě, zda chcete být trénováni, citováni, obojí, nebo ani jedno, protože to jsou samostatná rozhodnutí.
Vrstvený přístup
Blokování funguje nejlépe ve vrstvách, protože žádná jednotlivá vrstva není úplná.
Představte si blokování spíše jako obranu do hloubky než jako jediný přepínač. Každá vrstva zachytí případy, které ostatní minou, a každá má své poctivé limity. Začněte zdvořilými, málo rizikovými vrstvami a přísnější přidávejte jen tam, kde za to kompromis stojí.
1. robots.txt
Prostý textový soubor, který pojmenované crawlery žádá, aby nestahovaly uvedené cesty. Boti dodržující pravidla jej respektují; ti, kdo pravidla nedodržují, jej ignorují. Je to standardní první krok a nejméně rušivý.
2. Meta robots a X-Robots-Tag
Meta tag na úrovni stránky nebo HTTP hlavička odpovědi mohou požádat, aby obsah nebyl indexován nebo používán určitými způsoby. Podpora se u jednotlivých botů liší, proto s direktivami jako noai zacházejte jako s žádostmi, nikoli zárukami.
3. WAF, firewall a limity rychlosti
Webový aplikační firewall nebo omezovač rychlosti může blokovat nebo škrtit provoz podle user agenta, IP rozsahu nebo chování. Na rozdíl od robots.txt je to skutečně vynucováno na serveru, ačkoli to vyžaduje opatrnost, aby nebyli zachyceni legitimní návštěvníci.
4. Přihlašovací brány
Obsah za přihlášením není veřejně stahovatelný, což je nejspolehlivější způsob, jak zcela udržet příležitostné crawlery mimo. Cenou je tření pro skutečné uživatele, proto jej vyhraďte pro materiál, který jej opravdu potřebuje.
Spravované platformy přidávají další možnost. Někteří poskytovatelé, jako například služby typu Cloudflare, nabízejí vestavěné ovládací prvky, které za vás identifikují a blokují kategorie AI botů. Ty mohou být pohodlné, ale stále závisíte na přesnosti detekce a definicích poskytovatele, proto než danému přepínači uvěříte, ověřte, co skutečně dělá.
# robots.txt — zdvořilá první vrstva (ověřte aktuální názvy agentů)
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# Zachovejte funkční běžné vyhledávání: NEBLOKUJTE plošně Googlebota
User-agent: Googlebot
Allow: /
Bylo by zavádějící prezentovat kteroukoli z těchto technik jako neprůstřelnou. Významně snižují nechtěný crawling, ale nezpůsobí, že by byl váš obsah nedosažitelný. Správné nastavení očekávání je součástí zodpovědného přístupu.
robots.txt a podobné direktivy jsou dobrovolné. Crawlery dodržující pravidla je respektují; ostatní je mohou prostě ignorovat.
Kopie pořízené předtím, než jste přidali pravidlo, mohou přetrvávat v cache, archivech a datových sadách, ke kterým nemáte přístup.
Řetězce user agent lze podvrhnout, takže seznam blokovaných podle názvu nezachytí bota, který se vydává za běžný prohlížeč.
Příliš široká pravidla mohou náhodně poškodit viditelnost ve vyhledávání nebo zablokovat nástroje, které skutečně chcete.
Vynucování na úrovni serveru je silnější než zdvořilá pravidla, ale může vytvářet falešně pozitivní výsledky, které blokují skutečné lidi.
Nic z toho není právní poradenství a technická opatření sama o sobě neřeší otázky autorského práva, smlouvy nebo jurisdikce.
Realistický cíl.
Usilujte o to, aby byl nechtěný AI crawling výrazně méně pohodlný a aby vaše uvedená preference byla jasně zdokumentována. To je dosažitelné. Zaručené, univerzální vyloučení nikoli.
Sledujte své logy
Jak sledovat serverové logy kvůli AI user agentům.
Pravidla jsou užitečná jen tehdy, pokud kontrolujete, zda fungují. Vaše serverové přístupové logy zaznamenávají, kdo si co, kdy a s jakým řetězcem user agent vyžádal. Krátká, pravidelná kontrola vám řekne, kteří boti skutečně navštěvují a zda jsou vaše pravidla dodržována. Pamatujte, že user agenty lze napodobit, proto s logy zacházejte jako s důkazem k interpretaci, nikoli jako s absolutní pravdou.
Na co se zaměřit
Prohledávejte známé řetězce AI user agentů, jako jsou GPTBot, CCBot, ClaudeBot, PerplexityBot a Bytespider. Zaznamenejte objem jejich požadavků a které cesty stahují.
Známky problémů
Sledujte agenty, kteří váš web silně vyžadují poté, co jste je zakázali, neznámé agenty rychle stahující mnoho stránek nebo obecné řetězce prohlížečů zasahující URL, které by žádný člověk nenavštívil.
Co dělat dál
Pokud crawler dodržující pravidla ignoruje pravidlo, znovu zkontrolujte syntaxi. Pokud bot skutečně ignoruje robots.txt, zvažte pravidlo firewallu nebo omezení rychlosti a přijměte přidané riziko falešně pozitivních výsledků.
# Hrubý příklad: spočítat požadavky podle user agenta souvisejícího s AI
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
| awk '{print $NF}' | sort | uniq -c | sort -rn
Zavádění krok za krokem
Obezřetné zavádění, které lze vrátit zpět.
Protože nesprávné pravidlo může tiše poškodit legitimní viditelnost, zaváděte změny postupně a v každém kroku sledujte účinek. Níže uvedený postup upřednostňuje vratnost před rychlostí, což je pro většinu osobních a malých webů správná priorita.
Výchozí stav: zkontrolujte své aktuální logy, abyste věděli, kteří boti navštěvují, než cokoli změníte.
Rozhodněte o záměru: zvolte, zda chcete být vyloučeni z tréninku, z živého získávání dat, nebo z obojího, a potvrďte, že zachováváte běžné vyhledávání neporušené.
Začněte zdvořile: přidejte pravidla robots.txt pro konkrétní AI tréninkové crawlery, které chcete vyloučit, s použitím názvů ověřených oproti oficiální dokumentaci.
Přidejte ovládání na úrovni stránky: tam, kde je podporováno, přidejte direktivy meta robots nebo X-Robots-Tag pro jemnější ovládání.
Pozorujte: počkejte týden nebo dva a znovu zkontrolujte logy a viditelnost ve vyhledávání, abyste potvrdili, že se nic důležitého nerozbilo.
Vynucujte selektivně: pouze pro boty, kteří ignorují zdvořilá pravidla, přidejte pravidla firewallu nebo omezení rychlosti a pečlivě testujte, abyste se vyhnuli falešně pozitivním výsledkům.
Kontrolujte podle plánu: vracejte se k tomu každých pár měsíců, protože názvy crawlerů, zásady poskytovatelů i vaše vlastní priority se mění.
Mohu zastavit AI trénink na svých osobních fotkách?
Můžete snížit expozici, ale jakmile jsou fotky veřejné, nemůžete zaručit úplnou kontrolu. Citlivé fotky udržujte soukromé, zkontrolujte nastavení platformy, vyhněte se veřejnému nahrávání ve vysokém rozlišení a použijte ovládání crawlerů pro svůj vlastní web.
Měl bych vkládat svůj životopis do AI chatbota?
Pouze po odstranění údajů, které pro daný úkol nepotřebujete. Jména, adresy, telefonní čísla, data narození, podpisy, firemní tajemství a reference lze často nahradit zástupnými hodnotami.
Mohu nahrávat rodinné dokumenty do AI?
Buďte opatrní. Lékařské dopisy, pasy, školní dokumenty, právní listiny, bankovní soubory a rodinné záznamy mohou obsahovat citlivé údaje o jiných lidech. Použijte schválená nastavení soukromí, nebo je nenahrávejte.
Stávají se soukromé prompty tréninkovými daty AI?
Záleží na produktu, typu účtu a nastavení. Někteří poskytovatelé nabízejí ovládací prvky, týmové plány nebo podmínky API, které s daty zacházejí odlišně. Než začnete psát citlivé informace, zkontrolujte aktuální nastavení.
Mohu zcela zabránit AI společnostem trénovat na mém webu?
Ne jedním technickým přepínačem. robots.txt může požádat, aby se crawlery dodržující pravidla držely stranou, ale je dobrovolný a neodstraňuje kopie, které již existují jinde.
Blokuje robots.txt AI trénink právně?
robots.txt je technická konvence, nikoli sám o sobě smlouva. Může podpořit vaši politickou pozici, ale právní otázky závisejí na jurisdikci, podmínkách, autorském právu, smlouvách a vymáhání.