Osobní weby

Jak blokovat AI crawlery.

Pokud provozujete osobní blog, portfolio, rodinný web nebo malou tvůrčí stránku, blokování crawlerů začíná pojmenováním správných user agentů a pochopením, že robots.txt je žádost, nikoli zámek.

Dělejte to obezřetně

Blokujte AI crawlery, aniž byste zničili užitečnou viditelnost.

Oddělte vyhledávání

Nekopírujte náhodný seznam blokovaných botů do produkce. Vyhledávací crawlery, AI vyhledávací crawlery, tréninkové crawlery a fetchery spouštěné uživatelem mohou mít různé účely. Zablokování nesprávného agenta může skrýt vaše stránky před nástroji, které stále chcete využívat.

Sledujte logy

Serverové logy ukazují, kdo skutečně navštěvuje. Udržujte krátký cyklus kontroly: přidejte pravidla, sledujte provoz, zkontrolujte, zda se důležité stránky stále zobrazují tam, kde očekáváte, a poté upravte.

User agentSpolečnostProč na tom záležíUpozornění na opatrnost
GPTBotOpenAIBěžně používaný pro ovládání webového crawlingu OpenAI.Zablokujte, pokud nechcete, aby tento crawler stahoval vaše veřejné stránky pro účely související s AI. Ověřte aktuální dokumentaci OpenAI.
ChatGPT-UserOpenAIAgent pro prohlížení/stahování spouštěný uživatelem, o kterém se často diskutuje.Zablokování může zabránit uživatelům ChatGPT požádat jej o přečtení vaší stránky. To není stejný záměr jako plošný tréninkový crawling.
Google-ExtendedGoogleOvládací prvek, který Google dokumentuje pro některé případy generativní AI.Není to totéž jako zablokování Google Search. Neblokujte Googlebota, pokud nechcete ovlivnit viditelnost ve vyhledávání.
ClaudeBotAnthropicNázev crawleru Anthropic, který se objevuje v diskusích o ovládání crawlerů.Používejte až po kontrole nejnovější dokumentace Anthropic.
Claude-SearchBotAnthropicNázev vyhledávacího crawleru Claude, který se objevuje ve veřejných pokynech.Před zablokováním agentů vyhledávacího typu zvažte kompromis ve viditelnosti.
PerplexityBotPerplexityCrawler/user agent Perplexity, o kterém diskutují vydavatelé.Zablokování může ovlivnit, jak je váš obsah objevován nebo citován odpovídacími systémy typu Perplexity.
CCBotCommon CrawlVeřejný webový crawler používaný pro velké webové datové sady.Často blokovaný vydavateli, kteří nechtějí, aby byly stránky kopírovány do veřejných crawl korpusů.
BytespiderByteDanceCrawler spojený se společností ByteDance.Užitečné zvážit, pokud chcete široký seznam blokovaných AI crawlerů.

Jak vás crawlery najdou

Jak AI crawlery objevují a stahují váš web.

Než můžete crawler zablokovat, pomůže vědět, jak přichází. Automatizované fetchery jen zřídka narazí na stránku náhodně; sledují poměrně předvídatelný řetězec objevování. Popisy níže jsou obecné a zjednodušené a přesné chování jakéhokoli konkrétního bota se může měnit, proto před jednáním ověřte oficiální dokumentaci každého poskytovatele.

Objevování

Crawlery nacházejí URL sledováním odkazů z jiných stránek, čtením vašeho XML sitemap, kontrolou vašeho robots.txt a čerpáním z velkých veřejných datových sad odkazů. Zbrusu nová stránka se obvykle stane dosažitelnou ve chvíli, kdy na ni něco veřejného odkáže.

Stahování

Crawler odesílá HTTP požadavek, ve kterém se identifikuje řetězcem user agent. Váš server může tento řetězec prozkoumat a rozhodnout, jak odpovědět, ačkoli user agenty lze napodobit, proto s nimi zacházejte jako se signálem, nikoli jako s důkazem.

Frekvence

Slušně se chovající crawlery se pravidelně vracejí, aby zachytily změny, a mnohé respektují pokyny crawl-delay nebo vlastní limity rychlosti. Špatně se chovající mohou stahovat agresivně, což je jeden z důvodů, proč je omezování rychlosti vedle zdvořilých pravidel důležité.

Tři druhy botů

Vyhledávací crawlery, AI tréninkové crawlery a boty pro živé získávání dat nejsou totéž.

Mnoho chyb při blokování pramení z toho, že se s každým botem zachází stejně. Tři níže uvedené kategorie se v mechanice překrývají, ale liší se účelem, a zablokování jedné může mít velmi odlišné důsledky než zablokování jiné. Názvosloví a chování se vyvíjejí, proto před tím, než se na tento rámec spolehnete, potvrďte aktuální roli jakéhokoli konkrétního agenta.

TypCo děláÚčinek zablokování
Vyhledávací crawlerIndexuje stránky, aby se mohly objevit ve výsledcích vyhledávače.Zablokování vás může odstranit z daného vyhledávače. Obvykle to není to, co chcete.
AI tréninkový crawlerStahuje stránky pro tvorbu nebo vylepšování tréninkových datových sad pro AI modely.Zablokování žádá poskytovatele, aby vaše veřejné stránky nepoužíval k tréninku. To je hlavní cíl pro většinu lidí zde.
Bot pro živé získávání dat AIStáhne stránku na vyžádání, když uživatel požádá AI asistenta o její přečtení nebo citaci.Zablokování může zabránit tomu, aby byla vaše stránka čtena nebo citována v reálném čase, což ovlivňuje viditelnost v odpovídacích systémech spíše než trénink.

Kompromis, který stojí za pojmenování.

Tréninkové crawlery a boty pro živé získávání dat jsou ty, které většina lidí míní pojmem „AI boti“, ale některé také pohánějí objevování a citaci. Rozhodněte se uvážlivě, zda chcete být trénováni, citováni, obojí, nebo ani jedno, protože to jsou samostatná rozhodnutí.

Vrstvený přístup

Blokování funguje nejlépe ve vrstvách, protože žádná jednotlivá vrstva není úplná.

Představte si blokování spíše jako obranu do hloubky než jako jediný přepínač. Každá vrstva zachytí případy, které ostatní minou, a každá má své poctivé limity. Začněte zdvořilými, málo rizikovými vrstvami a přísnější přidávejte jen tam, kde za to kompromis stojí.

1. robots.txt

Prostý textový soubor, který pojmenované crawlery žádá, aby nestahovaly uvedené cesty. Boti dodržující pravidla jej respektují; ti, kdo pravidla nedodržují, jej ignorují. Je to standardní první krok a nejméně rušivý.

2. Meta robots a X-Robots-Tag

Meta tag na úrovni stránky nebo HTTP hlavička odpovědi mohou požádat, aby obsah nebyl indexován nebo používán určitými způsoby. Podpora se u jednotlivých botů liší, proto s direktivami jako noai zacházejte jako s žádostmi, nikoli zárukami.

3. WAF, firewall a limity rychlosti

Webový aplikační firewall nebo omezovač rychlosti může blokovat nebo škrtit provoz podle user agenta, IP rozsahu nebo chování. Na rozdíl od robots.txt je to skutečně vynucováno na serveru, ačkoli to vyžaduje opatrnost, aby nebyli zachyceni legitimní návštěvníci.

4. Přihlašovací brány

Obsah za přihlášením není veřejně stahovatelný, což je nejspolehlivější způsob, jak zcela udržet příležitostné crawlery mimo. Cenou je tření pro skutečné uživatele, proto jej vyhraďte pro materiál, který jej opravdu potřebuje.

Spravované platformy přidávají další možnost. Někteří poskytovatelé, jako například služby typu Cloudflare, nabízejí vestavěné ovládací prvky, které za vás identifikují a blokují kategorie AI botů. Ty mohou být pohodlné, ale stále závisíte na přesnosti detekce a definicích poskytovatele, proto než danému přepínači uvěříte, ověřte, co skutečně dělá.

# robots.txt — zdvořilá první vrstva (ověřte aktuální názvy agentů)
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

# Zachovejte funkční běžné vyhledávání: NEBLOKUJTE plošně Googlebota
User-agent: Googlebot
Allow: /
# Příklad HTTP hlavičky odpovědi (konfigurace serveru nebo WAF)
X-Robots-Tag: noai, noimageai

Proč je blokování nedokonalé

Poctivé limity: co blokování dokáže a co ne.

Bylo by zavádějící prezentovat kteroukoli z těchto technik jako neprůstřelnou. Významně snižují nechtěný crawling, ale nezpůsobí, že by byl váš obsah nedosažitelný. Správné nastavení očekávání je součástí zodpovědného přístupu.

Realistický cíl.

Usilujte o to, aby byl nechtěný AI crawling výrazně méně pohodlný a aby vaše uvedená preference byla jasně zdokumentována. To je dosažitelné. Zaručené, univerzální vyloučení nikoli.

Sledujte své logy

Jak sledovat serverové logy kvůli AI user agentům.

Pravidla jsou užitečná jen tehdy, pokud kontrolujete, zda fungují. Vaše serverové přístupové logy zaznamenávají, kdo si co, kdy a s jakým řetězcem user agent vyžádal. Krátká, pravidelná kontrola vám řekne, kteří boti skutečně navštěvují a zda jsou vaše pravidla dodržována. Pamatujte, že user agenty lze napodobit, proto s logy zacházejte jako s důkazem k interpretaci, nikoli jako s absolutní pravdou.

Na co se zaměřit

Prohledávejte známé řetězce AI user agentů, jako jsou GPTBot, CCBot, ClaudeBot, PerplexityBot a Bytespider. Zaznamenejte objem jejich požadavků a které cesty stahují.

Známky problémů

Sledujte agenty, kteří váš web silně vyžadují poté, co jste je zakázali, neznámé agenty rychle stahující mnoho stránek nebo obecné řetězce prohlížečů zasahující URL, které by žádný člověk nenavštívil.

Co dělat dál

Pokud crawler dodržující pravidla ignoruje pravidlo, znovu zkontrolujte syntaxi. Pokud bot skutečně ignoruje robots.txt, zvažte pravidlo firewallu nebo omezení rychlosti a přijměte přidané riziko falešně pozitivních výsledků.

# Hrubý příklad: spočítat požadavky podle user agenta souvisejícího s AI
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

Zavádění krok za krokem

Obezřetné zavádění, které lze vrátit zpět.

Protože nesprávné pravidlo může tiše poškodit legitimní viditelnost, zaváděte změny postupně a v každém kroku sledujte účinek. Níže uvedený postup upřednostňuje vratnost před rychlostí, což je pro většinu osobních a malých webů správná priorita.

  1. Výchozí stav: zkontrolujte své aktuální logy, abyste věděli, kteří boti navštěvují, než cokoli změníte.
  2. Rozhodněte o záměru: zvolte, zda chcete být vyloučeni z tréninku, z živého získávání dat, nebo z obojího, a potvrďte, že zachováváte běžné vyhledávání neporušené.
  3. Začněte zdvořile: přidejte pravidla robots.txt pro konkrétní AI tréninkové crawlery, které chcete vyloučit, s použitím názvů ověřených oproti oficiální dokumentaci.
  4. Přidejte ovládání na úrovni stránky: tam, kde je podporováno, přidejte direktivy meta robots nebo X-Robots-Tag pro jemnější ovládání.
  5. Pozorujte: počkejte týden nebo dva a znovu zkontrolujte logy a viditelnost ve vyhledávání, abyste potvrdili, že se nic důležitého nerozbilo.
  6. Vynucujte selektivně: pouze pro boty, kteří ignorují zdvořilá pravidla, přidejte pravidla firewallu nebo omezení rychlosti a pečlivě testujte, abyste se vyhnuli falešně pozitivním výsledkům.
  7. Kontrolujte podle plánu: vracejte se k tomu každých pár měsíců, protože názvy crawlerů, zásady poskytovatelů i vaše vlastní priority se mění.

Související četba

Další kroky.

ModelVersus modelversus.com

Porovnejte AI modely, než si zvolíte pracovní postup.

ChatGPT Alternatives chatgpt-alternatives.com

Najděte neutrální alternativy, když jeden poskytovatel AI nestačí.

AI Subscription Guide aisubscriptionguide.com

Zjistěte, které předplatné AI se hodí k vaší skutečné práci.

Dokumentace crawleru OpenAI platform.openai.com/docs/gptbot

Zkontrolujte aktuální pokyny OpenAI ke crawleru a user agentovi.

Dokumentace crawlerů Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Ověřte názvy crawlerů Google, chování při indexaci a ovládací prvky související s AI.

Podpora Anthropic support.anthropic.com/

Zkontrolujte aktuální pokyny k účtu Claude, datům a crawleru.

FAQ

Časté pochybnosti.

Mohu zastavit AI trénink na svých osobních fotkách?

Můžete snížit expozici, ale jakmile jsou fotky veřejné, nemůžete zaručit úplnou kontrolu. Citlivé fotky udržujte soukromé, zkontrolujte nastavení platformy, vyhněte se veřejnému nahrávání ve vysokém rozlišení a použijte ovládání crawlerů pro svůj vlastní web.

Měl bych vkládat svůj životopis do AI chatbota?

Pouze po odstranění údajů, které pro daný úkol nepotřebujete. Jména, adresy, telefonní čísla, data narození, podpisy, firemní tajemství a reference lze často nahradit zástupnými hodnotami.

Mohu nahrávat rodinné dokumenty do AI?

Buďte opatrní. Lékařské dopisy, pasy, školní dokumenty, právní listiny, bankovní soubory a rodinné záznamy mohou obsahovat citlivé údaje o jiných lidech. Použijte schválená nastavení soukromí, nebo je nenahrávejte.

Stávají se soukromé prompty tréninkovými daty AI?

Záleží na produktu, typu účtu a nastavení. Někteří poskytovatelé nabízejí ovládací prvky, týmové plány nebo podmínky API, které s daty zacházejí odlišně. Než začnete psát citlivé informace, zkontrolujte aktuální nastavení.

Mohu zcela zabránit AI společnostem trénovat na mém webu?

Ne jedním technickým přepínačem. robots.txt může požádat, aby se crawlery dodržující pravidla držely stranou, ale je dobrovolný a neodstraňuje kopie, které již existují jinde.

Blokuje robots.txt AI trénink právně?

robots.txt je technická konvence, nikoli sám o sobě smlouva. Může podpořit vaši politickou pozici, ale právní otázky závisejí na jurisdikci, podmínkách, autorském právu, smlouvách a vymáhání.