Generátor úryvků

robots.txt pro AI boty.

Použijte tyto příklady jako výchozí bod, ne jako trvalou pravdu. Názvy user agentů, produkty i chování crawlerů se mění, proto před nasazením vždy zkontrolujte oficiální stránky.

Statický nástroj

Vytvořte opatrný úvodní úryvek robots.txt.

Vyberte crawlery, které chcete požádat, aby web neprohledávali. Tento generátor běží pouze ve vašem prohlížeči. Nikam neodesílá data. Před nasazením ověřte aktuální oficiální názvy user agentů.

# Ovládání AI crawlerů: před nasazením ověřte aktuální názvy user agentů.
# Toto je dobrovolné. robots.txt není právní zámek.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Varování: blokování agentů spouštěných uživatelem nebo souvisejících s vyhledáváním může snížit objevitelnost, náhledy nebo citace s podporou AI.

Blok ke zkopírování

Příklad robots.txt pro běžné AI user agenty.

Níže je úvodní blok pokrývající několik crawlerů souvisejících s AI. Názvy user agentů se mění a liší se podle produktu, berte to tedy jako šablonu a před nasazením ověřte každý název v oficiální dokumentaci provozovatele.

# Pouze příklad. Každý název user agenta ověřte v oficiální dokumentaci.
# robots.txt je dobrovolný. Neodstraňuje kopie, které již existují,
# a ovlivňuje pouze crawlery, které se ho rozhodnou dodržovat.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /
User-agent (ověřte)Spojený sObvykle používaný pro
GPTBotOpenAIProhledávání webového obsahu, který může být použit pro trénování modelů
Google-ExtendedGoogleŘídicí token pro omezení použití obsahu u některých AI produktů
CCBotCommon CrawlBudování otevřeného archivu Common Crawl používaného mnoha navazujícími datovými sadami
ClaudeBot / anthropic-aiAnthropicProhledávání související s Claude; aktuální tokeny ověřte v dokumentaci Anthropic
PerplexityBotPerplexityProhledávání pro funkce odpovědí a vyhledávání
BytespiderByteDanceRozsáhlé prohledávání spojené s produkty ByteDance
Applebot-ExtendedAppleŘídicí token pro omezení použití obsahu pro trénování AI od Apple

Některé z nich jsou skutečné user agenty crawlerů a jiné jsou řídicí tokeny, nikoli boty, které stahují stránky. Názvy, významy a chování se mění, proto před spoléháním se na kterýkoli z nich potvrďte každý v oficiální dokumentaci provozovatele.

Co nedělá

robots.txt je dobrovolný a omezený.

Je to žádost, ne zámek

robots.txt je konvence. Slušně se chovající crawlery ho čtou a dodržují, ale samotný web ho nevynucuje. Crawler, který ho ignoruje nebo který není na vašem seznamu, může stále stahovat veřejné stránky. Je to signál záměru, ne technická bariéra.

Neodstraňuje existující kopie

Přidání pravidla disallow dnes nic neudělá s obsahem, který již byl prohledán, uložen do cache, archivován nebo zkopírován jinam. Ani neovlivní data, která lidé ručně vkládají do AI nástrojů. Berte to jako snížení budoucího vystavení, ne jako zvrácení minulosti.

Silnější vrstvy

Alternativy a doplňky.

Pravidla WAF a firewallu

Firewall webových aplikací nebo serverové pravidlo může skutečně blokovat nebo prověřovat požadavky podle user agenta, rozsahu IP nebo chování, místo aby jen zdvořile žádaly. Jde o vynucení, nikoli o žádost, i když to vyžaduje údržbu, jak se identity crawlerů mění, a občas to může zachytit legitimní návštěvníky.

Meta tagy a hlavičky

Direktivy na úrovni stránky, jako je robots meta tag noindex nebo hlavička X-Robots-Tag, ovlivňují, jak crawlery dodržující pravidla se stránkou zacházejí. Stejně jako robots.txt spoléhají na spolupráci a nezastaví crawler, který je ignoruje.

Síťové a přístupové kontroly

Vyžadování přihlášení, omezení rychlosti nebo umístění citlivého materiálu za autentizaci ho zcela udrží mimo otevřené, prohledávatelné stránky. Omezení přístupu je obvykle mnohem spolehlivější než jakýkoli dobrovolný textový soubor u obsahu, který skutečně musí zůstat soukromý.

Ověřte, že to funguje

Jak zkontrolovat svůj robots.txt.

  1. Načtěte https://vasedomena.com/robots.txt přímo v prohlížeči a potvrďte, že se soubor správně servíruje v kořeni webu.
  2. Zkontrolujte překlepy v názvech user agentů a direktivách; chybně napsaný token prostě nic nedělá.
  3. Použijte tester robots.txt nebo nástroje ve vaší search console, abyste potvrdili, že se syntaxe parsuje podle očekávání.
  4. Průběžně kontrolujte serverové logy, abyste zjistili, zda se user agenty, na které jste cílili, stále objevují, a pamatujte, že názvy se mění a některé agenty soubor ignorují.
  5. Pravidelně znovu ověřujte názvy podle oficiální dokumentace každého provozovatele, protože identity crawlerů a řídicí tokeny se pravidelně aktualizují.

Tato stránka je vzdělávací informace, nejde o právní poradenství, a názvy user agentů zde uvedené mohou být zastaralé. Před spoléháním se na ně vždy potvrďte aktuální tokeny a chování v oficiální dokumentaci provozovatele.

Související čtení

Další kroky.

ModelVersus modelversus.com

Porovnejte AI modely, než si vyberete pracovní postup.

ChatGPT Alternatives chatgpt-alternatives.com

Najděte neutrální alternativy, když jeden poskytovatel AI nestačí.

AI Subscription Guide aisubscriptionguide.com

Zjistěte, které AI předplatné vyhovuje vaší skutečné práci.

Dokumentace crawleru OpenAI platform.openai.com/docs/gptbot

Zkontrolujte aktuální pokyny ke crawleru a user agentu OpenAI.

Dokumentace crawleru Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Ověřte názvy crawlerů Google, chování při indexaci a kontroly související s AI.

Podpora Anthropic support.anthropic.com/

Zkontrolujte aktuální pokyny k účtu, datům a crawleru Claude.

FAQ

Časté pochybnosti.

Mohu zastavit trénování AI na svých osobních fotkách?

Vystavení můžete snížit, ale jakmile jsou fotky veřejné, nemůžete zaručit plnou kontrolu. Uchovávejte citlivé fotky soukromé, zkontrolujte nastavení platforem, vyhněte se veřejnému nahrávání ve vysokém rozlišení a používejte kontroly crawlerů pro svůj vlastní web.

Měl bych vkládat svůj životopis do AI chatbota?

Jen po odstranění údajů, které pro daný úkol nepotřebujete. Jména, adresy, telefonní čísla, data narození, podpisy, firemní tajemství a reference lze často nahradit zástupnými texty.

Mohu nahrávat rodinné dokumenty do AI?

Buďte opatrní. Lékařské dopisy, pasy, školní dokumenty, právní listiny, bankovní soubory a rodinné záznamy mohou obsahovat citlivé údaje o jiných lidech. Použijte schválená nastavení soukromí, nebo je nenahrávejte.

Stávají se soukromé prompty tréninkovými daty AI?

Záleží na produktu, typu účtu a nastavení. Někteří poskytovatelé nabízejí kontroly, týmové plány nebo API podmínky, které s daty zacházejí odlišně. Před psaním citlivých informací zkontrolujte aktuální nastavení.

Mohu zcela zabránit AI společnostem v trénování na mém webu?

Ne jedním technickým přepínačem. robots.txt může požádat crawlery dodržující pravidla, aby se drželi stranou, ale je dobrovolný a neodstraňuje kopie, které již existují jinde.

Blokuje robots.txt trénování AI právně?

robots.txt je technická konvence, ne smlouva sama o sobě. Může podpořit vaši politickou pozici, ale právní otázky závisí na jurisdikci, podmínkách, autorském právu, smlouvách a vymáhání.