Mé prompty
Nevkládejte jména, adresy, hesla, zdravotní údaje, právní problémy, informace o dětech ani důvěrná pracovní data, pokud nástroj a účet nejsou pro toto použití schválené.
Průvodce pro běžné lidi
Toto je především pro běžné lidi: váš blog, fotky, životopis, rodinné dokumenty, soukromé poznámky, školní práce, klientské soubory, příspěvky na sociálních sítích a prompty. Zjistěte, co můžete zablokovat, co můžete jen omezit a co byste nikdy neměli nahrávat bez rozmyslu.
Rychlá odpověď
Nejbezpečnějším krokem není jen blokování crawlerů. Je to vědět, co nezveřejňovat, co nevkládat, jaká nastavení účtu zkontrolovat a kdy má soubor zůstat mimo AI nástroje úplně.
Nevkládejte jména, adresy, hesla, zdravotní údaje, právní problémy, informace o dětech ani důvěrná pracovní data, pokud nástroj a účet nejsou pro toto použití schválené.
Začerněte životopisy, smlouvy, bankovní soubory, lékařské zprávy, školní dokumenty a klientská PDF. Pokud data patří někomu jinému, berte je jako rizikovější.
Veřejné fotky mohou obsahovat obličeje, místa, jména, poznávací značky a soukromé události. Citlivá alba nechte soukromá a než nahrajete obrázky do AI nástrojů, přemýšlejte.
Pokud provozujete blog nebo portfolio, robots.txt a serverová pravidla mohou požádat crawlery dodržující pravidla, aby se webu vyhnuly. Staré kopie to nesmaže.
Kontrolní seznam pro běžné lidi
Než cokoli nahrajete nebo vložíte, položte si tyto otázky. Pokud vám některá odpověď není příjemná, použijte zástupné symboly, soubor odstraňte, nebo použijte lépe kontrolovaný účet.
Identifikuje mě to? Jméno, adresa, telefon, e-mail, podpis, datum narození, číslo pasu, obličej, hlas nebo přesná poloha.
Identifikuje to někoho jiného? Děti, partner, zákazník, pacient, student, kolega, nájemník, zaměstnanec nebo klient.
Zveřejnil bych to online? Pokud ne, neberte náhodný AI prompt jako bezpečný soukromý zápisník.
Mohu údaje nahradit? Používejte „Osoba A“, „Firma B“, smyšlená data, obecné lokality a zkrácené výňatky, když přesná data nejsou potřeba.
Znám nastavení účtu? Spotřebitelské, týmové, API a enterprise účty mohou s daty nakládat odlišně. Zkontrolujte aktuální nastavení.
Technické vrstvy
Používejte robots.txt, serverové logy, pravidla firewallu a viditelnou zásadu obsahu. To omezuje procházení crawlery dodržujícími pravidla, ale neodstraní staré kopie ani nezastaví aktéry nedodržující pravidla.
Používejte ovládání dat poskytovatele, nastavení historie chatů, týmové plány, API podmínky, možnosti uchovávání a odhlášení. To je oddělené od blokování crawlerů.
Než nahrajete zákaznické soubory, personální záznamy nebo důvěrné dokumenty, použijte souhlas klienta, firemní pravidla, začernění, schválené nástroje a řízení přístupu.
Rozhodovací mapa
Začněte tam, kde se vaše data stávají dostupnými. Prompt, veřejný blog, soukromé PDF, fotoalbum, cloudový disk a pracovní dokument jsou různé rizikové plochy.
Užitečný návyk na ochranu soukromí je nudný, ale silný: nahrávejte méně, více začerňujte, soukromá alba nechte soukromá, kontrolujte nastavení a blokování crawlerů používejte jen tam, kde se hodí.
Matice crawlerů
| User agent | Společnost | Proč na tom záleží | Upozornění |
|---|---|---|---|
GPTBot | OpenAI | Běžně používaný pro ovládání webového procházení OpenAI. | Zablokujte, pokud nechcete, aby tento crawler načítal vaše veřejné stránky pro účely související s AI. Ověřte aktuální dokumentaci OpenAI. |
ChatGPT-User | OpenAI | Uživatelem spouštěný agent pro prohlížení/načítání zmiňovaný v mnoha diskusích. | Blokování může zabránit uživatelům ChatGPT požádat jej o přečtení vaší stránky. To není totéž jako široké procházení pro trénování. |
Google-Extended | Ovládací prvek, který Google dokumentuje pro některé případy generativního využití AI. | Není to totéž jako blokování Google Search. Neblokujte Googlebota, pokud nechcete ovlivnit viditelnost ve vyhledávání. | |
ClaudeBot | Anthropic | Název crawleru Anthropic zmiňovaný v diskusích o ovládání crawlerů. | Používejte až po kontrole nejnovější dokumentace Anthropic. |
Claude-SearchBot | Anthropic | Název crawleru Claude souvisejícího s vyhledáváním, zmiňovaný ve veřejných doporučeních. | Před blokováním agentů vyhledávacího typu zvažte kompromis ve viditelnosti. |
PerplexityBot | Perplexity | Crawler/user agent Perplexity diskutovaný vydavateli. | Blokování může ovlivnit, jak je váš obsah objevován nebo citován odpovídacími systémy typu Perplexity. |
CCBot | Common Crawl | Veřejný webový crawler používaný pro velké datové sady webu. | Často blokovaný vydavateli, kteří nechtějí, aby jejich stránky byly kopírovány do veřejných crawl korpusů. |
Bytespider | ByteDance | Crawler spojený s ByteDance. | Užitečné zvážit, pokud chcete širokou blokovací listinu AI crawlerů. |
Statický nástroj
Vyberte crawlery, které chcete požádat, aby neprocházely. Tento generátor běží pouze ve vašem prohlížeči. Nikam neodesílá data. Před nasazením ověřte aktuální oficiální názvy user agentů.
# Ovládání AI crawlerů: před nasazením ověřte aktuální názvy user agentů.
# Toto je dobrovolné. robots.txt není právní zámek.
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: CCBot
Disallow: /
Upozornění: blokování uživatelem spouštěných nebo vyhledávání souvisejících agentů může omezit objevování, náhledy nebo citace s pomocí AI.
Oficiální reference
Zkontrolujte aktuální doporučení OpenAI ke crawleru a user agentům.
Dokumentace crawlerů Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlersOvěřte názvy crawlerů Google, chování indexace a ovládací prvky související s AI.
Podpora Anthropic support.anthropic.com/Zkontrolujte aktuální doporučení k účtu, datům a crawlerům Claude.
Perplexity www.perplexity.ai/Projděte aktuální informace o produktu a pro vydavatele od Perplexity.
Common Crawl commoncrawl.org/Seznamte se s jednou hlavní veřejnou datovou sadou procházení webu používanou ve výzkumu.
Robots Exclusion Protocol www.rfc-editor.org/rfc/rfc9309Formální reference protokolu robots.txt.
Související průvodci
Porovnejte AI modely, než si zvolíte workflow.
ChatGPT Alternatives chatgpt-alternatives.comNajděte neutrální alternativy, když jeden AI poskytovatel nestačí.
AI Subscription Guide aisubscriptionguide.comZjistěte, které AI předplatné vyhovuje vaší skutečné práci.
KIWerkzeuge kiwerkzeuge.comNěmecký katalog AI nástrojů a průvodci AI nástroji zaměření na soukromí.
BoiteAIA boiteaia.comFrancouzský katalog AI nástrojů pro chatboty, obrázkové nástroje a firemní použití.
MultipleChat AI multiplechat.aiPoužívejte několik AI modelů v jednom rozhraní a udržujte workflow oddělené podle projektu.
FAQ
Můžete omezit vystavení, ale jakmile jsou fotky veřejné, plnou kontrolu zaručit nelze. Citlivé fotky si nechte soukromé, projděte nastavení platforem, vyhněte se veřejnému nahrávání ve vysokém rozlišení a pro vlastní web používejte ovládání crawlerů.
Jen po odstranění údajů, které pro daný úkol nepotřebujete. Jména, adresy, telefonní čísla, data narození, podpisy, firemní tajemství a reference lze často nahradit zástupnými symboly.
Buďte opatrní. Lékařské zprávy, pasy, školní dokumenty, právní listiny, bankovní soubory a rodinné záznamy mohou obsahovat citlivá data o jiných lidech. Používejte schválená nastavení soukromí, nebo je nenahrávejte.
Záleží na produktu, typu účtu a nastavení. Někteří poskytovatelé nabízejí ovládací prvky, týmové plány nebo API podmínky, které s daty nakládají odlišně. Před psaním citlivých informací zkontrolujte aktuální nastavení.
Ne jedním technickým přepínačem. robots.txt může požádat crawlery dodržující pravidla, aby se webu vyhnuly, ale je to dobrovolné a neodstraňuje to kopie, které už existují jinde.
robots.txt je technická konvence, sama o sobě ne smlouva. Může podpořit vaše stanovisko, ale právní otázky závisejí na jurisdikci, podmínkách, autorském právu, smlouvách a vymáhání.
Blokování AI-specifických agentů by nemělo být bráno stejně jako blokování Googlebota. Pokud zablokujete běžné vyhledávací crawlery, může to poškodit viditelnost ve vyhledávání. Každého user agenta pečlivě zkontrolujte.
Jen pokud rozumíte kompromisu. Uživatelem spouštění agenti mohou načíst stránky, když někdo požádá AI nástroj o přečtení vašeho webu. Jejich blokování může omezit objevování s pomocí AI.