Průvodce pro běžné lidi

Držte svá osobní data mimo trénování AI, kde jen můžete.

Toto je především pro běžné lidi: váš blog, fotky, životopis, rodinné dokumenty, soukromé poznámky, školní práce, klientské soubory, příspěvky na sociálních sítích a prompty. Zjistěte, co můžete zablokovat, co můžete jen omezit a co byste nikdy neměli nahrávat bez rozmyslu.

Rychlá odpověď

Pro běžné lidi „blokovat trénování AI“ obvykle znamená čtyři různé věci.

Nejbezpečnějším krokem není jen blokování crawlerů. Je to vědět, co nezveřejňovat, co nevkládat, jaká nastavení účtu zkontrolovat a kdy má soubor zůstat mimo AI nástroje úplně.

01

Mé prompty

Nevkládejte jména, adresy, hesla, zdravotní údaje, právní problémy, informace o dětech ani důvěrná pracovní data, pokud nástroj a účet nejsou pro toto použití schválené.

02

Mé soubory

Začerněte životopisy, smlouvy, bankovní soubory, lékařské zprávy, školní dokumenty a klientská PDF. Pokud data patří někomu jinému, berte je jako rizikovější.

03

Mé fotky

Veřejné fotky mohou obsahovat obličeje, místa, jména, poznávací značky a soukromé události. Citlivá alba nechte soukromá a než nahrajete obrázky do AI nástrojů, přemýšlejte.

04

Můj web

Pokud provozujete blog nebo portfolio, robots.txt a serverová pravidla mohou požádat crawlery dodržující pravidla, aby se webu vyhnuly. Staré kopie to nesmaže.

Kontrolní seznam pro běžné lidi

Než použijete AI s osobními daty.

Než cokoli nahrajete nebo vložíte, položte si tyto otázky. Pokud vám některá odpověď není příjemná, použijte zástupné symboly, soubor odstraňte, nebo použijte lépe kontrolovaný účet.

Identifikuje mě to? Jméno, adresa, telefon, e-mail, podpis, datum narození, číslo pasu, obličej, hlas nebo přesná poloha.

Identifikuje to někoho jiného? Děti, partner, zákazník, pacient, student, kolega, nájemník, zaměstnanec nebo klient.

Zveřejnil bych to online? Pokud ne, neberte náhodný AI prompt jako bezpečný soukromý zápisník.

Mohu údaje nahradit? Používejte „Osoba A“, „Firma B“, smyšlená data, obecné lokality a zkrácené výňatky, když přesná data nejsou potřeba.

Znám nastavení účtu? Spotřebitelské, týmové, API a enterprise účty mohou s daty nakládat odlišně. Zkontrolujte aktuální nastavení.

Technické vrstvy

Po osobních návycích použijte správný nástroj na správném místě.

01

Procházení veřejného webu

Používejte robots.txt, serverové logy, pravidla firewallu a viditelnou zásadu obsahu. To omezuje procházení crawlery dodržujícími pravidla, ale neodstraní staré kopie ani nezastaví aktéry nedodržující pravidla.

02

Trénování aplikací a účtů

Používejte ovládání dat poskytovatele, nastavení historie chatů, týmové plány, API podmínky, možnosti uchovávání a odhlášení. To je oddělené od blokování crawlerů.

03

Vystavení práce a klientů

Než nahrajete zákaznické soubory, personální záznamy nebo důvěrné dokumenty, použijte souhlas klienta, firemní pravidla, začernění, schválené nástroje a řízení přístupu.

Rozhodovací mapa

Co chránit jako první?

Začněte tam, kde se vaše data stávají dostupnými. Prompt, veřejný blog, soukromé PDF, fotoalbum, cloudový disk a pracovní dokument jsou různé rizikové plochy.

  1. Klasifikujte obsah. Veřejný příspěvek, soukromá poznámka, fotka, životopis, školní práce, zákaznická data, zdrojový kód a lékařská nebo právní data potřebují odlišné zacházení.
  2. Zvolte správný nástroj. Začernění u promptů, nastavení soukromí u aplikací, robots.txt u webových crawlerů dodržujících pravidla, ověřování u soukromých oblastí, smlouvy u dodavatelů.
  3. Pravidelně kontrolujte. Kontrolujte nastavení účtů, procházejte veřejné stránky, veďte si seznam blokovaných agentů a přehodnoťte volby, když AI poskytovatelé mění své produkty.

Nestačí: „Jednou jsem klikl na odhlášení“.

Užitečný návyk na ochranu soukromí je nudný, ale silný: nahrávejte méně, více začerňujte, soukromá alba nechte soukromá, kontrolujte nastavení a blokování crawlerů používejte jen tam, kde se hodí.

Matice crawlerů

Běžné ovládací prvky AI crawlerů ke zvážení.

User agentSpolečnostProč na tom záležíUpozornění
GPTBotOpenAIBěžně používaný pro ovládání webového procházení OpenAI.Zablokujte, pokud nechcete, aby tento crawler načítal vaše veřejné stránky pro účely související s AI. Ověřte aktuální dokumentaci OpenAI.
ChatGPT-UserOpenAIUživatelem spouštěný agent pro prohlížení/načítání zmiňovaný v mnoha diskusích.Blokování může zabránit uživatelům ChatGPT požádat jej o přečtení vaší stránky. To není totéž jako široké procházení pro trénování.
Google-ExtendedGoogleOvládací prvek, který Google dokumentuje pro některé případy generativního využití AI.Není to totéž jako blokování Google Search. Neblokujte Googlebota, pokud nechcete ovlivnit viditelnost ve vyhledávání.
ClaudeBotAnthropicNázev crawleru Anthropic zmiňovaný v diskusích o ovládání crawlerů.Používejte až po kontrole nejnovější dokumentace Anthropic.
Claude-SearchBotAnthropicNázev crawleru Claude souvisejícího s vyhledáváním, zmiňovaný ve veřejných doporučeních.Před blokováním agentů vyhledávacího typu zvažte kompromis ve viditelnosti.
PerplexityBotPerplexityCrawler/user agent Perplexity diskutovaný vydavateli.Blokování může ovlivnit, jak je váš obsah objevován nebo citován odpovídacími systémy typu Perplexity.
CCBotCommon CrawlVeřejný webový crawler používaný pro velké datové sady webu.Často blokovaný vydavateli, kteří nechtějí, aby jejich stránky byly kopírovány do veřejných crawl korpusů.
BytespiderByteDanceCrawler spojený s ByteDance.Užitečné zvážit, pokud chcete širokou blokovací listinu AI crawlerů.

Statický nástroj

Vytvořte si opatrný výchozí úryvek robots.txt.

Vyberte crawlery, které chcete požádat, aby neprocházely. Tento generátor běží pouze ve vašem prohlížeči. Nikam neodesílá data. Před nasazením ověřte aktuální oficiální názvy user agentů.

# Ovládání AI crawlerů: před nasazením ověřte aktuální názvy user agentů.
# Toto je dobrovolné. robots.txt není právní zámek.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Upozornění: blokování uživatelem spouštěných nebo vyhledávání souvisejících agentů může omezit objevování, náhledy nebo citace s pomocí AI.

Oficiální reference

Než uvěříte náhodné blokovací listině, použijte oficiální stránky.

Dokumentace crawleru OpenAI platform.openai.com/docs/gptbot

Zkontrolujte aktuální doporučení OpenAI ke crawleru a user agentům.

Dokumentace crawlerů Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Ověřte názvy crawlerů Google, chování indexace a ovládací prvky související s AI.

Podpora Anthropic support.anthropic.com/

Zkontrolujte aktuální doporučení k účtu, datům a crawlerům Claude.

Perplexity www.perplexity.ai/

Projděte aktuální informace o produktu a pro vydavatele od Perplexity.

Common Crawl commoncrawl.org/

Seznamte se s jednou hlavní veřejnou datovou sadou procházení webu používanou ve výzkumu.

Robots Exclusion Protocol www.rfc-editor.org/rfc/rfc9309

Formální reference protokolu robots.txt.

Související průvodci

Propojte to se svým širším AI workflow.

ModelVersus modelversus.com

Porovnejte AI modely, než si zvolíte workflow.

ChatGPT Alternatives chatgpt-alternatives.com

Najděte neutrální alternativy, když jeden AI poskytovatel nestačí.

AI Subscription Guide aisubscriptionguide.com

Zjistěte, které AI předplatné vyhovuje vaší skutečné práci.

KIWerkzeuge kiwerkzeuge.com

Německý katalog AI nástrojů a průvodci AI nástroji zaměření na soukromí.

BoiteAIA boiteaia.com

Francouzský katalog AI nástrojů pro chatboty, obrázkové nástroje a firemní použití.

MultipleChat AI multiplechat.ai

Používejte několik AI modelů v jednom rozhraní a udržujte workflow oddělené podle projektu.

FAQ

Otázky, které lidé kladou před blokováním trénování AI.

Mohu zastavit trénování AI na svých osobních fotkách?

Můžete omezit vystavení, ale jakmile jsou fotky veřejné, plnou kontrolu zaručit nelze. Citlivé fotky si nechte soukromé, projděte nastavení platforem, vyhněte se veřejnému nahrávání ve vysokém rozlišení a pro vlastní web používejte ovládání crawlerů.

Mám vkládat svůj životopis do AI chatbota?

Jen po odstranění údajů, které pro daný úkol nepotřebujete. Jména, adresy, telefonní čísla, data narození, podpisy, firemní tajemství a reference lze často nahradit zástupnými symboly.

Mohu do AI nahrávat rodinné dokumenty?

Buďte opatrní. Lékařské zprávy, pasy, školní dokumenty, právní listiny, bankovní soubory a rodinné záznamy mohou obsahovat citlivá data o jiných lidech. Používejte schválená nastavení soukromí, nebo je nenahrávejte.

Stávají se soukromé prompty daty pro trénování AI?

Záleží na produktu, typu účtu a nastavení. Někteří poskytovatelé nabízejí ovládací prvky, týmové plány nebo API podmínky, které s daty nakládají odlišně. Před psaním citlivých informací zkontrolujte aktuální nastavení.

Mohu úplně zabránit AI společnostem v trénování na mém webu?

Ne jedním technickým přepínačem. robots.txt může požádat crawlery dodržující pravidla, aby se webu vyhnuly, ale je to dobrovolné a neodstraňuje to kopie, které už existují jinde.

Blokuje robots.txt trénování AI právně?

robots.txt je technická konvence, sama o sobě ne smlouva. Může podpořit vaše stanovisko, ale právní otázky závisejí na jurisdikci, podmínkách, autorském právu, smlouvách a vymáhání.

Poškodí blokování AI botů pozice v Googlu?

Blokování AI-specifických agentů by nemělo být bráno stejně jako blokování Googlebota. Pokud zablokujete běžné vyhledávací crawlery, může to poškodit viditelnost ve vyhledávání. Každého user agenta pečlivě zkontrolujte.

Mám blokovat ChatGPT-User?

Jen pokud rozumíte kompromisu. Uživatelem spouštění agenti mohou načíst stránky, když někdo požádá AI nástroj o přečtení vašeho webu. Jejich blokování může omezit objevování s pomocí AI.

Přečíst všechny FAQ