Fotky a obrázky

Fotky jsou také osobní údaje.

U osobních fotek je blokování crawlerů jen jednou vrstvou. Myslete na obličeje, děti, stopy o poloze, soukromé události, licencování, přihlášení, vodoznaky, metadata o původu a nastavení platforem.

Vizuální materiály

Ochrana fotek je vrstvená.

Soukromé fotky

Buďte opatrní u dětí, obličejů, interiérů domu, událostí, dokumentů v pozadí, školních uniforem, poznávacích značek aut a stop o poloze. Veřejné obrázky lze zkopírovat, proto nespoléhejte na jediné opatření.

Portfolia tvůrců

Používejte jasné licenční podmínky, náhledy v nižším rozlišení, galerie s přihlášením, vodoznaky, metadata o původu a nastavení platforem.

Jak funguje scraping

Jak vlastně probíhá sběr obrázků pro AI.

Pochopení celého procesu vám pomůže vidět, kam vaše vlastní opatření dosáhnou a kam ne. Mnoho z toho jsou veřejné informace o tom, jak se velké datové sady obrázků historicky budovaly, ale přesné metody se liší podle firmy a v čase se mění, takže to berte spíše jako pozadí než jako záruku.

Veřejné datové sady a seznamy odkazů

Mnoho trénovacích sad bylo sestaveno z velkých webových procházení (například rozsáhlých archivů veřejných stránek) a ze seznamů URL obrázků spárovaných s okolním textem. Pokud obrázek leží na veřejné stránce, na kterou se dostane crawler dodržující pravidla, může skončit uvedený v takové datové sadě. Pozdější odstranění obrázku nutně neodstraní kopie, které už byly nasbírány.

Alternativní text a popisky

Modely obrázků se často učí ze slov poblíž obrázku: z atributu alt, popisků, názvů souborů a okolních odstavců. Popisný alternativní text je dobrý pro přístupnost a vyhledávání, ale zároveň usnadňuje označení a indexaci obrázku. Je to kompromis, ne důvod k odstranění textu pro přístupnost.

EXIF a metadata

Fotky mohou nést EXIF metadata, jako je model fotoaparátu, časové značky a někdy i GPS souřadnice. Mnoho platforem je při nahrání odstraní, ale ne všechny, a soubory sdílené přímo je mohou zachovat. Odstranění polohy a identifikačních metadat před zveřejněním je rozumný zvyk, i když neovlivňuje to, co je v samotném obrázku viditelné.

Zpětné vyhledávání obrázků a opětovná nahrání

Jakmile je obrázek veřejný, ostatní ho mohou stáhnout, znovu umístit nebo zpětně vyhledat. To znamená, že stejná fotka se může objevit na webech, které neovládáte, každý s vlastními pravidly robots. Proto žádné jediné nastavení nemůže slíbit, že obrázek už nikdy nebude vidět.

Kontrola reality: tato opatření snižují expozici a signalizují váš záměr. Jsou to dobrovolné konvence a v praxi nedokonalé. Nic zde nezaručuje, že je obrázek vyloučen z každé datové sady, a tato stránka je vzdělávací informace, nejde o právní poradenství.

Praktický seznam kroků

Soukromé fotky versus portfolia tvůrců.

Pro soukromé a rodinné fotky

Nechte je soukromé: nejsilnějším opatřením je citlivé fotky vůbec veřejně nezveřejňovat. Používejte uzavřená alba nebo důvěryhodné sdílení namísto otevřených stránek.

Hlídejte pozadí: dokumenty, obrazovky, čísla domů, uniformy, jmenovky a poznávací značky aut mohou prozradit víc než samotný objekt.

Odstraňte metadata: před sdílením souborů odstraňte GPS a identifikační EXIF, zvláště u obrázků dětí.

Zkontrolujte nastavení platformy: ověřte, kdo může vidět, stahovat nebo indexovat vaše nahrávky a zda platforma nabízí nějaká nastavení pro AI či trénování.

Pro portfolia tvůrců

Ukazujte náhledy, ne originály: zveřejňujte verze v nižším rozlišení nebo s vodoznakem a plné rozlišení nechte za přihlášením nebo licencí.

Uveďte licencování jasně: viditelné prohlášení o použití a licencování podporuje vaši pozici, i když samo o sobě nemůže vynutit dodržování.

Zabezpečte galerie: galerie s přihlášením nebo jen pro klienty drží práci mimo otevřené, procházitelné stránky.

Skládejte obranu do vrstev: kombinujte pravidla robots, metadata o původu a nastavení platforem, místo abyste spoléhali na jediné opatření.

Původ a nástroje

Vodoznaky, původ a nástroje proti scrapingu.

Content Credentials (C2PA)

Standard C2PA, v některých nástrojích prezentovaný jako Content Credentials, přikládá metadata o původu odolná proti manipulaci, která popisují, jak byl obrázek vytvořen nebo upraven. Pomáhá ostatním ověřit původ a může signalizovat autorství, ale fyzicky nezabrání kopírování a metadata lze odstranit. Podpora se liší podle platformy, proto ve svých nástrojích ověřte aktuální chování.

Viditelné a neviditelné vodoznaky

Viditelné vodoznaky odrazují od nahodilého opětovného použití; neviditelné nebo forenzní vodoznaky vám mohou pomoci kopie později vystopovat. Ani jedno nezabrání tomu, aby byl obrázek scrapován, a agresivní vodoznaky ovlivňují vzhled vaší práce, proto zvažte kompromis.

Nástroje proti scrapingu (s výhradou)

Výzkumné nástroje jako Glaze a Nightshade se snaží přidat jemné poruchy, které některým modelům ztěžují učení z obrázků nebo narušují trénování. Účinnost se liší, je předmětem diskuse a může se měnit s vývojem modelů. Berte je jako experimentální doplňkové vrstvy, ne jako zaručenou ochranu, a před spoléháním na ně si přečtěte aktuální dokumentaci projektu.

Nastavení platforem

Kde obvykle najdete odhlášení a nastavení.

Mnoho fotografických a kreativních platforem přidalo nastavení související s AI, ale názvy, výchozí hodnoty a dostupnost se často mění a liší se podle regionu a typu účtu. Použijte to jako orientaci a poté potvrďte aktuální možnosti na stránkách soukromí nebo účtu každé platformy.

Kde hledatCo to může ovládatVýhrada
Nastavení soukromí účtuZda jsou příspěvky a obrázky veřejné a kdo je může stáhnout nebo indexovatVeřejný obsah může být i tak zkopírován ostatními, jakmile je jednou viděn
Nastavení AI nebo dat třetích stranNěkteré platformy nabízejí přepínač k omezení použití vašeho obsahu pro AI nebo trénování modelůDostupnost a rozsah se liší; nemusí pokrývat dřívější sběr
Možnosti portfolia a licencováníOchrana proti kliknutí pravým tlačítkem, limity stahování, licenční štítkyTyto odrazují od nahodilého opětovného použití, ale nejsou vynucením
Nastavení robots a webu (vlastní web)Žádost, aby crawlery dodržující pravidla přeskočily adresáře s obrázkyDobrovolné; neodstraní existující kopie jinde

Nastavení a přepínače se často přesouvají a přejmenovávají. Než budete předpokládat, že nějaké nastavení existuje nebo pokrývá, co očekáváte, ověřte aktuální možnosti v oficiálních nápovědách každého poskytovatele.

Související čtení

Další kroky.

ModelVersus modelversus.com

Porovnejte AI modely, než si zvolíte pracovní postup.

ChatGPT Alternatives chatgpt-alternatives.com

Najděte neutrální alternativy, když jeden poskytovatel AI nestačí.

AI Subscription Guide aisubscriptionguide.com

Zjistěte, které předplatné AI se hodí k vaší skutečné práci.

OpenAI crawler docs platform.openai.com/docs/gptbot

Zkontrolujte aktuální návod k crawleru a user-agentu OpenAI.

Google crawler docs developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Ověřte názvy crawlerů Google, chování při indexaci a nastavení související s AI.

Anthropic support support.anthropic.com/

Zkontrolujte aktuální návod k účtu, datům a crawleru Claude.

FAQ

Časté pochybnosti.

Můžu zastavit trénování AI na svých osobních fotkách?

Můžete snížit expozici, ale nemůžete zaručit plnou kontrolu, jakmile jsou fotky veřejné. Držte citlivé fotky v soukromí, zkontrolujte nastavení platforem, vyhněte se veřejným nahrávkám ve vysokém rozlišení a použijte nastavení crawlerů pro svůj vlastní web.

Měl bych vkládat svůj životopis do AI chatbota?

Jen po odstranění údajů, které pro danou úlohu nepotřebujete. Jména, adresy, telefonní čísla, data narození, podpisy, firemní tajemství a reference lze často nahradit zástupnými texty.

Můžu nahrávat rodinné dokumenty do AI?

Buďte opatrní. Lékařské zprávy, pasy, školní dokumenty, právní listiny, bankovní soubory a rodinné záznamy mohou obsahovat citlivé údaje o jiných lidech. Použijte schválená nastavení soukromí, nebo je nenahrávejte.

Stávají se soukromé prompty trénovacími daty AI?

Záleží na produktu, typu účtu a nastavení. Někteří poskytovatelé nabízejí nastavení, týmové plány nebo podmínky API, které s daty zacházejí jinak. Než napíšete citlivé informace, zkontrolujte aktuální nastavení.

Můžu úplně zabránit AI firmám v trénování na mém webu?

Ne jediným technickým přepínačem. robots.txt může požádat crawlery dodržující pravidla, aby se držely stranou, ale je dobrovolný a neodstraní kopie, které už existují jinde.

Blokuje robots.txt právně trénování AI?

robots.txt je technická konvence, ne smlouva sama o sobě. Může podpořit vaši pozici v rámci vašich zásad, ale právní otázky závisí na jurisdikci, podmínkách, autorských právech, smlouvách a vymáhání.