Foto private
Fai attenzione a bambini, volti, interni di casa, eventi, documenti sullo sfondo, divise scolastiche, targhe delle auto e indizi sulla posizione. Le immagini pubbliche possono essere copiate, quindi non affidarti a un unico controllo.
Foto e immagini
Per le foto personali, bloccare i crawler è solo un livello. Pensa ai volti, ai bambini, agli indizi sulla posizione, agli eventi privati, alle licenze, all'autenticazione, alle filigrane, alla provenienza e alle impostazioni delle piattaforme.
Contenuti visivi
Fai attenzione a bambini, volti, interni di casa, eventi, documenti sullo sfondo, divise scolastiche, targhe delle auto e indizi sulla posizione. Le immagini pubbliche possono essere copiate, quindi non affidarti a un unico controllo.
Usa termini di licenza chiari, anteprime a risoluzione più bassa, gallerie autenticate, filigrane, metadati di provenienza e impostazioni delle piattaforme.
Come funziona lo scraping
Capire il processo ti aiuta a vedere dove i tuoi controlli possono e non possono arrivare. Molte di queste informazioni sono di dominio pubblico su come sono stati storicamente costruiti i grandi set di dati di immagini, ma i metodi esatti variano da azienda ad azienda e cambiano nel tempo, quindi consideralo un contesto di riferimento e non una garanzia.
Molti set di addestramento sono stati assemblati a partire da grandi crawl del web (per esempio ampi archivi di pagine pubbliche) e da elenchi di URL di immagini abbinati al testo che le circonda. Se un'immagine si trova su una pagina pubblica che un crawler conforme può raggiungere, può finire referenziata in un set di dati di questo tipo. Rimuovere l'immagine in seguito non rimuove necessariamente le copie già raccolte.
I modelli per immagini spesso imparano dalle parole vicine a un'immagine: l'attributo alt, le didascalie, i nomi dei file e i paragrafi circostanti. Un testo alternativo descrittivo è utile per l'accessibilità e la ricerca, ma rende anche un'immagine più facile da etichettare e indicizzare. È un compromesso, non un motivo per rimuovere il testo per l'accessibilità.
Le foto possono contenere metadati EXIF come il modello della fotocamera, i timestamp e talvolta le coordinate GPS. Molte piattaforme li rimuovono al caricamento, ma non tutte, e i file condivisi direttamente possono conservarli. Rimuovere la posizione e i metadati identificativi prima di pubblicare è un'abitudine sensata, anche se non modifica ciò che è visibile nell'immagine stessa.
Una volta che un'immagine è pubblica, altri possono scaricarla, riospitarla o eseguire una ricerca inversa. Questo significa che la stessa immagine può comparire su siti che non controlli, ciascuno con le proprie regole robots. Ecco perché nessuna singola impostazione può promettere che un'immagine non verrà mai più vista.
Verifica della realtà: questi controlli riducono l'esposizione e segnalano la tua intenzione. Sono convenzioni volontarie e imperfette nella pratica. Nulla di quanto riportato qui garantisce che un'immagine sia esclusa da ogni set di dati, e questa pagina è informazione a scopo educativo, non è una consulenza legale.
Checklist pratica
Tienile private: il controllo più forte consiste nel non pubblicare affatto pubblicamente le foto sensibili. Usa album chiusi o condivisioni fidate anziché pagine aperte.
Attenzione allo sfondo: documenti, schermi, numeri civici, divise, tesserini e targhe delle auto possono rivelare più del soggetto stesso.
Rimuovi i metadati: elimina il GPS e i dati EXIF identificativi prima di condividere i file, soprattutto per le immagini di bambini.
Controlla le impostazioni della piattaforma: verifica chi può vedere, scaricare o indicizzare i tuoi caricamenti e se la piattaforma offre controlli per l'IA o l'addestramento.
Mostra anteprime, non gli originali: pubblica versioni a risoluzione più bassa o con filigrana e tieni i file a piena risoluzione dietro un accesso o una licenza.
Dichiara chiaramente le licenze: una dichiarazione visibile su uso e licenza sostiene la tua posizione, anche se da sola non può imporre la conformità.
Proteggi le gallerie: gallerie autenticate o riservate ai clienti tengono i lavori fuori dalle pagine aperte e indicizzabili.
Stratifica le tue difese: combina i controlli robots, i metadati di provenienza e le impostazioni della piattaforma anziché affidarti a un'unica misura.
Provenienza e strumenti
Lo standard C2PA, presentato in alcuni strumenti come Content Credentials, allega metadati di provenienza a prova di manomissione che descrivono come un'immagine è stata creata o modificata. Aiuta gli altri a verificarne l'origine e può segnalare la paternità, ma non impedisce fisicamente la copia, e i metadati possono essere rimossi. Il supporto varia da piattaforma a piattaforma, quindi verifica il comportamento attuale nei tuoi strumenti.
Le filigrane visibili scoraggiano il riutilizzo occasionale; le filigrane invisibili o forensi possono aiutarti a rintracciare le copie in seguito. Nessuna delle due impedisce che un'immagine venga sottoposta a scraping, e le filigrane aggressive influiscono sull'aspetto del tuo lavoro, quindi valuta il compromesso.
Strumenti di ricerca come Glaze e Nightshade mirano ad aggiungere sottili perturbazioni che rendono le immagini più difficili da apprendere per alcuni modelli o che disturbano l'addestramento. L'efficacia varia, è oggetto di dibattito e può cambiare man mano che i modelli si evolvono. Considerali come livelli aggiuntivi sperimentali, non come una protezione garantita, e leggi la documentazione attuale del progetto prima di affidarti a essi.
Impostazioni della piattaforma
Molte piattaforme di foto e creative hanno aggiunto impostazioni legate all'IA, ma nomi, valori predefiniti e disponibilità cambiano spesso e differiscono a seconda della regione e del tipo di account. Usa questo come orientamento, poi conferma le opzioni attuali nelle pagine sulla privacy o dell'account di ciascuna piattaforma.
| Dove cercare | Cosa può controllare | Avvertenza |
|---|---|---|
| Impostazioni della privacy dell'account | Se i post e le immagini sono pubblici e chi può scaricarli o indicizzarli | I contenuti pubblici possono comunque essere copiati da altri una volta visti |
| Impostazioni dei dati per IA o terze parti | Alcune piattaforme offrono un interruttore per limitare l'uso dei tuoi contenuti per l'IA o l'addestramento dei modelli | Disponibilità e portata variano; potrebbe non coprire la raccolta già avvenuta |
| Opzioni di portfolio e licenza | Protezione dal clic destro, limiti di download, etichette di licenza | Scoraggiano il riutilizzo occasionale ma non ne impongono il rispetto |
| Controlli robots e del sito (proprio sito) | Chiedere ai crawler conformi di saltare le directory delle immagini | Volontario; non rimuove le copie esistenti altrove |
Impostazioni e interruttori vengono spostati e rinominati di frequente. Verifica le opzioni attuali nelle pagine di aiuto ufficiali di ciascun fornitore prima di dare per scontato che un controllo esista o copra ciò che ti aspetti.
Letture correlate
Confronta i modelli di IA prima di scegliere un flusso di lavoro.
ChatGPT Alternatives chatgpt-alternatives.comTrova alternative neutrali quando un solo fornitore di IA non basta.
AI Subscription Guide aisubscriptionguide.comScopri quale abbonamento IA si adatta al tuo lavoro reale.
Documentazione dei crawler di OpenAI platform.openai.com/docs/gptbotVerifica le indicazioni attuali di OpenAI su crawler e user-agent.
Documentazione dei crawler di Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlersVerifica i nomi dei crawler di Google, il comportamento di indicizzazione e i controlli legati all'IA.
Supporto di Anthropic support.anthropic.com/Verifica le indicazioni attuali su account, dati e crawler di Claude.
FAQ
Puoi ridurre l'esposizione, ma non puoi garantire il controllo completo una volta che le foto sono pubbliche. Tieni private le foto sensibili, controlla le impostazioni della piattaforma, evita i caricamenti pubblici ad alta risoluzione e usa i controlli per i crawler sul tuo sito web.
Solo dopo aver rimosso i dettagli che non ti servono per l'attività. Nomi, indirizzi, numeri di telefono, date di nascita, firme, segreti aziendali e referenze possono spesso essere sostituiti con segnaposto.
Fai attenzione. Lettere mediche, passaporti, documenti scolastici, atti legali, file bancari e documenti di famiglia possono contenere dati sensibili su altre persone. Usa impostazioni sulla privacy approvate oppure non caricarli.
Dipende dal prodotto, dal tipo di account e dalle impostazioni. Alcuni fornitori offrono controlli, piani per team o termini API che trattano i dati in modo diverso. Controlla le impostazioni attuali prima di digitare informazioni sensibili.
Non con un unico interruttore tecnico. robots.txt può chiedere ai crawler conformi di stare alla larga, ma è volontario e non rimuove le copie già esistenti altrove.
robots.txt è una convenzione tecnica, non un contratto di per sé. Può sostenere la tua posizione di principio, ma le questioni legali dipendono dalla giurisdizione, dai termini, dal diritto d'autore, dai contratti e dall'applicazione.