Foto e immagini

Anche le foto sono dati personali.

Per le foto personali, bloccare i crawler è solo un livello. Pensa ai volti, ai bambini, agli indizi sulla posizione, agli eventi privati, alle licenze, all'autenticazione, alle filigrane, alla provenienza e alle impostazioni delle piattaforme.

Contenuti visivi

La protezione delle foto è a più livelli.

Foto private

Fai attenzione a bambini, volti, interni di casa, eventi, documenti sullo sfondo, divise scolastiche, targhe delle auto e indizi sulla posizione. Le immagini pubbliche possono essere copiate, quindi non affidarti a un unico controllo.

Portfolio dei creativi

Usa termini di licenza chiari, anteprime a risoluzione più bassa, gallerie autenticate, filigrane, metadati di provenienza e impostazioni delle piattaforme.

Come funziona lo scraping

Come avviene davvero la raccolta di immagini per l'IA.

Capire il processo ti aiuta a vedere dove i tuoi controlli possono e non possono arrivare. Molte di queste informazioni sono di dominio pubblico su come sono stati storicamente costruiti i grandi set di dati di immagini, ma i metodi esatti variano da azienda ad azienda e cambiano nel tempo, quindi consideralo un contesto di riferimento e non una garanzia.

Set di dati pubblici ed elenchi di link

Molti set di addestramento sono stati assemblati a partire da grandi crawl del web (per esempio ampi archivi di pagine pubbliche) e da elenchi di URL di immagini abbinati al testo che le circonda. Se un'immagine si trova su una pagina pubblica che un crawler conforme può raggiungere, può finire referenziata in un set di dati di questo tipo. Rimuovere l'immagine in seguito non rimuove necessariamente le copie già raccolte.

Testo alternativo e didascalie

I modelli per immagini spesso imparano dalle parole vicine a un'immagine: l'attributo alt, le didascalie, i nomi dei file e i paragrafi circostanti. Un testo alternativo descrittivo è utile per l'accessibilità e la ricerca, ma rende anche un'immagine più facile da etichettare e indicizzare. È un compromesso, non un motivo per rimuovere il testo per l'accessibilità.

EXIF e metadati

Le foto possono contenere metadati EXIF come il modello della fotocamera, i timestamp e talvolta le coordinate GPS. Molte piattaforme li rimuovono al caricamento, ma non tutte, e i file condivisi direttamente possono conservarli. Rimuovere la posizione e i metadati identificativi prima di pubblicare è un'abitudine sensata, anche se non modifica ciò che è visibile nell'immagine stessa.

Ricerca inversa di immagini e ricaricamenti

Una volta che un'immagine è pubblica, altri possono scaricarla, riospitarla o eseguire una ricerca inversa. Questo significa che la stessa immagine può comparire su siti che non controlli, ciascuno con le proprie regole robots. Ecco perché nessuna singola impostazione può promettere che un'immagine non verrà mai più vista.

Verifica della realtà: questi controlli riducono l'esposizione e segnalano la tua intenzione. Sono convenzioni volontarie e imperfette nella pratica. Nulla di quanto riportato qui garantisce che un'immagine sia esclusa da ogni set di dati, e questa pagina è informazione a scopo educativo, non è una consulenza legale.

Checklist pratica

Foto private rispetto ai portfolio dei creativi.

Per le foto private e di famiglia

Tienile private: il controllo più forte consiste nel non pubblicare affatto pubblicamente le foto sensibili. Usa album chiusi o condivisioni fidate anziché pagine aperte.

Attenzione allo sfondo: documenti, schermi, numeri civici, divise, tesserini e targhe delle auto possono rivelare più del soggetto stesso.

Rimuovi i metadati: elimina il GPS e i dati EXIF identificativi prima di condividere i file, soprattutto per le immagini di bambini.

Controlla le impostazioni della piattaforma: verifica chi può vedere, scaricare o indicizzare i tuoi caricamenti e se la piattaforma offre controlli per l'IA o l'addestramento.

Per i portfolio dei creativi

Mostra anteprime, non gli originali: pubblica versioni a risoluzione più bassa o con filigrana e tieni i file a piena risoluzione dietro un accesso o una licenza.

Dichiara chiaramente le licenze: una dichiarazione visibile su uso e licenza sostiene la tua posizione, anche se da sola non può imporre la conformità.

Proteggi le gallerie: gallerie autenticate o riservate ai clienti tengono i lavori fuori dalle pagine aperte e indicizzabili.

Stratifica le tue difese: combina i controlli robots, i metadati di provenienza e le impostazioni della piattaforma anziché affidarti a un'unica misura.

Provenienza e strumenti

Filigrane, provenienza e strumenti anti-scraping.

Content Credentials (C2PA)

Lo standard C2PA, presentato in alcuni strumenti come Content Credentials, allega metadati di provenienza a prova di manomissione che descrivono come un'immagine è stata creata o modificata. Aiuta gli altri a verificarne l'origine e può segnalare la paternità, ma non impedisce fisicamente la copia, e i metadati possono essere rimossi. Il supporto varia da piattaforma a piattaforma, quindi verifica il comportamento attuale nei tuoi strumenti.

Filigrane visibili e invisibili

Le filigrane visibili scoraggiano il riutilizzo occasionale; le filigrane invisibili o forensi possono aiutarti a rintracciare le copie in seguito. Nessuna delle due impedisce che un'immagine venga sottoposta a scraping, e le filigrane aggressive influiscono sull'aspetto del tuo lavoro, quindi valuta il compromesso.

Strumenti anti-scraping (con cautela)

Strumenti di ricerca come Glaze e Nightshade mirano ad aggiungere sottili perturbazioni che rendono le immagini più difficili da apprendere per alcuni modelli o che disturbano l'addestramento. L'efficacia varia, è oggetto di dibattito e può cambiare man mano che i modelli si evolvono. Considerali come livelli aggiuntivi sperimentali, non come una protezione garantita, e leggi la documentazione attuale del progetto prima di affidarti a essi.

Impostazioni della piattaforma

Dove si trovano di solito gli opt-out e i controlli.

Molte piattaforme di foto e creative hanno aggiunto impostazioni legate all'IA, ma nomi, valori predefiniti e disponibilità cambiano spesso e differiscono a seconda della regione e del tipo di account. Usa questo come orientamento, poi conferma le opzioni attuali nelle pagine sulla privacy o dell'account di ciascuna piattaforma.

Dove cercareCosa può controllareAvvertenza
Impostazioni della privacy dell'accountSe i post e le immagini sono pubblici e chi può scaricarli o indicizzarliI contenuti pubblici possono comunque essere copiati da altri una volta visti
Impostazioni dei dati per IA o terze partiAlcune piattaforme offrono un interruttore per limitare l'uso dei tuoi contenuti per l'IA o l'addestramento dei modelliDisponibilità e portata variano; potrebbe non coprire la raccolta già avvenuta
Opzioni di portfolio e licenzaProtezione dal clic destro, limiti di download, etichette di licenzaScoraggiano il riutilizzo occasionale ma non ne impongono il rispetto
Controlli robots e del sito (proprio sito)Chiedere ai crawler conformi di saltare le directory delle immaginiVolontario; non rimuove le copie esistenti altrove

Impostazioni e interruttori vengono spostati e rinominati di frequente. Verifica le opzioni attuali nelle pagine di aiuto ufficiali di ciascun fornitore prima di dare per scontato che un controllo esista o copra ciò che ti aspetti.

Letture correlate

Prossimi passi.

ModelVersus modelversus.com

Confronta i modelli di IA prima di scegliere un flusso di lavoro.

ChatGPT Alternatives chatgpt-alternatives.com

Trova alternative neutrali quando un solo fornitore di IA non basta.

AI Subscription Guide aisubscriptionguide.com

Scopri quale abbonamento IA si adatta al tuo lavoro reale.

Documentazione dei crawler di OpenAI platform.openai.com/docs/gptbot

Verifica le indicazioni attuali di OpenAI su crawler e user-agent.

Documentazione dei crawler di Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Verifica i nomi dei crawler di Google, il comportamento di indicizzazione e i controlli legati all'IA.

Supporto di Anthropic support.anthropic.com/

Verifica le indicazioni attuali su account, dati e crawler di Claude.

FAQ

Dubbi comuni.

Posso impedire l'addestramento dell'IA sulle mie foto personali?

Puoi ridurre l'esposizione, ma non puoi garantire il controllo completo una volta che le foto sono pubbliche. Tieni private le foto sensibili, controlla le impostazioni della piattaforma, evita i caricamenti pubblici ad alta risoluzione e usa i controlli per i crawler sul tuo sito web.

Dovrei incollare il mio CV in un chatbot di IA?

Solo dopo aver rimosso i dettagli che non ti servono per l'attività. Nomi, indirizzi, numeri di telefono, date di nascita, firme, segreti aziendali e referenze possono spesso essere sostituiti con segnaposto.

Posso caricare documenti di famiglia sull'IA?

Fai attenzione. Lettere mediche, passaporti, documenti scolastici, atti legali, file bancari e documenti di famiglia possono contenere dati sensibili su altre persone. Usa impostazioni sulla privacy approvate oppure non caricarli.

I prompt privati diventano dati di addestramento dell'IA?

Dipende dal prodotto, dal tipo di account e dalle impostazioni. Alcuni fornitori offrono controlli, piani per team o termini API che trattano i dati in modo diverso. Controlla le impostazioni attuali prima di digitare informazioni sensibili.

Posso impedire completamente alle aziende di IA di addestrarsi sul mio sito web?

Non con un unico interruttore tecnico. robots.txt può chiedere ai crawler conformi di stare alla larga, ma è volontario e non rimuove le copie già esistenti altrove.

robots.txt blocca legalmente l'addestramento dell'IA?

robots.txt è una convenzione tecnica, non un contratto di per sé. Può sostenere la tua posizione di principio, ma le questioni legali dipendono dalla giurisdizione, dai termini, dal diritto d'autore, dai contratti e dall'applicazione.