I miei prompt
Non incollare nomi, indirizzi, password, dettagli sanitari, problemi legali, informazioni sui bambini o dati di lavoro riservati a meno che lo strumento e l'account non siano approvati per quell'uso.
Guida per privati
Questo è pensato prima di tutto per le persone comuni: il tuo blog, le foto, il CV, i documenti di famiglia, le note private, i lavori scolastici, i file dei clienti, i post sui social e i prompt. Scopri cosa puoi bloccare, cosa puoi solo ridurre e cosa non dovresti mai caricare senza pensarci.
Risposta rapida
La mossa più sicura non è solo un blocco dei crawler. È sapere cosa non pubblicare, cosa non incollare, quali impostazioni dell'account controllare e quando un file dovrebbe restare del tutto fuori dagli strumenti IA.
Non incollare nomi, indirizzi, password, dettagli sanitari, problemi legali, informazioni sui bambini o dati di lavoro riservati a meno che lo strumento e l'account non siano approvati per quell'uso.
Oscura CV, contratti, file bancari, referti medici, documenti scolastici e PDF dei clienti. Se i dati appartengono a qualcun altro, trattali come a rischio più elevato.
Le foto pubbliche possono contenere volti, luoghi, nomi, targhe ed eventi privati. Mantieni privati gli album sensibili e pensaci prima di caricare immagini sugli strumenti IA.
Se gestisci un blog o un portfolio, robots.txt e le regole del server possono chiedere ai crawler IA conformi di stare lontani. Non cancellano le vecchie copie.
Checklist per privati
Poniti queste domande prima di caricare o incollare qualsiasi cosa. Se una risposta ti mette a disagio, usa segnaposto, rimuovi il file oppure usa un account più controllato.
Questo mi identifica? Nome, indirizzo, telefono, email, firma, data di nascita, numero di passaporto, volto, voce o posizione esatta.
Identifica qualcun altro? Bambini, partner, clienti, pazienti, studenti, colleghi, inquilini, dipendenti o assistiti.
Lo pubblicherei online? Se no, non trattare un prompt IA qualsiasi come un taccuino privato sicuro.
Posso sostituire i dettagli? Usa «Persona A», «Azienda B», date fittizie, luoghi generici ed estratti abbreviati quando i dati esatti non servono.
Conosco le impostazioni dell'account? Gli account consumer, team, API ed enterprise possono gestire i dati in modo diverso. Controlla le impostazioni attuali.
Livelli tecnici
Usa robots.txt, log del server, regole del firewall e una policy sui contenuti visibile. Questo riduce il crawling conforme ma non rimuove le vecchie copie né ferma gli attori malintenzionati.
Usa i controlli sui dati del fornitore, le impostazioni della cronologia chat, i piani per team, le condizioni API, le opzioni di conservazione e gli opt-out. Questo è separato dal blocco dei crawler.
Usa il permesso del cliente, la policy aziendale, l'oscuramento, gli strumenti approvati e il controllo degli accessi prima di caricare file dei clienti, documenti HR o documenti riservati.
Mappa decisionale
Inizia dal punto in cui i tuoi dati diventano disponibili. Un prompt, un blog pubblico, un PDF privato, un album fotografico, un drive cloud e un documento di lavoro sono superfici di rischio diverse.
Una buona abitudine di privacy è noiosa ma potente: caricare meno, oscurare di più, mantenere privati gli album privati, controllare le impostazioni e usare i blocchi per i crawler solo dove servono.
Matrice dei crawler
| User agent | Azienda | Perché è importante | Nota di cautela |
|---|---|---|---|
GPTBot | OpenAI | Comunemente usato per i controlli di web crawling di OpenAI. | Bloccalo se non vuoi che questo crawler recuperi le tue pagine pubbliche per usi legati all'IA. Verifica la documentazione OpenAI attuale. |
ChatGPT-User | OpenAI | Agente di navigazione/recupero attivato dall'utente in molte discussioni. | Bloccarlo può impedire agli utenti di ChatGPT di chiedergli di leggere la tua pagina. Non è la stessa intenzione del crawling di addestramento su larga scala. |
Google-Extended | Un controllo che Google documenta per alcuni casi d'uso dell'IA generativa. | Non è la stessa cosa che bloccare la Ricerca Google. Non bloccare Googlebot a meno che tu non voglia che la visibilità nella ricerca ne risenta. | |
ClaudeBot | Anthropic | Nome del crawler di Anthropic visto nelle discussioni sui controlli dei crawler. | Usa solo dopo aver verificato la documentazione più recente di Anthropic. |
Claude-SearchBot | Anthropic | Nome del crawler Claude legato alla ricerca visto nelle indicazioni pubbliche. | Valuta il compromesso sulla visibilità prima di bloccare gli agenti di tipo ricerca. |
PerplexityBot | Perplexity | Crawler/user-agent di Perplexity discusso dagli editori. | Bloccarlo può influire su come i tuoi contenuti vengono scoperti o citati dai motori di risposta di tipo Perplexity. |
CCBot | Common Crawl | Crawler web pubblico usato per grandi set di dati web. | Spesso bloccato dagli editori che non vogliono che le pagine vengano copiate nei corpora di crawl pubblici. |
Bytespider | ByteDance | Crawler associato a ByteDance. | Utile da esaminare se vuoi una lista di blocco ampia per i crawler IA. |
Strumento statico
Seleziona i crawler a cui vuoi chiedere di non effettuare il crawling. Questo generatore funziona solo nel tuo browser. Non invia dati da nessuna parte. Prima di pubblicare, verifica gli attuali nomi ufficiali degli user agent.
# Controlli per crawler IA: verifica gli attuali nomi degli user agent prima di pubblicare.
# Questo è volontario. robots.txt non è un blocco legale.
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: CCBot
Disallow: /
Attenzione: bloccare gli agenti attivati dall'utente o legati alla ricerca può ridurre la scoperta, le anteprime o le citazioni assistite dall'IA.
Riferimenti ufficiali
Controlla le indicazioni attuali su crawler e user agent di OpenAI.
Documentazione crawler Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlersVerifica i nomi dei crawler Google, il comportamento di indicizzazione e i controlli legati all'IA.
Supporto Anthropic support.anthropic.com/Controlla le indicazioni attuali su account, dati e crawler di Claude.
Perplexity www.perplexity.ai/Consulta le informazioni attuali su prodotto ed editori di Perplexity.
Common Crawl commoncrawl.org/Comprendi uno dei principali set di dati di crawl web pubblici usati nella ricerca.
Robots Exclusion Protocol www.rfc-editor.org/rfc/rfc9309Il riferimento formale al protocollo robots.txt.
Guide correlate
Confronta i modelli IA prima di scegliere un flusso di lavoro.
ChatGPT Alternatives chatgpt-alternatives.comTrova alternative neutrali quando un solo fornitore di IA non basta.
AI Subscription Guide aisubscriptionguide.comScopri quale abbonamento IA si adatta al tuo lavoro reale.
KIWerkzeuge kiwerkzeuge.comDirectory di strumenti IA in tedesco e guide agli strumenti IA orientate alla privacy.
BoiteAIA boiteaia.comDirectory di strumenti IA in francese per chatbot, strumenti per immagini e uso aziendale.
MultipleChat AI multiplechat.aiUsa diversi modelli IA in un'unica interfaccia e mantieni i flussi di lavoro separati per progetto.
FAQ
Puoi ridurre l'esposizione, ma non puoi garantire il controllo totale una volta che le foto sono pubbliche. Mantieni private le foto sensibili, controlla le impostazioni della piattaforma, evita caricamenti pubblici ad alta risoluzione e usa i controlli per i crawler sul tuo sito web.
Solo dopo aver rimosso i dettagli che non ti servono per l'attività. Nomi, indirizzi, numeri di telefono, date di nascita, firme, segreti del datore di lavoro e referenze spesso possono essere sostituiti con segnaposto.
Fai attenzione. Referti medici, passaporti, documenti scolastici, atti legali, file bancari e documenti di famiglia possono contenere dati sensibili su altre persone. Usa impostazioni sulla privacy approvate oppure non caricarli.
Dipende dal prodotto, dal tipo di account e dalle impostazioni. Alcuni fornitori offrono controlli, piani per team o condizioni API che trattano i dati in modo diverso. Controlla le impostazioni attuali prima di digitare informazioni sensibili.
Non con un unico interruttore tecnico. robots.txt può chiedere ai crawler conformi di stare lontani, ma è volontario e non rimuove le copie che già esistono altrove.
robots.txt è una convenzione tecnica, non un contratto di per sé. Può sostenere la tua posizione, ma le questioni legali dipendono dalla giurisdizione, dalle condizioni, dal diritto d'autore, dai contratti e dall'applicazione.
Bloccare gli agenti specifici dell'IA non va trattato allo stesso modo del blocco di Googlebot. Se blocchi i normali crawler di ricerca, la visibilità nella ricerca può risentirne. Controlla ogni user agent con attenzione.
Solo se ne comprendi il compromesso. Gli agenti attivati dall'utente possono recuperare le pagine quando una persona chiede a uno strumento IA di leggere il tuo sito. Bloccarli può ridurre la scoperta assistita dall'IA.