Siti web personali

Come bloccare i crawler IA.

Se gestisci un blog personale, un portfolio, un sito di famiglia o una piccola pagina da creator, il blocco dei crawler inizia con l'indicare i giusti user agent e con il capire che robots.txt è una richiesta, non un lucchetto.

Procedi con attenzione

Blocca i crawler IA senza distruggere una visibilità utile.

Tieni separata la ricerca

Non copiare una lista di blocco a caso in produzione. I crawler di ricerca, i crawler di ricerca IA, i crawler di addestramento e i fetcher attivati dall'utente possono avere scopi diversi. Bloccare l'agente sbagliato può nascondere le tue pagine agli strumenti che desideri ancora.

Monitora i log

I log del server mostrano chi visita davvero. Mantieni un breve ciclo di revisione: aggiungi regole, osserva il traffico, controlla se le pagine importanti compaiono ancora dove ti aspetti e poi apporta le modifiche.

User agentAziendaPerché è importanteNota di attenzione
GPTBotOpenAIComunemente usato per i controlli del web crawling di OpenAI.Bloccalo se non vuoi che questo crawler recuperi le tue pagine pubbliche per usi legati all'IA. Verifica la documentazione OpenAI attuale.
ChatGPT-UserOpenAIAgente di navigazione/recupero attivato dall'utente in molte discussioni.Bloccarlo può impedire agli utenti di ChatGPT di chiedergli di leggere la tua pagina. Questa non è la stessa intenzione del crawling di addestramento su larga scala.
Google-ExtendedGoogleUn controllo che Google documenta per alcuni casi d'uso di IA generativa.Questo non equivale a bloccare la Ricerca Google. Non bloccare Googlebot a meno che tu non voglia compromettere la visibilità nella ricerca.
ClaudeBotAnthropicNome del crawler di Anthropic visto nelle discussioni sul controllo dei crawler.Usalo solo dopo aver controllato la documentazione più recente di Anthropic.
Claude-SearchBotAnthropicNome del crawler di Claude legato alla ricerca visto nelle guide pubbliche.Valuta il compromesso sulla visibilità prima di bloccare gli agenti di tipo ricerca.
PerplexityBotPerplexityCrawler/user agent di Perplexity discusso dagli editori.Bloccarlo può influire su come i tuoi contenuti vengono scoperti o citati dai motori di risposta di tipo Perplexity.
CCBotCommon CrawlCrawler web pubblico usato per grandi set di dati web.Spesso bloccato dagli editori che non vogliono che le pagine vengano copiate in corpora di crawl pubblici.
BytespiderByteDanceCrawler associato a ByteDance.Utile da valutare se vuoi una lista di blocco ampia per i crawler IA.

Come i crawler ti trovano

Come i crawler IA scoprono e recuperano il tuo sito.

Prima di poter bloccare un crawler, è utile sapere come arriva. I fetcher automatici raramente inciampano su una pagina a caso; seguono una catena di scoperta abbastanza prevedibile. Le descrizioni qui sotto sono generiche e semplificate, e il comportamento esatto di qualsiasi bot indicato può cambiare, quindi verifica sulla documentazione ufficiale di ciascun fornitore prima di agire.

Scoperta

I crawler trovano gli URL seguendo i link da altre pagine, leggendo la tua sitemap XML, controllando il tuo robots.txt e attingendo a grandi set di dati di link pubblici. Una pagina nuova di zecca di solito diventa raggiungibile nel momento in cui qualcosa di pubblico vi rimanda con un link.

Recupero

Un crawler invia una richiesta HTTP identificandosi con una stringa user agent. Il tuo server può ispezionare quella stringa e decidere come rispondere, anche se gli user agent possono essere imitati, quindi trattali come un indizio e non come una prova.

Frequenza

I crawler ben educati tornano periodicamente per raccogliere le modifiche, e molti rispettano i suggerimenti di crawl-delay o i propri limiti di velocità. Quelli mal educati possono recuperare in modo aggressivo, il che è uno dei motivi per cui la limitazione della velocità conta accanto a regole cortesi.

Tre tipi di bot

I crawler di ricerca, i crawler di addestramento IA e i bot di recupero in tempo reale non sono la stessa cosa.

Molti errori di blocco derivano dal trattare ogni bot come identico. Le tre categorie qui sotto si sovrappongono nella meccanica ma differiscono nello scopo, e bloccarne una può avere conseguenze molto diverse dal bloccarne un'altra. Nomi e comportamenti si evolvono, quindi conferma il ruolo attuale di un agente specifico prima di affidarti a questo schema.

TipoCosa faEffetto del blocco
Crawler di ricercaIndicizza le pagine affinché possano apparire nei risultati di un motore di ricerca.Bloccarlo può rimuoverti da quel motore di ricerca. Di solito non è ciò che vuoi.
Crawler di addestramento IARecupera le pagine per costruire o migliorare i set di dati di addestramento per i modelli IA.Bloccarlo chiede al fornitore di non usare le tue pagine pubbliche per l'addestramento. Questo è l'obiettivo principale per la maggior parte delle persone qui.
Bot di recupero IA in tempo realeRecupera una pagina su richiesta quando un utente chiede a un assistente IA di leggerla o citarla.Bloccarlo può impedire che la tua pagina venga letta o citata in tempo reale, il che influisce sulla visibilità nei motori di risposta anziché sull'addestramento.

Il compromesso che vale la pena nominare.

I crawler di addestramento e i bot di recupero in tempo reale sono ciò che la maggior parte delle persone intende con "bot IA", ma alcuni alimentano anche la scoperta e la citazione. Decidi consapevolmente se vuoi essere addestrato, citato, entrambe le cose o nessuna, perché sono scelte separate.

Un approccio a più livelli

Il blocco funziona meglio a livelli, perché nessun singolo livello è completo.

Pensa al blocco come a una difesa in profondità piuttosto che a un singolo interruttore. Ogni livello intercetta casi che gli altri si lasciano sfuggire, e ognuno ha limiti onesti. Inizia con i livelli cortesi e a basso rischio e aggiungi quelli più rigidi solo dove il compromesso ne vale la pena.

1. robots.txt

Un file di testo semplice che chiede ai crawler indicati di non recuperare i percorsi elencati. I bot conformi lo rispettano; quelli non conformi lo ignorano. È il consueto primo passo e il meno invasivo.

2. Meta robots e X-Robots-Tag

Un meta tag a livello di pagina o un'intestazione di risposta HTTP possono richiedere che i contenuti non vengano indicizzati o usati in certi modi. Il supporto varia da bot a bot, quindi tratta direttive come noai come richieste, non come garanzie.

3. WAF, firewall e limiti di velocità

Un web application firewall o un limitatore di velocità può bloccare o rallentare il traffico in base a user agent, intervallo di IP o comportamento. A differenza di robots.txt, questo applica davvero il controllo a livello di server, anche se richiede attenzione per non intercettare i visitatori legittimi.

4. Barriere di autenticazione

I contenuti dietro un login non sono recuperabili pubblicamente, il che è il modo più affidabile per tenere del tutto fuori i crawler occasionali. Il costo è l'attrito per gli utenti reali, quindi riservalo al materiale che ne ha davvero bisogno.

Le piattaforme gestite aggiungono un'altra opzione. Alcuni fornitori, come i servizi di tipo Cloudflare, offrono controlli integrati che identificano e bloccano categorie di bot IA al posto tuo. Possono essere comodi, ma dipendi comunque dall'accuratezza di rilevamento e dalle definizioni del fornitore, quindi verifica cosa fa davvero una determinata opzione prima di fidartene.

# robots.txt — un primo livello cortese (verifica i nomi degli agenti attuali)
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

# Mantieni la ricerca normale funzionante: NON bloccare in blocco Googlebot
User-agent: Googlebot
Allow: /
# Esempio di intestazione di risposta HTTP (configurazione server o WAF)
X-Robots-Tag: noai, noimageai

Perché il blocco è imperfetto

Limiti onesti: cosa può e cosa non può fare il blocco.

Sarebbe fuorviante presentare una qualsiasi di queste tecniche come a prova di errore. Riducono in modo significativo il crawling indesiderato, ma non rendono i tuoi contenuti irraggiungibili. Impostare correttamente le aspettative fa parte del farlo in modo responsabile.

Un obiettivo realistico.

Punta a rendere il crawling IA indesiderato notevolmente meno comodo e a documentare chiaramente la tua preferenza dichiarata. Questo è raggiungibile. Un'esclusione garantita e universale non lo è.

Osserva i tuoi log

Come monitorare i log del server per gli user agent IA.

Le regole sono utili solo se controlli se stanno funzionando. I log di accesso del tuo server registrano chi ha richiesto cosa, quando e con quale stringa user agent. Una breve revisione regolare ti dice quali bot stanno effettivamente visitando e se le tue regole vengono rispettate. Ricorda che gli user agent possono essere imitati, quindi tratta i log come prove da interpretare anziché come verità assoluta.

Cosa cercare

Scansiona alla ricerca di note stringhe user agent IA come GPTBot, CCBot, ClaudeBot, PerplexityBot e Bytespider. Annota il loro volume di richieste e quali percorsi recuperano.

Segnali di problemi

Fai attenzione agli agenti che richiedono il tuo sito in modo intenso dopo che li hai vietati, ad agenti sconosciuti che recuperano rapidamente molte pagine, o a stringhe di browser generiche che colpiscono URL che nessun essere umano visiterebbe.

Cosa fare dopo

Se un bot conforme ignora una regola, ricontrolla la tua sintassi. Se un bot ignora davvero robots.txt, valuta una regola di firewall o di limitazione della velocità, accettando il rischio aggiuntivo di falsi positivi.

# Esempio approssimativo: conta le richieste per user agent legato all'IA
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

Implementazione passo dopo passo

Un'implementazione prudente che puoi annullare.

Poiché una regola sbagliata può danneggiare in silenzio la visibilità legittima, implementa le modifiche gradualmente e osserva l'effetto a ogni passo. La sequenza qui sotto privilegia la reversibilità rispetto alla velocità, che è la priorità giusta per la maggior parte dei siti personali e piccoli.

  1. Riferimento di partenza: esamina i tuoi log attuali così da sapere quali bot visitano prima di cambiare qualsiasi cosa.
  2. Decidi l'intenzione: scegli se vuoi essere escluso dall'addestramento, dal recupero in tempo reale o da entrambi, e conferma di mantenere intatta la ricerca normale.
  3. Inizia in modo cortese: aggiungi regole robots.txt per gli specifici crawler di addestramento IA che vuoi escludere, usando nomi che hai verificato sulla documentazione ufficiale.
  4. Aggiungi controlli a livello di pagina: dove supportato, aggiungi direttive meta robots o X-Robots-Tag per un controllo più fine.
  5. Osserva: attendi una o due settimane e ricontrolla i log e la visibilità nella ricerca per confermare che nulla di importante si sia rotto.
  6. Applica in modo selettivo: solo per i bot che ignorano le regole cortesi, aggiungi regole di firewall o di limitazione della velocità, testando con attenzione per evitare falsi positivi.
  7. Rivedi secondo un calendario: torna a controllare ogni pochi mesi, poiché i nomi dei crawler, le policy dei fornitori e le tue stesse priorità cambiano tutti.

Letture correlate

Prossimi passi.

ModelVersus modelversus.com

Confronta i modelli IA prima di scegliere un flusso di lavoro.

ChatGPT Alternatives chatgpt-alternatives.com

Trova alternative neutrali quando un solo fornitore di IA non basta.

AI Subscription Guide aisubscriptionguide.com

Scopri quale abbonamento IA si adatta al tuo lavoro reale.

Documentazione crawler OpenAI platform.openai.com/docs/gptbot

Controlla le attuali indicazioni su crawler e user agent di OpenAI.

Documentazione crawler Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Verifica i nomi dei crawler di Google, il comportamento di indicizzazione e i controlli legati all'IA.

Supporto Anthropic support.anthropic.com/

Controlla le attuali indicazioni su account Claude, dati e crawler.

FAQ

Dubbi comuni.

Posso impedire l'addestramento dell'IA sulle mie foto personali?

Puoi ridurre l'esposizione, ma non puoi garantire il pieno controllo una volta che le foto sono pubbliche. Tieni private le foto sensibili, controlla le impostazioni della piattaforma, evita caricamenti pubblici ad alta risoluzione e usa i controlli per i crawler sul tuo sito web.

Dovrei incollare il mio CV o curriculum in un chatbot IA?

Solo dopo aver rimosso i dettagli di cui non hai bisogno per il compito. Nomi, indirizzi, numeri di telefono, date di nascita, firme, segreti del datore di lavoro e referenze possono spesso essere sostituiti con segnaposto.

Posso caricare documenti di famiglia su un'IA?

Fai attenzione. Lettere mediche, passaporti, documenti scolastici, atti legali, file bancari e documenti di famiglia possono contenere dati sensibili su altre persone. Usa le impostazioni sulla privacy approvate oppure non caricarli.

I prompt privati diventano dati di addestramento dell'IA?

Dipende dal prodotto, dal tipo di account e dalle impostazioni. Alcuni fornitori offrono controlli, piani per team o termini API che trattano i dati in modo diverso. Controlla le impostazioni attuali prima di digitare informazioni sensibili.

Posso impedire completamente alle aziende di IA di addestrarsi sul mio sito web?

Non con un solo interruttore tecnico. robots.txt può chiedere ai crawler conformi di stare alla larga, ma è volontario e non rimuove le copie che esistono già altrove.

robots.txt blocca legalmente l'addestramento dell'IA?

robots.txt è una convenzione tecnica, non un contratto di per sé. Può sostenere la tua posizione dichiarata, ma le questioni legali dipendono da giurisdizione, termini, copyright, contratti e applicazione.