Se gestisci un blog personale, un portfolio, un sito di famiglia o una piccola pagina da creator, il blocco dei crawler inizia con l'indicare i giusti user agent e con il capire che robots.txt è una richiesta, non un lucchetto.
Blocca i crawler IA senza distruggere una visibilità utile.
Tieni separata la ricerca
Non copiare una lista di blocco a caso in produzione. I crawler di ricerca, i crawler di ricerca IA, i crawler di addestramento e i fetcher attivati dall'utente possono avere scopi diversi. Bloccare l'agente sbagliato può nascondere le tue pagine agli strumenti che desideri ancora.
Monitora i log
I log del server mostrano chi visita davvero. Mantieni un breve ciclo di revisione: aggiungi regole, osserva il traffico, controlla se le pagine importanti compaiono ancora dove ti aspetti e poi apporta le modifiche.
User agent
Azienda
Perché è importante
Nota di attenzione
GPTBot
OpenAI
Comunemente usato per i controlli del web crawling di OpenAI.
Bloccalo se non vuoi che questo crawler recuperi le tue pagine pubbliche per usi legati all'IA. Verifica la documentazione OpenAI attuale.
ChatGPT-User
OpenAI
Agente di navigazione/recupero attivato dall'utente in molte discussioni.
Bloccarlo può impedire agli utenti di ChatGPT di chiedergli di leggere la tua pagina. Questa non è la stessa intenzione del crawling di addestramento su larga scala.
Google-Extended
Google
Un controllo che Google documenta per alcuni casi d'uso di IA generativa.
Questo non equivale a bloccare la Ricerca Google. Non bloccare Googlebot a meno che tu non voglia compromettere la visibilità nella ricerca.
ClaudeBot
Anthropic
Nome del crawler di Anthropic visto nelle discussioni sul controllo dei crawler.
Usalo solo dopo aver controllato la documentazione più recente di Anthropic.
Claude-SearchBot
Anthropic
Nome del crawler di Claude legato alla ricerca visto nelle guide pubbliche.
Valuta il compromesso sulla visibilità prima di bloccare gli agenti di tipo ricerca.
PerplexityBot
Perplexity
Crawler/user agent di Perplexity discusso dagli editori.
Bloccarlo può influire su come i tuoi contenuti vengono scoperti o citati dai motori di risposta di tipo Perplexity.
CCBot
Common Crawl
Crawler web pubblico usato per grandi set di dati web.
Spesso bloccato dagli editori che non vogliono che le pagine vengano copiate in corpora di crawl pubblici.
Bytespider
ByteDance
Crawler associato a ByteDance.
Utile da valutare se vuoi una lista di blocco ampia per i crawler IA.
Come i crawler ti trovano
Come i crawler IA scoprono e recuperano il tuo sito.
Prima di poter bloccare un crawler, è utile sapere come arriva. I fetcher automatici raramente inciampano su una pagina a caso; seguono una catena di scoperta abbastanza prevedibile. Le descrizioni qui sotto sono generiche e semplificate, e il comportamento esatto di qualsiasi bot indicato può cambiare, quindi verifica sulla documentazione ufficiale di ciascun fornitore prima di agire.
Scoperta
I crawler trovano gli URL seguendo i link da altre pagine, leggendo la tua sitemap XML, controllando il tuo robots.txt e attingendo a grandi set di dati di link pubblici. Una pagina nuova di zecca di solito diventa raggiungibile nel momento in cui qualcosa di pubblico vi rimanda con un link.
Recupero
Un crawler invia una richiesta HTTP identificandosi con una stringa user agent. Il tuo server può ispezionare quella stringa e decidere come rispondere, anche se gli user agent possono essere imitati, quindi trattali come un indizio e non come una prova.
Frequenza
I crawler ben educati tornano periodicamente per raccogliere le modifiche, e molti rispettano i suggerimenti di crawl-delay o i propri limiti di velocità. Quelli mal educati possono recuperare in modo aggressivo, il che è uno dei motivi per cui la limitazione della velocità conta accanto a regole cortesi.
Tre tipi di bot
I crawler di ricerca, i crawler di addestramento IA e i bot di recupero in tempo reale non sono la stessa cosa.
Molti errori di blocco derivano dal trattare ogni bot come identico. Le tre categorie qui sotto si sovrappongono nella meccanica ma differiscono nello scopo, e bloccarne una può avere conseguenze molto diverse dal bloccarne un'altra. Nomi e comportamenti si evolvono, quindi conferma il ruolo attuale di un agente specifico prima di affidarti a questo schema.
Tipo
Cosa fa
Effetto del blocco
Crawler di ricerca
Indicizza le pagine affinché possano apparire nei risultati di un motore di ricerca.
Bloccarlo può rimuoverti da quel motore di ricerca. Di solito non è ciò che vuoi.
Crawler di addestramento IA
Recupera le pagine per costruire o migliorare i set di dati di addestramento per i modelli IA.
Bloccarlo chiede al fornitore di non usare le tue pagine pubbliche per l'addestramento. Questo è l'obiettivo principale per la maggior parte delle persone qui.
Bot di recupero IA in tempo reale
Recupera una pagina su richiesta quando un utente chiede a un assistente IA di leggerla o citarla.
Bloccarlo può impedire che la tua pagina venga letta o citata in tempo reale, il che influisce sulla visibilità nei motori di risposta anziché sull'addestramento.
Il compromesso che vale la pena nominare.
I crawler di addestramento e i bot di recupero in tempo reale sono ciò che la maggior parte delle persone intende con "bot IA", ma alcuni alimentano anche la scoperta e la citazione. Decidi consapevolmente se vuoi essere addestrato, citato, entrambe le cose o nessuna, perché sono scelte separate.
Un approccio a più livelli
Il blocco funziona meglio a livelli, perché nessun singolo livello è completo.
Pensa al blocco come a una difesa in profondità piuttosto che a un singolo interruttore. Ogni livello intercetta casi che gli altri si lasciano sfuggire, e ognuno ha limiti onesti. Inizia con i livelli cortesi e a basso rischio e aggiungi quelli più rigidi solo dove il compromesso ne vale la pena.
1. robots.txt
Un file di testo semplice che chiede ai crawler indicati di non recuperare i percorsi elencati. I bot conformi lo rispettano; quelli non conformi lo ignorano. È il consueto primo passo e il meno invasivo.
2. Meta robots e X-Robots-Tag
Un meta tag a livello di pagina o un'intestazione di risposta HTTP possono richiedere che i contenuti non vengano indicizzati o usati in certi modi. Il supporto varia da bot a bot, quindi tratta direttive come noai come richieste, non come garanzie.
3. WAF, firewall e limiti di velocità
Un web application firewall o un limitatore di velocità può bloccare o rallentare il traffico in base a user agent, intervallo di IP o comportamento. A differenza di robots.txt, questo applica davvero il controllo a livello di server, anche se richiede attenzione per non intercettare i visitatori legittimi.
4. Barriere di autenticazione
I contenuti dietro un login non sono recuperabili pubblicamente, il che è il modo più affidabile per tenere del tutto fuori i crawler occasionali. Il costo è l'attrito per gli utenti reali, quindi riservalo al materiale che ne ha davvero bisogno.
Le piattaforme gestite aggiungono un'altra opzione. Alcuni fornitori, come i servizi di tipo Cloudflare, offrono controlli integrati che identificano e bloccano categorie di bot IA al posto tuo. Possono essere comodi, ma dipendi comunque dall'accuratezza di rilevamento e dalle definizioni del fornitore, quindi verifica cosa fa davvero una determinata opzione prima di fidartene.
# robots.txt — un primo livello cortese (verifica i nomi degli agenti attuali)
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# Mantieni la ricerca normale funzionante: NON bloccare in blocco Googlebot
User-agent: Googlebot
Allow: /
# Esempio di intestazione di risposta HTTP (configurazione server o WAF)
X-Robots-Tag: noai, noimageai
Perché il blocco è imperfetto
Limiti onesti: cosa può e cosa non può fare il blocco.
Sarebbe fuorviante presentare una qualsiasi di queste tecniche come a prova di errore. Riducono in modo significativo il crawling indesiderato, ma non rendono i tuoi contenuti irraggiungibili. Impostare correttamente le aspettative fa parte del farlo in modo responsabile.
robots.txt e direttive simili sono volontari. I crawler conformi li rispettano; altri possono semplicemente ignorarli.
Le copie realizzate prima che tu aggiungessi una regola possono persistere in cache, archivi e set di dati che non puoi raggiungere.
Le stringhe user agent possono essere falsificate, quindi una lista di blocco basata sul nome non intercetterà un bot che finge di essere un normale browser.
Regole troppo ampie possono danneggiare accidentalmente la visibilità nella ricerca o bloccare strumenti che invece desideri.
L'applicazione a livello di server è più forte delle regole cortesi, ma può produrre falsi positivi che bloccano persone reali.
Nulla di ciò è una consulenza legale, e i controlli tecnici non risolvono di per sé le questioni di copyright, contratto o giurisdizione.
Un obiettivo realistico.
Punta a rendere il crawling IA indesiderato notevolmente meno comodo e a documentare chiaramente la tua preferenza dichiarata. Questo è raggiungibile. Un'esclusione garantita e universale non lo è.
Osserva i tuoi log
Come monitorare i log del server per gli user agent IA.
Le regole sono utili solo se controlli se stanno funzionando. I log di accesso del tuo server registrano chi ha richiesto cosa, quando e con quale stringa user agent. Una breve revisione regolare ti dice quali bot stanno effettivamente visitando e se le tue regole vengono rispettate. Ricorda che gli user agent possono essere imitati, quindi tratta i log come prove da interpretare anziché come verità assoluta.
Cosa cercare
Scansiona alla ricerca di note stringhe user agent IA come GPTBot, CCBot, ClaudeBot, PerplexityBot e Bytespider. Annota il loro volume di richieste e quali percorsi recuperano.
Segnali di problemi
Fai attenzione agli agenti che richiedono il tuo sito in modo intenso dopo che li hai vietati, ad agenti sconosciuti che recuperano rapidamente molte pagine, o a stringhe di browser generiche che colpiscono URL che nessun essere umano visiterebbe.
Cosa fare dopo
Se un bot conforme ignora una regola, ricontrolla la tua sintassi. Se un bot ignora davvero robots.txt, valuta una regola di firewall o di limitazione della velocità, accettando il rischio aggiuntivo di falsi positivi.
# Esempio approssimativo: conta le richieste per user agent legato all'IA
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
| awk '{print $NF}' | sort | uniq -c | sort -rn
Implementazione passo dopo passo
Un'implementazione prudente che puoi annullare.
Poiché una regola sbagliata può danneggiare in silenzio la visibilità legittima, implementa le modifiche gradualmente e osserva l'effetto a ogni passo. La sequenza qui sotto privilegia la reversibilità rispetto alla velocità, che è la priorità giusta per la maggior parte dei siti personali e piccoli.
Riferimento di partenza: esamina i tuoi log attuali così da sapere quali bot visitano prima di cambiare qualsiasi cosa.
Decidi l'intenzione: scegli se vuoi essere escluso dall'addestramento, dal recupero in tempo reale o da entrambi, e conferma di mantenere intatta la ricerca normale.
Inizia in modo cortese: aggiungi regole robots.txt per gli specifici crawler di addestramento IA che vuoi escludere, usando nomi che hai verificato sulla documentazione ufficiale.
Aggiungi controlli a livello di pagina: dove supportato, aggiungi direttive meta robots o X-Robots-Tag per un controllo più fine.
Osserva: attendi una o due settimane e ricontrolla i log e la visibilità nella ricerca per confermare che nulla di importante si sia rotto.
Applica in modo selettivo: solo per i bot che ignorano le regole cortesi, aggiungi regole di firewall o di limitazione della velocità, testando con attenzione per evitare falsi positivi.
Rivedi secondo un calendario: torna a controllare ogni pochi mesi, poiché i nomi dei crawler, le policy dei fornitori e le tue stesse priorità cambiano tutti.
Posso impedire l'addestramento dell'IA sulle mie foto personali?
Puoi ridurre l'esposizione, ma non puoi garantire il pieno controllo una volta che le foto sono pubbliche. Tieni private le foto sensibili, controlla le impostazioni della piattaforma, evita caricamenti pubblici ad alta risoluzione e usa i controlli per i crawler sul tuo sito web.
Dovrei incollare il mio CV o curriculum in un chatbot IA?
Solo dopo aver rimosso i dettagli di cui non hai bisogno per il compito. Nomi, indirizzi, numeri di telefono, date di nascita, firme, segreti del datore di lavoro e referenze possono spesso essere sostituiti con segnaposto.
Posso caricare documenti di famiglia su un'IA?
Fai attenzione. Lettere mediche, passaporti, documenti scolastici, atti legali, file bancari e documenti di famiglia possono contenere dati sensibili su altre persone. Usa le impostazioni sulla privacy approvate oppure non caricarli.
I prompt privati diventano dati di addestramento dell'IA?
Dipende dal prodotto, dal tipo di account e dalle impostazioni. Alcuni fornitori offrono controlli, piani per team o termini API che trattano i dati in modo diverso. Controlla le impostazioni attuali prima di digitare informazioni sensibili.
Posso impedire completamente alle aziende di IA di addestrarsi sul mio sito web?
Non con un solo interruttore tecnico. robots.txt può chiedere ai crawler conformi di stare alla larga, ma è volontario e non rimuove le copie che esistono già altrove.
robots.txt è una convenzione tecnica, non un contratto di per sé. Può sostenere la tua posizione dichiarata, ma le questioni legali dipendono da giurisdizione, termini, copyright, contratti e applicazione.