Generatore di snippet

robots.txt per i bot IA.

Usa questi esempi come punto di partenza, non come una verità permanente. I nomi degli user agent, i prodotti e il comportamento dei crawler cambiano, quindi controlla sempre le pagine ufficiali prima di procedere alla pubblicazione.

Strumento statico

Crea uno snippet robots.txt iniziale e prudente.

Seleziona i crawler a cui vuoi chiedere di non effettuare il crawling. Questo generatore funziona solo nel tuo browser. Non invia dati da nessuna parte. Prima della pubblicazione, verifica i nomi ufficiali attuali degli user agent.

# Controlli per i crawler IA: verifica i nomi attuali degli user agent prima della pubblicazione.
# Questo è volontario. robots.txt non è un blocco legale.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Attenzione: bloccare gli agent attivati dall'utente o legati alla ricerca può ridurre la reperibilità assistita dall'IA, le anteprime o le citazioni.

Blocco da copiare e incollare

Un esempio di robots.txt per i comuni user agent IA.

Di seguito trovi un blocco iniziale che copre diversi crawler legati all'IA. I nomi degli user agent cambiano e variano a seconda del prodotto, quindi trattalo come un modello e verifica ogni nome nella documentazione ufficiale dell'operatore prima di pubblicarlo.

# Solo un esempio. Verifica ogni nome di user agent nella documentazione ufficiale.
# robots.txt è volontario. Non rimuove le copie già esistenti
# e agisce solo sui crawler che scelgono di rispettarlo.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /
User agent (da verificare)Associato aSolitamente usato per
GPTBotOpenAICrawling di contenuti web che potrebbero essere usati per l'addestramento dei modelli
Google-ExtendedGoogleUn token di controllo per limitare l'uso dei contenuti per determinati prodotti IA
CCBotCommon CrawlCostruzione dell'archivio aperto Common Crawl, usato da molti dataset a valle
ClaudeBot / anthropic-aiAnthropicCrawling legato a Claude; verifica i token attuali nella documentazione di Anthropic
PerplexityBotPerplexityCrawling per le sue funzioni di risposta e ricerca
BytespiderByteDanceCrawling esteso associato ai prodotti ByteDance
Applebot-ExtendedAppleUn token di controllo per limitare l'uso dei contenuti per l'addestramento dell'IA di Apple

Alcuni di questi sono veri user agent di crawler e altri sono token di controllo piuttosto che bot che recuperano le pagine. Nomi, significati e comportamento cambiano, quindi conferma ciascuno di essi nella documentazione ufficiale dell'operatore prima di farvi affidamento.

Cosa non fa

robots.txt è volontario e limitato.

È una richiesta, non un blocco

robots.txt è una convenzione. I crawler ben educati la leggono e la rispettano, ma non viene imposta dal web stesso. Un crawler che la ignora, o che non è nel tuo elenco, può comunque recuperare le pagine pubbliche. È un segnale di intento, non una barriera tecnica.

Non rimuove le copie esistenti

Aggiungere oggi una regola disallow non fa nulla per i contenuti che sono già stati sottoposti a crawling, memorizzati nella cache, archiviati o copiati altrove. Né incide sui dati che le persone incollano manualmente negli strumenti IA. Consideralo come una riduzione dell'esposizione futura, non come un annullamento del passato.

Livelli più forti

Alternative e complementi.

Regole WAF e firewall

Un web application firewall o una regola del server può effettivamente bloccare o sottoporre a verifica le richieste in base allo user agent, all'intervallo di IP o al comportamento, anziché limitarsi a chiedere cortesemente. Questa è un'applicazione forzata anziché una richiesta, ma richiede manutenzione quando le identità dei crawler cambiano e può occasionalmente colpire visitatori legittimi.

Meta tag e header

Le direttive a livello di pagina come un meta tag robots noindex o un header X-Robots-Tag influenzano il modo in cui i crawler conformi trattano una pagina. Come robots.txt, si basano sulla cooperazione e non fermano un crawler che le ignora.

Controlli di rete e di accesso

Richiedere un login, limitare la frequenza delle richieste o collocare il materiale sensibile dietro un'autenticazione lo tiene completamente fuori dalle pagine aperte e soggette a crawling. Limitare l'accesso è di solito molto più affidabile di qualsiasi file di testo volontario per i contenuti che devono davvero rimanere privati.

Verifica che funzioni

Come controllare il tuo robots.txt.

  1. Carica https://yourdomain.com/robots.txt direttamente in un browser e conferma che il file venga servito correttamente nella radice del sito.
  2. Controlla eventuali errori di battitura nei nomi degli user agent e nelle direttive; un token scritto male semplicemente non fa nulla.
  3. Usa un tester di robots.txt o gli strumenti della tua search console per confermare che la sintassi venga interpretata come previsto.
  4. Rivedi i log del server nel tempo per vedere se gli user agent che hai preso di mira compaiono ancora, ricordando che i nomi cambiano e alcuni agent ignorano il file.
  5. Riverifica periodicamente i nomi nella documentazione ufficiale di ciascun operatore, poiché le identità dei crawler e i token di controllo vengono aggiornati regolarmente.

Questa pagina è materiale informativo a scopo didattico, non una consulenza legale, e i nomi degli user agent qui mostrati potrebbero essere obsoleti. Conferma sempre i token e il comportamento attuali nella documentazione ufficiale dell'operatore prima di farvi affidamento.

Letture correlate

Prossimi passi.

ModelVersus modelversus.com

Confronta i modelli IA prima di scegliere un flusso di lavoro.

ChatGPT Alternatives chatgpt-alternatives.com

Trova alternative neutrali quando un solo fornitore di IA non basta.

AI Subscription Guide aisubscriptionguide.com

Scopri quale abbonamento IA è adatto al tuo lavoro reale.

Documentazione crawler OpenAI platform.openai.com/docs/gptbot

Controlla le attuali indicazioni sui crawler e sugli user agent di OpenAI.

Documentazione crawler Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Verifica i nomi dei crawler Google, il comportamento di indicizzazione e i controlli legati all'IA.

Supporto Anthropic support.anthropic.com/

Controlla le attuali indicazioni su account, dati e crawler di Claude.

FAQ

Dubbi comuni.

Posso impedire l'addestramento dell'IA sulle mie foto personali?

Puoi ridurre l'esposizione, ma non puoi garantire il pieno controllo una volta che le foto sono pubbliche. Mantieni private le foto sensibili, controlla le impostazioni della piattaforma, evita caricamenti pubblici ad alta risoluzione e usa i controlli per i crawler sul tuo sito web.

Dovrei incollare il mio CV in un chatbot IA?

Solo dopo aver rimosso i dettagli che non ti servono per l'attività. Nomi, indirizzi, numeri di telefono, date di nascita, firme, segreti aziendali e referenze possono spesso essere sostituiti con segnaposto.

Posso caricare documenti di famiglia sull'IA?

Fai attenzione. Lettere mediche, passaporti, documenti scolastici, atti legali, file bancari e registri di famiglia possono contenere dati sensibili su altre persone. Usa impostazioni di privacy approvate oppure non caricarli.

I prompt privati diventano dati di addestramento dell'IA?

Dipende dal prodotto, dal tipo di account e dalle impostazioni. Alcuni fornitori offrono controlli, piani per team o condizioni API che trattano i dati in modo diverso. Controlla le impostazioni attuali prima di digitare informazioni sensibili.

Posso impedire completamente alle aziende di IA di addestrarsi sul mio sito web?

Non con un unico interruttore tecnico. robots.txt può chiedere ai crawler conformi di stare alla larga, ma è volontario e non rimuove le copie che esistono già altrove.

robots.txt blocca legalmente l'addestramento dell'IA?

robots.txt è una convenzione tecnica, non un contratto di per sé. Può sostenere la tua posizione in materia di policy, ma le questioni legali dipendono dalla giurisdizione, dai termini, dal diritto d'autore, dai contratti e dall'applicazione.