Utdragsbyggare

robots.txt för AI-bottar.

Använd dessa exempel som en utgångspunkt, inte som en permanent sanning. User-agent-namn, produkter och crawlerbeteende ändras, så kontrollera alltid officiella sidor innan driftsättning.

Statiskt verktyg

Bygg ett försiktigt robots.txt-startutdrag.

Välj de crawlers du vill be att inte crawla. Denna generator körs enbart i din webbläsare. Den skickar inte data någonstans. Verifiera de aktuella officiella user-agent-namnen innan driftsättning.

# AI-crawler-kontroller: verifiera aktuella user-agent-namn innan driftsättning.
# Detta är frivilligt. robots.txt är inte ett juridiskt lås.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Varning: att blockera användarutlösta eller sökrelaterade agenter kan minska AI-assisterad upptäckbarhet, förhandsvisningar eller citeringar.

Kopiera-och-klistra-block

Ett exempel på robots.txt för vanliga AI-user-agents.

Nedan finns ett startblock som täcker flera AI-relaterade crawlers. User-agent-namn ändras och varierar mellan produkter, så behandla detta som en mall och verifiera varje namn mot operatörens officiella dokumentation innan du driftsätter det.

# Endast exempel. Verifiera varje user-agent-namn mot officiell dokumentation.
# robots.txt är frivilligt. Det tar inte bort kopior som redan finns,
# och det påverkar bara crawlers som väljer att följa det.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /
User-agent (verifiera)Förknippad medAnvänds vanligtvis för
GPTBotOpenAICrawling av webbinnehåll som kan användas för modellträning
Google-ExtendedGoogleEn kontrolltoken för att begränsa användning av innehåll för vissa AI-produkter
CCBotCommon CrawlBygga det öppna Common Crawl-arkivet som används av många efterföljande dataset
ClaudeBot / anthropic-aiAnthropicCrawling relaterad till Claude; verifiera aktuella tokens i Anthropics dokumentation
PerplexityBotPerplexityCrawling för dess svars- och sökfunktioner
BytespiderByteDanceBred crawling förknippad med ByteDance-produkter
Applebot-ExtendedAppleEn kontrolltoken för att begränsa användning av innehåll för Apples AI-träning

Vissa av dessa är verkliga crawler-user-agents och andra är kontrolltokens snarare än bottar som hämtar sidor. Namn, betydelser och beteende ändras, så bekräfta var och en i operatörens officiella dokumentation innan du förlitar dig på den.

Vad det inte gör

robots.txt är frivilligt och begränsat.

Det är en begäran, inte ett lås

robots.txt är en konvention. Välartade crawlers läser den och följer den, men den upprätthålls inte av webben själv. En crawler som ignorerar den, eller som inte finns på din lista, kan fortfarande hämta offentliga sidor. Det är en signal om avsikt, inte en teknisk barriär.

Det tar inte bort befintliga kopior

Att lägga till en disallow-regel idag gör ingenting åt innehåll som redan crawlats, cachelagrats, arkiverats eller kopierats någon annanstans. Det påverkar inte heller data som människor klistrar in i AI-verktyg för hand. Se det som att minska framtida exponering, inte att göra det förflutna ogjort.

Starkare lager

Alternativ och komplement.

WAF- och brandväggsregler

En webbapplikationsbrandvägg eller serverregel kan faktiskt blockera eller ifrågasätta förfrågningar utifrån user-agent, IP-intervall eller beteende, i stället för att bara be artigt. Detta är upprätthållande snarare än en begäran, även om det kräver underhåll när crawleridentiteter ändras och ibland kan fånga legitima besökare.

Metataggar och headers

Sidnivådirektiv som en noindex robots-metatagg eller X-Robots-Tag-header påverkar hur regelefterlevande crawlers behandlar en sida. Precis som robots.txt förlitar de sig på samarbete och stoppar inte en crawler som ignorerar dem.

Nätverks- och åtkomstkontroller

Att kräva inloggning, hastighetsbegränsa eller placera känsligt material bakom autentisering håller det helt borta från öppna, crawlbara sidor. Att grinda åtkomst är oftast betydligt mer tillförlitligt än någon frivillig textfil för innehåll som verkligen måste förbli privat.

Verifiera att det fungerar

Så kontrollerar du din robots.txt.

  1. Ladda https://yourdomain.com/robots.txt direkt i en webbläsare och bekräfta att filen serveras korrekt i webbplatsroten.
  2. Kontrollera efter stavfel i user-agent-namn och direktiv; en felstavad token gör helt enkelt ingenting.
  3. Använd en robots.txt-testare eller ditt search console-verktyg för att bekräfta att syntaxen tolkas som du förväntar dig.
  4. Gå igenom serverloggar över tid för att se om de user-agents du riktade in dig på fortfarande dyker upp, och kom ihåg att namn ändras och att vissa agenter ignorerar filen.
  5. Verifiera namnen på nytt regelbundet mot varje operatörs officiella dokumentation, eftersom crawleridentiteter och kontrolltokens uppdateras regelbundet.

Denna sida är pedagogisk information, inte juridisk rådgivning, och de user-agent-namn som visas här kan vara inaktuella. Bekräfta alltid de aktuella tokens och beteendet i operatörens officiella dokumentation innan du förlitar dig på dem.

Relaterad läsning

Nästa steg.

ModelVersus modelversus.com

Jämför AI-modeller innan du väljer ett arbetsflöde.

ChatGPT Alternatives chatgpt-alternatives.com

Hitta neutrala alternativ när en enda AI-leverantör inte räcker.

AI Subscription Guide aisubscriptionguide.com

Lär dig vilket AI-abonnemang som passar ditt verkliga arbete.

OpenAI:s crawler-dokumentation platform.openai.com/docs/gptbot

Kontrollera OpenAI:s aktuella vägledning om crawlers och user agents.

Googles crawler-dokumentation developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Verifiera Googles crawlernamn, indexeringsbeteende och AI-relaterade kontroller.

Anthropic support support.anthropic.com/

Kontrollera aktuell vägledning om Claude-konto, data och crawlers.

FAQ

Vanliga tvivel.

Kan jag stoppa AI-träning på mina personliga foton?

Du kan minska exponeringen, men du kan inte garantera full kontroll när foton väl är offentliga. Håll känsliga foton privata, gå igenom plattformens inställningar, undvik offentliga uppladdningar i hög upplösning och använd crawler-kontroller för din egen webbplats.

Bör jag klistra in mitt CV i en AI-chatbot?

Bara efter att du tagit bort uppgifter du inte behöver för uppgiften. Namn, adresser, telefonnummer, födelsedatum, signaturer, arbetsgivarhemligheter och referenser kan ofta ersättas med platshållare.

Kan jag ladda upp familjedokument till AI?

Var försiktig. Läkarintyg, pass, skoldokument, juridiska handlingar, bankfiler och familjeregister kan innehålla känsliga uppgifter om andra människor. Använd godkända integritetsinställningar eller ladda inte upp dem.

Blir privata prompter till AI-träningsdata?

Det beror på produkten, kontotypen och inställningarna. Vissa leverantörer erbjuder kontroller, team-abonnemang eller API-villkor som hanterar data annorlunda. Kontrollera de aktuella inställningarna innan du skriver in känslig information.

Kan jag helt stoppa AI-företag från att träna på min webbplats?

Inte med en enda teknisk brytare. robots.txt kan begära att regelefterlevande crawlers håller sig borta, men det är frivilligt och tar inte bort kopior som redan finns på andra ställen.

Blockerar robots.txt AI-träning juridiskt?

robots.txt är en teknisk konvention, inte ett avtal i sig. Den kan stödja din policyståndpunkt, men juridiska frågor beror på jurisdiktion, villkor, upphovsrätt, avtal och tillämpning.