Om du driver en personlig blogg, portfölj, familjesajt eller liten kreatörssida börjar crawlerblockering med att namnge rätt user agents och att förstå att robots.txt är en begäran, inte ett lås.
Blockera AI-crawlers utan att förstöra användbar synlighet.
Håll sökning separat
Kopiera inte en slumpmässig blockeringslista till produktion. Sökcrawlers, AI-sökcrawlers, träningscrawlers och användarutlösta hämtare kan ha olika syften. Att blockera fel agent kan dölja dina sidor från verktyg du fortfarande vill använda.
Övervaka loggar
Serverloggar visar vem som faktiskt besöker. Håll en kort granskningscykel: lägg till regler, bevaka trafiken, kontrollera om viktiga sidor fortfarande syns där du förväntar dig, och justera sedan.
User agent
Företag
Varför det spelar roll
Försiktighetsnotering
GPTBot
OpenAI
Används ofta för OpenAI:s webbcrawling-kontroller.
Blockera om du inte vill att denna crawler hämtar dina offentliga sidor för AI-relaterad användning. Verifiera aktuell OpenAI-dokumentation.
ChatGPT-User
OpenAI
Användarutlöst surf-/hämtningsagent i många diskussioner.
Att blockera den kan hindra ChatGPT-användare från att be den läsa din sida. Detta har inte samma avsikt som bred träningscrawling.
Google-Extended
Google
En kontroll som Google dokumenterar för vissa generativa AI-användningsfall.
Detta är inte samma sak som att blockera Google Sök. Blockera inte Googlebot om du inte vill påverka sökbarheten.
ClaudeBot
Anthropic
Anthropic-crawlernamn som setts i diskussioner om crawler-kontroll.
Använd endast efter att ha kontrollerat Anthropics senaste dokumentation.
Claude-SearchBot
Anthropic
Sökrelaterat Claude-crawlernamn som setts i offentlig vägledning.
Överväg synlighetsavvägningen innan du blockerar söktypsagenter.
PerplexityBot
Perplexity
Perplexity-crawler/user-agent som diskuterats av publicister.
Att blockera kan påverka hur ditt innehåll upptäcks eller citeras av Perplexity-liknande svarsmotorer.
CCBot
Common Crawl
Offentlig webbcrawler som används för stora webbdataset.
Blockeras ofta av publicister som inte vill att sidor kopieras till offentliga crawl-korpusar.
Bytespider
ByteDance
Crawler förknippad med ByteDance.
Bra att gå igenom om du vill ha en bred blockeringslista för AI-crawlers.
Så hittar crawlers dig
Så upptäcker och hämtar AI-crawlers din webbplats.
Innan du kan blockera en crawler hjälper det att veta hur den anländer. Automatiserade hämtare snubblar sällan över en sida av en slump; de följer en ganska förutsägbar upptäcktskedja. Beskrivningarna nedan är allmänna och förenklade, och det exakta beteendet hos vilken namngiven bot som helst kan ändras, så verifiera mot varje leverantörs officiella dokumentation innan du agerar.
Upptäckt
Crawlers hittar URL:er genom att följa länkar från andra sidor, läsa din XML-webbplatskarta, kontrollera din robots.txt och dra nytta av stora offentliga länkdataset. En helt ny sida blir vanligtvis nåbar i samma stund som något offentligt länkar till den.
Hämtning
En crawler skickar en HTTP-förfrågan som identifierar sig med en user-agent-sträng. Din server kan inspektera den strängen och avgöra hur den ska svara, men user agents kan imiteras, så behandla dem som en signal snarare än ett bevis.
Frekvens
Välartade crawlers återbesöker med jämna mellanrum för att fånga upp ändringar, och många respekterar crawl-delay-tips eller sina egna hastighetsgränser. Illa uppförda kan hämta aggressivt, vilket är ett skäl till att hastighetsbegränsning spelar roll vid sidan av artiga regler.
Tre sorters botar
Sökcrawlers, AI-träningscrawlers och botar för direkthämtning är inte samma sak.
Många blockeringsmisstag kommer från att behandla varje bot som identisk. De tre kategorierna nedan överlappar mekaniskt men skiljer sig i syfte, och att blockera en kan få mycket olika konsekvenser jämfört med att blockera en annan. Namn och beteende utvecklas, så bekräfta den aktuella rollen för en specifik agent innan du förlitar dig på denna indelning.
Typ
Vad den gör
Effekt av blockering
Sökcrawler
Indexerar sidor så att de kan visas i en sökmotors resultat.
Att blockera kan ta bort dig från den sökmotorn. Vanligtvis inte vad du vill.
AI-träningscrawler
Hämtar sidor för att bygga eller förbättra träningsdataset för AI-modeller.
Att blockera ber leverantören att inte använda dina offentliga sidor för träning. Detta är huvudmålet för de flesta som är här.
AI-bot för direkthämtning
Hämtar en sida på begäran när en användare ber en AI-assistent att läsa eller citera den.
Att blockera kan hindra din sida från att läsas eller citeras i realtid, vilket påverkar synligheten i svarsmotorer snarare än träning.
Avvägningen värd att namnge.
Träningscrawlers och botar för direkthämtning är de som de flesta menar med "AI-botar", men vissa driver även upptäckt och citering. Bestäm medvetet om du vill bli tränad på, citerad, både eller ingetdera, för det är separata val.
En skiktad ansats
Blockering fungerar bäst i lager, eftersom inget enskilt lager är komplett.
Tänk på blockering som djupförsvar snarare än en enda strömbrytare. Varje lager fångar fall som de andra missar, och varje har ärliga begränsningar. Börja med de artiga, lågriskabla lagren och lägg bara till striktare där avvägningen är värd det.
1. robots.txt
En textfil som ber namngivna crawlers att inte hämta listade sökvägar. Regelefterlevande botar respekterar den; icke-efterlevande ignorerar den. Det är standardens första steg och det minst störande.
2. Meta robots och X-Robots-Tag
En meta-tagg på sidnivå eller en HTTP-svarsrubrik kan begära att innehåll inte indexeras eller används på vissa sätt. Stödet varierar mellan botar, så behandla direktiv som noai som begäranden, inte garantier.
3. WAF, brandvägg och hastighetsgränser
En webbapplikationsbrandvägg (WAF) eller hastighetsbegränsare kan blockera eller strypa trafik efter user agent, IP-intervall eller beteende. Till skillnad från robots.txt tvingar detta faktiskt igenom på servern, men det kräver omsorg för att undvika att fånga legitima besökare.
4. Autentiseringsväggar
Innehåll bakom en inloggning är inte offentligt hämtbart, vilket är det mest tillförlitliga sättet att helt hålla tillfälliga crawlers ute. Kostnaden är friktion för verkliga användare, så reservera det för material som verkligen behöver det.
Hanterade plattformar lägger till ytterligare ett alternativ. Vissa leverantörer, som Cloudflare-liknande tjänster, erbjuder inbyggda kontroller som identifierar och blockerar kategorier av AI-botar åt dig. Dessa kan vara praktiska, men du är fortfarande beroende av leverantörens detektionsnoggrannhet och definitioner, så verifiera vad en given inställning faktiskt gör innan du litar på den.
# robots.txt — ett artigt första lager (verifiera aktuella agentnamn)
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# Håll vanlig sökning fungerande: blockera INTE Googlebot generellt
User-agent: Googlebot
Allow: /
# Exempel på HTTP-svarsrubrik (server- eller WAF-konfiguration)
X-Robots-Tag: noai, noimageai
Varför blockering är ofullkomlig
Ärliga begränsningar: vad blockering kan och inte kan göra.
Det vore vilseledande att presentera någon av dessa tekniker som vattentät. De minskar oönskad crawling på ett meningsfullt sätt, men de gör inte ditt innehåll onåbart. Att ställa förväntningarna rätt är en del av att göra detta ansvarsfullt.
robots.txt och liknande direktiv är frivilliga. Regelefterlevande crawlers respekterar dem; andra kan helt enkelt ignorera dem.
Kopior som gjorts innan du lade till en regel kan finnas kvar i cacher, arkiv och dataset som du inte kan nå.
User-agent-strängar kan förfalskas, så en blockeringslista efter namn fångar inte en bot som utger sig för att vara en vanlig webbläsare.
Alltför breda regler kan av misstag skada sökbarheten eller blockera verktyg du faktiskt vill ha.
Tillämpning på servernivå är starkare än artiga regler, men den kan ge falska positiva som blockerar verkliga människor.
Inget av detta är juridisk rådgivning, och tekniska kontroller löser inte i sig frågor om upphovsrätt, avtal eller jurisdiktion.
Ett realistiskt mål.
Sikta på att göra oönskad AI-crawling meningsfullt mindre bekväm och att tydligt dokumentera din uttalade preferens. Det är uppnåeligt. Garanterad, universell uteslutning är det inte.
Bevaka dina loggar
Så övervakar du serverloggar efter AI-user-agents.
Regler är bara användbara om du kontrollerar om de fungerar. Din servers åtkomstloggar registrerar vem som begärde vad, när och med vilken user-agent-sträng. En kort, regelbunden granskning berättar vilka botar som faktiskt besöker och om dina regler efterlevs. Kom ihåg att user agents kan imiteras, så behandla loggarna som bevis att tolka snarare än absolut sanning.
Vad du ska leta efter
Sök efter kända AI-user-agent-strängar som GPTBot, CCBot, ClaudeBot, PerplexityBot och Bytespider. Notera deras förfrågningsvolym och vilka sökvägar de hämtar.
Tecken på problem
Håll utkik efter agenter som begär din webbplats intensivt efter att du har avvisat dem, obekanta agenter som hämtar många sidor snabbt, eller generiska webbläsarsträngar som träffar URL:er som ingen människa skulle.
Vad du gör härnäst
Om en regelefterlevande bot ignorerar en regel, kontrollera din syntax igen. Om en bot verkligen ignorerar robots.txt, överväg en brandväggs- eller hastighetsgränsregel, och acceptera den ökade risken för falska positiva.
Eftersom en felaktig regel tyst kan skada legitim synlighet, rulla ut ändringar gradvis och bevaka effekten vid varje steg. Sekvensen nedan prioriterar reverserbarhet framför hastighet, vilket är rätt prioritering för de flesta personliga och små webbplatser.
Utgångsläge: granska dina nuvarande loggar så att du vet vilka botar som besöker innan du ändrar något.
Bestäm avsikt: välj om du vill uteslutas från träning, från direkthämtning, eller båda, och bekräfta att du håller vanlig sökning intakt.
Börja artigt: lägg till robots.txt-regler för de specifika AI-träningscrawlers du vill utesluta, med namn du har verifierat mot officiell dokumentation.
Lägg till kontroller på sidnivå: där det stöds, lägg till meta robots- eller X-Robots-Tag-direktiv för finare kontroll.
Observera: vänta en vecka eller två och kontrollera loggar och sökbarhet igen för att bekräfta att inget viktigt gick sönder.
Tillämpa selektivt: lägg endast till brandväggs- eller hastighetsgränsregler för botar som ignorerar artiga regler, och testa noggrant för att undvika falska positiva.
Granska enligt schema: återkom med några månaders mellanrum, eftersom crawlernamn, leverantörspolicyer och dina egna prioriteringar alla förändras.
Kan jag stoppa AI-träning på mina personliga foton?
Du kan minska exponeringen, men du kan inte garantera full kontroll när foton väl är offentliga. Håll känsliga foton privata, gå igenom plattformens inställningar, undvik offentliga uppladdningar i hög upplösning och använd crawler-kontroller för din egen webbplats.
Bör jag klistra in mitt CV i en AI-chatbot?
Bara efter att du tagit bort uppgifter du inte behöver för uppgiften. Namn, adresser, telefonnummer, födelsedatum, signaturer, arbetsgivarhemligheter och referenser kan ofta ersättas med platshållare.
Kan jag ladda upp familjedokument till AI?
Var försiktig. Läkarintyg, pass, skoldokument, juridiska handlingar, bankfiler och familjeregister kan innehålla känsliga uppgifter om andra människor. Använd godkända integritetsinställningar eller ladda inte upp dem.
Blir privata prompter till AI-träningsdata?
Det beror på produkten, kontotypen och inställningarna. Vissa leverantörer erbjuder kontroller, team-abonnemang eller API-villkor som hanterar data annorlunda. Kontrollera de aktuella inställningarna innan du skriver in känslig information.
Kan jag helt stoppa AI-företag från att träna på min webbplats?
Inte med en enda teknisk brytare. robots.txt kan begära att regelefterlevande crawlers håller sig borta, men det är frivilligt och tar inte bort kopior som redan finns på andra ställen.
Blockerar robots.txt AI-träning juridiskt?
robots.txt är en teknisk konvention, inte ett avtal i sig. Den kan stödja din policyståndpunkt, men juridiska frågor beror på jurisdiktion, villkor, upphovsrätt, avtal och tillämpning.