Private Websites

So blockieren Sie KI-Crawler.

Wenn Sie einen privaten Blog, ein Portfolio, eine Familienseite oder eine kleine Creator-Seite betreiben, beginnt das Blockieren von Crawlern damit, die richtigen User-Agents zu benennen und zu verstehen, dass robots.txt eine Bitte ist, kein Schloss.

Gehen Sie hier sorgfältig vor

KI-Crawler blockieren, ohne nützliche Sichtbarkeit zu zerstören.

Suche getrennt halten

Kopieren Sie keine beliebige Sperrliste in die Produktion. Suchcrawler, KI-Suchcrawler, Trainingscrawler und nutzergesteuerte Abrufer können unterschiedliche Zwecke haben. Wenn Sie den falschen Agenten blockieren, können Ihre Seiten vor Tools verborgen bleiben, die Sie weiterhin wünschen.

Protokolle überwachen

Serverprotokolle zeigen, wer Ihre Seite tatsächlich besucht. Halten Sie einen kurzen Prüfzyklus ein: Regeln hinzufügen, Traffic beobachten, prüfen, ob wichtige Seiten weiterhin dort erscheinen, wo Sie es erwarten, und dann anpassen.

User-AgentUnternehmenWarum es wichtig istWichtiger Hinweis
GPTBotOpenAIHäufig für die Steuerung des OpenAI-Web-Crawlings verwendet.Blockieren Sie ihn, wenn Sie nicht möchten, dass dieser Crawler Ihre öffentlichen Seiten für KI-bezogene Zwecke abruft. Prüfen Sie die aktuelle OpenAI-Doku.
ChatGPT-UserOpenAIIn vielen Diskussionen ein nutzergesteuerter Browsing-/Abruf-Agent.Ein Blockieren kann ChatGPT-Nutzer daran hindern, die Anwendung Ihre Seite lesen zu lassen. Das ist nicht dieselbe Absicht wie breites Trainings-Crawling.
Google-ExtendedGoogleEine Steuerung, die Google für einige generative KI-Anwendungsfälle dokumentiert.Das ist nicht dasselbe wie das Blockieren der Google-Suche. Blockieren Sie den Googlebot nicht, sofern Sie nicht Ihre Suchsichtbarkeit beeinträchtigen möchten.
ClaudeBotAnthropicAnthropic-Crawler-Name, der in Diskussionen zur Crawler-Steuerung auftaucht.Nur nach Prüfung der aktuellen Anthropic-Dokumentation verwenden.
Claude-SearchBotAnthropicSuchbezogener Claude-Crawler-Name, der in öffentlichen Leitfäden auftaucht.Wägen Sie den Sichtbarkeitskompromiss ab, bevor Sie suchähnliche Agenten blockieren.
PerplexityBotPerplexityPerplexity-Crawler/User-Agent, der von Publishern diskutiert wird.Ein Blockieren kann beeinflussen, wie Ihre Inhalte von Perplexity-artigen Antwort-Engines gefunden oder zitiert werden.
CCBotCommon CrawlÖffentlicher Web-Crawler, der für große Web-Datensätze verwendet wird.Wird oft von Publishern blockiert, die nicht möchten, dass Seiten in öffentliche Crawl-Korpora kopiert werden.
BytespiderByteDanceMit ByteDance assoziierter Crawler.Sinnvoll zu prüfen, wenn Sie eine breite KI-Crawler-Sperrliste wünschen.

Wie Crawler Sie finden

Wie KI-Crawler Ihre Website entdecken und abrufen.

Bevor Sie einen Crawler blockieren können, hilft es zu wissen, wie er ankommt. Automatisierte Abrufer stolpern selten zufällig auf eine Seite; sie folgen einer recht vorhersehbaren Kette der Entdeckung. Die folgenden Beschreibungen sind allgemein und vereinfacht, und das genaue Verhalten jedes benannten Bots kann sich ändern. Prüfen Sie daher die offizielle Dokumentation jedes Anbieters, bevor Sie handeln.

Entdeckung

Crawler finden URLs, indem sie Links von anderen Seiten folgen, Ihre XML-Sitemap lesen, Ihre robots.txt prüfen und auf große öffentliche Link-Datensätze zurückgreifen. Eine brandneue Seite wird in der Regel erreichbar, sobald etwas Öffentliches darauf verlinkt.

Abruf

Ein Crawler sendet eine HTTP-Anfrage, die sich mit einer User-Agent-Zeichenfolge identifiziert. Ihr Server kann diese Zeichenfolge prüfen und entscheiden, wie er antwortet, doch User-Agents können imitiert werden; behandeln Sie sie daher als Hinweis, nicht als Beweis.

Häufigkeit

Gut funktionierende Crawler kehren regelmäßig zurück, um Änderungen zu erfassen, und viele respektieren Crawl-Delay-Hinweise oder ihre eigenen Ratenbegrenzungen. Schlecht funktionierende können aggressiv abrufen, was ein Grund ist, warum Ratenbegrenzung neben höflichen Regeln wichtig ist.

Drei Arten von Bots

Suchcrawler, KI-Trainingscrawler und Live-Abruf-Bots sind nicht dasselbe.

Viele Blockierfehler entstehen dadurch, dass jeder Bot als identisch behandelt wird. Die drei folgenden Kategorien überschneiden sich in der Mechanik, unterscheiden sich aber im Zweck, und das Blockieren einer Kategorie kann sehr unterschiedliche Folgen haben als das Blockieren einer anderen. Benennung und Verhalten entwickeln sich weiter; bestätigen Sie daher die aktuelle Rolle eines bestimmten Agenten, bevor Sie sich auf dieses Schema verlassen.

TypWas er tutWirkung des Blockierens
SuchcrawlerIndexiert Seiten, damit sie in den Ergebnissen einer Suchmaschine erscheinen können.Ein Blockieren kann Sie aus dieser Suchmaschine entfernen. Meist nicht das, was Sie möchten.
KI-TrainingscrawlerRuft Seiten ab, um Trainingsdatensätze für KI-Modelle aufzubauen oder zu verbessern.Ein Blockieren bittet den Anbieter, Ihre öffentlichen Seiten nicht zum Training zu verwenden. Das ist hier für die meisten Menschen das Hauptziel.
KI-Live-Abruf-BotRuft eine Seite bei Bedarf ab, wenn ein Nutzer einen KI-Assistenten bittet, sie zu lesen oder zu zitieren.Ein Blockieren kann verhindern, dass Ihre Seite in Echtzeit gelesen oder zitiert wird, was die Sichtbarkeit in Antwort-Engines beeinflusst, nicht das Training.

Der Kompromiss, den es zu benennen gilt.

Trainingscrawler und Live-Abruf-Bots sind das, was die meisten Menschen mit "KI-Bots" meinen, doch einige treiben auch Entdeckung und Zitation an. Entscheiden Sie bewusst, ob Sie trainiert, zitiert, beides oder keines von beidem werden möchten, denn das sind getrennte Entscheidungen.

Ein mehrschichtiger Ansatz

Blockieren funktioniert am besten in Schichten, weil keine einzelne Schicht vollständig ist.

Betrachten Sie das Blockieren als tiefgestaffelte Verteidigung statt als einzelnen Schalter. Jede Schicht fängt Fälle ab, die die anderen verpassen, und jede hat ehrliche Grenzen. Beginnen Sie mit den höflichen, risikoarmen Schichten und fügen Sie strengere nur dort hinzu, wo der Kompromiss es wert ist.

1. robots.txt

Eine reine Textdatei, die benannte Crawler bittet, aufgelistete Pfade nicht abzurufen. Konforme Bots respektieren sie; nicht konforme ignorieren sie. Sie ist der übliche erste Schritt und der am wenigsten störende.

2. Meta-Robots und X-Robots-Tag

Ein Meta-Tag auf Seitenebene oder ein HTTP-Antwort-Header kann verlangen, dass Inhalte nicht indexiert oder auf bestimmte Weise verwendet werden. Die Unterstützung variiert je nach Bot; behandeln Sie Direktiven wie noai daher als Bitten, nicht als Garantien.

3. WAF, Firewall und Ratenbegrenzung

Eine Web Application Firewall oder ein Ratenbegrenzer kann Traffic nach User-Agent, IP-Bereich oder Verhalten blockieren oder drosseln. Anders als robots.txt setzt dies tatsächlich am Server durch, erfordert jedoch Sorgfalt, um keine legitimen Besucher zu erfassen.

4. Authentifizierungsschranken

Inhalte hinter einer Anmeldung sind nicht öffentlich abrufbar, was die zuverlässigste Methode ist, um gelegentliche Crawler vollständig fernzuhalten. Der Preis ist Reibung für echte Nutzer; reservieren Sie es daher für Material, das es wirklich benötigt.

Verwaltete Plattformen bieten eine weitere Option. Manche Anbieter, etwa Dienste vom Cloudflare-Typ, bieten integrierte Steuerungen, die Kategorien von KI-Bots für Sie erkennen und blockieren. Diese können praktisch sein, doch Sie hängen weiterhin von der Erkennungsgenauigkeit und den Definitionen des Anbieters ab; prüfen Sie daher, was ein bestimmter Schalter tatsächlich bewirkt, bevor Sie ihm vertrauen.

# robots.txt — eine höfliche erste Schicht (aktuelle Agentennamen prüfen)
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

# Normale Suche funktionsfähig halten: Googlebot NICHT pauschal blockieren
User-agent: Googlebot
Allow: /
# Beispiel für HTTP-Antwort-Header (Server- oder WAF-Konfiguration)
X-Robots-Tag: noai, noimageai

Warum Blockieren unvollkommen ist

Ehrliche Grenzen: Was Blockieren kann und was nicht.

Es wäre irreführend, eine dieser Techniken als lückenlos darzustellen. Sie reduzieren unerwünschtes Crawling erheblich, machen Ihre Inhalte aber nicht unerreichbar. Erwartungen richtig zu setzen, gehört zum verantwortungsvollen Umgang damit.

Ein realistisches Ziel.

Streben Sie danach, unerwünschtes KI-Crawling deutlich weniger bequem zu machen und Ihre erklärte Präferenz klar zu dokumentieren. Das ist erreichbar. Garantierter, universeller Ausschluss ist es nicht.

Beobachten Sie Ihre Protokolle

So überwachen Sie Serverprotokolle auf KI-User-Agents.

Regeln sind nur nützlich, wenn Sie prüfen, ob sie funktionieren. Ihre Server-Zugriffsprotokolle erfassen, wer was wann und mit welcher User-Agent-Zeichenfolge angefragt hat. Eine kurze, regelmäßige Prüfung zeigt Ihnen, welche Bots tatsächlich besuchen und ob Ihre Regeln respektiert werden. Denken Sie daran, dass User-Agents imitiert werden können; behandeln Sie die Protokolle daher als zu interpretierende Belege statt als absolute Wahrheit.

Worauf Sie achten sollten

Suchen Sie nach bekannten KI-User-Agent-Zeichenfolgen wie GPTBot, CCBot, ClaudeBot, PerplexityBot und Bytespider. Notieren Sie deren Anfragevolumen und welche Pfade sie abrufen.

Anzeichen für Probleme

Achten Sie auf Agenten, die Ihre Website stark anfragen, nachdem Sie sie ausgeschlossen haben, auf unbekannte Agenten, die schnell viele Seiten abrufen, oder auf generische Browser-Zeichenfolgen, die URLs ansteuern, die kein Mensch aufrufen würde.

Was Sie als Nächstes tun sollten

Wenn ein konformer Bot eine Regel ignoriert, prüfen Sie Ihre Syntax erneut. Wenn ein Bot robots.txt tatsächlich ignoriert, erwägen Sie eine Firewall- oder Ratenbegrenzungsregel und akzeptieren Sie das erhöhte Risiko von Fehlalarmen.

# Grobes Beispiel: Anfragen nach KI-bezogenem User-Agent zählen
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

Schrittweise Einführung

Eine vorsichtige Einführung, die Sie rückgängig machen können.

Weil eine falsche Regel legitime Sichtbarkeit unbemerkt beeinträchtigen kann, führen Sie Änderungen schrittweise ein und beobachten Sie bei jedem Schritt die Wirkung. Die folgende Reihenfolge bevorzugt Umkehrbarkeit vor Geschwindigkeit, was für die meisten privaten und kleinen Websites die richtige Priorität ist.

  1. Ausgangslage: Prüfen Sie Ihre aktuellen Protokolle, damit Sie wissen, welche Bots besuchen, bevor Sie etwas ändern.
  2. Absicht festlegen: Entscheiden Sie, ob Sie vom Training, vom Live-Abruf oder von beidem ausgeschlossen werden möchten, und bestätigen Sie, dass Sie die normale Suche intakt halten.
  3. Höflich beginnen: Fügen Sie robots.txt-Regeln für die spezifischen KI-Trainingscrawler hinzu, die Sie ausschließen möchten, und verwenden Sie Namen, die Sie gegen die offizielle Doku geprüft haben.
  4. Steuerungen auf Seitenebene hinzufügen: Fügen Sie dort, wo unterstützt, Meta-Robots- oder X-Robots-Tag-Direktiven für feinere Steuerung hinzu.
  5. Beobachten: Warten Sie ein bis zwei Wochen und prüfen Sie Protokolle und Suchsichtbarkeit erneut, um zu bestätigen, dass nichts Wichtiges kaputtging.
  6. Selektiv durchsetzen: Fügen Sie nur für Bots, die höfliche Regeln ignorieren, Firewall- oder Ratenbegrenzungsregeln hinzu und testen Sie sorgfältig, um Fehlalarme zu vermeiden.
  7. Nach Zeitplan überprüfen: Kehren Sie alle paar Monate zurück, da sich Crawler-Namen, Anbieterrichtlinien und Ihre eigenen Prioritäten allesamt ändern.

Weiterführende Lektüre

Nächste Schritte.

ModelVersus modelversus.com

Vergleichen Sie KI-Modelle, bevor Sie sich für einen Workflow entscheiden.

ChatGPT Alternatives chatgpt-alternatives.com

Finden Sie neutrale Alternativen, wenn ein einziger KI-Anbieter nicht genügt.

AI Subscription Guide aisubscriptionguide.com

Erfahren Sie, welches KI-Abonnement zu Ihrer tatsächlichen Arbeit passt.

OpenAI-Crawler-Doku platform.openai.com/docs/gptbot

Prüfen Sie die aktuellen OpenAI-Crawler- und User-Agent-Hinweise.

Google-Crawler-Doku developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Prüfen Sie Google-Crawler-Namen, Indexierungsverhalten und KI-bezogene Steuerungen.

Anthropic-Support support.anthropic.com/

Prüfen Sie die aktuellen Hinweise zu Claude-Konto, Daten und Crawlern.

FAQ

Häufige Zweifel.

Kann ich das KI-Training mit meinen privaten Fotos stoppen?

Sie können die Exposition reduzieren, aber Sie können keine vollständige Kontrolle garantieren, sobald Fotos öffentlich sind. Halten Sie sensible Fotos privat, prüfen Sie die Plattformeinstellungen, vermeiden Sie öffentliche Uploads in hoher Auflösung und nutzen Sie Crawler-Steuerungen für Ihre eigene Website.

Sollte ich meinen Lebenslauf in einen KI-Chatbot einfügen?

Nur nachdem Sie Details entfernt haben, die Sie für die Aufgabe nicht benötigen. Namen, Adressen, Telefonnummern, Geburtsdaten, Unterschriften, Betriebsgeheimnisse und Referenzen lassen sich oft durch Platzhalter ersetzen.

Kann ich Familiendokumente in eine KI hochladen?

Seien Sie vorsichtig. Arztbriefe, Reisepässe, Schuldokumente, juristische Papiere, Bankunterlagen und Familienunterlagen können sensible Daten über andere Personen enthalten. Nutzen Sie freigegebene Datenschutzeinstellungen oder laden Sie sie nicht hoch.

Werden private Prompts zu KI-Trainingsdaten?

Das hängt vom Produkt, dem Kontotyp und den Einstellungen ab. Manche Anbieter bieten Steuerungen, Team-Tarife oder API-Bedingungen, die Daten unterschiedlich behandeln. Prüfen Sie die aktuellen Einstellungen, bevor Sie sensible Informationen eingeben.

Kann ich KI-Unternehmen vollständig daran hindern, mit meiner Website zu trainieren?

Nicht mit einem einzigen technischen Schalter. robots.txt kann konforme Crawler bitten, fernzubleiben, aber das ist freiwillig und entfernt keine Kopien, die bereits anderswo existieren.

Blockiert robots.txt das KI-Training rechtlich?

robots.txt ist eine technische Konvention, für sich genommen kein Vertrag. Sie kann Ihre Positionierung untermauern, aber rechtliche Fragen hängen von Rechtsordnung, Nutzungsbedingungen, Urheberrecht, Verträgen und Durchsetzung ab.