Schnipsel-Generator

robots.txt für KI-Bots.

Verwenden Sie diese Beispiele als Ausgangspunkt, nicht als dauerhafte Wahrheit. User-Agent-Namen, Produkte und Crawler-Verhalten ändern sich, prüfen Sie daher vor der Bereitstellung stets die offiziellen Seiten.

Statisches Werkzeug

Erstellen Sie einen vorsichtigen robots.txt-Starter-Schnipsel.

Wählen Sie die Crawler aus, die Sie bitten möchten, nicht zu crawlen. Dieser Generator läuft ausschließlich in Ihrem Browser. Er sendet keine Daten irgendwohin. Überprüfen Sie vor der Bereitstellung die aktuellen offiziellen User-Agent-Namen.

# KI-Crawler-Steuerungen: aktuelle User-Agent-Namen vor der Bereitstellung prüfen.
# Dies ist freiwillig. robots.txt ist keine rechtliche Sperre.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Warnung: Das Blockieren von nutzergesteuerten oder suchbezogenen Agents kann KI-gestützte Auffindbarkeit, Vorschauen oder Zitate verringern.

Kopier-Block

Ein Beispiel für eine robots.txt für gängige KI-User-Agents.

Nachfolgend finden Sie einen Starter-Block, der mehrere KI-bezogene Crawler abdeckt. User-Agent-Namen ändern sich und variieren je nach Produkt, behandeln Sie dies daher als Vorlage und prüfen Sie jeden Namen anhand der offiziellen Dokumentation des Betreibers, bevor Sie ihn bereitstellen.

# Nur ein Beispiel. Jeden User-Agent-Namen anhand der offiziellen Doku prüfen.
# robots.txt ist freiwillig. Sie entfernt keine bereits vorhandenen Kopien
# und wirkt sich nur auf Crawler aus, die sich entscheiden, sie zu befolgen.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /
User-Agent (prüfen)Verbunden mitTypischerweise verwendet für
GPTBotOpenAICrawlen von Webinhalten, die möglicherweise für das Modelltraining verwendet werden
Google-ExtendedGoogleEin Steuerungs-Token, um die Nutzung von Inhalten für bestimmte KI-Produkte zu begrenzen
CCBotCommon CrawlAufbau des offenen Common-Crawl-Archivs, das von vielen nachgelagerten Datensätzen genutzt wird
ClaudeBot / anthropic-aiAnthropicCrawlen im Zusammenhang mit Claude; aktuelle Tokens in der Anthropic-Doku prüfen
PerplexityBotPerplexityCrawlen für seine Antwort- und Suchfunktionen
BytespiderByteDanceUmfangreiches Crawlen im Zusammenhang mit ByteDance-Produkten
Applebot-ExtendedAppleEin Steuerungs-Token, um die Nutzung von Inhalten für das KI-Training von Apple zu begrenzen

Einige davon sind echte Crawler-User-Agents und andere sind Steuerungs-Tokens statt Bots, die Seiten abrufen. Namen, Bedeutungen und Verhalten ändern sich, bestätigen Sie daher jeden einzelnen in der offiziellen Dokumentation des Betreibers, bevor Sie sich darauf verlassen.

Was sie nicht leistet

robots.txt ist freiwillig und begrenzt.

Es ist eine Bitte, keine Sperre

robots.txt ist eine Konvention. Wohlerzogene Crawler lesen sie und befolgen sie, aber sie wird vom Web selbst nicht erzwungen. Ein Crawler, der sie ignoriert oder der nicht auf Ihrer Liste steht, kann öffentliche Seiten dennoch abrufen. Sie ist ein Signal der Absicht, keine technische Barriere.

Sie entfernt keine bestehenden Kopien

Das Hinzufügen einer Disallow-Regel heute ändert nichts an Inhalten, die bereits gecrawlt, zwischengespeichert, archiviert oder anderswo kopiert wurden. Ebenso wenig wirkt es sich auf Daten aus, die Menschen von Hand in KI-Werkzeuge einfügen. Betrachten Sie es als Verringerung künftiger Exposition, nicht als Rückgängigmachen der Vergangenheit.

Stärkere Ebenen

Alternativen und Ergänzungen.

WAF- und Firewall-Regeln

Eine Web Application Firewall oder eine Serverregel kann Anfragen anhand von User-Agent, IP-Bereich oder Verhalten tatsächlich blockieren oder herausfordern, statt nur höflich zu bitten. Dies ist eine Durchsetzung statt einer Bitte, erfordert jedoch Pflege, wenn sich Crawler-Identitäten ändern, und kann gelegentlich legitime Besucher erfassen.

Meta-Tags und Header

Direktiven auf Seitenebene wie ein noindex-robots-Meta-Tag oder ein X-Robots-Tag-Header beeinflussen, wie konforme Crawler eine Seite behandeln. Wie robots.txt beruhen sie auf Kooperation und halten einen Crawler nicht auf, der sie ignoriert.

Netzwerk- und Zugriffskontrollen

Eine erforderliche Anmeldung, Ratenbegrenzung oder das Ablegen sensiblen Materials hinter einer Authentifizierung hält es vollständig von offenen, crawlbaren Seiten fern. Das Beschränken des Zugriffs ist bei Inhalten, die wirklich privat bleiben müssen, in der Regel weit zuverlässiger als jede freiwillige Textdatei.

Überprüfen, ob es funktioniert

So prüfen Sie Ihre robots.txt.

  1. Laden Sie https://yourdomain.com/robots.txt direkt in einem Browser und bestätigen Sie, dass die Datei korrekt im Stammverzeichnis der Website ausgeliefert wird.
  2. Prüfen Sie User-Agent-Namen und Direktiven auf Tippfehler; ein falsch geschriebenes Token bewirkt schlicht nichts.
  3. Verwenden Sie einen robots.txt-Tester oder Ihre Search-Console-Werkzeuge, um zu bestätigen, dass die Syntax wie erwartet interpretiert wird.
  4. Überprüfen Sie die Serverprotokolle im Laufe der Zeit, um zu sehen, ob die von Ihnen anvisierten User-Agents weiterhin auftauchen, und denken Sie daran, dass sich Namen ändern und einige Agents die Datei ignorieren.
  5. Überprüfen Sie die Namen regelmäßig erneut anhand der offiziellen Dokumentation des jeweiligen Betreibers, da Crawler-Identitäten und Steuerungs-Tokens regelmäßig aktualisiert werden.

Diese Seite ist eine informative Bildungsressource, keine Rechtsberatung, und die hier gezeigten User-Agent-Namen können veraltet sein. Bestätigen Sie stets die aktuellen Tokens und das Verhalten in der offiziellen Dokumentation des Betreibers, bevor Sie sich darauf verlassen.

Weiterführende Lektüre

Nächste Schritte.

ModelVersus modelversus.com

Vergleichen Sie KI-Modelle, bevor Sie einen Workflow wählen.

ChatGPT Alternatives chatgpt-alternatives.com

Finden Sie neutrale Alternativen, wenn ein KI-Anbieter nicht ausreicht.

AI Subscription Guide aisubscriptionguide.com

Erfahren Sie, welches KI-Abonnement zu Ihrer tatsächlichen Arbeit passt.

OpenAI-Crawler-Doku platform.openai.com/docs/gptbot

Prüfen Sie die aktuellen Hinweise zu OpenAI-Crawlern und User-Agents.

Google-Crawler-Doku developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Überprüfen Sie Google-Crawler-Namen, Indexierungsverhalten und KI-bezogene Steuerungen.

Anthropic-Support support.anthropic.com/

Prüfen Sie die aktuellen Hinweise zu Claude-Konten, Daten und Crawlern.

FAQ

Häufige Zweifel.

Kann ich das KI-Training an meinen persönlichen Fotos stoppen?

Sie können die Exposition verringern, aber sobald Fotos öffentlich sind, können Sie keine vollständige Kontrolle garantieren. Halten Sie sensible Fotos privat, überprüfen Sie die Plattformeinstellungen, vermeiden Sie öffentliche Uploads in hoher Auflösung und nutzen Sie Crawler-Steuerungen für Ihre eigene Website.

Sollte ich meinen Lebenslauf in einen KI-Chatbot einfügen?

Nur nachdem Sie Angaben entfernt haben, die Sie für die Aufgabe nicht benötigen. Namen, Adressen, Telefonnummern, Geburtsdaten, Unterschriften, Betriebsgeheimnisse und Referenzen können oft durch Platzhalter ersetzt werden.

Kann ich Familiendokumente in KI hochladen?

Seien Sie vorsichtig. Arztbriefe, Reisepässe, Schuldokumente, juristische Unterlagen, Bankdateien und Familienunterlagen können sensible Daten über andere Personen enthalten. Nutzen Sie freigegebene Datenschutzeinstellungen oder laden Sie sie nicht hoch.

Werden private Prompts zu KI-Trainingsdaten?

Das hängt vom Produkt, der Kontoart und den Einstellungen ab. Einige Anbieter bieten Steuerungen, Team-Tarife oder API-Bedingungen an, die Daten unterschiedlich behandeln. Prüfen Sie die aktuellen Einstellungen, bevor Sie sensible Informationen eingeben.

Kann ich KI-Unternehmen vollständig daran hindern, an meiner Website zu trainieren?

Nicht mit einem einzigen technischen Schalter. robots.txt kann konforme Crawler bitten, fernzubleiben, aber sie ist freiwillig und entfernt keine Kopien, die anderswo bereits vorhanden sind.

Blockiert robots.txt das KI-Training rechtlich?

robots.txt ist eine technische Konvention, für sich genommen kein Vertrag. Sie kann Ihre Richtlinienposition unterstützen, aber rechtliche Fragen hängen von Gerichtsbarkeit, Bedingungen, Urheberrecht, Verträgen und Durchsetzung ab.