Δημιουργός αποσπασμάτων

robots.txt για bots AI.

Χρησιμοποιήστε αυτά τα παραδείγματα ως αφετηρία, όχι ως μόνιμη αλήθεια. Τα ονόματα των user-agent, τα προϊόντα και η συμπεριφορά των ανιχνευτών αλλάζουν, γι' αυτό ελέγχετε πάντα τις επίσημες σελίδες πριν την ανάπτυξη.

Στατικό εργαλείο

Δημιουργήστε ένα προσεκτικό αρχικό απόσπασμα robots.txt.

Επιλέξτε τους ανιχνευτές που θέλετε να ζητήσετε να μην κάνουν ανίχνευση. Αυτός ο γεννήτορας εκτελείται μόνο στο πρόγραμμα περιήγησής σας. Δεν αποστέλλει δεδομένα πουθενά. Πριν την ανάπτυξη, επαληθεύστε τα τρέχοντα επίσημα ονόματα των user-agent.

# Έλεγχοι ανιχνευτών AI: επαληθεύστε τα τρέχοντα ονόματα user-agent πριν την ανάπτυξη.
# Αυτό είναι εθελοντικό. Το robots.txt δεν αποτελεί νομικό κλείδωμα.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Προειδοποίηση: ο αποκλεισμός agent που ενεργοποιούνται από τον χρήστη ή σχετίζονται με αναζήτηση μπορεί να μειώσει την υποβοηθούμενη από AI ανακάλυψη, τις προεπισκοπήσεις ή τις παραπομπές.

Μπλοκ αντιγραφής-επικόλλησης

Ένα παράδειγμα robots.txt για κοινά user-agent AI.

Παρακάτω υπάρχει ένα αρχικό μπλοκ που καλύπτει διάφορους ανιχνευτές σχετικούς με AI. Τα ονόματα των user-agent αλλάζουν και διαφέρουν ανά προϊόν, γι' αυτό αντιμετωπίστε το ως πρότυπο και επαληθεύστε κάθε όνομα ως προς την επίσημη τεκμηρίωση του χειριστή πριν το αναπτύξετε.

# Παράδειγμα μόνο. Επαληθεύστε κάθε όνομα user-agent ως προς την επίσημη τεκμηρίωση.
# Το robots.txt είναι εθελοντικό. Δεν αφαιρεί αντίγραφα που υπάρχουν ήδη,
# και επηρεάζει μόνο τους ανιχνευτές που επιλέγουν να το τηρήσουν.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /
User-agent (επαληθεύστε)Συνδέεται μεΧρησιμοποιείται συνήθως για
GPTBotOpenAIΑνίχνευση περιεχομένου ιστού που ενδέχεται να χρησιμοποιηθεί για εκπαίδευση μοντέλων
Google-ExtendedGoogleΈνα διακριτικό ελέγχου για τον περιορισμό χρήσης περιεχομένου σε ορισμένα προϊόντα AI
CCBotCommon CrawlΔημιουργία του ανοικτού αρχείου Common Crawl που χρησιμοποιείται από πολλά επόμενα σύνολα δεδομένων
ClaudeBot / anthropic-aiAnthropicΑνίχνευση σχετική με το Claude· επαληθεύστε τα τρέχοντα διακριτικά στην τεκμηρίωση της Anthropic
PerplexityBotPerplexityΑνίχνευση για τις λειτουργίες απαντήσεων και αναζήτησης
BytespiderByteDanceΕυρεία ανίχνευση που συνδέεται με προϊόντα της ByteDance
Applebot-ExtendedAppleΈνα διακριτικό ελέγχου για τον περιορισμό χρήσης περιεχομένου για την εκπαίδευση AI της Apple

Ορισμένα από αυτά είναι πραγματικά user-agent ανιχνευτών και άλλα είναι διακριτικά ελέγχου παρά bots που ανακτούν σελίδες. Τα ονόματα, οι σημασίες και η συμπεριφορά αλλάζουν, γι' αυτό επιβεβαιώστε το καθένα στην επίσημη τεκμηρίωση του χειριστή πριν βασιστείτε σε αυτό.

Τι δεν κάνει

Το robots.txt είναι εθελοντικό και περιορισμένο.

Είναι αίτημα, όχι κλείδωμα

Το robots.txt είναι μια σύμβαση. Οι καλά συμπεριφερόμενοι ανιχνευτές το διαβάζουν και συμμορφώνονται, αλλά δεν επιβάλλεται από τον ίδιο τον ιστό. Ένας ανιχνευτής που το αγνοεί, ή που δεν βρίσκεται στη λίστα σας, μπορεί ακόμα να ανακτήσει δημόσιες σελίδες. Είναι ένδειξη πρόθεσης, όχι τεχνικό εμπόδιο.

Δεν αφαιρεί υπάρχοντα αντίγραφα

Η προσθήκη ενός κανόνα disallow σήμερα δεν κάνει τίποτα για περιεχόμενο που είχε ήδη ανιχνευθεί, αποθηκευτεί προσωρινά, αρχειοθετηθεί ή αντιγραφεί αλλού. Ούτε επηρεάζει δεδομένα που οι άνθρωποι επικολλούν χειροκίνητα σε εργαλεία AI. Θεωρήστε το ως μείωση της μελλοντικής έκθεσης, όχι ως αναίρεση του παρελθόντος.

Ισχυρότερα επίπεδα

Εναλλακτικές και συμπληρώματα.

Κανόνες WAF και τείχους προστασίας

Ένα τείχος προστασίας εφαρμογών ιστού ή ένας κανόνας διακομιστή μπορεί πραγματικά να αποκλείσει ή να προκαλέσει αιτήματα ανά user-agent, εύρος IP ή συμπεριφορά, αντί απλώς να ζητά ευγενικά. Αυτό είναι επιβολή και όχι αίτημα, αν και χρειάζεται συντήρηση καθώς αλλάζουν οι ταυτότητες των ανιχνευτών και ενίοτε μπορεί να παγιδεύσει νόμιμους επισκέπτες.

Meta tags και κεφαλίδες

Οδηγίες σε επίπεδο σελίδας όπως ένα meta tag robots noindex ή μια κεφαλίδα X-Robots-Tag επηρεάζουν τον τρόπο με τον οποίο οι συμμορφούμενοι ανιχνευτές αντιμετωπίζουν μια σελίδα. Όπως και το robots.txt, βασίζονται στη συνεργασία και δεν σταματούν έναν ανιχνευτή που τις αγνοεί.

Έλεγχοι δικτύου και πρόσβασης

Η απαίτηση σύνδεσης, ο περιορισμός ρυθμού ή η τοποθέτηση ευαίσθητου υλικού πίσω από έλεγχο ταυτότητας το κρατά εντελώς εκτός ανοικτών, ανιχνεύσιμων σελίδων. Ο περιορισμός πρόσβασης είναι συνήθως πολύ πιο αξιόπιστος από οποιοδήποτε εθελοντικό αρχείο κειμένου για περιεχόμενο που πρέπει πραγματικά να παραμείνει ιδιωτικό.

Επαληθεύστε ότι λειτουργεί

Πώς να ελέγξετε το robots.txt σας.

  1. Φορτώστε το https://yourdomain.com/robots.txt απευθείας σε ένα πρόγραμμα περιήγησης και επιβεβαιώστε ότι το αρχείο σερβίρεται σωστά στη ρίζα του ιστότοπου.
  2. Ελέγξτε για τυπογραφικά λάθη στα ονόματα των user-agent και στις οδηγίες· ένα λανθασμένα γραμμένο διακριτικό απλώς δεν κάνει τίποτα.
  3. Χρησιμοποιήστε ένα εργαλείο δοκιμής robots.txt ή τα εργαλεία της κονσόλας αναζήτησής σας για να επιβεβαιώσετε ότι η σύνταξη αναλύεται όπως αναμένετε.
  4. Ελέγξτε τα αρχεία καταγραφής του διακομιστή με την πάροδο του χρόνου για να δείτε αν τα user-agent που στοχεύσατε εξακολουθούν να εμφανίζονται, θυμούμενοι ότι τα ονόματα αλλάζουν και ορισμένα agent αγνοούν το αρχείο.
  5. Επαληθεύστε ξανά τα ονόματα περιοδικά ως προς την επίσημη τεκμηρίωση κάθε χειριστή, καθώς οι ταυτότητες των ανιχνευτών και τα διακριτικά ελέγχου ενημερώνονται τακτικά.

Αυτή η σελίδα είναι εκπαιδευτική πληροφορία, δεν αποτελεί νομική συμβουλή, και τα ονόματα των user-agent που εμφανίζονται εδώ ενδέχεται να είναι παρωχημένα. Επιβεβαιώνετε πάντα τα τρέχοντα διακριτικά και τη συμπεριφορά στην επίσημη τεκμηρίωση του χειριστή πριν βασιστείτε σε αυτά.

Σχετική ανάγνωση

Επόμενα βήματα.

ModelVersus modelversus.com

Συγκρίνετε μοντέλα AI πριν επιλέξετε μια ροή εργασίας.

ChatGPT Alternatives chatgpt-alternatives.com

Βρείτε ουδέτερες εναλλακτικές όταν ένας πάροχος AI δεν επαρκεί.

AI Subscription Guide aisubscriptionguide.com

Μάθετε ποια συνδρομή AI ταιριάζει στην πραγματική σας εργασία.

OpenAI crawler docs platform.openai.com/docs/gptbot

Ελέγξτε την τρέχουσα καθοδήγηση της OpenAI για ανιχνευτές και user-agent.

Google crawler docs developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Επαληθεύστε τα ονόματα των ανιχνευτών Google, τη συμπεριφορά ευρετηρίασης και τους ελέγχους σχετικούς με AI.

Anthropic support support.anthropic.com/

Ελέγξτε την τρέχουσα καθοδήγηση για λογαριασμό, δεδομένα και ανιχνευτές του Claude.

Συχνές ερωτήσεις

Συνήθεις αμφιβολίες.

Μπορώ να σταματήσω την εκπαίδευση AI στις προσωπικές μου φωτογραφίες;

Μπορείτε να μειώσετε την έκθεση, αλλά δεν μπορείτε να εγγυηθείτε πλήρη έλεγχο μόλις οι φωτογραφίες γίνουν δημόσιες. Κρατήστε τις ευαίσθητες φωτογραφίες ιδιωτικές, ελέγξτε τις ρυθμίσεις της πλατφόρμας, αποφύγετε δημόσιες μεταφορτώσεις υψηλής ανάλυσης και χρησιμοποιήστε ελέγχους ανιχνευτών για τον δικό σας ιστότοπο.

Πρέπει να επικολλήσω το βιογραφικό μου σε ένα chatbot AI;

Μόνο αφού αφαιρέσετε λεπτομέρειες που δεν χρειάζεστε για την εργασία. Ονόματα, διευθύνσεις, αριθμοί τηλεφώνου, ημερομηνίες γέννησης, υπογραφές, εταιρικά μυστικά και συστάσεις μπορούν συχνά να αντικατασταθούν με σύμβολα κράτησης θέσης.

Μπορώ να ανεβάσω οικογενειακά έγγραφα σε AI;

Να είστε προσεκτικοί. Ιατρικές επιστολές, διαβατήρια, σχολικά έγγραφα, νομικά χαρτιά, τραπεζικά αρχεία και οικογενειακά αρχεία μπορεί να περιέχουν ευαίσθητα δεδομένα για άλλα άτομα. Χρησιμοποιήστε εγκεκριμένες ρυθμίσεις ιδιωτικότητας ή μην τα ανεβάζετε.

Οι ιδιωτικές προτροπές γίνονται δεδομένα εκπαίδευσης AI;

Εξαρτάται από το προϊόν, τον τύπο λογαριασμού και τις ρυθμίσεις. Ορισμένοι πάροχοι προσφέρουν ελέγχους, ομαδικά προγράμματα ή όρους API που αντιμετωπίζουν τα δεδομένα διαφορετικά. Ελέγξτε τις τρέχουσες ρυθμίσεις πριν πληκτρολογήσετε ευαίσθητες πληροφορίες.

Μπορώ να σταματήσω εντελώς τις εταιρείες AI από την εκπαίδευση στον ιστότοπό μου;

Όχι με έναν τεχνικό διακόπτη. Το robots.txt μπορεί να ζητήσει από τους συμμορφούμενους ανιχνευτές να μείνουν μακριά, αλλά είναι εθελοντικό και δεν αφαιρεί αντίγραφα που υπάρχουν ήδη αλλού.

Το robots.txt αποκλείει νομικά την εκπαίδευση AI;

Το robots.txt είναι μια τεχνική σύμβαση, όχι σύμβαση από μόνο του. Μπορεί να υποστηρίξει τη θέση της πολιτικής σας, αλλά τα νομικά ζητήματα εξαρτώνται από τη δικαιοδοσία, τους όρους, τα πνευματικά δικαιώματα, τις συμβάσεις και την επιβολή.