これはロックではなく、要求です
robots.txtは慣習です。行儀の良いクローラーはこれを読んで従いますが、ウェブ自体によって強制されるものではありません。これを無視するクローラーや、あなたのリストに載っていないクローラーは、依然として公開ページを取得できます。これは意図を示すシグナルであり、技術的な障壁ではありません。
スニペットビルダー
これらの例は出発点として使用してください。恒久的な真実ではありません。ユーザーエージェント名、製品、クローラーの挙動は変化するため、デプロイ前には必ず公式ページを確認してください。
静的ツール
クロールしないよう要求したいクローラーを選択してください。このジェネレーターはお使いのブラウザ内でのみ動作します。データをどこにも送信しません。デプロイ前に、現在の公式ユーザーエージェント名を確認してください。
# AIクローラー制御:デプロイ前に現在のユーザーエージェント名を確認してください。
# これは任意です。robots.txtは法的なロックではありません。
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: CCBot
Disallow: /
警告:ユーザーが起動するエージェントや検索関連のエージェントをブロックすると、AIによる発見、プレビュー、引用が減少する可能性があります。
コピー&ペースト用ブロック
以下は、いくつかのAI関連クローラーをカバーするスターター用ブロックです。ユーザーエージェント名は変化し、製品によって異なるため、これはテンプレートとして扱い、デプロイ前に各名称を運営者の公式ドキュメントと照合して確認してください。
# 例のみ。すべてのユーザーエージェント名を公式ドキュメントで確認してください。
# robots.txtは任意です。すでに存在するコピーを削除するものではなく、
# また従うことを選んだクローラーにのみ影響します。
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Applebot-Extended
Disallow: /| ユーザーエージェント(要確認) | 関連する提供者 | 一般的な用途 |
|---|---|---|
| GPTBot | OpenAI | モデル学習に使用される可能性のあるウェブコンテンツのクロール |
| Google-Extended | 特定のAI製品でのコンテンツ利用を制限するための制御トークン | |
| CCBot | Common Crawl | 多くの下流データセットで使用されるオープンなCommon Crawlアーカイブの構築 |
| ClaudeBot / anthropic-ai | Anthropic | Claudeに関連するクロール。現在のトークンはAnthropicのドキュメントで確認してください |
| PerplexityBot | Perplexity | 回答機能や検索機能のためのクロール |
| Bytespider | ByteDance | ByteDance製品に関連する広範なクロール |
| Applebot-Extended | Apple | AppleのAI学習でのコンテンツ利用を制限するための制御トークン |
これらのうちいくつかは実際のクローラーのユーザーエージェントですが、他はページを取得するボットではなく制御トークンです。名称、意味、挙動は変化するため、頼りにする前に各項目を運営者の公式ドキュメントで確認してください。
できないこと
robots.txtは慣習です。行儀の良いクローラーはこれを読んで従いますが、ウェブ自体によって強制されるものではありません。これを無視するクローラーや、あなたのリストに載っていないクローラーは、依然として公開ページを取得できます。これは意図を示すシグナルであり、技術的な障壁ではありません。
今日disallowルールを追加しても、すでにクロール、キャッシュ、アーカイブ、または他所にコピーされたコンテンツには何も作用しません。また、人々が手作業でAIツールに貼り付けるデータにも影響しません。これは過去を取り消すものではなく、将来の露出を減らすものと考えてください。
より強力な層
ウェブアプリケーションファイアウォールやサーバールールは、丁寧にお願いするだけでなく、ユーザーエージェント、IP範囲、または挙動に基づいて実際にリクエストをブロックしたりチャレンジしたりできます。これは要求ではなく強制ですが、クローラーの識別情報が変化するにつれてメンテナンスが必要で、正当な訪問者を誤って捕捉することもあります。
noindexのrobotsメタタグやX-Robots-Tagヘッダーといったページ単位のディレクティブは、ルールを守るクローラーがそのページをどう扱うかに影響します。robots.txtと同様に、これらは協力に依存しており、無視するクローラーを止めることはできません。
ログインを必須にする、レート制限をかける、または機密資料を認証の背後に置くことで、それをオープンでクロール可能なページから完全に排除できます。本当に非公開に保つ必要のあるコンテンツについては、アクセスを制限する方が、いかなる任意のテキストファイルよりもはるかに信頼できるのが通常です。
動作を確認する
https://yourdomain.com/robots.txtを直接読み込み、ファイルがサイトのルートで正しく配信されていることを確認してください。このページは教育的な情報であり、法的助言ではありません。また、ここに示されているユーザーエージェント名は古くなっている可能性があります。頼りにする前に、必ず運営者の公式ドキュメントで現在のトークンと挙動を確認してください。
関連する読み物
ワークフローを選ぶ前にAIモデルを比較しましょう。
ChatGPT Alternatives chatgpt-alternatives.com1つのAIプロバイダーでは不十分なとき、中立的な代替案を見つけましょう。
AI Subscription Guide aisubscriptionguide.com実際の仕事にどのAIサブスクリプションが合うかを学びましょう。
OpenAI crawler docs platform.openai.com/docs/gptbot現在のOpenAIクローラーとユーザーエージェントのガイダンスを確認しましょう。
Google crawler docs developers.google.com/search/docs/crawling-indexing/overview-google-crawlersGoogleのクローラー名、インデックス作成の挙動、AI関連の制御を確認しましょう。
Anthropic support support.anthropic.com/現在のClaudeアカウント、データ、クローラーのガイダンスを確認しましょう。
FAQ
露出を減らすことはできますが、写真が公開されてしまうと完全な制御を保証することはできません。機密性の高い写真は非公開に保ち、プラットフォームの設定を確認し、高解像度の公開アップロードを避け、ご自身のウェブサイトにはクローラー制御を使用してください。
タスクに不要な情報を削除してからにしてください。名前、住所、電話番号、生年月日、署名、雇用主の機密、推薦者などは、多くの場合プレースホルダーに置き換えられます。
注意してください。診断書、パスポート、学校の書類、法的書類、銀行のファイル、家族の記録には、他人に関する機密データが含まれている場合があります。承認されたプライバシー設定を使用するか、アップロードしないでください。
製品、アカウントの種類、設定によります。一部のプロバイダーは、データを異なる扱いにする制御機能、チームプラン、API規約を提供しています。機密情報を入力する前に、現在の設定を確認してください。
1つの技術的なスイッチでは無理です。robots.txtはルールを守るクローラーに近づかないよう要求できますが、任意であり、すでに他所に存在するコピーを削除するものではありません。
robots.txtはそれ自体で契約ではなく、技術的な慣習です。あなたの方針上の立場を支える助けにはなりますが、法的な問題は管轄、規約、著作権、契約、執行によって異なります。