検索は分けて考える
ランダムなブロックリストを本番環境にコピーしないでください。検索クローラー、AI検索クローラー、学習クローラー、そしてユーザーが起動するフェッチャーは、それぞれ異なる目的を持つことがあります。誤ったエージェントをブロックすると、今も利用したいツールからページが隠れてしまう可能性があります。
個人向けウェブサイト
個人ブログ、ポートフォリオ、家族向けサイト、または小規模なクリエイターページを運営している場合、クローラーのブロックは適切なユーザーエージェントを指定することから始まります。そして、robots.txtはあくまでもリクエストであって、ロック(施錠)ではないことを理解しておくことが大切です。
慎重に行いましょう
ランダムなブロックリストを本番環境にコピーしないでください。検索クローラー、AI検索クローラー、学習クローラー、そしてユーザーが起動するフェッチャーは、それぞれ異なる目的を持つことがあります。誤ったエージェントをブロックすると、今も利用したいツールからページが隠れてしまう可能性があります。
サーバーログには、実際に誰が訪れたかが記録されます。短い見直しのサイクルを保ちましょう。ルールを追加し、トラフィックを観察し、重要なページが期待どおりの場所に表示されているかを確認し、それから調整するのです。
| ユーザーエージェント | 企業 | なぜ重要か | 注意点 |
|---|---|---|---|
GPTBot | OpenAI | OpenAIのウェブクローリング制御によく使われます。 | このクローラーにAI関連の用途で公開ページを取得されたくない場合はブロックしてください。最新のOpenAIのドキュメントを確認してください。 |
ChatGPT-User | OpenAI | 多くの議論で言及される、ユーザーが起動するブラウジング/フェッチのエージェントです。 | ブロックすると、ChatGPTのユーザーがページを読み込むよう依頼できなくなることがあります。これは広範な学習クローリングとは意図が異なります。 |
Google-Extended | 一部の生成AIの用途向けにGoogleが文書化している制御です。 | これはGoogle検索をブロックすることと同じではありません。検索での可視性に影響を与えたくない場合は、Googlebotをブロックしないでください。 | |
ClaudeBot | Anthropic | クローラー制御の議論で見られるAnthropicのクローラー名です。 | Anthropicの最新ドキュメントを確認したうえでのみ使用してください。 |
Claude-SearchBot | Anthropic | 公開ガイダンスで見られる、検索関連のClaudeクローラー名です。 | 検索系のエージェントをブロックする前に、可視性とのトレードオフを検討してください。 |
PerplexityBot | Perplexity | パブリッシャーの間で議論されているPerplexityのクローラー/ユーザーエージェントです。 | ブロックすると、Perplexity系の回答エンジンでコンテンツがどのように発見・引用されるかに影響する可能性があります。 |
CCBot | Common Crawl | 大規模なウェブデータセットに使われる公開ウェブクローラーです。 | 公開クロールのコーパスにページをコピーされたくないパブリッシャーによって、しばしばブロックされます。 |
Bytespider | ByteDance | ByteDanceに関連するクローラーです。 | 広範なAIクローラーのブロックリストを作りたい場合は、確認しておくとよいでしょう。 |
クローラーがあなたを見つける仕組み
クローラーをブロックするには、まずそれがどのように到達するかを知っておくと役立ちます。自動フェッチャーがランダムにページに行き当たることはめったになく、かなり予測可能な発見の連鎖をたどります。以下の説明は一般的で簡略化したものであり、名前の付いたボットの正確な挙動は変わり得ますので、対処する前に各提供者の公式ドキュメントで確認してください。
クローラーは、他のページからのリンクをたどったり、XMLサイトマップを読み込んだり、robots.txtを確認したり、大規模な公開リンクデータセットを利用したりして、URLを見つけます。真新しいページは通常、何か公開されたものがリンクを張った瞬間に到達可能になります。
クローラーは、ユーザーエージェント文字列で自身を識別するHTTPリクエストを送信します。サーバーはその文字列を検査して応答方法を決められますが、ユーザーエージェントは偽装され得るため、証拠ではなくシグナルとして扱ってください。
行儀のよいクローラーは変更を拾うために定期的に再訪し、多くはクロール遅延のヒントや独自のレート制限を尊重します。行儀の悪いものは積極的に取得することがあり、それが丁寧なルールと並んでレート制限が重要な理由の一つです。
3種類のボット
ブロックの失敗の多くは、あらゆるボットを同一視することから生じます。以下の3つのカテゴリーは仕組みの点で重なりますが、目的は異なり、一つをブロックすることは別のものをブロックすることとは大きく異なる結果をもたらす可能性があります。名前と挙動は進化していくため、この枠組みに頼る前に特定のエージェントの現在の役割を確認してください。
| 種類 | 何をするか | ブロックの効果 |
|---|---|---|
| 検索クローラー | ページを索引付けし、検索エンジンの結果に表示できるようにします。 | ブロックすると、その検索エンジンから外れる可能性があります。通常は望ましくありません。 |
| AI学習クローラー | AIモデルの学習データセットを構築または改善するためにページを取得します。 | ブロックは、公開ページを学習に使わないよう提供者に依頼するものです。ここでは、これがほとんどの人にとって主な対象となります。 |
| AIライブ取得ボット | ユーザーがAIアシスタントにページを読み込むか引用するよう依頼したときに、その都度ページを取得します。 | ブロックすると、リアルタイムでページが読み込まれたり引用されたりするのを止められます。これは学習ではなく回答エンジンでの可視性に影響します。 |
学習クローラーとライブ取得ボットは、ほとんどの人が「AIボット」と言うときに意味するものですが、一部は発見や引用も担っています。学習されたいのか、引用されたいのか、両方か、どちらでもないのかを意図的に決めてください。それらは別々の選択だからです。
段階的なアプローチ
ブロックを、単一のスイッチではなく多層防御として捉えてください。各層は他の層が取りこぼすケースを捕え、それぞれに正直な限界があります。丁寧でリスクの低い層から始め、トレードオフに見合う場合にのみ、より厳しい層を追加してください。
指定したパスを取得しないよう、名前を挙げたクローラーに依頼するプレーンテキストのファイルです。規約を守るボットはこれを尊重し、守らないものは無視します。標準的な最初のステップであり、最も影響の少ない方法です。
ページ単位のメタタグやHTTPレスポンスヘッダーで、コンテンツを索引付けしない、あるいは特定の方法で使用しないよう要求できます。対応状況はボットによって異なるため、noaiのようなディレクティブは保証ではなくリクエストとして扱ってください。
ウェブアプリケーションファイアウォールやレートリミッターは、ユーザーエージェント、IP範囲、または挙動によってトラフィックをブロックまたは抑制できます。robots.txtとは異なり、これはサーバー側で実際に強制しますが、正当な訪問者を巻き込まないよう注意が必要です。
ログインの背後にあるコンテンツは公開的に取得できず、通りすがりのクローラーを完全に締め出す最も信頼できる方法です。その代償は実際のユーザーにとっての手間なので、本当に必要な素材にのみ用いてください。
マネージド型のプラットフォームには、もう一つの選択肢があります。Cloudflare系のサービスなど一部の提供者は、AIボットのカテゴリーを識別してブロックする組み込みの制御を提供しています。これらは便利ですが、提供者の検出精度と定義に依存することに変わりはないため、あるトグルが実際に何をするのかを、信頼する前に確認してください。
# robots.txt — 丁寧な最初の層(現在のエージェント名を確認)
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# 通常の検索を維持する: Googlebotを一括ブロックしないこと
User-agent: Googlebot
Allow: /# HTTPレスポンスヘッダーの例(サーバーまたはWAFの設定)
X-Robots-Tag: noai, noimageaiなぜブロックは不完全なのか
これらの手法のいずれかを完璧なものとして提示するのは誤解を招くでしょう。不要なクローリングは有意に減らせますが、コンテンツを到達不能にはできません。期待値を正しく設定することも、これを責任を持って行うことの一部です。
不要なAIクローリングを有意に不便にし、あなたの示した意向を明確に文書化することを目指してください。それは達成可能です。保証された普遍的な排除は不可能です。
ログを見守る
ルールは、それが機能しているかを確認して初めて役立ちます。サーバーのアクセスログには、誰が、いつ、どのユーザーエージェント文字列で、何をリクエストしたかが記録されます。短く定期的な見直しによって、実際にどのボットが訪れているか、そしてルールが尊重されているかがわかります。ユーザーエージェントは偽装され得ることを忘れず、ログを絶対的な真実ではなく、解釈すべき証拠として扱ってください。
GPTBot、CCBot、ClaudeBot、PerplexityBot、Bytespiderなど、既知のAIユーザーエージェント文字列を探してください。それらのリクエスト量と、どのパスを取得しているかに注目しましょう。
拒否したにもかかわらずサイトに大量にリクエストしてくるエージェント、多数のページを短時間で取得する見慣れないエージェント、あるいは人間なら訪れないURLに当たってくる一般的なブラウザ文字列に注意してください。
規約を守るボットがルールを無視する場合は、構文を再確認してください。ボットが本当にrobots.txtを無視する場合は、誤検知のリスクが増えることを受け入れたうえで、ファイアウォールやレート制限のルールを検討してください。
# おおよその例: AI関連のユーザーエージェント別にリクエストを集計
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
| awk '{print $NF}' | sort | uniq -c | sort -rn段階的な展開
誤ったルールは正当な可視性を静かに損なう可能性があるため、変更は徐々に展開し、各ステップで効果を見守ってください。以下の順序は速さよりも可逆性を重視しており、ほとんどの個人サイトや小規模サイトにとって正しい優先順位です。
関連する読み物
ワークフローを選ぶ前にAIモデルを比較しましょう。
ChatGPT Alternatives chatgpt-alternatives.com一つのAI提供者では足りないときに、中立的な代替を見つけましょう。
AI Subscription Guide aisubscriptionguide.comあなたの実際の仕事にどのAIサブスクリプションが合うかを学びましょう。
OpenAIクローラードキュメント platform.openai.com/docs/gptbot現在のOpenAIのクローラーとユーザーエージェントのガイダンスを確認しましょう。
Googleクローラードキュメント developers.google.com/search/docs/crawling-indexing/overview-google-crawlersGoogleのクローラー名、索引付けの挙動、AI関連の制御を確認しましょう。
Anthropicサポート support.anthropic.com/現在のClaudeのアカウント、データ、クローラーに関するガイダンスを確認しましょう。
FAQ
露出を減らすことはできますが、写真がいったん公開されると完全な制御を保証することはできません。機密性の高い写真は非公開に保ち、プラットフォームの設定を確認し、高解像度画像の公開アップロードを避け、そして自分のウェブサイトにはクローラー制御を使いましょう。
その作業に必要でない詳細を削除したうえでのみ行ってください。氏名、住所、電話番号、生年月日、署名、雇用主の秘密、そして推薦者は、多くの場合プレースホルダーに置き換えられます。
注意してください。診断書、パスポート、学校の書類、法的文書、銀行のファイル、家族の記録には、他の人に関する機密データが含まれることがあります。承認されたプライバシー設定を使うか、アップロードしないでください。
それは製品、アカウントの種類、そして設定によって異なります。一部の提供者は、データを異なる扱いにする制御、チームプラン、またはAPI規約を提供しています。機密情報を入力する前に、現在の設定を確認してください。
一つの技術的なスイッチでは止められません。robots.txtは規約を守るクローラーに近づかないよう依頼できますが、これは任意であり、すでに他の場所に存在するコピーを削除するものではありません。
robots.txtはそれ自体が契約ではなく、技術的な慣行です。あなたの方針上の立場を裏付けることはできますが、法的な問題は法域、規約、著作権、契約、そして執行によって左右されます。