スニペットビルダー

AIボット向けのrobots.txt。

これらの例は出発点として使用してください。恒久的な真実ではありません。ユーザーエージェント名、製品、クローラーの挙動は変化するため、デプロイ前には必ず公式ページを確認してください。

静的ツール

慎重なrobots.txtのスターター用スニペットを作成する。

クロールしないよう要求したいクローラーを選択してください。このジェネレーターはお使いのブラウザ内でのみ動作します。データをどこにも送信しません。デプロイ前に、現在の公式ユーザーエージェント名を確認してください。

# AIクローラー制御:デプロイ前に現在のユーザーエージェント名を確認してください。
# これは任意です。robots.txtは法的なロックではありません。

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

警告:ユーザーが起動するエージェントや検索関連のエージェントをブロックすると、AIによる発見、プレビュー、引用が減少する可能性があります。

コピー&ペースト用ブロック

一般的なAIユーザーエージェント向けのrobots.txtの例。

以下は、いくつかのAI関連クローラーをカバーするスターター用ブロックです。ユーザーエージェント名は変化し、製品によって異なるため、これはテンプレートとして扱い、デプロイ前に各名称を運営者の公式ドキュメントと照合して確認してください。

# 例のみ。すべてのユーザーエージェント名を公式ドキュメントで確認してください。
# robots.txtは任意です。すでに存在するコピーを削除するものではなく、
# また従うことを選んだクローラーにのみ影響します。

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /
ユーザーエージェント(要確認)関連する提供者一般的な用途
GPTBotOpenAIモデル学習に使用される可能性のあるウェブコンテンツのクロール
Google-ExtendedGoogle特定のAI製品でのコンテンツ利用を制限するための制御トークン
CCBotCommon Crawl多くの下流データセットで使用されるオープンなCommon Crawlアーカイブの構築
ClaudeBot / anthropic-aiAnthropicClaudeに関連するクロール。現在のトークンはAnthropicのドキュメントで確認してください
PerplexityBotPerplexity回答機能や検索機能のためのクロール
BytespiderByteDanceByteDance製品に関連する広範なクロール
Applebot-ExtendedAppleAppleのAI学習でのコンテンツ利用を制限するための制御トークン

これらのうちいくつかは実際のクローラーのユーザーエージェントですが、他はページを取得するボットではなく制御トークンです。名称、意味、挙動は変化するため、頼りにする前に各項目を運営者の公式ドキュメントで確認してください。

できないこと

robots.txtは任意であり、限界があります。

これはロックではなく、要求です

robots.txtは慣習です。行儀の良いクローラーはこれを読んで従いますが、ウェブ自体によって強制されるものではありません。これを無視するクローラーや、あなたのリストに載っていないクローラーは、依然として公開ページを取得できます。これは意図を示すシグナルであり、技術的な障壁ではありません。

既存のコピーは削除されません

今日disallowルールを追加しても、すでにクロール、キャッシュ、アーカイブ、または他所にコピーされたコンテンツには何も作用しません。また、人々が手作業でAIツールに貼り付けるデータにも影響しません。これは過去を取り消すものではなく、将来の露出を減らすものと考えてください。

より強力な層

代替手段と補完策。

WAFとファイアウォールのルール

ウェブアプリケーションファイアウォールやサーバールールは、丁寧にお願いするだけでなく、ユーザーエージェント、IP範囲、または挙動に基づいて実際にリクエストをブロックしたりチャレンジしたりできます。これは要求ではなく強制ですが、クローラーの識別情報が変化するにつれてメンテナンスが必要で、正当な訪問者を誤って捕捉することもあります。

メタタグとヘッダー

noindexのrobotsメタタグやX-Robots-Tagヘッダーといったページ単位のディレクティブは、ルールを守るクローラーがそのページをどう扱うかに影響します。robots.txtと同様に、これらは協力に依存しており、無視するクローラーを止めることはできません。

ネットワークとアクセスの制御

ログインを必須にする、レート制限をかける、または機密資料を認証の背後に置くことで、それをオープンでクロール可能なページから完全に排除できます。本当に非公開に保つ必要のあるコンテンツについては、アクセスを制限する方が、いかなる任意のテキストファイルよりもはるかに信頼できるのが通常です。

動作を確認する

robots.txtの確認方法。

  1. ブラウザでhttps://yourdomain.com/robots.txtを直接読み込み、ファイルがサイトのルートで正しく配信されていることを確認してください。
  2. ユーザーエージェント名やディレクティブのタイプミスを確認してください。スペルミスのあるトークンは単に何も作用しません。
  3. robots.txtテスターや検索コンソールのツールを使用して、構文が期待どおりに解析されることを確認してください。
  4. 時間をかけてサーバーログを確認し、対象としたユーザーエージェントが依然として現れるかどうかを確認してください。名称は変化し、一部のエージェントはファイルを無視することを念頭に置いてください。
  5. クローラーの識別情報や制御トークンは定期的に更新されるため、各運営者の公式ドキュメントと照合して名称を定期的に再確認してください。

このページは教育的な情報であり、法的助言ではありません。また、ここに示されているユーザーエージェント名は古くなっている可能性があります。頼りにする前に、必ず運営者の公式ドキュメントで現在のトークンと挙動を確認してください。

関連する読み物

次のステップ。

ModelVersus modelversus.com

ワークフローを選ぶ前にAIモデルを比較しましょう。

ChatGPT Alternatives chatgpt-alternatives.com

1つのAIプロバイダーでは不十分なとき、中立的な代替案を見つけましょう。

AI Subscription Guide aisubscriptionguide.com

実際の仕事にどのAIサブスクリプションが合うかを学びましょう。

OpenAI crawler docs platform.openai.com/docs/gptbot

現在のOpenAIクローラーとユーザーエージェントのガイダンスを確認しましょう。

Google crawler docs developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Googleのクローラー名、インデックス作成の挙動、AI関連の制御を確認しましょう。

Anthropic support support.anthropic.com/

現在のClaudeアカウント、データ、クローラーのガイダンスを確認しましょう。

FAQ

よくある疑問。

個人の写真へのAI学習を止められますか?

露出を減らすことはできますが、写真が公開されてしまうと完全な制御を保証することはできません。機密性の高い写真は非公開に保ち、プラットフォームの設定を確認し、高解像度の公開アップロードを避け、ご自身のウェブサイトにはクローラー制御を使用してください。

職務経歴書や履歴書をAIチャットボットに貼り付けるべきですか?

タスクに不要な情報を削除してからにしてください。名前、住所、電話番号、生年月日、署名、雇用主の機密、推薦者などは、多くの場合プレースホルダーに置き換えられます。

家族の書類をAIにアップロードできますか?

注意してください。診断書、パスポート、学校の書類、法的書類、銀行のファイル、家族の記録には、他人に関する機密データが含まれている場合があります。承認されたプライバシー設定を使用するか、アップロードしないでください。

非公開のプロンプトはAIの学習データになりますか?

製品、アカウントの種類、設定によります。一部のプロバイダーは、データを異なる扱いにする制御機能、チームプラン、API規約を提供しています。機密情報を入力する前に、現在の設定を確認してください。

AI企業が自分のウェブサイトで学習するのを完全に止められますか?

1つの技術的なスイッチでは無理です。robots.txtはルールを守るクローラーに近づかないよう要求できますが、任意であり、すでに他所に存在するコピーを削除するものではありません。

robots.txtは法的にAI学習をブロックしますか?

robots.txtはそれ自体で契約ではなく、技術的な慣習です。あなたの方針上の立場を支える助けにはなりますが、法的な問題は管轄、規約、著作権、契約、執行によって異なります。