あなたが入力・アップロードするもの
AIツールに送るプロンプト、ファイル、画像は、その製品の設定、アカウントの種類、規約に従います。ここでの制御は通常最も直接的です。何を送るかを自分で決められ、多くの場合データや学習の設定を調整できるからです。初期設定を想定するのではなく、その正確なツールとプランについて現在のオプションを確認してください。
実際によく尋ねられる質問
まず短い答え、次に重要な但し書きを。完璧なクローラーブロックは存在せず、規制対象データや高リスクのデータについて、いかなるガイドも法的助言の代わりにはなりません。
FAQ全文
露出を減らすことはできますが、写真が公開された後は完全なコントロールを保証できません。機微な写真は非公開にし、プラットフォームの設定を見直し、公開の高解像度アップロードを避け、自分のウェブサイトにはクローラー制御を使いましょう。
作業に不要な情報を削除してからにしてください。氏名、住所、電話番号、生年月日、署名、雇用主の秘密、推薦者などは、多くの場合プレースホルダーに置き換えられます。
注意してください。診断書、パスポート、学校の書類、法的書類、銀行の書類、家族の記録には、他人に関する機微なデータが含まれることがあります。承認されたプライバシー設定を使うか、アップロードしないでください。
製品、アカウントの種類、設定によって異なります。一部の提供者は、データを異なる方法で扱う制御、チームプラン、API規約を提供しています。機微な情報を入力する前に、現在の設定を確認してください。
一つの技術的スイッチだけでは無理です。robots.txtは準拠するクローラーに立ち去るよう求めることができますが、これは任意であり、すでに他所に存在するコピーを削除するものではありません。
robots.txtは技術的な慣習であり、それ自体は契約ではありません。あなたの方針の裏付けにはなりますが、法的な問題は管轄、規約、著作権、契約、執行に左右されます。
AI専用のエージェントをブロックすることは、Googlebotをブロックすることと同じに扱うべきではありません。通常の検索クローラーをブロックすると、検索での可視性が損なわれることがあります。各ユーザーエージェントを慎重に確認してください。
トレードオフを理解している場合に限ります。ユーザー起動のエージェントは、人がAIツールにサイトを読むよう頼んだときにページを取得することがあります。これらをブロックすると、AIによる発見が減る可能性があります。
Googleは、Google-Extendedを一部の生成AI利用に関連する制御として説明しています。これは通常のGoogle検索のクロールとは異なりますが、最新のGoogleのドキュメントを確認してください。
アカウントのデータ制御、必要に応じてビジネスまたはエンタープライズの制御、保持設定、墨消し、厳格なアップロード規則を使いましょう。非公開のアップロードにウェブサイトのクローラー規則を頼りにしないでください。
通常、これは会社の方針で定めるべきです。機微な顧客・人事・法務・財務・医療・営業秘密の書類は、承認なしにアップロードすべきではありません。
方針は製品、アカウントの種類、設定によって異なります。個人向け、チーム、エンタープライズ、API製品では、データの取り扱いが異なる場合があります。常に現在の提供者の規約を確認してください。
クローラー制御、認証付きギャラリー、ライセンス条件、透かし、来歴メタデータ、プラットフォーム設定でリスクを減らせますが、公開画像は準拠しない者によって依然コピーされ得ます。
いいえ。一部のツールは特定のメタデータを尊重するかもしれませんが、対応は普遍的ではありません。盾ではなく、あくまで一つのシグナルとして扱ってください。
必ずしもそうではありません。AI回答エンジンがトラフィック、引用、ブランドの発見をもたらすなら、全面的なブロックは可視性を損なうことがあります。ページの種類で判断しましょう:非公開、有料、公開マーケティング、ドキュメント、ニュース。
自分でコントロールできることから始めましょう:機微なファイルをアップロードしない、非公開アルバムは非公開に保つ、プロンプトでプレースホルダーを使う、AIアカウントの設定を見直す、ウェブサイトを運営しているならクローラー制御を追加する。
はい。サーバー側の規則は、トラフィック制御においてrobots.txtより強力になり得ます。ただしユーザーエージェントやIP範囲は変化するため、維持管理が必要です。
はい。クローラーのブロックは、準拠するクローラーに対して今後にのみ効きます。既存のデータセット、ミラー、アーカイブ、スクリーンショット、コピーされたテキストは消しません。
いいえ。このサイトは教育目的のチェックリストです。契約、著作権紛争、規制対象データ、従業員方針については、資格のある弁護士に相談してください。
通常、これらは異なるものです。オプトアウトは一般に、提供者に対して今後のデータを学習に使わないよう求めるものであり、削除はすでに保持しているデータを取り除くよう求めるものです。一方が自動的にもう一方を行うわけではなく、それぞれ独自の申請手続きがある場合があるため、その提供者の具体的な制御を確認してください。
製品と、そのモードがどう定義されているかによって異なります。一部のツールは一時的チャットを学習や履歴から除外すると説明していますが、詳細は提供者ごとに異なり、変わることもあります。一時的チャットが除外されると仮定する前に、その正確なツールとアカウントの種類について公式ドキュメントを確認してください。
クローラーのブロックは、今後の準拠したクロールに影響するのであって、すでに存在するコピーには影響しません。以前に収集されたデータは、すでにデータセット、アーカイブ、ミラー、第三者のコピーに存在しているかもしれません。オプトアウトやブロックのツールは通常、そうした既存のコピーには手が届かないため、露出を消し去るのではなく減らすにとどまります。
特定のデータセットや提供者について、オプトアウトや削除申請の経路が用意されている場合もありますが、対応範囲はまちまちで任意です。あるデータセットへの申請は、無関係なコピーには影響しません。その特定のデータセットや提供者が文書化された削除手続きを提供しているかを確認し、期待は現実的に保ちましょう。
多くの場合、初期設定は階層によって異なりますが、そう決めてかからないでください。一部の個人向け階層は、設定を変えない限り入力をモデル改善に使うことがあり、一部のビジネス・エンタープライズ・API階層は学習を行わない初期設定をうたっています。唯一信頼できる情報源は、その正確な製品とプランの現在の規約です。
Common Crawlは、多くの研究者やプロジェクトがデータ源として使ってきた、大規模で公に利用可能なウェブのクロールです。そうしたデータセットに含まれること自体は、特定のモデルがあなたのページで学習したことを意味しませんが、公開ページは広範なデータセットに入り込む可能性があります。ロボット制御は今後のクロールに影響するかもしれませんが、既存のコピーには影響しません。
必ずしもそうではありません。学習用クローラー、ライブ閲覧エージェント、一般的な知識は別々のものです。学習用クローラーをブロックすると今後の学習利用は減るかもしれませんが、ツールは以前のデータ、ユーザーが提供したテキスト、別の閲覧エージェントからあなたのサイトを説明することがあります。各ユーザーエージェントの役割を提供者のドキュメントで確認してください。
あまり関係ありません。AI検出器はテキストがAI生成かどうかを推測しようとするものであり、あなたのデータが学習に使われるかどうかとは別の話題です。検出器は信頼性が低いことでも知られているため、慎重に扱い、オプトアウトやクローラー制御と混同しないでください。
EUのGDPRやカリフォルニア州のCCPA/CPRAといったデータ保護法は、個人データに関する権利を付与することがあり、個人データがAIのために処理される場合に関係し得ます。これらが学習にどう適用されるかは複雑で、事実に依存し、なお発展途上です。このページは教育目的にすぎません。重要な事柄については、資格のあるデータ保護または法律の専門家に相談してください。
子どもに関するデータは、多くの規則やプラットフォームの方針の下で、特に機微なものとして扱われることが多いです。子どもを特定できる学校記録、写真、書類のアップロードには非常に慎重になり、そうしたデータは個人向けAIツールにはそもそも入力しないようにしましょう。義務が及び得る場合には、資格のある助言を求めてください。
ツール、階層、関わるデータによります。承認済みツールを挙げ、レッドラインとなるデータを定義し、墨消しを求める短い社内方針は、人々がひそかに無視する全面禁止よりも、たいてい役に立ちます。機微な顧客・人事・法務・財務データは、承認されていないツールから遠ざけるべきです。
画像はテキストと同じウェブクロールで収集され得るため、クローラー制御、認証付きギャラリー、ライセンス条件によって、自分がホストする画像の露出を減らせます。ただし、他所にコピーされ再ホストされた画像や、すでにデータセットに入っている画像は、そうした制御の外にあります。noaiのようなメタデータのシグナルは任意であり、対応はまちまちです。
サーバーログ、アナリティクス、ファイアウォールやCDNのダッシュボードは、名前の付いたAIクローラーを含め、どのユーザーエージェントがページを要求したかを示せます。ユーザーエージェントやIP範囲は変化し、なりすましもあり得るため、監視は一度きりの設定ではなく継続的なものとして扱い、現在のクローラー名を公式ドキュメントで確認してください。
役に立つ考え方
単一のオン/オフのスイッチとして考えるのをやめ、代わりに三つの別々のレイヤーを思い描くと役立ちます。ツールによって作用するレイヤーは異なり、どれも完璧ではないため、目標は何も使われないと保証することではなく、露出を減らすことです。
AIツールに送るプロンプト、ファイル、画像は、その製品の設定、アカウントの種類、規約に従います。ここでの制御は通常最も直接的です。何を送るかを自分で決められ、多くの場合データや学習の設定を調整できるからです。初期設定を想定するのではなく、その正確なツールとプランについて現在のオプションを確認してください。
公開ウェブページ、画像、投稿はクローラーに到達され得ます。robots.txt、サーバー側の規則、メタデータのシグナルといったツールは、準拠するクローラーに立ち去るよう求められますが、これらは任意で今後向けであり、すでに他所に存在するコピーは削除しません。
ひとたびコンテンツが公開されると、すでにデータセット、アーカイブ、スクリーンショット、第三者のミラーに存在しているかもしれません。オプトアウトやブロックのツールは、通常そうしたコピーには手が届きません。これは最もコントロールの効かないレイヤーであり、だからこそ現実的な期待が重要です。
これらのレイヤーのいずれも保証を提供するものではなく、このページは法的助言ではなく教育目的です。規制対象データ、契約、著作権の問題については、資格のある専門家に状況を確認し、各ツールの公式ドキュメントを確認してください。
どこから始めるか
時間が少ししかない場合、単純で順序立てた手順が、最小の労力で最も多くの露出を減らす傾向があります。ご自身の状況に合わせて調整し、各ステップを完全な解決策ではなく出発点として扱ってください。
これらのステップは露出を減らしますが、あなたのコンテンツのコピーが決して使われないと保証することはできません。いかなるユーザーエージェント名や方針上の主張に頼る前にも、現在の提供者のドキュメントを確認してください。
リファレンス
現在のOpenAIのクローラーとユーザーエージェントのガイダンスを確認します。
Googleクローラーのドキュメント developers.google.com/search/docs/crawling-indexing/overview-google-crawlersGoogleのクローラー名、インデックス動作、AI関連の制御を確認します。
Anthropicサポート support.anthropic.com/現在のClaudeのアカウント、データ、クローラーのガイダンスを確認します。
Perplexity www.perplexity.ai/現在のPerplexityの製品とパブリッシャー情報を確認します。
Common Crawl commoncrawl.org/研究に使われる主要な公開ウェブクロールデータセットの一つを理解します。
ロボット排除プロトコル www.rfc-editor.org/rfc/rfc9309正式なrobots.txtプロトコルのリファレンスです。