個人の写真
子ども、顔、家の内装、イベント、背景に写り込んだ書類、制服、車のナンバープレート、位置の手がかりには注意してください。公開された画像はコピーされる可能性があるため、一つの対策だけに頼らないようにしましょう。
写真と画像
個人の写真の場合、クローラーのブロックはあくまで一つの層にすぎません。顔、子ども、位置の手がかり、プライベートなイベント、ライセンス、認証、透かし、来歴、プラットフォームの設定についても考えてみてください。
ビジュアル素材
子ども、顔、家の内装、イベント、背景に写り込んだ書類、制服、車のナンバープレート、位置の手がかりには注意してください。公開された画像はコピーされる可能性があるため、一つの対策だけに頼らないようにしましょう。
明確なライセンス条件、低解像度のプレビュー、認証付きのギャラリー、透かし、来歴メタデータ、プラットフォームの設定を活用してください。
スクレイピングの仕組み
その一連の流れを理解すると、ご自身の対策が届く範囲と届かない範囲が見えてきます。大規模な画像データセットがこれまでどのように構築されてきたかについては、その多くが公開情報ですが、正確な手法は企業によって異なり、時間とともに変化するため、保証としてではなく背景知識として捉えてください。
多くの学習用データセットは、大規模なウェブクロール(たとえば公開ページの広範なアーカイブなど)や、画像URLと周辺のテキストを対にしたリストから構築されてきました。ルールを守るクローラーが到達できる公開ページに画像が置かれている場合、そのような画像データセットに参照として含まれる可能性があります。後から画像を削除しても、すでに収集されたコピーが必ずしも消えるわけではありません。
画像モデルは、画像の近くにある言葉、すなわちalt属性、キャプション、ファイル名、近くの段落から学習することがよくあります。説明的な代替テキストはアクセシビリティや検索に役立ちますが、同時に画像へのラベル付けやインデックス化を容易にもします。これはトレードオフであって、アクセシビリティ用のテキストを削除する理由にはなりません。
写真には、カメラの機種、撮影日時、場合によってはGPS座標といったEXIFメタデータが含まれることがあります。多くのプラットフォームはアップロード時にこれを除去しますが、すべてがそうとは限らず、直接共有されたファイルはこれを保持している場合があります。公開前に位置情報や身元を特定できるメタデータを削除しておくのは賢明な習慣ですが、画像そのものに写っている内容には影響しません。
画像がいったん公開されると、他の人がダウンロードしたり、再ホスティングしたり、逆画像検索したりできます。つまり、同じ写真が、それぞれ独自のrobotsルールを持つ、あなたの管理外のサイトに現れる可能性があるということです。だからこそ、どの設定一つをもってしても、その画像が二度と見られないと約束することはできないのです。
現実の確認:これらの対策は露出を減らし、あなたの意図を示すものです。それらは任意の慣習であり、実際には完全ではありません。ここに書かれているどれも、画像があらゆるデータセットから除外されることを保証するものではなく、このページは教育的な情報であって、法的助言ではありません。
実践チェックリスト
非公開に保つ:最も強力な対策は、機密性の高い写真をそもそも一般に公開しないことです。オープンなページの代わりに、限定公開のアルバムや信頼できる相手との共有を使いましょう。
背景に注意する:書類、画面、家の番地、制服、バッジ、車のナンバープレートは、被写体そのもの以上に多くを明らかにしてしまうことがあります。
メタデータを除去する:ファイルを共有する前に、特に子どもの画像については、GPSや身元を特定できるEXIFを削除してください。
プラットフォームの設定を確認する:アップロードした内容を誰が閲覧、ダウンロード、インデックス化できるか、またそのプラットフォームがAIや学習に関する何らかの制御を提供しているかを確認しましょう。
マスターではなくプレビューを見せる:低解像度版や透かし入りの版を公開し、フル解像度のファイルはログインやライセンスの後ろに置いておきましょう。
ライセンスを明確に示す:目に見える利用・ライセンスの記載は、それ自体で遵守を強制することはできませんが、あなたの立場を裏付けます。
ギャラリーにアクセス制限をかける:認証付きやクライアント限定のギャラリーは、作品をオープンでクロール可能なページから遠ざけます。
防御を層状にする:単一の手段に頼るのではなく、robotsによる制御、来歴メタデータ、プラットフォームの設定を組み合わせましょう。
来歴とツール
C2PA規格は、一部のツールではContent Credentialsとして提供されており、画像がどのように作成・編集されたかを示す、改ざんが検出可能な来歴メタデータを付加します。これは他者が出所を検証するのに役立ち、著作者を示すことができますが、コピーを物理的に防ぐわけではなく、メタデータは除去され得ます。対応状況はプラットフォームによって異なるため、お使いのツールでの現在の挙動を確認してください。
可視の透かしは軽い気持ちでの再利用を抑止し、不可視またはフォレンジックの透かしは後からコピーを追跡するのに役立ちます。どちらも画像がスクレイピングされることを防ぐわけではなく、過度な透かしは作品の見え方に影響するため、トレードオフを比較検討してください。
GlazeやNightshadeといった研究ツールは、一部のモデルにとって画像を学習しにくくしたり、学習を妨げたりする微妙な摂動を加えることを目指しています。その効果はさまざまで、議論もあり、モデルの進化に伴って変わる可能性があります。保証された保護ではなく実験的な追加の層として捉え、頼る前に現在のプロジェクトのドキュメントを読んでください。
プラットフォームの設定
多くの写真・クリエイティブ系プラットフォームがAI関連の設定を追加していますが、その名称、初期値、提供状況はしばしば変わり、地域やアカウントの種類によっても異なります。これは方向性を示すものとして使い、その上で各プラットフォームのプライバシーやアカウントのページで現在の選択肢を確認してください。
| 確認する場所 | 制御できる可能性のあること | 注意点 |
|---|---|---|
| アカウントのプライバシー設定 | 投稿や画像を公開するかどうか、また誰がダウンロードやインデックス化できるか | 公開コンテンツは、いったん見られると他者によってコピーされ得ます |
| AIや第三者データの設定 | 一部のプラットフォームは、あなたのコンテンツをAIやモデルの学習に使うことを制限するトグルを提供しています | 提供状況や範囲はさまざまで、過去の収集には及ばないことがあります |
| ポートフォリオとライセンスのオプション | 右クリック保護、ダウンロード制限、ライセンス表示 | これらは軽い気持ちでの再利用を抑止しますが、強制力はありません |
| robotsとサイトの制御(自分のサイト) | ルールを守るクローラーに画像ディレクトリをスキップするよう要求すること | 任意であり、他所にすでに存在するコピーを削除するものではありません |
設定やトグルは頻繁に移動され、名称が変更されます。ある制御が存在する、あるいは期待どおりの範囲をカバーすると思い込む前に、各提供者の公式ヘルプページで現在の選択肢を確認してください。
関連する読み物
ワークフローを選ぶ前にAIモデルを比較しましょう。
ChatGPT Alternatives chatgpt-alternatives.com一つのAI提供者では足りないときに、中立的な代替を見つけましょう。
AI Subscription Guide aisubscriptionguide.comあなたの実際の仕事に合うAIサブスクリプションを学びましょう。
OpenAI crawler docs platform.openai.com/docs/gptbot現在のOpenAIのクローラーおよびユーザーエージェントに関するガイダンスを確認しましょう。
Google crawler docs developers.google.com/search/docs/crawling-indexing/overview-google-crawlersGoogleのクローラー名、インデックス化の挙動、AI関連の制御を確認しましょう。
Anthropic support support.anthropic.com/現在のClaudeのアカウント、データ、クローラーに関するガイダンスを確認しましょう。
FAQ
露出を減らすことはできますが、写真がいったん公開されると完全な制御を保証することはできません。機密性の高い写真は非公開に保ち、プラットフォームの設定を見直し、高解像度画像の公開アップロードを避け、ご自身のウェブサイトにはクローラーの制御を使ってください。
そのタスクに必要のない情報を削除してからにしましょう。名前、住所、電話番号、生年月日、署名、雇用主の機密、推薦者は、多くの場合プレースホルダーに置き換えられます。
注意してください。診断書、パスポート、学校の書類、法的文書、銀行のファイル、家族の記録には、他人に関する機密データが含まれ得ます。承認されたプライバシー設定を使うか、アップロードしないようにしましょう。
それは製品、アカウントの種類、設定によります。一部の提供者は、データを異なる扱いにする制御、チームプラン、API条件を提供しています。機密情報を入力する前に、現在の設定を確認してください。
一つの技術的なスイッチで止めることはできません。robots.txtはルールを守るクローラーに近づかないよう要求できますが、それは任意であり、他所にすでに存在するコピーを削除するものではありません。
robots.txtは技術的な慣習であって、それ自体が契約となるものではありません。あなたの方針上の立場を裏付けることはできますが、法的な問題は管轄区域、利用規約、著作権、契約、執行によって異なります。