개인 웹사이트

AI 크롤러를 차단하는 방법.

개인 블로그, 포트폴리오, 가족 사이트 또는 소규모 크리에이터 페이지를 운영한다면, 크롤러 차단은 올바른 사용자 에이전트를 지정하는 것과 robots.txt가 잠금장치가 아니라 요청이라는 점을 이해하는 것에서 시작됩니다.

신중하게 진행하십시오

유용한 가시성을 훼손하지 않으면서 AI 크롤러를 차단하십시오.

검색은 별개로 유지하십시오

아무 차단 목록이나 운영 환경에 복사하지 마십시오. 검색 크롤러, AI 검색 크롤러, 학습 크롤러, 사용자 트리거 방식의 페처는 목적이 서로 다를 수 있습니다. 잘못된 에이전트를 차단하면 여전히 원하는 도구로부터 페이지가 숨겨질 수 있습니다.

로그를 모니터링하십시오

서버 로그는 실제로 누가 방문하는지 보여줍니다. 짧은 검토 주기를 유지하십시오. 규칙을 추가하고, 트래픽을 관찰하고, 중요한 페이지가 기대하는 곳에 여전히 나타나는지 확인한 다음 조정하십시오.

사용자 에이전트회사중요한 이유주의 사항
GPTBotOpenAIOpenAI 웹 크롤링 제어에 일반적으로 사용됩니다.이 크롤러가 AI 관련 용도로 공개 페이지를 가져오는 것을 원하지 않으면 차단하십시오. 최신 OpenAI 문서를 확인하십시오.
ChatGPT-UserOpenAI많은 논의에서 사용자 트리거 방식의 브라우징/가져오기 에이전트입니다.차단하면 ChatGPT 사용자가 해당 앱에 페이지를 읽어달라고 요청하는 것을 막을 수 있습니다. 이는 광범위한 학습 크롤링과 같은 의도가 아닙니다.
Google-ExtendedGoogleGoogle이 일부 생성형 AI 사용 사례에 대해 문서화한 제어 수단입니다.이는 Google 검색을 차단하는 것과 같지 않습니다. 검색 가시성에 영향을 주고 싶지 않다면 Googlebot을 차단하지 마십시오.
ClaudeBotAnthropic크롤러 제어 논의에서 보이는 Anthropic 크롤러 이름입니다.Anthropic의 최신 문서를 확인한 후에만 사용하십시오.
Claude-SearchBotAnthropic공개 안내에서 보이는 검색 관련 Claude 크롤러 이름입니다.검색 유형의 에이전트를 차단하기 전에 가시성 절충을 고려하십시오.
PerplexityBotPerplexity게시자들이 논의하는 Perplexity 크롤러/사용자 에이전트입니다.차단하면 Perplexity 유형의 답변 엔진이 콘텐츠를 발견하거나 인용하는 방식에 영향을 줄 수 있습니다.
CCBotCommon Crawl대규모 웹 데이터셋에 사용되는 공개 웹 크롤러입니다.페이지가 공개 크롤 코퍼스에 복사되는 것을 원하지 않는 게시자들이 자주 차단합니다.
BytespiderByteDanceByteDance와 연관된 크롤러입니다.광범위한 AI 크롤러 차단 목록을 원한다면 검토할 만합니다.

크롤러가 사이트를 찾는 방법

AI 크롤러가 사이트를 발견하고 가져오는 방법.

크롤러를 차단하려면 먼저 그것이 어떻게 도달하는지 아는 것이 도움이 됩니다. 자동화된 페처가 무작위로 페이지에 우연히 도달하는 경우는 드뭅니다. 이들은 상당히 예측 가능한 발견 과정을 따릅니다. 아래 설명은 일반적이고 단순화된 것이며, 명명된 봇의 정확한 동작은 바뀔 수 있으므로 조치를 취하기 전에 각 제공업체의 공식 문서에 대조하여 확인하십시오.

발견

크롤러는 다른 페이지의 링크를 따라가고, XML 사이트맵을 읽고, robots.txt를 확인하고, 대규모 공개 링크 데이터셋을 활용하여 URL을 찾습니다. 새로 만든 페이지는 대개 공개된 무언가가 그것에 링크하는 순간 도달 가능해집니다.

가져오기

크롤러는 사용자 에이전트 문자열로 자신을 식별하는 HTTP 요청을 보냅니다. 서버는 그 문자열을 검사하고 어떻게 응답할지 결정할 수 있지만, 사용자 에이전트는 위장될 수 있으므로 증거가 아니라 신호로 취급하십시오.

빈도

잘 동작하는 크롤러는 변경 사항을 반영하기 위해 주기적으로 다시 방문하며, 다수가 crawl-delay 힌트나 자체 속도 제한을 존중합니다. 잘못 동작하는 크롤러는 공격적으로 가져올 수 있으며, 이것이 정중한 규칙과 함께 속도 제한이 중요한 한 가지 이유입니다.

세 가지 종류의 봇

검색 크롤러, AI 학습 크롤러, 실시간 검색 봇은 서로 같지 않습니다.

많은 차단 실수는 모든 봇을 동일하게 취급하는 데서 비롯됩니다. 아래 세 가지 범주는 작동 방식에서 겹치지만 목적이 다르며, 하나를 차단하는 것은 다른 것을 차단하는 것과 매우 다른 결과를 가져올 수 있습니다. 명명과 동작은 계속 진화하므로, 이 틀에 의존하기 전에 특정 에이전트의 현재 역할을 확인하십시오.

유형하는 일차단의 효과
검색 크롤러페이지가 검색 엔진 결과에 나타날 수 있도록 색인합니다.차단하면 해당 검색 엔진에서 제외될 수 있습니다. 보통 원하는 바가 아닙니다.
AI 학습 크롤러AI 모델용 학습 데이터셋을 구축하거나 개선하기 위해 페이지를 가져옵니다.차단은 제공업체에게 공개 페이지를 학습에 사용하지 말아 달라고 요청하는 것입니다. 이는 여기 대부분의 사람들에게 주된 대상입니다.
AI 실시간 검색 봇사용자가 AI 어시스턴트에게 페이지를 읽거나 인용하도록 요청할 때 필요에 따라 페이지를 가져옵니다.차단하면 페이지가 실시간으로 읽히거나 인용되는 것을 막을 수 있으며, 이는 학습이 아니라 답변 엔진에서의 가시성에 영향을 줍니다.

짚어둘 만한 절충.

학습 크롤러와 실시간 검색 봇은 대부분의 사람들이 "AI 봇"이라고 말할 때 의미하는 것이지만, 일부는 발견과 인용도 지원합니다. 학습되기를, 인용되기를, 둘 다를, 아니면 둘 다 아니기를 원하는지 신중하게 결정하십시오. 이것들은 별개의 선택이기 때문입니다.

계층적 접근

단일 계층으로는 완전하지 않기 때문에 차단은 계층으로 할 때 가장 효과적입니다.

차단을 단일 스위치가 아니라 심층 방어로 생각하십시오. 각 계층은 다른 계층이 놓치는 경우를 잡아내며, 각각 솔직한 한계를 가지고 있습니다. 정중하고 위험이 낮은 계층부터 시작하고, 절충할 가치가 있는 곳에만 더 엄격한 계층을 추가하십시오.

1. robots.txt

명명된 크롤러에게 나열된 경로를 가져오지 말아 달라고 요청하는 일반 텍스트 파일입니다. 규정을 준수하는 봇은 이를 존중하고, 준수하지 않는 봇은 무시합니다. 이는 표준적인 첫 단계이며 가장 방해가 적습니다.

2. Meta robots 및 X-Robots-Tag

페이지 수준의 메타 태그나 HTTP 응답 헤더로 콘텐츠가 색인되거나 특정 방식으로 사용되지 않도록 요청할 수 있습니다. 지원 여부는 봇마다 다르므로 noai 같은 지시어는 보장이 아니라 요청으로 취급하십시오.

3. WAF, 방화벽, 속도 제한

웹 애플리케이션 방화벽이나 속도 제한기는 사용자 에이전트, IP 범위 또는 동작에 따라 트래픽을 차단하거나 조절할 수 있습니다. robots.txt와 달리 이것은 서버에서 실제로 강제하지만, 정당한 방문자를 걸리게 하지 않도록 주의가 필요합니다.

4. 인증 장벽

로그인 뒤의 콘텐츠는 공개적으로 가져올 수 없으며, 이는 일상적인 크롤러를 완전히 차단하는 가장 신뢰할 수 있는 방법입니다. 대가는 실제 사용자에게 생기는 마찰이므로, 정말로 필요한 자료에만 사용하십시오.

관리형 플랫폼은 또 다른 선택지를 제공합니다. Cloudflare 유형의 서비스 같은 일부 제공업체는 AI 봇 범주를 식별하고 차단해 주는 내장 제어 기능을 제공합니다. 이는 편리할 수 있지만, 여전히 제공업체의 탐지 정확도와 정의에 의존하므로 특정 토글이 실제로 무엇을 하는지 신뢰하기 전에 확인하십시오.

# robots.txt — 정중한 첫 계층 (현재 에이전트 이름을 확인하십시오)
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

# 일반 검색을 유지하십시오: Googlebot을 전면 차단하지 마십시오
User-agent: Googlebot
Allow: /
# HTTP 응답 헤더 예시 (서버 또는 WAF 설정)
X-Robots-Tag: noai, noimageai

차단이 불완전한 이유

솔직한 한계: 차단으로 할 수 있는 것과 할 수 없는 것.

이러한 기법 중 어느 것도 빈틈없는 것으로 제시한다면 오해를 불러일으킬 것입니다. 이들은 원치 않는 크롤링을 의미 있게 줄이지만, 콘텐츠를 도달 불가능하게 만들지는 못합니다. 기대치를 올바르게 설정하는 것은 이 일을 책임감 있게 하는 것의 일부입니다.

현실적인 목표.

원치 않는 AI 크롤링을 훨씬 덜 편리하게 만들고 명시한 선호를 분명하게 문서화하는 것을 목표로 삼으십시오. 그것은 달성 가능합니다. 보장된 보편적 배제는 그렇지 않습니다.

로그를 주시하십시오

AI 사용자 에이전트에 대해 서버 로그를 모니터링하는 방법.

규칙은 작동하는지 확인해야만 유용합니다. 서버 접근 로그는 누가 무엇을, 언제, 어떤 사용자 에이전트 문자열로 요청했는지 기록합니다. 짧고 정기적인 검토는 실제로 어떤 봇이 방문하는지, 그리고 규칙이 존중되고 있는지 알려줍니다. 사용자 에이전트는 위장될 수 있으므로 로그를 절대적 진실이 아니라 해석해야 할 증거로 취급하십시오.

무엇을 살펴봐야 하는가

GPTBot, CCBot, ClaudeBot, PerplexityBot, Bytespider 같은 알려진 AI 사용자 에이전트 문자열을 훑어보십시오. 이들의 요청량과 어떤 경로를 가져오는지 기록하십시오.

문제의 징후

차단한 후에도 사이트를 심하게 요청하는 에이전트, 많은 페이지를 빠르게 가져오는 낯선 에이전트, 또는 사람이라면 접근하지 않을 URL에 접근하는 일반적인 브라우저 문자열을 주의하십시오.

다음에 할 일

규정을 준수하는 봇이 규칙을 무시한다면 구문을 다시 확인하십시오. 봇이 정말로 robots.txt를 무시한다면, 오탐의 추가 위험을 감수하며 방화벽이나 속도 제한 규칙을 고려하십시오.

# 대략적인 예시: AI 관련 사용자 에이전트별로 요청 수 세기
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
  | awk '{print $NF}' | sort | uniq -c | sort -rn

단계별 배포

되돌릴 수 있는 신중한 배포.

잘못된 규칙이 정당한 가시성을 조용히 해칠 수 있기 때문에, 변경 사항을 점진적으로 배포하고 각 단계에서 효과를 관찰하십시오. 아래 순서는 속도보다 되돌릴 수 있음을 우선하며, 이는 대부분의 개인 및 소규모 사이트에 올바른 우선순위입니다.

  1. 기준선: 아무것도 바꾸기 전에 어떤 봇이 방문하는지 알 수 있도록 현재 로그를 검토하십시오.
  2. 의도 결정: 학습에서, 실시간 검색에서, 아니면 둘 다에서 제외되기를 원하는지 선택하고, 일반 검색을 온전히 유지하고 있는지 확인하십시오.
  3. 정중하게 시작: 공식 문서에 대조하여 확인한 이름을 사용하여, 제외하려는 특정 AI 학습 크롤러에 대한 robots.txt 규칙을 추가하십시오.
  4. 페이지 수준 제어 추가: 지원되는 경우 더 세밀한 제어를 위해 meta robots 또는 X-Robots-Tag 지시어를 추가하십시오.
  5. 관찰: 한두 주 기다린 다음 로그와 검색 가시성을 다시 확인하여 중요한 것이 손상되지 않았는지 확인하십시오.
  6. 선택적으로 강제: 정중한 규칙을 무시하는 봇에 대해서만 방화벽이나 속도 제한 규칙을 추가하고, 오탐을 피하기 위해 신중하게 테스트하십시오.
  7. 일정에 따라 검토: 크롤러 이름, 제공업체 정책, 자신의 우선순위가 모두 바뀌므로 몇 달마다 다시 살펴보십시오.

관련 읽을거리

다음 단계.

ModelVersus modelversus.com

워크플로를 선택하기 전에 AI 모델을 비교하십시오.

ChatGPT Alternatives chatgpt-alternatives.com

하나의 AI 제공업체로 충분하지 않을 때 중립적인 대안을 찾으십시오.

AI Subscription Guide aisubscriptionguide.com

실제 업무에 맞는 AI 구독이 무엇인지 알아보십시오.

OpenAI 크롤러 문서 platform.openai.com/docs/gptbot

현재 OpenAI 크롤러 및 사용자 에이전트 안내를 확인하십시오.

Google 크롤러 문서 developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Google 크롤러 이름, 색인 동작, AI 관련 제어를 확인하십시오.

Anthropic 지원 support.anthropic.com/

현재 Claude 계정, 데이터, 크롤러 안내를 확인하십시오.

FAQ

흔한 의문.

개인 사진에 대한 AI 학습을 멈출 수 있나요?

노출을 줄일 수는 있지만, 사진이 일단 공개되면 완전한 통제를 보장할 수 없습니다. 민감한 사진은 비공개로 유지하고, 플랫폼 설정을 검토하고, 공개된 고해상도 업로드를 피하고, 자신의 웹사이트에는 크롤러 제어를 사용하십시오.

이력서를 AI 챗봇에 붙여넣어도 되나요?

작업에 필요하지 않은 세부 정보를 제거한 후에만 하십시오. 이름, 주소, 전화번호, 생년월일, 서명, 고용주의 비밀, 추천인은 대개 자리표시자로 대체할 수 있습니다.

가족 문서를 AI에 업로드해도 되나요?

조심하십시오. 진료 소견서, 여권, 학교 서류, 법률 문서, 은행 파일, 가족 기록에는 다른 사람에 관한 민감한 데이터가 포함될 수 있습니다. 승인된 개인정보 설정을 사용하거나 업로드하지 마십시오.

비공개 프롬프트가 AI 학습 데이터가 되나요?

제품, 계정 유형, 설정에 따라 다릅니다. 일부 제공업체는 데이터를 다르게 취급하는 제어 기능, 팀 요금제, API 약관을 제공합니다. 민감한 정보를 입력하기 전에 현재 설정을 확인하십시오.

AI 회사가 내 웹사이트로 학습하는 것을 완전히 멈출 수 있나요?

단일 기술 스위치로는 안 됩니다. robots.txt는 규정을 준수하는 크롤러에게 접근하지 말아 달라고 요청할 수 있지만, 이는 자발적이며 이미 다른 곳에 존재하는 사본을 제거하지 못합니다.

robots.txt가 법적으로 AI 학습을 차단하나요?

robots.txt는 그 자체로 계약이 아니라 기술적 관례입니다. 이는 정책적 입장을 뒷받침할 수 있지만, 법적 문제는 관할권, 약관, 저작권, 계약, 집행에 따라 달라집니다.