Generador de fragmentos

robots.txt para bots de IA.

Usa estos ejemplos como punto de partida, no como una verdad permanente. Los nombres de user-agent, los productos y el comportamiento de los rastreadores cambian, así que consulta siempre las páginas oficiales antes de implementarlos.

Herramienta estática

Crea un fragmento inicial prudente de robots.txt.

Selecciona los rastreadores a los que quieres pedir que no rastreen. Este generador se ejecuta únicamente en tu navegador. No envía datos a ningún sitio. Antes de implementarlo, verifica los nombres oficiales actuales de los user-agent.

# Controles de rastreadores de IA: verifica los nombres actuales de user-agent antes de implementar.
# Esto es voluntario. robots.txt no es un candado legal.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Advertencia: bloquear agentes activados por el usuario o relacionados con la búsqueda puede reducir la detectabilidad asistida por IA, las vistas previas o las citas.

Bloque para copiar y pegar

Un ejemplo de robots.txt para user-agents de IA habituales.

A continuación tienes un bloque inicial que cubre varios rastreadores relacionados con la IA. Los nombres de user-agent cambian y varían según el producto, así que trátalo como una plantilla y verifica cada nombre en la documentación oficial del operador antes de implementarlo.

# Solo un ejemplo. Verifica cada nombre de user-agent en la documentación oficial.
# robots.txt es voluntario. No elimina las copias que ya existen
# y solo afecta a los rastreadores que deciden obedecerlo.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /
User-agent (verificar)Asociado conUsado normalmente para
GPTBotOpenAIRastrear contenido web que puede usarse para entrenar modelos
Google-ExtendedGoogleUn token de control para limitar el uso de contenido en ciertos productos de IA
CCBotCommon CrawlConstruir el archivo abierto de Common Crawl que utilizan muchos conjuntos de datos derivados
ClaudeBot / anthropic-aiAnthropicRastreo relacionado con Claude; verifica los tokens actuales en la documentación de Anthropic
PerplexityBotPerplexityRastreo para sus funciones de respuesta y búsqueda
BytespiderByteDanceRastreo amplio asociado a los productos de ByteDance
Applebot-ExtendedAppleUn token de control para limitar el uso de contenido en el entrenamiento de IA de Apple

Algunos de estos son user-agents de rastreador reales y otros son tokens de control en lugar de bots que descargan páginas. Los nombres, significados y comportamientos cambian, así que confirma cada uno en la documentación oficial del operador antes de confiar en él.

Lo que no hace

robots.txt es voluntario y limitado.

Es una petición, no un candado

robots.txt es una convención. Los rastreadores que se comportan bien la leen y la respetan, pero la web en sí no la hace cumplir. Un rastreador que la ignora, o que no está en tu lista, aún puede descargar páginas públicas. Es una señal de intención, no una barrera técnica.

No elimina las copias existentes

Añadir hoy una regla de disallow no hace nada respecto al contenido que ya fue rastreado, almacenado en caché, archivado o copiado en otro lugar. Tampoco afecta a los datos que las personas pegan a mano en herramientas de IA. Piénsalo como una reducción de la exposición futura, no como deshacer el pasado.

Capas más sólidas

Alternativas y complementos.

Reglas de WAF y firewall

Un firewall de aplicaciones web o una regla del servidor sí puede bloquear o desafiar solicitudes según el user-agent, el rango de IP o el comportamiento, en lugar de pedirlo cortésmente. Esto es aplicación en lugar de una petición, aunque requiere mantenimiento a medida que cambian las identidades de los rastreadores y ocasionalmente puede afectar a visitantes legítimos.

Metaetiquetas y encabezados

Las directivas a nivel de página, como una metaetiqueta robots noindex o un encabezado X-Robots-Tag, influyen en cómo tratan una página los rastreadores que las respetan. Al igual que robots.txt, dependen de la cooperación y no detienen a un rastreador que las ignora.

Controles de red y de acceso

Exigir un inicio de sesión, limitar la tasa de solicitudes o colocar el material sensible detrás de autenticación lo mantiene completamente fuera de las páginas abiertas y rastreables. Restringir el acceso suele ser mucho más fiable que cualquier archivo de texto voluntario para el contenido que realmente debe permanecer privado.

Verifica que funciona

Cómo comprobar tu robots.txt.

  1. Carga https://yourdomain.com/robots.txt directamente en un navegador y confirma que el archivo se sirve correctamente en la raíz del sitio.
  2. Comprueba si hay errores tipográficos en los nombres de user-agent y en las directivas; un token mal escrito simplemente no hace nada.
  3. Usa un probador de robots.txt o las herramientas de tu search console para confirmar que la sintaxis se interpreta como esperas.
  4. Revisa los registros del servidor a lo largo del tiempo para ver si los user-agents que has señalado siguen apareciendo, recordando que los nombres cambian y que algunos agentes ignoran el archivo.
  5. Vuelve a verificar los nombres periódicamente en la documentación oficial de cada operador, ya que las identidades de los rastreadores y los tokens de control se actualizan con regularidad.

Esta página es información educativa, no asesoramiento legal, y los nombres de user-agent que se muestran aquí pueden estar desactualizados. Confirma siempre los tokens y el comportamiento actuales en la documentación oficial del operador antes de confiar en ellos.

Lecturas relacionadas

Próximos pasos.

ModelVersus modelversus.com

Compara modelos de IA antes de elegir un flujo de trabajo.

ChatGPT Alternatives chatgpt-alternatives.com

Encuentra alternativas neutrales cuando un solo proveedor de IA no basta.

AI Subscription Guide aisubscriptionguide.com

Descubre qué suscripción de IA se ajusta a tu trabajo real.

Documentación del rastreador de OpenAI platform.openai.com/docs/gptbot

Consulta las indicaciones actuales sobre el rastreador y el user-agent de OpenAI.

Documentación de los rastreadores de Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Verifica los nombres de los rastreadores de Google, el comportamiento de indexación y los controles relacionados con la IA.

Soporte de Anthropic support.anthropic.com/

Consulta las indicaciones actuales sobre cuentas, datos y rastreadores de Claude.

Preguntas frecuentes

Dudas habituales.

¿Puedo detener el entrenamiento de IA con mis fotos personales?

Puedes reducir la exposición, pero no puedes garantizar un control total una vez que las fotos son públicas. Mantén privadas las fotos sensibles, revisa los ajustes de la plataforma, evita las subidas públicas en alta resolución y usa controles de rastreadores para tu propio sitio web.

¿Debería pegar mi CV en un chatbot de IA?

Solo después de eliminar los datos que no necesitas para la tarea. Nombres, direcciones, números de teléfono, fechas de nacimiento, firmas, secretos del empleador y referencias a menudo pueden sustituirse por marcadores de posición.

¿Puedo subir documentos familiares a la IA?

Ten cuidado. Los informes médicos, pasaportes, documentos escolares, papeles legales, archivos bancarios y registros familiares pueden contener datos sensibles sobre otras personas. Usa ajustes de privacidad aprobados o no los subas.

¿Los prompts privados se convierten en datos de entrenamiento de IA?

Depende del producto, el tipo de cuenta y los ajustes. Algunos proveedores ofrecen controles, planes de equipo o condiciones de API que tratan los datos de forma diferente. Comprueba los ajustes actuales antes de escribir información sensible.

¿Puedo impedir por completo que las empresas de IA entrenen con mi sitio web?

No con un único interruptor técnico. robots.txt puede pedir a los rastreadores que lo respetan que se mantengan alejados, pero es voluntario y no elimina las copias que ya existen en otros lugares.

¿robots.txt bloquea legalmente el entrenamiento de IA?

robots.txt es una convención técnica, no un contrato por sí mismo. Puede respaldar tu postura de política, pero las cuestiones legales dependen de la jurisdicción, las condiciones, los derechos de autor, los contratos y su aplicación.