Si gestionas un blog personal, un portafolio, un sitio familiar o una pequeña página de creador, el bloqueo de rastreadores empieza por nombrar los user agents correctos y comprender que robots.txt es una petición, no un candado.
Bloquea los rastreadores de IA sin destruir la visibilidad útil.
Mantén la búsqueda separada
No copies una lista de bloqueo cualquiera en producción. Los rastreadores de búsqueda, los rastreadores de búsqueda con IA, los rastreadores de entrenamiento y los recuperadores activados por el usuario pueden tener finalidades distintas. Bloquear al agente equivocado puede ocultar tus páginas de herramientas que sigues queriendo.
Supervisa los registros
Los registros del servidor muestran quién visita realmente. Mantén un ciclo de revisión corto: añade reglas, observa el tráfico, comprueba si las páginas importantes siguen apareciendo donde esperas y, luego, ajusta.
User agent
Empresa
Por qué importa
Nota de cautela
GPTBot
OpenAI
Usado habitualmente para los controles de rastreo web de OpenAI.
Bloquéalo si no quieres que este rastreador obtenga tus páginas públicas para uso relacionado con IA. Verifica la documentación actual de OpenAI.
ChatGPT-User
OpenAI
Agente de navegación/obtención activado por el usuario en muchas discusiones.
Bloquearlo puede impedir que los usuarios de ChatGPT le pidan que lea tu página. Esta no es la misma intención que el rastreo amplio de entrenamiento.
Google-Extended
Google
Un control que Google documenta para algunos casos de uso de IA generativa.
Esto no es lo mismo que bloquear la Búsqueda de Google. No bloquees Googlebot a menos que quieras que se vea afectada tu visibilidad en la búsqueda.
ClaudeBot
Anthropic
Nombre del rastreador de Anthropic que aparece en las discusiones sobre control de rastreadores.
Úsalo solo tras consultar la documentación más reciente de Anthropic.
Claude-SearchBot
Anthropic
Nombre del rastreador de Claude relacionado con la búsqueda que aparece en la orientación pública.
Sopesa el equilibrio de visibilidad antes de bloquear agentes de tipo búsqueda.
PerplexityBot
Perplexity
Rastreador/user agent de Perplexity comentado por los editores.
Bloquearlo puede afectar a cómo tu contenido es descubierto o citado por motores de respuesta al estilo de Perplexity.
CCBot
Common Crawl
Rastreador web público usado para grandes conjuntos de datos web.
A menudo lo bloquean los editores que no quieren que sus páginas se copien en corpus de rastreo público.
Bytespider
ByteDance
Rastreador asociado con ByteDance.
Útil de revisar si quieres una lista de bloqueo amplia de rastreadores de IA.
Cómo te encuentran los rastreadores
Cómo descubren y obtienen tu sitio los rastreadores de IA.
Antes de poder bloquear un rastreador, ayuda saber cómo llega. Los recuperadores automatizados rara vez tropiezan con una página al azar; siguen una cadena de descubrimiento bastante predecible. Las descripciones siguientes son generales y simplificadas, y el comportamiento exacto de cualquier bot nombrado puede cambiar, así que verifícalo con la documentación oficial de cada proveedor antes de actuar.
Descubrimiento
Los rastreadores encuentran URLs siguiendo enlaces de otras páginas, leyendo tu sitemap XML, comprobando tu robots.txt y basándose en grandes conjuntos de datos de enlaces públicos. Una página nueva suele volverse accesible en el momento en que algo público enlaza con ella.
Obtención
Un rastreador envía una petición HTTP que se identifica con una cadena de user agent. Tu servidor puede inspeccionar esa cadena y decidir cómo responder, aunque los user agents pueden imitarse, así que trátalos como una señal en lugar de una prueba.
Frecuencia
Los rastreadores que se comportan bien vuelven a visitar periódicamente para recoger los cambios, y muchos respetan las indicaciones de crawl-delay o sus propios límites de frecuencia. Los que se comportan mal pueden obtener de forma agresiva, lo cual es una razón por la que la limitación de frecuencia importa junto a las reglas educadas.
Tres tipos de bots
Los rastreadores de búsqueda, los rastreadores de entrenamiento de IA y los bots de recuperación en vivo no son lo mismo.
Muchos errores de bloqueo provienen de tratar a todos los bots como idénticos. Las tres categorías siguientes se solapan en su mecánica, pero difieren en su finalidad, y bloquear una puede tener consecuencias muy distintas de bloquear otra. La nomenclatura y el comportamiento evolucionan, así que confirma el papel actual de cualquier agente concreto antes de basarte en este esquema.
Tipo
Qué hace
Efecto del bloqueo
Rastreador de búsqueda
Indexa páginas para que puedan aparecer en los resultados de un motor de búsqueda.
Bloquearlo puede eliminarte de ese motor de búsqueda. Normalmente no es lo que quieres.
Rastreador de entrenamiento de IA
Obtiene páginas para construir o mejorar conjuntos de datos de entrenamiento de modelos de IA.
Bloquearlo pide al proveedor que no use tus páginas públicas para el entrenamiento. Este es el objetivo principal para la mayoría de la gente aquí.
Bot de recuperación en vivo de IA
Obtiene una página bajo demanda cuando un usuario pide a un asistente de IA que la lea o la cite.
Bloquearlo puede impedir que tu página se lea o cite en tiempo real, lo que afecta a la visibilidad en los motores de respuesta en lugar de al entrenamiento.
El equilibrio que merece la pena nombrar.
Los rastreadores de entrenamiento y los bots de recuperación en vivo son los que la mayoría de la gente entiende por "bots de IA", pero algunos también impulsan el descubrimiento y la citación. Decide deliberadamente si quieres que te entrenen, que te citen, ambas cosas o ninguna, porque esas son opciones separadas.
Un enfoque por capas
El bloqueo funciona mejor por capas, porque ninguna capa es completa por sí sola.
Piensa en el bloqueo como una defensa en profundidad en lugar de un único interruptor. Cada capa detecta casos que las demás pasan por alto, y cada una tiene límites honestos. Empieza por las capas educadas y de bajo riesgo, y añade otras más estrictas solo donde el equilibrio lo merezca.
1. robots.txt
Un archivo de texto plano que pide a los rastreadores nombrados que no obtengan las rutas listadas. Los bots que cumplen las reglas lo respetan; los que no las cumplen lo ignoran. Es el primer paso estándar y el menos disruptivo.
2. Meta robots y X-Robots-Tag
Una metaetiqueta a nivel de página o una cabecera de respuesta HTTP puede pedir que el contenido no se indexe ni se use de determinadas maneras. El soporte varía según el bot, así que trata directivas como noai como peticiones, no como garantías.
3. WAF, cortafuegos y límites de frecuencia
Un firewall de aplicaciones web o un limitador de frecuencia puede bloquear o ralentizar el tráfico por user agent, rango de IP o comportamiento. A diferencia de robots.txt, esto sí se aplica de verdad en el servidor, aunque requiere cuidado para no atrapar a visitantes legítimos.
4. Muros de autenticación
El contenido tras un inicio de sesión no se puede obtener públicamente, lo que constituye la forma más fiable de mantener fuera del todo a los rastreadores ocasionales. El coste es fricción para los usuarios reales, así que resérvalo para el material que realmente lo necesita.
Las plataformas gestionadas añaden otra opción. Algunos proveedores, como los servicios de tipo Cloudflare, ofrecen controles integrados que identifican y bloquean categorías de bots de IA por ti. Estos pueden resultar cómodos, pero sigues dependiendo de la precisión de detección y las definiciones del proveedor, así que verifica qué hace realmente un interruptor determinado antes de confiar en él.
# robots.txt — una primera capa educada (verifica los nombres de agente actuales)
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# Mantén la búsqueda normal en funcionamiento: NO bloquees Googlebot de forma general
User-agent: Googlebot
Allow: /
# Ejemplo de cabecera de respuesta HTTP (configuración de servidor o WAF)
X-Robots-Tag: noai, noimageai
Por qué el bloqueo es imperfecto
Límites honestos: qué puede y qué no puede hacer el bloqueo.
Sería engañoso presentar cualquiera de estas técnicas como infalible. Reducen de forma significativa el rastreo no deseado, pero no hacen que tu contenido sea inaccesible. Fijar las expectativas correctamente forma parte de hacer esto de manera responsable.
robots.txt y directivas similares son voluntarias. Los rastreadores que cumplen las reglas las respetan; otros pueden simplemente ignorarlas.
Las copias hechas antes de añadir una regla pueden persistir en cachés, archivos y conjuntos de datos que no puedes alcanzar.
Las cadenas de user agent pueden falsificarse, así que una lista de bloqueo por nombre no atrapará a un bot que finge ser un navegador corriente.
Las reglas demasiado amplias pueden perjudicar accidentalmente la visibilidad en la búsqueda o bloquear herramientas que en realidad quieres.
La aplicación a nivel de servidor es más fuerte que las reglas educadas, pero puede producir falsos positivos que bloqueen a personas reales.
Nada de esto es asesoramiento legal, y los controles técnicos no resuelven por sí solos cuestiones de derechos de autor, contrato o jurisdicción.
Un objetivo realista.
Aspira a hacer que el rastreo no deseado de IA sea notablemente menos cómodo y a documentar claramente tu preferencia declarada. Eso es alcanzable. La exclusión garantizada y universal no lo es.
Vigila tus registros
Cómo supervisar los registros del servidor en busca de user agents de IA.
Las reglas solo son útiles si compruebas si funcionan. Los registros de acceso de tu servidor recogen quién solicitó qué, cuándo y con qué cadena de user agent. Una revisión breve y regular te indica qué bots visitan realmente y si tus reglas se están respetando. Recuerda que los user agents pueden imitarse, así que trata los registros como pruebas por interpretar en lugar de como verdad absoluta.
Qué buscar
Rastrea en busca de cadenas de user agent de IA conocidas como GPTBot, CCBot, ClaudeBot, PerplexityBot y Bytespider. Anota su volumen de peticiones y qué rutas obtienen.
Señales de problemas
Vigila a los agentes que solicitan tu sitio de forma intensa después de que los hayas rechazado, a los agentes desconocidos que obtienen muchas páginas rápidamente, o a las cadenas de navegador genéricas que acceden a URLs que ningún humano visitaría.
Qué hacer a continuación
Si un bot que cumple las reglas ignora una regla, vuelve a comprobar tu sintaxis. Si un bot ignora realmente robots.txt, considera una regla de cortafuegos o de límite de frecuencia, aceptando el riesgo añadido de falsos positivos.
# Ejemplo aproximado: contar peticiones por user agent relacionado con IA
grep -Ei "GPTBot|CCBot|ClaudeBot|PerplexityBot|Bytespider" access.log \
| awk '{print $NF}' | sort | uniq -c | sort -rn
Despliegue paso a paso
Un despliegue prudente que puedes revertir.
Como una regla equivocada puede perjudicar de forma silenciosa la visibilidad legítima, despliega los cambios de manera gradual y observa el efecto en cada paso. La secuencia siguiente prioriza la reversibilidad sobre la rapidez, que es la prioridad correcta para la mayoría de los sitios personales y pequeños.
Punto de partida: revisa tus registros actuales para saber qué bots visitan antes de cambiar nada.
Decide la intención: elige si quieres quedar excluido del entrenamiento, de la recuperación en vivo o de ambas cosas, y confirma que mantienes la búsqueda normal intacta.
Empieza de forma educada: añade reglas de robots.txt para los rastreadores de entrenamiento de IA concretos que quieras excluir, usando nombres que hayas verificado con la documentación oficial.
Añade controles a nivel de página: donde sea compatible, añade directivas meta robots o X-Robots-Tag para un control más fino.
Observa: espera una o dos semanas y vuelve a comprobar los registros y la visibilidad en la búsqueda para confirmar que no se ha roto nada importante.
Aplica de forma selectiva: solo para los bots que ignoran las reglas educadas, añade reglas de cortafuegos o de límite de frecuencia, probando con cuidado para evitar falsos positivos.
Revisa según un calendario: vuelve a ello cada pocos meses, ya que los nombres de los rastreadores, las políticas de los proveedores y tus propias prioridades cambian con el tiempo.
¿Puedo impedir el entrenamiento de IA con mis fotos personales?
Puedes reducir la exposición, pero no puedes garantizar un control total una vez que las fotos son públicas. Mantén privadas las fotos sensibles, revisa la configuración de la plataforma, evita las subidas públicas en alta resolución y usa controles de rastreadores para tu propio sitio web.
¿Debería pegar mi CV o currículum en un chatbot de IA?
Solo después de eliminar los detalles que no necesites para la tarea. Nombres, direcciones, números de teléfono, fechas de nacimiento, firmas, secretos del empleador y referencias a menudo pueden sustituirse por marcadores de posición.
¿Puedo subir documentos familiares a una IA?
Ten cuidado. Cartas médicas, pasaportes, documentos escolares, papeles legales, archivos bancarios y registros familiares pueden contener datos sensibles sobre otras personas. Usa configuraciones de privacidad aprobadas o no los subas.
¿Los prompts privados se convierten en datos de entrenamiento de IA?
Depende del producto, el tipo de cuenta y la configuración. Algunos proveedores ofrecen controles, planes de equipo o condiciones de API que tratan los datos de forma distinta. Comprueba la configuración actual antes de escribir información sensible.
¿Puedo impedir por completo que las empresas de IA entrenen con mi sitio web?
No con un único interruptor técnico. robots.txt puede pedir a los rastreadores que cumplen las reglas que se mantengan alejados, pero es voluntario y no elimina las copias que ya existen en otros lugares.
¿robots.txt bloquea legalmente el entrenamiento de IA?
robots.txt es una convención técnica, no un contrato por sí mismo. Puede respaldar tu posición de política, pero las cuestiones legales dependen de la jurisdicción, las condiciones, los derechos de autor, los contratos y la aplicación.