Guía para personas particulares

Mantenga sus datos personales fuera del entrenamiento de IA donde pueda.

Esto es ante todo para personas normales: su blog, fotos, CV, documentos familiares, notas privadas, trabajos escolares, archivos de clientes, publicaciones en redes sociales y prompts. Aprenda qué puede bloquear, qué solo puede reducir y qué nunca debería subir sin pensarlo.

Respuesta rápida

Para las personas particulares, «bloquear el entrenamiento de IA» suele significar cuatro cosas distintas.

La medida más segura no es solo un bloqueo de rastreo. Consiste en saber qué no publicar, qué no pegar, qué ajustes de cuenta comprobar y cuándo un archivo debe quedar totalmente fuera de las herramientas de IA.

01

Mis prompts

No pegue nombres, direcciones, contraseñas, datos de salud, problemas legales, información sobre menores ni datos de trabajo confidenciales, salvo que la herramienta y la cuenta estén aprobadas para ese uso.

02

Mis archivos

Redacte CV, contratos, archivos bancarios, informes médicos, documentos escolares y PDF de clientes. Si los datos pertenecen a otra persona, trátelos como de mayor riesgo.

03

Mis fotos

Las fotos públicas pueden contener rostros, ubicaciones, nombres, matrículas y eventos privados. Mantenga privados los álbumes sensibles y piénselo antes de subir imágenes a herramientas de IA.

04

Mi sitio web

Si gestiona un blog o un portafolio, robots.txt y las reglas del servidor pueden pedir que los rastreadores de IA que cumplen las normas se mantengan al margen. No borran las copias antiguas.

Lista de comprobación para personas particulares

Antes de usar IA con datos personales.

Hágase estas preguntas antes de subir o pegar algo. Si alguna respuesta le resulta incómoda, use marcadores de posición, elimine el archivo o utilice una cuenta más controlada.

¿Esto me identifica a mí? Nombre, dirección, teléfono, correo electrónico, firma, cumpleaños, número de pasaporte, rostro, voz o ubicación exacta.

¿Identifica a otra persona? Menores, pareja, cliente, paciente, estudiante, colega, inquilino, empleado o cliente.

¿Lo publicaría en internet? Si no, no trate un prompt de IA cualquiera como un cuaderno privado seguro.

¿Puedo sustituir los datos? Use «Persona A», «Empresa B», fechas ficticias, ubicaciones amplias y extractos abreviados cuando no se necesiten los datos exactos.

¿Conozco la configuración de la cuenta? Las cuentas de consumo, de equipo, de API y enterprise pueden tratar los datos de forma distinta. Compruebe la configuración actual.

Capas técnicas

Tras los hábitos personales, use el control adecuado para cada lugar.

01

Rastreo de sitios web públicos

Use robots.txt, registros del servidor, reglas de cortafuegos y una política de contenido visible. Esto reduce el rastreo que cumple las normas, pero no elimina las copias antiguas ni detiene a los actores malintencionados.

02

Entrenamiento en apps y cuentas

Use los controles de datos del proveedor, los ajustes del historial de chat, los planes de equipo, las condiciones de API, las opciones de retención y las exclusiones. Esto es independiente del bloqueo de rastreadores.

03

Exposición de datos de trabajo y de clientes

Use el permiso del cliente, la política de la empresa, la redacción, herramientas aprobadas y control de acceso antes de subir archivos de clientes, registros de HR o documentos confidenciales.

Mapa de decisiones

¿Qué debería proteger primero?

Empiece por el lugar donde sus datos quedan disponibles. Un prompt, un blog público, un PDF privado, un álbum de fotos, una unidad en la nube y un documento de trabajo son superficies de riesgo diferentes.

  1. Clasifique el contenido. Una publicación pública, una nota privada, una foto, un currículum, un trabajo escolar, datos de clientes, código fuente y datos médicos o legales requieren un tratamiento distinto.
  2. Elija el control adecuado. Redacción para los prompts, ajustes de privacidad para las apps, robots.txt para los rastreadores web que cumplen las normas, autenticación para las áreas privadas, contratos para los proveedores.
  3. Revise con regularidad. Compruebe la configuración de las cuentas, revise las páginas públicas, mantenga una lista de agentes bloqueados y reconsidere sus decisiones cuando los proveedores de IA cambien sus productos.

No basta: «Hice clic en excluirme una vez».

Un hábito de privacidad útil es aburrido pero potente: subir menos, redactar más, mantener privados los álbumes privados, comprobar los ajustes y usar bloqueos de rastreo solo donde encajen.

Matriz de rastreadores

Controles habituales de rastreadores de IA que conviene revisar.

User-agentEmpresaPor qué importaNota de precaución
GPTBotOpenAIDe uso común para los controles de rastreo web de OpenAI.Bloquéelo si no quiere que este rastreador recupere sus páginas públicas para uso relacionado con IA. Verifique la documentación actual de OpenAI.
ChatGPT-UserOpenAIAgente de navegación/recuperación activado por el usuario en muchos debates.Bloquearlo puede impedir que los usuarios de ChatGPT le pidan que lea su página. Esto no tiene la misma intención que el rastreo amplio de entrenamiento.
Google-ExtendedGoogleUn control que Google documenta para algunos casos de uso de IA generativa.Esto no es lo mismo que bloquear la Búsqueda de Google. No bloquee Googlebot salvo que quiera que su visibilidad en la búsqueda se vea afectada.
ClaudeBotAnthropicNombre del rastreador de Anthropic que aparece en los debates sobre control de rastreadores.Úselo solo tras comprobar la documentación más reciente de Anthropic.
Claude-SearchBotAnthropicNombre del rastreador de Claude relacionado con la búsqueda que aparece en las guías públicas.Considere la contrapartida de visibilidad antes de bloquear los agentes de tipo búsqueda.
PerplexityBotPerplexityRastreador/user-agent de Perplexity comentado por los editores.Bloquearlo puede afectar a cómo se descubre o cita su contenido en los motores de respuesta de tipo Perplexity.
CCBotCommon CrawlRastreador web público usado para grandes conjuntos de datos web.A menudo lo bloquean los editores que no quieren que sus páginas se copien en corpus de rastreo públicos.
BytespiderByteDanceRastreador asociado con ByteDance.Útil de revisar si quiere una lista amplia de bloqueo de rastreadores de IA.

Herramienta estática

Cree un fragmento inicial de robots.txt prudente.

Seleccione los rastreadores a los que quiere pedir que no rastreen. Este generador se ejecuta solo en su navegador. No envía datos a ningún sitio. Antes de implementarlo, verifique los nombres oficiales actuales de los user-agents.

# Controles de rastreadores de IA: verifique los nombres actuales de los user-agents antes de implementar.
# Esto es voluntario. robots.txt no es un candado legal.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: CCBot
Disallow: /

Advertencia: bloquear agentes activados por el usuario o relacionados con la búsqueda puede reducir el descubrimiento, las vistas previas o las citas asistidas por IA.

Referencias oficiales

Use páginas oficiales antes de confiar en una lista de bloqueo cualquiera.

Documentación del rastreador de OpenAI platform.openai.com/docs/gptbot

Consulte las orientaciones actuales de OpenAI sobre rastreadores y user-agents.

Documentación de rastreadores de Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Verifique los nombres de los rastreadores de Google, el comportamiento de indexación y los controles relacionados con IA.

Soporte de Anthropic support.anthropic.com/

Consulte las orientaciones actuales sobre cuentas, datos y rastreadores de Claude.

Perplexity www.perplexity.ai/

Revise la información actual de productos y para editores de Perplexity.

Common Crawl commoncrawl.org/

Comprenda uno de los grandes conjuntos de datos públicos de rastreo web usados en investigación.

Robots Exclusion Protocol www.rfc-editor.org/rfc/rfc9309

La referencia formal del protocolo robots.txt.

Guías relacionadas

Conecte esto con su flujo de trabajo de IA más amplio.

ModelVersus modelversus.com

Compare modelos de IA antes de elegir un flujo de trabajo.

ChatGPT Alternatives chatgpt-alternatives.com

Encuentre alternativas neutrales cuando un solo proveedor de IA no basta.

AI Subscription Guide aisubscriptionguide.com

Descubra qué suscripción de IA se adapta a su trabajo real.

KIWerkzeuge kiwerkzeuge.com

Directorio alemán de herramientas de IA y guías de herramientas de IA centradas en la privacidad.

BoiteAIA boiteaia.com

Directorio francés de herramientas de IA para chatbots, herramientas de imagen y uso empresarial.

MultipleChat AI multiplechat.ai

Use varios modelos de IA en una sola interfaz y mantenga los flujos de trabajo separados por proyecto.

FAQ

Preguntas que la gente hace antes de bloquear el entrenamiento de IA.

¿Puedo impedir el entrenamiento de IA con mis fotos personales?

Puede reducir la exposición, pero no puede garantizar un control total una vez que las fotos son públicas. Mantenga privadas las fotos sensibles, revise la configuración de la plataforma, evite subir imágenes públicas de alta resolución y use controles de rastreo para su propio sitio web.

¿Debería pegar mi CV o currículum en un chatbot de IA?

Solo después de eliminar los datos que no necesita para la tarea. Nombres, direcciones, números de teléfono, fechas de nacimiento, firmas, secretos del empleador y referencias suelen poder sustituirse por marcadores de posición.

¿Puedo subir documentos familiares a una IA?

Tenga cuidado. Informes médicos, pasaportes, documentos escolares, papeles legales, archivos bancarios y registros familiares pueden contener datos sensibles sobre otras personas. Use ajustes de privacidad aprobados o no los suba.

¿Los prompts privados se convierten en datos de entrenamiento de IA?

Depende del producto, el tipo de cuenta y la configuración. Algunos proveedores ofrecen controles, planes de equipo o condiciones de API que tratan los datos de forma distinta. Compruebe la configuración actual antes de escribir información sensible.

¿Puedo impedir por completo que las empresas de IA entrenen con mi sitio web?

No con un único interruptor técnico. robots.txt puede pedir que los rastreadores que cumplen las normas se mantengan al margen, pero es voluntario y no elimina las copias que ya existen en otros lugares.

¿robots.txt bloquea legalmente el entrenamiento de IA?

robots.txt es una convención técnica, no un contrato por sí mismo. Puede respaldar su posición de política, pero las cuestiones legales dependen de la jurisdicción, las condiciones, los derechos de autor, los contratos y su aplicación.

¿Bloquear los bots de IA perjudica el posicionamiento en Google?

Bloquear agentes específicos de IA no debe tratarse igual que bloquear Googlebot. Si bloquea los rastreadores de búsqueda normales, la visibilidad en la búsqueda puede verse afectada. Compruebe cada user-agent con cuidado.

¿Debería bloquear ChatGPT-User?

Solo si comprende la contrapartida. Los agentes activados por el usuario pueden recuperar páginas cuando una persona pide a una herramienta de IA que lea su sitio. Bloquearlos puede reducir el descubrimiento asistido por IA.

Leer todas las FAQ