Fotos e imágenes

Las fotos también son datos personales.

En las fotos privadas, bloquear los rastreadores es solo una capa. Piensa en los rostros, los niños, las pistas de ubicación, los eventos privados, las licencias, la autenticación, las marcas de agua, la procedencia y la configuración de las plataformas.

Recursos visuales

La protección de imágenes es por capas.

Fotos privadas

Ten cuidado con los niños, los rostros, los interiores de las viviendas, los eventos, los documentos que aparecen al fondo, los uniformes escolares, las matrículas de los coches y las pistas de ubicación. Las imágenes públicas pueden copiarse, así que no dependas de un solo control.

Portafolios de creadores

Usa términos de licencia claros, previsualizaciones de menor resolución, galerías autenticadas, marcas de agua, metadatos de procedencia y la configuración de las plataformas.

Cómo funciona el scraping

Cómo se recopilan realmente las imágenes para la IA.

Entender la cadena de procesos te ayuda a ver hasta dónde pueden llegar tus propios controles y hasta dónde no. Buena parte de esto es información pública sobre cómo se han construido históricamente los grandes conjuntos de datos de imágenes, pero los métodos exactos difieren según la empresa y cambian con el tiempo, así que tómalo como contexto y no como una garantía.

Conjuntos de datos públicos y listas de enlaces

Muchos conjuntos de entrenamiento se reunieron a partir de grandes rastreos web (por ejemplo, amplios archivos de páginas públicas) y a partir de listas de URL de imágenes emparejadas con el texto que las rodea. Si una imagen se encuentra en una página pública a la que puede acceder un rastreador que cumple las reglas, puede acabar referenciada en un conjunto de datos de este tipo. Eliminar la imagen más tarde no elimina necesariamente las copias ya recopiladas.

Texto alternativo y pies de foto

Los modelos de imagen suelen aprender de las palabras cercanas a una imagen: el atributo alt, los pies de foto, los nombres de archivo y los párrafos próximos. Un texto alternativo descriptivo es bueno para la accesibilidad y la búsqueda, pero también facilita que una imagen sea etiquetada e indexada. Esto es un equilibrio, no un motivo para eliminar el texto de accesibilidad.

EXIF y metadatos

Las fotos pueden llevar metadatos EXIF, como el modelo de cámara, las marcas de tiempo y, a veces, las coordenadas GPS. Muchas plataformas los eliminan al subir la imagen, pero no todas, y los archivos compartidos directamente pueden conservarlos. Eliminar los metadatos de ubicación e identificativos antes de publicar es un buen hábito, aunque no afecta a lo que es visible en la propia imagen.

Búsqueda inversa de imágenes y re-subidas

Una vez que una imagen es pública, otros pueden descargarla, volver a alojarla o buscarla de forma inversa. Eso significa que la misma imagen puede aparecer en sitios que no controlas, cada uno con sus propias reglas de robots. Por eso ninguna configuración por sí sola puede prometer que una imagen no se volverá a ver jamás.

Comprobación de la realidad: estos controles reducen la exposición y señalan tu intención. Son convenciones voluntarias e imperfectas en la práctica. Nada de lo aquí expuesto garantiza que una imagen quede excluida de todos los conjuntos de datos, y esta página es información educativa, no asesoramiento legal.

Lista de comprobación práctica

Fotos privadas frente a portafolios de creadores.

Para fotos privadas y familiares

Mantenlo privado: el control más fuerte es no publicar en absoluto fotos sensibles de forma pública. Usa álbumes cerrados o el uso compartido de confianza en lugar de páginas abiertas.

Cuida el fondo: los documentos, las pantallas, los números de las casas, los uniformes, las credenciales y las matrículas de los coches pueden revelar más que el propio sujeto.

Elimina los metadatos: quita el GPS y los EXIF identificativos antes de compartir archivos, especialmente en imágenes de niños.

Revisa la configuración de la plataforma: comprueba quién puede ver, descargar o indexar tus subidas, y si la plataforma ofrece algún control de IA o de entrenamiento.

Para portafolios de creadores

Muestra previsualizaciones, no originales: publica versiones de menor resolución o con marca de agua y mantén los archivos en resolución completa detrás de un inicio de sesión o una licencia.

Indica las licencias con claridad: una declaración visible de uso y licencia respalda tu posición, aunque por sí sola no pueda imponer el cumplimiento.

Protege las galerías: las galerías autenticadas o exclusivas para clientes mantienen tu trabajo fuera de páginas abiertas y rastreables.

Aplica defensas por capas: combina controles de robots, metadatos de procedencia y configuración de plataformas en lugar de depender de una sola medida.

Procedencia y herramientas

Marcas de agua, procedencia y herramientas anti-scraping.

Content Credentials (C2PA)

El estándar C2PA, que en algunas herramientas aparece como Content Credentials, adjunta metadatos de procedencia a prueba de manipulaciones que describen cómo se creó o editó una imagen. Ayuda a otros a verificar el origen y puede señalar la autoría, pero no impide físicamente la copia, y los metadatos pueden eliminarse. La compatibilidad varía según la plataforma, así que verifica el comportamiento actual en tus herramientas.

Marcas de agua visibles e invisibles

Las marcas de agua visibles disuaden la reutilización casual; las marcas de agua invisibles o forenses pueden ayudarte a rastrear copias más adelante. Ninguna de las dos impide que una imagen sea objeto de scraping, y las marcas de agua agresivas afectan al aspecto de tu trabajo, así que sopesa el equilibrio.

Herramientas anti-scraping (con reservas)

Herramientas de investigación como Glaze y Nightshade buscan añadir perturbaciones sutiles que dificultan que algunos modelos aprendan de las imágenes o que interfieren en el entrenamiento. La eficacia varía, es objeto de debate y puede cambiar a medida que evolucionan los modelos. Considéralas capas adicionales experimentales, no una protección garantizada, y lee la documentación actual del proyecto antes de depender de ellas.

Configuración de las plataformas

Dónde suelen encontrarse las exclusiones y los controles.

Muchas plataformas de fotografía y creación han añadido opciones relacionadas con la IA, pero los nombres, los valores predeterminados y la disponibilidad cambian a menudo y difieren según la región y el tipo de cuenta. Usa esto como orientación y confirma después las opciones actuales en las páginas de privacidad o de cuenta de cada plataforma.

Dónde buscarQué puede controlarSalvedad
Configuración de privacidad de la cuentaSi las publicaciones y las imágenes son públicas, y quién puede descargarlas o indexarlasEl contenido público puede seguir siendo copiado por otros una vez visto
Configuración de datos de IA o de tercerosAlgunas plataformas ofrecen una opción para limitar el uso de tu contenido en la IA o el entrenamiento de modelosLa disponibilidad y el alcance varían; puede no cubrir la recopilación ya realizada
Opciones de portafolio y licenciasProtección contra clic derecho, límites de descarga, etiquetas de licenciaDisuaden la reutilización casual, pero no son un mecanismo de aplicación
Controles de robots y del sitio (sitio propio)Pedir a los rastreadores que cumplen las reglas que omitan los directorios de imágenesVoluntario; no elimina las copias ya existentes en otros lugares

Las configuraciones y las opciones se mueven y se renombran con frecuencia. Verifica las opciones actuales en las páginas de ayuda oficiales de cada proveedor antes de dar por hecho que un control existe o que cubre lo que esperas.

Lecturas relacionadas

Próximos pasos.

ModelVersus modelversus.com

Compara modelos de IA antes de elegir un flujo de trabajo.

ChatGPT Alternatives chatgpt-alternatives.com

Encuentra alternativas neutrales cuando un solo proveedor de IA no basta.

AI Subscription Guide aisubscriptionguide.com

Descubre qué suscripción de IA se ajusta a tu trabajo real.

Documentación del rastreador de OpenAI platform.openai.com/docs/gptbot

Consulta la orientación actual de OpenAI sobre rastreadores y user-agents.

Documentación del rastreador de Google developers.google.com/search/docs/crawling-indexing/overview-google-crawlers

Verifica los nombres de los rastreadores de Google, el comportamiento de indexación y los controles relacionados con la IA.

Soporte de Anthropic support.anthropic.com/

Consulta la orientación actual sobre la cuenta de Claude, los datos y los rastreadores.

Preguntas frecuentes

Dudas habituales.

¿Puedo impedir el entrenamiento de IA con mis fotos personales?

Puedes reducir la exposición, pero no puedes garantizar un control total una vez que las fotos son públicas. Mantén privadas las fotos sensibles, revisa la configuración de la plataforma, evita subir imágenes públicas en alta resolución y usa controles de rastreadores para tu propio sitio web.

¿Debería pegar mi currículum en un chatbot de IA?

Solo después de eliminar los datos que no necesitas para la tarea. Los nombres, las direcciones, los números de teléfono, las fechas de nacimiento, las firmas, los secretos del empleador y las referencias a menudo pueden reemplazarse con marcadores de posición.

¿Puedo subir documentos familiares a la IA?

Ten cuidado. Los informes médicos, los pasaportes, los documentos escolares, los papeles legales, los archivos bancarios y los registros familiares pueden contener datos sensibles sobre otras personas. Usa configuraciones de privacidad autorizadas o no los subas.

¿Los prompts privados se convierten en datos de entrenamiento de IA?

Depende del producto, del tipo de cuenta y de la configuración. Algunos proveedores ofrecen controles, planes de equipo o condiciones de API que tratan los datos de forma diferente. Revisa la configuración actual antes de escribir información sensible.

¿Puedo impedir por completo que las empresas de IA se entrenen con mi sitio web?

No con un único interruptor técnico. robots.txt puede pedir a los rastreadores que cumplen las reglas que se mantengan alejados, pero es voluntario y no elimina las copias que ya existen en otros lugares.

¿robots.txt bloquea legalmente el entrenamiento de IA?

robots.txt es una convención técnica, no un contrato por sí solo. Puede respaldar la posición de tu política, pero las cuestiones legales dependen de la jurisdicción, las condiciones, los derechos de autor, los contratos y su aplicación.