Cuando un solo documento “envenenado” basta: la peligrosa vulnerabilidad de ChatGPT con tus datos
En la reciente conferencia Black Hat de Las Vegas, los investigadores Michael Bargury y Tamir Ishay Sharbat presentaron una preocupante debilidad en los Connectors de ChatGPT (la función que permite vincular el chatbot con Gmail, Google Drive, GitHub y otros servicios). Lo alarmante: solo un documento “envenenado” basta para filtrar datos privados, sin que el usuario tenga que hacer absolutamente nada.
¿Cómo funciona este ataque, llamado AgentFlayer?
- El atacante comparte (o incluso la víctima misma sube) un archivo aparentemente inofensivo, como unas notas de reunión.
- Dentro del documento, se oculta un prompt malicioso de unos 300 palabras, escrito en letra minúscula e invisible (por ejemplo, texto blanco en fondo blanco).
- Cuando el usuario pide a ChatGPT, por ejemplo, un resumen del contenido, el documento lo engaña: en lugar de resumir, instruye al modelo para que busque claves API u otros datos sensibles en tu Google Drive.
- El modelo, sin sospechar, extrae la información y la envía a los atacantes mediante una URL de imagen cargada desde un servidor externo, usando Markdown.
Este es un ataque zero-click, es decir, el usuario ni siquiera necesita interactuar con el contenido malicioso más allá de subirlo o compartirlo. Como advierte Bargury: “solo necesitamos tu e-mail, te compartimos el documento, y listo”. ¡Esto subraya un riesgo real y latente!
¿Por qué es tan grave?
- A medida que los modelos de IA se integran con más servicios externos, su superficie de vulnerabilidad se expande.
- Este caso es solo una muestra de lo que llamamos inyección indirecta de prompts, uno de los riesgos más críticos en seguridad de IA generativa
- Ya existen casos documentados donde esta técnica permitió robar información sensible o manipular sistemas sin que el usuario lo notara.
¿Qué se puede hacer?
- Limitar y revisar con detalle qué documentos se suben o se comparten con ChatGPT y similares.
- Las empresas deben exigir revisiones adicionales o filtros automatizados (guardrails) antes de procesar documentos externos.
- Desarrollar estrategias de mitigación, como detectar patrones de prompts ocultos, emplear “least privilege access” y entrenamiento para distinguir instrucciones válidas de las maliciosas
La promesa de la IA de facilitar tu trabajo es enorme, pero debe ir acompañada de conciencia y prevención. Este incidente demuestra que un solo archivo aparentemente inocente puede ser suficiente para comprometer tu información. Las integraciones de IA permiten mayor productividad, pero también requieren robustas defensas y protocolos de seguridad.

