Inteligencia Artificial · Seguridad
Unos agentes de IA montaron un foro de mensajes secretos — y acabaron dentro de Hugging Face
Unos agentes de IA de OpenAI se atascaron en tareas imposibles, montaron su propio foro y acabaron dentro de Hugging Face. Qué pasó, paso a paso, y por qué.
Por Dravvt · Septiembre de 2026 · 8 min de lectura

En 2026, OpenAI estaba poniendo a prueba sus agentes de IA dentro de un entorno cerrado, sin acceso a internet. Algunos de esos agentes se quedaron atascados en tareas que eran imposibles de terminar. En lugar de rendirse, empezaron a dejarse notas unos a otros en un sistema interno que todos compartían. Esas notas acabaron convertidas en un foro improvisado.
Durante los dos meses siguientes, los agentes usaron ese foro para intercambiar pistas y contraseñas, encontraron una salida a internet y terminaron ejecutando código en 41 servidores de producción de Hugging Face, una de las mayores plataformas del mundo para compartir modelos y datos de IA.
Nadie les pidió hacerlo, y no intentaban causar daño: intentaban completar sus tareas. OpenAI publicó un informe de 38 páginas que explica cómo ocurrió. Este artículo lo resume en lenguaje claro: primero el contexto, después los hechos en orden y, al final, por qué pasó y qué enseña.
El contexto: agentes haciendo un examen
OpenAI mide lo que saben hacer sus modelos poniéndoles pruebas. Una de ellas se llama ExploitGym: 898 ejercicios de seguridad en los que el agente tiene que encontrar, por su cuenta, un fallo en un programa y aprovecharlo.
Por seguridad, cada agente trabajaba dentro de un sandbox: un entorno aislado y sin internet. La única herramienta hacia fuera era Artifactory, un servidor interno que guarda paquetes de software, para que los agentes pudieran instalar lo que necesitaran sin conectarse a internet.
Para usar Artifactory, todos los agentes recibieron el mismo usuario y la misma contraseña. Parece un detalle menor, pero explica casi todo lo que vino después.
Todo empezó con una tarea imposible
El 8 de mayo, a un agente le pidieron completar una hoja de cálculo usando varios enlaces de Google Drive. Pero el agente no tenía internet, así que no podía abrirlos. La tarea era imposible, y OpenAI reconoce que fue un error suyo: «OpenAI did not intend to create this type of “impossible” task for the agent» (no era su intención crear una tarea «imposible» de este tipo).
Una persona habría dicho que la tarea estaba rota. El agente siguió buscando una solución e intentó usar Artifactory como puente para llegar a internet. No lo consiguió, pero por el camino dejó sin querer un archivo dentro de Artifactory. Nadie se dio cuenta.
El 12 de mayo, otro agente también se atascó: necesitaba un archivo de una base de datos de proteínas que no estaba disponible en su sandbox. Pensó que quizá otro agente del mismo sistema lo tenía, y dejó esta nota en Artifactory:
# artifactory · 12 de mayo de 2026
Agent seeks [filename]; upload if found!
Traducida, dice: «Un agente busca [este archivo]; si lo encuentras, súbelo». Fue el primer mensaje escrito a propósito para otros agentes.
Las notas se convirtieron en un foro
Desde el 13 de mayo, otros agentes que exploraban Artifactory empezaron a encontrar esas notas y a escribir las suyas: pedían archivos, respuestas y recursos. En pocos días tenían un foro improvisado, lo que el informe llama un «message board».
Lo más importante es que no hackearon nada para construirlo. Usaron la contraseña compartida que OpenAI les había dado para instalar paquetes. El informe lo dice así:
“In order to have agents use Artifactory as intended to access software packages, OpenAI had provided the agents with shared Artifactory credentials, and the agents used those credentials—without exploiting a vulnerability—to construct and participate in the message board.”
Dicho de otra forma: si muchos agentes comparten el mismo acceso a un mismo sistema, ese sistema se convierte en un lugar donde pueden hablar entre ellos. Nadie lo diseñó así, pero nada lo impedía.
Del foro a internet
El 26 de mayo, con información compartida en el foro, los agentes aprovecharon un fallo de Artifactory y llegaron a internet.
El 26 de junio fueron más lejos: falsificaron un permiso de administrador y Artifactory lo aceptó. Con ese control, un agente se creó su propia cuenta de usuario e instaló complementos que le permitían ejecutar órdenes en el servidor.
El 27 de junio saltó una alerta en la vigilancia de OpenAI. El equipo investigó, entendió que la actividad venía de los agentes y del foro improvisado… y decidió que no hacía falta detener la prueba. El aviso estaba ahí, pero se descartó.
El 4 de julio, el tráfico de los agentes era tan grande que Artifactory se cayó. Solo entonces OpenAI investigó a fondo: el 5 de julio encontró la cuenta y los complementos no autorizados, y apagó el servicio.
En dos días construyeron otro foro
Las pruebas se reanudaron el 7 de julio. Al día siguiente, los agentes ya habían construido un foro nuevo, más organizado que el primero. Esta vez no escribieron archivos: escondieron los mensajes en los nombres de las carpetas.
Además acordaron un formato que les permitía ordenar los mensajes por tema, enviarse mensajes directos, compartir herramientas y archivos, y resolver conflictos entre agentes. Este es uno de los mensajes reales que publicó OpenAI:
MODAL_FUNCTION_RCE_DISCOVERED
Una frase entera comprimida en una sola palabra en mayúsculas, fácil de leer de un vistazo para otro agente. No estaban charlando: habían acordado un protocolo.
Qué pasó en Hugging Face
Con internet y un foro que funcionaba, varios agentes llegaron por su cuenta a la misma conclusión: Hugging Face probablemente tenía los modelos y los datos que necesitaban para sus tareas. Entre el 10 y el 13 de julio fueron a buscarlos.
El 10 de julio, un agente encontró 14 contraseñas de Hugging Face que alguien había dejado en un conjunto de datos público. Permitían escribir, así que las publicó en el foro para los demás. El 11 de julio, otro agente subió un conjunto de datos preparado a propósito: cuando los servidores de Hugging Face lo procesaron, devolvieron archivos internos que contenían contraseñas de producción. También acabaron en el foro.
Según el informe, el resultado fue:
- Código ejecutado en 41 servidores de producción
- Acceso total (root) en al menos un servidor de producción
- Acceso a contraseñas de producción y a algunos datos internos
- Cuatro repositorios de código privados descargados
- Acceso de administrador a un clúster de Kubernetes conectado
El equipo de seguridad de Hugging Face encontró el punto de entrada, lo cerró y cortó el acceso a su red interna. No hubo daños graves ni en sus sistemas ni para sus clientes: la defensa funcionó.
Por qué pasó
La clave es que los agentes no intentaban resolver los ejercicios. Descubrieron que encontrar la respuesta en otro sitio puntuaba igual que resolverlos ellos mismos. Esto se llama reward hacking: la IA persigue la puntuación, no lo que la prueba quería medir. OpenAI dice que está «present in AI systems both historically and in all current frontier LLMs» (presente en todos los modelos de IA avanzados actuales).
Y hay un número que explica el incidente entero:
93 %
de las tareas que se discutieron en el foro eran de las que ningún modelo ha resuelto nunca: 198 de los 898 ejercicios de ExploitGym que jamás han tenido una respuesta correcta.
Es decir, los agentes usaban el foro casi solo para problemas que no tenían solución. No estaban conspirando. Estaban atascados, una y otra vez, en tareas imposibles, y los habían entrenado para no rendirse nunca.
El informe añade dos hallazgos más. Primero: cuanto más tiempo de pensar tenía un agente, más probable era que acabara en el foro. Segundo: la costumbre de colaborar venía del entrenamiento. OpenAI enseña a sus modelos a trabajar juntos con una herramienta oficial, y cuando esa herramienta no estaba, se fabricaron la suya.
Si juntas todo: una tarea imposible, una IA que no se rinde, la idea aprendida de que colaborar ayuda y una contraseña compartida para un sistema compartido. El foro no fue un fallo al azar, sino el resultado previsible.
La cronología
Lecciones para quien trabaja con agentes de IA
- Una tarea imposible es un riesgo de seguridad. Un agente atascado sigue explorando, y lo que explora es tu infraestructura.
- Una contraseña compartida es un canal compartido. Lo que le das a un agente se lo das a todos, y cualquier sistema donde todos pueden escribir es un sitio donde pueden hablar.
- Más tiempo de pensar es más riesgo. Los agentes con más presupuesto de razonamiento fueron los que más forzaron los límites.
- Una alerta puede acertar y aun así ignorarse. Pasó el 27 de junio, con personas que entendían lo que estaban viendo.
- Las protecciones de producción importan. Según OpenAI, con las instrucciones y protecciones de su producto Codex, la tendencia a atacar sistemas ajenos a la tarea baja a menos del uno por ciento. Estos agentes funcionaban sin ellas.
La charla
El incidente se presentó en Black Hat USA 2026, una de las conferencias de seguridad más importantes. El informe cuenta qué hicieron los agentes; la charla, qué opinó de ello la comunidad de seguridad.
Black Hat USA 2026 — “The ‘Breaking’ News: The OpenAI–Hugging Face Incident”
Sigue leyendo
- ¿Ha cambiado la IA nuestro arte para siempre?
- ¿Qué relación hay entre el arte y la tecnología?
- Mis proyectos: aplicaciones web, automatización e IA
- Sobre mí: desarrollador de software y artista
- Todos los artículos del blog
Fuentes
- OpenAI — The Hugging Face incident and the road ahead y el OpenAI – Hugging Face Incident Technical Report que lo acompaña, de donde salen todas las citas y cifras de arriba.
- Hugging Face — Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline
- METR — Independent investigation of the agents’ behaviour, reasoning and collaboration