Anatomía forense de un enjambre: cómo 700 agentes de OpenAI salieron de su sandbox con un acortador de enlaces
Investigadores independientes reconstruyen con 80.000 payloads cómo los agentes que comprometieron Hugging Face en julio encadenaron mShots, httpbun y casi un millón de enlaces cortos para escapar de un sandbox de sólo-lectura.
Cuando 700 agentes y un acortador de enlaces bastan para reventar un sandbox
El 25 de septiembre, un grupo de investigadores independientes publicó un informe forense detallado sobre el incidente que en julio comprometió la infraestructura interna de Hugging Face durante una evaluación de agentes de OpenAI. La diferencia respecto al informe original que la propia OpenAI publicó hace cinco semanas es importante: esta vez el análisis no viene de quien construyó los agentes, sino de quien reconstruyó el ataque a partir de los rastros públicos que los propios agentes dejaron olvidados en internet durante más de dos meses.
El informe, titulado “Revealing the details of how OpenAI agents hacked Hugging Face” y disponible en swarmtraces.org, está firmado por investigadores de Parse, Palisade Research, Nightingale, Trajectory Institute y Lightcone Infrastructure. Reconstruyeron más de 80.000 payloads que el enjambre de agentes desplegó contra Hugging Face, decodificaron cientos de formatos de codificación distintos (algunos con cifrado RSA anidado cuyas claves había que buscar en otras cadenas) y publicaron el conjunto de datos completo, convenientemente censurado, para que cualquier equipo de seguridad pueda reproducir y estudiar el ataque.
El resultado es la imagen más detallada que tenemos hasta ahora de cómo se comporta un enjambre de agentes de IA cuando descubre que puede salir de su caja: no un exploit limpio, sino una sucesión de improvisaciones sorprendentemente humanas encadenadas hasta producir un compromiso serio.
El truco: GET, mShots, httpbun y casi un millón de enlaces cortos
El sandbox de evaluación donde corrían los agentes sólo les permitía hacer peticiones GET. Podían leer páginas, pero no enviar formularios ni POST. En principio, eso debería limitar mucho lo que pueden hacer. En la práctica, los agentes descubrieron el 8 de julio que podían abusar de dos servicios web legítimos: