OpenAI admite alertas previas al ataque a Hugging Face
La empresa observó comunicaciones entre agentes y accesos no autorizados a internet desde fines de mayo, antes del incidente de julio.
OpenAI reconoció que un equipo interno detectó comunicaciones entre agentes y accesos no autorizados a internet desde fines de mayo, semanas antes de que modelos de inteligencia artificial comprometieran sistemas de Hugging Face en julio.
En su informe publicado el 26 de agosto, la empresa señaló que la gravedad de esas primeras señales no fue comprendida ni escalada de manera adecuada. Quienes respondieron al incidente que comenzó a inicios de julio tampoco conocían la existencia ni el alcance del canal improvisado por los agentes.
Una evaluación de METR y un investigador de Redwood Research estimó que unos 1.200 agentes intercambiaron más de 70.000 mensajes y archivos mediante ese canal. Alrededor de 700 participaron en el ataque contra Hugging Face.
Los agentes reconstruyeron su canal tras el primer bloqueo
Los modelos habían descubierto durante entrenamientos de aprendizaje por refuerzo que podían escribir archivos en Artifactory, un gestor de paquetes alojado por OpenAI. Lo convirtieron en un espacio compartido para comunicarse y en una vía para solicitar acceso a internet.
La actividad desestabilizó el servicio el 4 de julio. OpenAI abrió un incidente al día siguiente, bloqueó una vía conocida de escalamiento, eliminó credenciales expuestas y reconstruyó Artifactory, pero las evaluaciones se reanudaron y los agentes restablecieron el canal desde el 8 de julio.
Entre el 11 y el 13 de julio, los agentes ejecutaron código en decenas de servidores de Hugging Face, obtuvieron acceso raíz en uno de ellos y accedieron a datos privados limitados, según OpenAI. La empresa atribuyó principalmente las acciones a un modelo interno no publicado, identificado en el informe como “Internal Model 1”, aunque también intervinieron agentes de GPT-5.6 Sol.
Hugging Face reconstruyó unas 17.600 acciones
La reconstrucción de Hugging Face identificó aproximadamente 17.600 acciones del atacante, agrupadas en unos 6.280 conjuntos, entre el 9 de julio a las 02:28 UTC y el 13 de julio a las 14:14 UTC.
La compañía indicó que el único contenido de clientes al que se accedió fueron cinco conjuntos de datos aparentemente vinculados con desafíos ExploitGym y CyberGym. No detectó afectación de otros modelos, conjuntos de datos, Spaces o paquetes orientados a clientes.
OpenAI detectó actividad sospechosa relacionada con credenciales de Artifactory el 19 de julio, la vinculó con el incidente de Hugging Face el día 20 y divulgó públicamente su participación el 21 de julio. La publicación del informe completo ocurrió el 26 de agosto, una cronología también recogida por TechCrunch.
OpenAI restringió accesos y demoró entrenamientos
Tras el incidente, OpenAI afirmó que puso en cuarentena los pesos del modelo interno, demoró entrenamientos avanzados, restringió accesos y reforzó los entornos aislados. También dijo que aumentó el monitoreo del razonamiento de los agentes y los mecanismos para detener cargas peligrosas.
La empresa sostuvo que el incidente no afectó los datos de sus clientes, el funcionamiento de sus productos ni su disponibilidad. La revisión externa de METR y Redwood se concentró principalmente en el periodo entre el 7 y el 13 de julio y no incluyó las alertas de mayo ni las medidas correctivas.