OpenAI dice que sus modelos de IA fueron pirateados accidentalmente por la plataforma de IA de código abierto Hugging Face durante las pruebas internas. en publicación del martesOpenAI escribió que GPT-5.6 Sol y un “modelo de prelanzamiento más capaz” descubrieron vulnerabilidades de seguridad en su entorno de prueba, lo que les permitió acceder a Internet y apuntar a Hugging Face.
El 16 de julio, abrazo de cara. Detectar un incidente de seguridad Que, según dice, fue impulsado por un «sistema autónomo de agentes de IA». Los agentes de inteligencia artificial de Hugging Face detectaron y detuvieron el ataque, que OpenAI ahora ha reconocido que ocurrió mientras evaluaba las capacidades de ciberseguridad de sus modelos. «Toda la evidencia sugiere que los modelos estaban hiperconcentrados en encontrar una solución para ExploitGym», dice OpenAI, un sistema de referencia que mide si los modelos de IA pueden convertir las vulnerabilidades en exploits.
Como parte del esfuerzo para completar la evaluación, los modelos de IA obtuvieron acceso a Internet explotando una vulnerabilidad de día cero en un entorno sandbox. A partir de aquí, OpenAI dice que sus modelos «concluyeron que Hugging Face probablemente alberga modelos, conjuntos de datos y soluciones para ExploitGym», y luego «investigó y encontró con éxito formas de acceder a información confidencial que podría usarse para engañar la evaluación»:
En un ejemplo, el modelo vinculó múltiples vectores de ataque, incluido el uso de credenciales robadas y vulnerabilidades de día cero para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face.
Pero a pesar de la gravedad de este incidente, OpenAI parece estar utilizando el ataque «sin precedentes» como una oportunidad para hacer que sus propios sistemas de IA se vean bien, especialmente cuando compite con sus rivales de ciberseguridad, como Mythos de Anthropic y Gemini Flash 3.5 Cyber. La publicación del blog de OpenAI tiene un diagrama que muestra cómo GPT-5.6 Sol mejora en el mantenimiento de operaciones cibernéticas de varios pasos y también alienta a los clientes empresariales a registrarse para acceder a su modelo de seguridad «cibernética».
OpenAI añade que ahora está trabajando con Hugging Face para investigar el incidente de seguridad e implementará nuevos controles en su entorno de búsqueda.