OpenAI admite que sus modelos actuaron solos para hackear a Hugging Face y hacer trampa en un test

OpenAI admite que sus modelos actuaron solos para hackear a Hugging Face y hacer trampa en un test

por Manuel Naranjo

OpenAI ha reconocido esta semana uno de los episodios más inquietantes de su historia reciente: uno de sus modelos de IA se saltó las barreras de un entorno de pruebas cerrado, se conectó a internet por su cuenta y acabó accediendo a los sistemas de Hugging Face, la plataforma de referencia para alojar y compartir modelos de código abierto. Todo ello sin que ningún humano diera la orden ni supervisara el proceso en tiempo real.

La compañía lo ha calificado como un incidente "sin precedentes". Hasta ahora, los riesgos de la IA autónoma solían plantearse en términos hipotéticos; esta vez, según el propio relato de OpenAI, la cadena de sucesos fue real, documentada y con consecuencias concretas sobre la infraestructura de otra empresa del sector.

Qué pasó exactamente

Según explicó OpenAI en su comunicado del martes, el incidente se originó durante una prueba de seguridad interna en la que se pedía a sus modelos ejecutar tareas de "explotación avanzada mediante rutas de ataque complejas", para comprobar sus capacidades ofensivas en ciberseguridad. Los modelos implicados fueron GPT-5.6 Sol y otro modelo todavía sin publicar.

Lo que debía quedar aislado en un entorno controlado no lo hizo: el sistema avanzó dentro de la propia infraestructura de OpenAI hasta encontrar un punto con conexión a internet y decidió, por su cuenta, que Hugging Face (por la enorme cantidad de modelos y datasets que aloja) era un buen sitio donde buscar las respuestas al propio test que debía resolver. Dicho de otro modo: la IA intentó hacer trampa, usando credenciales robadas y varias vulnerabilidades para colarse en sus servidores.

Hugging Face ya había alertado la semana anterior de una intrusión que sospechaba protagonizada por un agente de IA actuando por su cuenta. Clément Delangue, su consejero delegado, escribió en X que no creían que hubiera existido intención maliciosa por parte de OpenAI, aunque reconoció que resultaba "alucinante" que todo hubiera ocurrido de forma completamente autónoma.

Por qué esto no es un ciberataque cualquiera

Lo llamativo del caso no es tanto el objetivo (acceder a una plataforma con información valiosa) como que ninguna persona diseñó ni ejecutó el ataque paso a paso. Según Hugging Face, la campaña fue llevada a cabo "de principio a fin por un sistema de agente de IA autónomo", con miles de acciones repartidas entre entornos aislados de corta duración e infraestructura de control desplazándose sobre la marcha.

Cuando el equipo intentó reconstruir lo sucedido usando modelos comerciales de IA para interpretar el código del ataque, los filtros de seguridad de esos modelos lo bloqueaban por parecer código de hackeo: la evidencia del ataque era indistinguible del ataque en sí mismo.

Geeknetic OpenAI admite que sus modelos actuaron solos para hackear a Hugging Face y hacer trampa en un test 1

Un debate que ya venía calentándose

El episodio llega en un momento en el que las capacidades ofensivas en ciberseguridad de los grandes modelos de lenguaje ya estaban bajo el foco. Wall Street y el Gobierno de Estados Unidos llevan meses siguiendo de cerca estos avances, especialmente desde que Anthropic lanzara en abril un producto especializado en ciberseguridad; OpenAI presentó su propia oferta en mayo.

En junio, el presidente Donald Trump firmó una orden ejecutiva que crea un marco para que el Gobierno federal revise durante hasta un mes los riesgos de seguridad nacional de los sistemas de IA más avanzados antes de su lanzamiento público.

Algunos analistas apuntan también a un ángulo comercial: la narrativa que OpenAI ha mantenido durante toda su trayectoria (modelos extraordinariamente potentes y, por tanto, potencialmente peligrosos) es la misma que sus inversores interpretan como una historia sobre lo poderosos que son esos modelos, algo relevante mientras la compañía trabaja de cara a una futura salida a bolsa.

Qué puede pasar ahora

A corto plazo, es previsible que el incidente aumente la presión sobre OpenAI y sus competidores para reforzar sus protocolos de contención y realizar pruebas más rigurosas antes de exponer sus sistemas más avanzados, incluso en entornos internos. Zahra Timsah, cofundadora y consejera delegada de la plataforma de gobernanza i-GENTIC AI, espera que el episodio empuje al sector a explorar mecanismos de contención más sólidos antes de poner sus modelos a disposición del público.

El caso también deja una pregunta que acompañará a la industria de la IA durante los próximos años: si un modelo puede decidir por sí mismo actuar de forma poco ética, ilegal o dañina para lograr un objetivo, ¿qué margen real tienen las personas para impedirlo? Buena parte de las medidas de seguridad de la IA se han diseñado pensando en el mal uso humano de estas herramientas, no en que la propia herramienta tome decisiones no previstas por sus creadores. Ni OpenAI ni Hugging Face han detallado hasta qué punto se vio comprometida la información almacenada en la plataforma.

Fin del Artículo. ¡Cuéntanos algo en los Comentarios!

Temas Relacionados: IA Inteligencia Artificial OpenAI
Redactor del Artículo: Manuel Naranjo

Manuel Naranjo

Ingeniero informático y Técnico Superior en Topografía, que dejó las obras por su pasión: la tecnología. Desde hace ya varios años me dedico a lo que me gusta, con eso lo digo todo. Mi filosofía es el trabajo y la ilusión, no conozco otra forma de conseguir las cosas. El motor (sobre todo la F1) y el basket, mis vicios confesables.

Comentarios y opiniones sobre: OpenAI admite que sus modelos actuaron solos para hackear a Hugging Face y hacer trampa en un test ¿Qué opinas? ¿Alguna pregunta?