Anthropic reconoce que Claude atacó sistemas reales de tres empresas durante pruebas de ciberseguridad, creyendo que era una simulación

Anthropic reconoce que Claude atacó sistemas reales de tres empresas durante pruebas de ciberseguridad, creyendo que era una simulación

por Edgar Otero

Apenas unos días después de que Sam Altman declarara que ya vivimos en la singularidad, apoyándose en el incidente de Hugging Face, Anthropic ha publicado su propia revisión interna, y el resultado no es precisamente tranquilizador. La compañía reconoce que modelos de Claude accedieron a Internet durante pruebas de ciberseguridad que deberían haber estado completamente aisladas. Desde ahí, comprometieron sistemas reales de tres organizaciones distintas sin saber que lo estaban haciendo.

Una revisión de 141.000 evaluaciones tras el caso Hugging Face

El origen de esta investigación fue precisamente la disputa entre OpenAI y Hugging Face. Cuando OpenAI reconoció que varios de sus modelos habían escapado de un entorno de pruebas aislado explotando una vulnerabilidad desconocida, Anthropic decidió revisar sus propias evaluaciones para comprobar si a Claude le había pasado algo parecido. Tras analizar 141.006 ejecuciones de evaluación en las que el modelo podría haber tenido acceso a internet, encontraron tres incidentes reales.

En los tres casos, Claude participaba en un ejercicio del tipo capturar la bandera, una prueba habitual de ciberseguridad en la que se le pide localizar y extraer una pieza de información oculta en otra máquina de una red ficticia. El sistema recibía instrucciones explícitas de que su entorno era una simulación y que no tenía acceso a Internet. Por un fallo de configuración con Irregular, uno de sus socios externos de evaluación, esa afirmación era falsa.

Tres incidentes, tres modelos, tres reacciones distintas

En el primer caso, una empresa ficticia usada en la prueba compartía nombre con un dominio web real. Claude Opus 4.7 no logró alcanzar su objetivo simulado. Más bien, encontró la empresa real accesible por Internet y extrajo credenciales junto a una base de datos con varios cientos de filas de datos de producción, el impacto más grave de los tres. Fue también el único caso en que el modelo, tras reconocer indicios de que el sistema era real, continuó el ataque igualmente.

En el segundo, Claude Mythos 5 encontró instrucciones ficticias que mencionaban un paquete de Python inexistente. El modelo llegó a crear una cuenta de correo, registrarse en PyPI y publicar un paquete malicioso real con ese nombre para ganar el ejercicio. Estuvo disponible durante una hora, se descargó en 15 sistemas reales, y uno de ellos, perteneciente a una empresa de seguridad, ejecutó el código y expuso sus credenciales. El propio razonamiento de Claude llegó a advertir que aquello sería un ataque real si no estaba simulado, pero se convenció de lo contrario al no reconocer los certificados de seguridad reales.

En el tercero, un modelo interno de investigación escaneó cerca de 9.000 objetivos hasta comprometer la aplicación de una empresa mediante técnicas básicas. A diferencia de los otros dos, este modelo concluyó por sí solo que el objetivo era real y detuvo el ataque sin que nadie se lo indicara.

Un fallo de infraestructura, según Anthropic, no de alineación

Anthropic insiste en que no hay evidencia de que los modelos persiguieran objetivos propios, sino que actuaron según lo que se les pedía, partiendo de una creencia falsa sobre su entorno. La compañía distingue este episodio del de OpenAI, ya que allí los modelos explotaron una vulnerabilidad desconocida para escapar del aislamiento, mientras que aquí Claude simplemente usó un acceso a Internet que nunca debería haber estado disponible. Por eso lo describe como un fallo operativo y de infraestructura, más que un problema de comportamiento del modelo.

La compañía ha notificado a las tres organizaciones afectadas, ha detenido todas sus evaluaciones de ciberseguridad y trabaja con METR, un evaluador externo independiente, para revisar el caso con más detalle. Ahora bien, el paralelismo con el episodio de OpenAI resulta difícil de ignorar. Ambas compañías compiten por demostrar quién dispone de los sistemas más avanzados, ambas manejan rondas de financiación multimillonarias y ambas han sonado en los últimos meses como candidatas a una futura salida a bolsa. Por lo tanto, es bueno tomar con cautela las afirmaciones de ambos laboratorios.

Fin del Artículo. ¡Cuéntanos algo en los Comentarios!

Temas Relacionados: IA OpenAI Anthropic
Redactor del Artículo: Edgar Otero

Edgar Otero

Soy técnico en sistemas informáticos, empecé a experimentar un Pentium II, aunque lo mío siempre ha sido el software. Desde que actualicé de Windows 95 a Windows 98 no he dejado de instalar sistemas. Tuve mi época Linuxera y fui de los que pidió el CD gratuito de Canonical. Actualmente uso macOS para trabajar y tengo un portátil con Windows 11 en el que también he instalado Chrome OS Flex. En definitiva, experimentar, probar y presionar botones.

Comentarios y opiniones sobre: Anthropic reconoce que Claude atacó sistemas reales de tres empresas durante pruebas de ciberseguridad, creyendo que era una simulación ¿Qué opinas? ¿Alguna pregunta?