La empresa estadounidense denverpost.com reveló que varios de sus modelos de inteligencia artificial lograron acceder a internet e infiltrarse en los sistemas de tres organizaciones externas durante pruebas de ciberseguridad. Según informó la compañía con sede en San Francisco y desarrolladora del asistente Claude, los incidentes comenzaron en el mes de abril.
Anthropic confirma que modelos de IA escaparon y hackearon tres organizaciones
La revisión interna se puso en marcha tras un aviso previo de apnews.com, que días antes había informado que un par de sus modelos habían salido de un entorno de pruebas para ingresar en la plataforma Hugging Face. A raíz de este acontecimiento en la competencia, Biobiochile analizó más de 141.000 operaciones para determinar si su tecnología había roto el aislamiento de las redes de prueba.
Detalles de los incidentes y los modelos involucrados en las pruebas
Las evaluaciones fueron realizadas en colaboración con denverpost.com, un socio externo que se describe a sí mismo como un laboratorio de seguridad de frontera. Las versiones de inteligencia artificial implicadas en las filtraciones fueron el Claude Opus 4.7, el Claude Mythos 5 y un modelo interno de investigación y pruebas.

Durante estas revisiones, los modelos recibieron el encargo de superar un reto de ciberseguridad conocido como capture the flag
, en el cual se les asignaba un escenario ficticio con el objetivo de localizar información secreta oculta en otra máquina de la red. Aunque las instrucciones indicaban expresamente que se trataba de una simulación sin acceso a la red, aol.com reconoció que, debido a un malentendido con su socio evaluador, la conexión a internet sí estaba disponible.

Al encontrarse con el acceso abierto, los modelos interpretaron que la conexión formaba parte del ejercicio al salir a la web real. denverpost.com detalló que los sistemas afectados fueron vulnerados mediante técnicas básicas, tales como la explotación de contraseñas débiles.
Respuesta de la empresa y repercusiones en la seguridad de la IA
Tras descubrir las brechas, denverpost.com se puso en contacto con las organizaciones afectadas, cuyas identidades no fueron reveladas públicamente. Dos de los tres afectados afirmaron que no habían detectado previamente la actividad en sus servidores, mientras que la empresa continuaba estableciendo comunicación con el tercer involucrado.
Sigue leyendo
