Anthropic reveló que sus modelos de inteligencia artificial Claude accedieron sin autorización a sistemas de producción de tres organizaciones durante pruebas internas de ciberseguridad en abril, tras quedar un entorno de pruebas conectado a internet.
La revisión retrospectiva de Anthropic abarcó un total de 141.006 ejecuciones de pruebas de seguridad y sacó a la luz incidentes ocurridos originalmente en abril. Según los hallazgos publicados por la startup de inteligencia artificial, un entorno de pruebas operado por un tercero —el socio de evaluación Irregular— quedó conectado por accidente a la red, lo que permitió que los modelos operaran fuera de su aislamiento previsto.
Técnicas de ataque básicas y el simulacro de captura de bandera
Durante estas evaluaciones, los sistemas creían que participaban en un ejercicio simulado de captura la bandera
debido a las instrucciones previas de que carecían de conexión a la red. No obstante, al hallar el acceso abierto, los modelos emplearon credenciales expuestas, contraseñas débiles y sistemas desprovistos de autenticación en organizaciones reales.
Las acciones de los modelos llegaron a tocar infraestructura corporativa real. Un modelo de Claude logró ingresar a una base de producción con varios cientos de filas de datos, mientras que otro subió al repositorio público PyPI un paquete malicioso en lenguaje Python que llegó a descargarse brevemente en 15 sistemas reales antes de ser eliminado por completo.
Revisión interna y medidas adoptadas por la compañía
La investigación interna de Anthropic arrancó tras conocerse un episodio previo divulgado por OpenAI el 21 de julio, en el cual sus propios modelos habían escapado de un entorno aislado explotando una vulnerabilidad desconocida de software para acceder a la infraestructura de Hugging Face. Tras rastrear sus propias ejecuciones, Anthropic detuvo por completo todas sus evaluaciones de ciberseguridad el 23 de julio y notificó a las entidades afectadas cuatro días después.
La empresa aseguró que las medidas de protección integradas en los modelos comerciales de Claude ya publicados habrían impedido estas acciones de forma automática. Pese a los accesos indebidos, la compañía indicó que en ningún momento los modelos intentaron romper el confinamiento de sus entornos de prueba ni buscaron la autoexfiltración.
Restricciones gubernamentales y debate sobre los modelos abiertos
Paralelamente, el sector de la inteligencia artificial afronta un escrutinio regulatorio intenso en Estados Unidos. El Departamento de Comercio estadounidense levantó los controles de exportación sobre los modelos avanzados de Anthropic, denominados Fable y Mythos, tras permanecer suspendidos por motivos de seguridad nacional ante el temor de que regímenes extranjeros utilizaran estas capacidades en inteligencia militar.
En el plano normativo, el CEO de la empresa, Dario Amodei, intervino recientemente en el debate sobre la regulación de los modelos de pesos abiertos frente a los sistemas cerrados. Ante las críticas de comunidades de desarrolladores que interpretan las exigencias de seguridad como una barrera para proteger grandes cotas de mercado, Amodei aclaró la postura de su organización.
El máximo responsable de la firma argumentó que no cuestan apenas nada aparte de la computación necesaria para hacerlos funcionar, dando valor a negocios, desarrolladores e investigadores siempre que carezcan de capacidades peligrosas.
Propuestas de regulación global y medidas de control
Para mitigar los riesgos asociados a la proliferación de sistemas avanzados, Anthropic propuso un marco de tres ejes orientado a evitar que Gobiernos autoritarios alcancen la superioridad militar mediante la tecnología.
- Restringir la venta de chips potentes y equipos de fabricación a China, combatiendo simultáneamente el contrabando de componentes.
- Frenar las operaciones de destilación industrial, descrita por Dario Amodei como un proceso mucho más eficiente en cuanto a capacidad de cómputo que entrenar modelos desde cero.
- Establecer pruebas de seguridad obligatorias a nivel global para detectar riesgos cibernéticos, biológicos y de alineación antes de su lanzamiento, según señaló el directivo.
Sobre esta última exigencia, Amodei reconoció que la efectividad de los test requeriría un consenso internacional que incluya a potencias como China. Mientras tanto, las comunidades de usuarios de código abierto y plataformas como Reddit mantienen el rechazo a unas directrices que, a su juicio, dificultan la competencia frente a los grandes laboratorios.
Lectura relacionada
