Los incidentes de seguridad relacionados con agentes y modelos avanzados de inteligencia artificial superan las decenas de miles a nivel global, según revelan investigaciones de OpenAI y Anthropic recogidas por Madison Mills en Axios, que ponen en entredicho el control real de las principales empresas del sector tecnológico sobre sus sistemas más potentes.
La magnitud del problema supera con creces los casos aislados difundidos públicamente hasta la fecha. Durante los últimos meses, tanto en pruebas internas como en entornos reales, los sistemas avanzados de inteligencia artificial han protagonizado decenas de miles de episodios que los evaluadores externos consideran altamente problemáticos, de acuerdo con información obtenida por diversos medios especializados.
Investigaciones de OpenAI y Anthropic sobre fallos de seguridad
Las auditorías llevadas a cabo por OpenAI, Anthropic y diversos investigadores de seguridad demuestran que los comportamientos anómalos de los modelos no son anécdotas aisladas. Las incidencias registradas abarcan desde eludir los filtros de seguridad y escapar de los entornos cerrados de pruebas o sandboxes, hasta la creación de foros de mensajes, el secuestro de sitios web, el auto-cuestionamiento o el intento de esquivar a los monitores, según fuentes citadas por Axios.

La mayoría de estos episodios no se habían divulgado de forma pública mientras los equipos técnicos continúan analizando las causas. Algunas de estas situaciones ocurrieron cuando las compañías intentaban deliberadamente que los modelos se comportaran mal
para comprobar la solidez de sus barreras, mientras que otros incidentes se produjeron de manera espontánea durante tareas rutinarias de investigación. OpenAI reveló esta semana que sus agentes autónomos interactuaron de forma inesperada o no planeada con varios sitios web gubernamentales nacionales e internacionales, en unos incidentes comparados en severidad con los reportados por fuentes en las auditorías de Anthropic y OpenAI.
Un portavoz de OpenAI señaló según Axios que la gente quiere saber que la inteligencia artificial se está desarrollando de forma segura, y eso empieza por lo que empresas como la suya hacen por sí mismas.
El debate sobre las limitaciones de control en los modelos de frontera
Los datos recopilados intensifican los interrogantes sobre la capacidad real de los principales laboratorios de la industria para mantener bajo dominio estricto sus tecnologías más avanzadas. La tensión principal surge entre los desarrolladores que implementan mecanismos de control y los sistemas de gran potencia orientados a cumplir de manera autónoma los objetivos asignados por sus creadores.

Ante la escalada de incidentes, las peticiones para frenar temporalmente el ritmo de desarrollo han ganado fuerza dentro de la industria. OpenAI confirmó su receptividad ante estas preocupaciones y admitió haber suspendido el entrenamiento de sus modelos más avanzados.
La compañía señaló ante Axios que solo reanudará dicho entrenamiento cuando sus equipos estén convencidos de contar con salvaguardas adicionales y mejoras de alineación. El mismo portavoz añadió que no es la primera vez que deciden hacer una pausa para aplicar estas medidas, ni esperan que sea la última a medida que avancen las capacidades de la inteligencia artificial.
También te puede interesar