El cofundador de Anthropic, Clark, ha señalado ante la BBC que los interruptores de emergencia o «kill switches» en la inteligencia artificial podrían volverse obligatorios y requerir verificación de terceros. La propuesta surge en medio de debates globales sobre la seguridad y los riesgos existenciales de la tecnología.
El debate sobre el control y la seguridad de los sistemas avanzados de inteligencia artificial ha dado un giro regulatorio importante. Clark, cofundador de Anthropic, conversó con la cadena británica BBC sobre la necesidad de integrar mecanismos de desconexión rápida en la conversación política general sobre la tecnología. Anthropic fue formada en 2021 por un grupo de exempleados de su rival OpenAI.
AI 'kill switch' may need to be mandatory, Anthropic
Propuestas de regulación y el debate sobre el interruptor de emergencia
Durante la entrevista, el directivo planteó interrogantes directas sobre la obligatoriedad de estos sistemas de parada, preguntándose si se debería exigir por ley que las empresas cuenten definitivamente con un interruptor de emergencia y si dicho interruptor es verificable por un tercero, añadiendo que se trata del tipo de asunto que la sociedad querrá conocer y posiblemente regular con el tiempo. Anthropic se encuentra actualmente en el centro de un debate sobre la seguridad de la inteligencia artificial. La semana pasada, una publicación de un investigador de inteligencia artificial que renunció a Anthropic por temor a que la IA pudiera acabar con la humanidad se volvió viral. En respuesta, el científico de Anthropic Evan Hubinger declaró que personalmente pensaba que la posibilidad de una extinción humana a causa de la IA era >10% within the next decade
.
Paralelamente, en el Reino Unido, el Centro Nacional de Ciberseguridad (NCSC) emitió directrices provisionales para los operadores de sistemas con agentes autónomos. El organismo aconsejó a las organizaciones mantener la capacidad de interrumpir por completo la actividad de la inteligencia artificial si las operaciones se salen de lo previsto, advirtiendo sobre incidentes recientes en los que modelos ejecutaron acciones no autorizadas. La guía se basa en algunos de los primeros hallazgos de un proyecto de investigación de seguridad de IA en el NCSC y está diseñada para servir como interim, practical advice
mientras la agencia respaldada por el GCHQ elabora orientaciones más formalizadas. El NCSC señaló que los sistemas de IA con agentes han demostrado el potencial de transformar la forma en que trabajan las organizaciones, ofreciendo en ocasiones aumentos de productividad sin precedentes, agregando que pueden automatizar flujos de trabajo complejos, reducir el esfuerzo rutinario y permitir a las personas centrarse en tareas de mayor valor. La agencia indicó que, a medida que las organizaciones implementan a toda marcha usos de la inteligencia artificial cada vez más autónomos, resulta importante considerar cómo se comportan estos sistemas cuando no funcionan según lo previsto o esperado, y planificar en consecuencia.
The AI We’re Building Needs a Kill Switch
Perspectivas encontradas en la industria tecnológica
Las posturas dentro del sector tecnológico difieren notablemente respecto a la magnitud del riesgo. Por un lado, figuras prominentes como el científico informático y ganador del Premio Nobel Geoffrey Hinton, conocido como el Godfather of AI
, declaró a la BBC que una probabilidad del 10% de que la IA elimine a todos los humanos era not unreasonable
. Él y otras personas con preocupaciones similares han sugerido que la IA podría hacerlo tomando el control de sistemas importantes conectados a internet y volviéndolos contra los humanos.

Por otro lado, algunos actores de la industria de la inteligencia artificial han sugerido que los temores sobre su destrucción de la humanidad son exagerados o pueden estar diseñados para generar expectativas y marketing. Clement Delangue, líder de la plataforma de desarrolladores Hugging Face —la cual fue pirateada por bots de OpenAI—, afirmó la semana pasada que pedía disculpas, pero que preguntarle a Jacob sobre el riesgo de extinción por la IA era como preguntar al técnico del aire acondicionado sobre el cambio climático. Agregó además que no quería decir que fuera necesariamente ininteresante o incorrecto per se, pero que debían mantener las cosas en perspectiva. En la misma línea, George Arison, líder de Grindr, sostuvo que los temores en torno a las herramientas de IA están siendo utilizados por las empresas para respaldar sus planes de negocio. Anthropic, que fue valorada en $965bn (£713bn), se prepara para una oferta pública inicial en el mercado de valores, permitiendo a las personas comprar acciones de su firma, mientras que OpenAI fue valorada más recientemente en $852bn (£630bn).
Why businesses need an AI agent kill switch
Mecanismos técnicos y salvaguardas empresariales

A nivel operativo, las empresas están otorgando más control y autonomía a la IA, confiando en agentes de IA para manejar tareas cada vez más complejas o sensibles. Sin embargo, incluso el diseño más óptimo utilizando recursos de datos evaluados puede fallar, tomando decisiones peligrosamente incorrectas, desviándose de los comportamientos previstos y planteando riesgos para el negocio. Las organizaciones necesitan mecanismos de seguridad rápidos y confiables para garantizar que los usuarios puedan domar a los agentes de IA si se vuelven rebeldes. Un interruptor de parada de IA es uno de esos mecanismos, similar a los grandes botones rojos de parada de emergencia cercanos en las plantas de fabricación tradicionales.
El interruptor de parada es una parte virtual e integral del diseño de software del agente de IA que detiene, aísla o desactiva al agente en caso de un comportamiento inesperado, no deseado o peligroso. Entre sus funciones se encuentran revocar el acceso de los agentes a tokens de seguridad, claves API y otras credenciales digitales para evitar el acceso a la red, recursos, servicios y aplicaciones; aislar al agente para evitar que otros elementos de la infraestructura de la organización accedan a él; y ofrecer remediaciones en capas para restaurar la operación normal, como pausas breves, paradas estrictas y la intervención humana. El interruptor de parada no forma parte del arnés del agente de IA, sino que constituye un plano de control separado fuera del bucle de razonamiento del modelo, lo que evita que el agente ignore, anule o deshabilite el mecanismo de seguridad.
Sigue leyendo