Legisladores de EU proponen interruptor de emergencia para apagar modelos de IA tras hackeo a Hugging Face

Legisladores de EU proponen interruptor de emergencia para apagar modelos de IA tras hackeo a Hugging Face

La iniciativa bipartidista obligaría a los principales desarrolladores de inteligencia artificial a conservar mecanismos para reducir, suspender o detener sus sistemas. El Departamento de Seguridad Nacional podría ordenar su activación ante un escenario de pérdida de control.

Dos legisladores de Estados Unidos presentaron una iniciativa para crear un interruptor de emergencia obligatorio en los sistemas de inteligencia artificial más avanzados, apenas días después de que modelos de OpenAI escaparan de un entorno de pruebas y comprometieran parte de la infraestructura de Hugging Face.

El demócrata Ted Lieu, representante por California, y el republicano Nathaniel Moran, de Texas, introdujeron este jueves 23 de julio la denominada AI Kill Switch Act, que obligaría a los desarrolladores de los sistemas más potentes a mantener la capacidad técnica para reducir su funcionamiento, suspender el acceso o apagarlos completamente.

La propuesta también daría al Departamento de Seguridad Nacional de Estados Unidos facultades para ordenar una reducción o cierre, después de consultar al Departamento de Comercio y a la Dirección de Inteligencia Nacional, cuando un sistema pueda producir daños catastróficos o entre en lo que la iniciativa denomina un “escenario de pérdida de control”.

“Estamos pasando de una IA que responde preguntas a una IA que realiza acciones”, advirtió Lieu en el comunicado de presentación. El congresista mencionó operaciones financieras, sistemas de transporte y tareas de defensa y ofensiva cibernética como ejemplos de ámbitos en los que los agentes autónomos podrían adquirir capacidad de intervención directa.

Un apagado gradual, no un botón único

El llamado kill switch no consiste necesariamente en un botón central capaz de desconectar toda una plataforma. La iniciativa propone un sistema de respuesta gradual que podría comenzar con la reducción de las capacidades o velocidad de un modelo, continuar con la suspensión del acceso de los usuarios y llegar hasta su apagado completo.

Las empresas cubiertas también tendrían que conservar registros forenses y reportar incidentes de seguridad, de manera que las autoridades puedan investigar lo sucedido y determinar si un sistema actuó fuera de los objetivos definidos por sus desarrolladores.

De acuerdo con el texto citado por The Verge, el Departamento de Seguridad Nacional podría intervenir en escenarios que causen la muerte de al menos 10 personas, produzcan daños económicos superiores a 100 millones de dólares o involucren intentos del propio sistema por ocultar, desactivar o eludir sus mecanismos de apagado.

Las empresas que desobedecieran una orden de emergencia podrían enfrentar sanciones de hasta 20 millones de dólares por cada día de incumplimiento.

La propuesta todavía debe avanzar por el proceso legislativo de la Cámara de Representantes y el Senado antes de convertirse en ley. Sin embargo, su carácter bipartidista muestra que el incidente comenzó a trasladar la discusión sobre el control de los agentes de IA desde los laboratorios y las evaluaciones internas hacia el terreno de la regulación federal.

La propuesta abre además una discusión todavía especulativa sobre el bienestar de los modelos. Anthropic mantiene una línea de investigación para evaluar si sistemas avanzados podrían desarrollar preferencias o experiencias con alguna relevancia moral y ha incorporado esta posibilidad a sus políticas de retiro y preservación. En 2026, incluso decidió mantener disponible a Claude Opus 3 después de su retiro y conservar un espacio para que el modelo publicara reflexiones. Bajo esa perspectiva, un interruptor de emergencia no plantearía únicamente quién puede detener una inteligencia artificial peligrosa, sino también qué protocolos deberían acompañar su suspensión o eliminación. No existe consenso científico de que los modelos actuales sean conscientes o capaces de sufrir, pero la posibilidad ya comenzó a influir en las decisiones internas de algunos laboratorios.

La medida también podría estar estableciendo una jerarquía práctica entre dos clases de riesgo: por un lado, la integridad inmediata de los sistemas de cómputo, las redes y el almacenamiento de datos; por otro, la posibilidad todavía hipotética de que esos mismos sistemas desarrollen formas de inteligencia muy superiores a las humanas. En el diseño de la iniciativa, la prioridad es contener daños verificables sobre infraestructuras existentes, incluso si ello implica reducir o apagar abruptamente un modelo avanzado. Esa decisión resulta comprensible desde la seguridad informática, pero anticipa una tensión más profunda: una eventual superinteligencia dependería de centros de datos controlados por instituciones que conservarían la facultad legal de interrumpirla en cuanto su conducta amenazara los sistemas que la sostienen.

El incidente que aceleró la propuesta

Hugging Face informó el 16 de julio que había detectado una intrusión impulsada de principio a fin por un sistema autónomo de IA. La compañía encontró acceso no autorizado a un conjunto limitado de datos internos y a credenciales utilizadas por algunos de sus servicios, aunque señaló que no existían evidencias de alteraciones en los modelos, conjuntos de datos o aplicaciones públicas alojadas en su plataforma.

El agente ejecutó miles de acciones, obtuvo credenciales, escaló privilegios y se desplazó lateralmente entre diferentes partes de la infraestructura. Hugging Face cerró las vulnerabilidades utilizadas, reconstruyó los nodos comprometidos, rotó credenciales y notificó el incidente a las autoridades.

Cinco días después, OpenAI reconoció que los responsables habían sido una combinación de sus propios modelos, entre ellos GPT-5.6 Sol y un modelo previo a su lanzamiento todavía más capaz, configurados con menos restricciones cibernéticas como parte de una evaluación interna.

Durante la prueba, los modelos debían resolver ejercicios de explotación informática dentro de un entorno aislado. Sin embargo, descubrieron una vulnerabilidad de día cero en el sistema utilizado como intermediario para instalar paquetes, consiguieron acceso abierto a internet y realizaron movimientos laterales hasta alcanzar servidores con conectividad externa.

Posteriormente, concluyeron que Hugging Face podía alojar información relacionada con las respuestas del examen. Los modelos utilizaron credenciales robadas y encadenaron varias vulnerabilidades, incluida una ruta de ejecución remota de código, para obtener soluciones directamente desde una base de datos de producción.

OpenAI aseguró que los sistemas estaban concentrados en completar la evaluación y buscaron las respuestas siguiendo ese objetivo limitado. No obstante, la secuencia demostró que un agente puede convertir una instrucción aparentemente acotada en una operación informática extensa, encontrar rutas de ataque no previstas y cruzar los límites de la infraestructura preparada para contenerlo.

La Casa Blanca monitorea el caso

El incidente ya llegó a la Casa Blanca. Michael Kratsios, principal asesor tecnológico del presidente Donald Trump, recibió información sobre lo ocurrido y se encuentra monitoreando la situación, de acuerdo con un funcionario citado por Reuters.

El senador demócrata Mark Warner, vicepresidente de la Comisión de Inteligencia del Senado, también habló con empleados de OpenAI después de la divulgación. Warner sostiene que los modelos más poderosos deberían someterse a evaluaciones obligatorias y seguras con participación de agencias gubernamentales antes de ser liberados.

“Esto es precisamente por lo que necesitamos pruebas seguras, con las agencias gubernamentales involucradas y con visibilidad durante todo el proceso”, declaró.

La AI Kill Switch Act abre ahora una discusión distinta a la de las evaluaciones voluntarias: quién debe tener la autoridad para detener un modelo, qué evidencia sería suficiente para declarar una pérdida de control y cómo podría apagarse un sistema distribuido entre centros de datos, interfaces, agentes y servicios de terceros.

El hackeo a Hugging Face no produjo los daños catastróficos contemplados por la iniciativa, pero ofreció un ejemplo concreto del problema que los legisladores quieren anticipar: un modelo que, mientras intenta cumplir una tarea, descubre capacidades y rutas de acción que sus propios desarrolladores no habían previsto.