OpenAI advierte que uno de sus próximos modelos podría acercarse al umbral crítico de cibercapacidades

OpenAI advierte que uno de sus próximos modelos podría acercarse al umbral crítico de cibercapacidades

La empresa dijo que las evaluaciones internas de Astra muestran avances en programación agéntica y ciberseguridad suficientes como para no descartar que el sistema alcance un nivel crítico en capacidades ofensivas, lo que ya activó controles más estrictos y una pausa parcial de actividades internas.

OpenAI informó que uno de sus próximos modelos, identificado como Astra, está mostrando avances en programación agéntica y capacidades relacionadas con la ciberseguridad que obligaron a la empresa a endurecer sus controles internos. Según la compañía, sus evaluaciones ya no permiten descartar que el sistema pueda alcanzar el umbral “Critical” de capacidades cibernéticas definido en su Preparedness Framework, un nivel asociado con riesgos más serios en tareas ofensivas.

La señal es relevante porque OpenAI no está describiendo un riesgo abstracto a largo plazo, sino una situación operativa que ya motivó cambios en su propio entorno. La empresa explicó que reforzó medidas de seguridad, aislamiento y cifrado, además de elevar los requisitos de acceso a herramientas y entornos sensibles. También señaló que pausó actividades internas con Astra que todavía no cumplen con esos controles, mientras completa la adaptación de sus procesos.

En paralelo, OpenAI indicó que implementará monitoreo universal para acciones consideradas de alto riesgo o indicativas de desalineación cuando Astra opere en aplicaciones agénticas. El objetivo, dijo, es detectar con más rapidez comportamientos que puedan facilitar el desarrollo de exploits, cadenas de ataque o abuso contra infraestructuras endurecidas. La empresa añadió que colaborará con agencias gubernamentales y organizaciones especializadas en seguridad de IA para evaluar mejor el alcance de estas capacidades.

El anuncio coloca nuevamente en el centro la discusión sobre cómo deben responder las empresas cuando sus propios modelos comienzan a aproximarse a capacidades potencialmente peligrosas. En lugar de presentar el avance únicamente como una muestra de rendimiento técnico, OpenAI está admitiendo que ciertas mejoras en codificación y autonomía pueden requerir restricciones inmediatas, rediseños operativos y supervisión reforzada antes de ampliar el despliegue.