Anthropic eleva a «bajo» el riesgo de desalineamiento en sus modelos y revela un sistema interno no publicado más capaz que Mythos 5

Anthropic eleva a «bajo» el riesgo de desalineamiento en sus modelos y revela un sistema interno no publicado más capaz que Mythos 5

Anthropic elevó de «muy bajo» a «bajo» su calificación de riesgo por desalineamiento en entornos de alto riesgo, informó la empresa el 14 de agosto en su segundo Risk Report, publicado bajo la versión 3.4 de su Política de Escalamiento Responsable (RSP). El documento cubre el periodo del 24 de febrero al 15 de julio de 2026.

La compañía atribuyó el ajuste a la mayor incertidumbre generada por incidentes recientes en evaluaciones de ciberseguridad, no a un hallazgo de que algún modelo haya fallado una prueba de seguridad. Anthropic precisó que sus argumentos de fondo probablemente seguirían respaldando la calificación anterior, pero optó por la etiqueta más conservadora.

El reporte reveló además, por primera vez en la serie, la existencia de un modelo interno no publicado llamado «Model 2», que la empresa describe como algo más capaz que Mythos 5, su sistema de frontera actualmente disponible al público. Anthropic dijo usarlo de forma intensiva en trabajo interno, incluida la evaluación de riesgos de automatización de investigación y desarrollo (I+D), y afirmó no tener planes de lanzarlo externamente por ahora.

La empresa explicó que Model 2 no ha completado la suite estándar de evaluaciones previas al despliegue, por lo que tiene menor confianza en sus estimaciones de capacidades que en las de sus modelos ya publicados. Dentro de ese alcance limitado de pruebas, dijo no haber detectado ninguna forma de desalineamiento nueva o más preocupante que la ya documentada para Mythos 5.

Sobre automatización de I+D, Anthropic mantuvo la calificación general en «bajo»: sus modelos actuales no cruzan el umbral que activaría salvaguardas adicionales. La empresa reportó que Claude genera ya la mayoría del código que se integra a sus bases de producción y que su investigación interna avanza más rápido con esa asistencia, aunque sostuvo que el trabajo aún no alcanza el doble de velocidad respecto a un escenario sin IA, el umbral que definiría una aceleración extrema. Anthropic dijo tener menor confianza que antes en esta conclusión, porque sus evaluaciones basadas en tareas concretas comenzaron a «saturarse» y ya no capturan con precisión los incrementos de capacidad de los modelos más nuevos.

La compañía aclaró que «riesgo bajo» no equivale a estimar baja la probabilidad de cualquier tipo de falla: el reporte se concentra en daño catastrófico, los escenarios más severos contemplados por su RSP. Anthropic también reconoció que buena parte de su argumento sobre desalineamiento depende de que los modelos mantengan capacidades limitadas para ocultar acciones o evadir supervisión, y de que la empresa siga mejorando su capacidad para medir esas capacidades hacia adelante.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *