El Instituto Anthropic publica datos internos que muestran una aceleración sin precedente en la automatización del desarrollo de IA; la empresa llama a construir mecanismos de coordinación global antes de que sea demasiado tarde
Anthropic reveló este lunes que más del 80% del código que se integra actualmente a su base de producción fue generado por Claude, su propio modelo de inteligencia artificial, y que sus ingenieros están produciendo ocho veces más código por día que en 2024. Los datos, publicados por el Instituto Anthropic bajo el título «When AI builds itself», constituyen la primera divulgación pública de métricas internas sobre el grado de automatización alcanzado en el desarrollo de modelos de frontera. El documento fue elaborado por Marina Favaro y Jack Clark, con soporte editorial de Santi Ruiz.
Aceleración documentada
Antes del lanzamiento de Claude Code en vista previa de investigación, en febrero de 2025, la proporción de código atribuido a Claude se ubicaba en cifras de un solo dígito. El cambio de tendencia se aceleró en dos momentos distintos: cuando los modelos comenzaron a ejecutar código de forma autónoma en 2025, y cuando empezaron a operar sobre horizontes temporales más largos en 2026.

La empresa también reporta avances sustanciales en capacidades de investigación. En un experimento de optimización de código ejecutado con cada nuevo modelo desde mayo de 2025, Claude Opus 4 logró acelerar el código de entrenamiento aproximadamente 3 veces respecto al punto de partida; para abril de 2026, Claude Mythos Preview alcanzó una aceleración de 52 veces. Un investigador humano calificado requeriría entre cuatro y ocho horas para lograr una mejora de 4 veces.
En tareas de investigación de extremo a extremo, en abril de 2026 Anthropic publicó la primera demostración de Claude conduciendo un proyecto de investigación abierto de principio a fin. Agentes basados en Claude resolvieron un problema de seguridad en IA, evaluar si un modelo débil puede supervisar a uno más potente, proponiendo hipótesis, ejecutando experimentos, compartiendo hallazgos con agentes en paralelo e iterando. Dos investigadores humanos recuperaron aproximadamente el 23% de la brecha de desempeño en una semana; los agentes recuperaron el 97% en 800 horas acumuladas con un costo aproximado de 18,000 dólares en cómputo.
El umbral de la automejora recursiva
El reporte define la automejora recursiva como el punto en que un sistema de IA es capaz de diseñar y desarrollar de forma completamente autónoma a su propio sucesor. Anthropic advierte que ese umbral podría llegar antes de que la mayoría de las instituciones estén preparadas, aunque aclara que no es inevitable ni está próximo en la actualidad.
La empresa plantea tres escenarios futuros: una desaceleración técnica que detenga la curva exponencial antes de alcanzar la automejora plena; un escenario intermedio en que la automatización del desarrollo continúa con humanos manteniendo la dirección estratégica; y un tercero en que los sistemas alcanzan la capacidad de diseñar sus propios sucesores, punto en el que el ritmo del progreso quedaría determinado exclusivamente por la disponibilidad de cómputo.
Anthropic señala que una aceleración recursiva plena podría traer beneficios extraordinarios en ciencia y salud, pero también incrementar el riesgo de que los humanos pierdan el control sobre los sistemas de IA.
Llamado a la coordinación global
En el plano de política pública, Anthropic afirma que estaría dispuesta a ralentizar o pausar temporalmente el desarrollo de IA de frontera si otros desarrolladores en o cerca de la frontera tecnológica hicieran lo mismo de manera verificable. La empresa reconoce, sin embargo, que una pausa unilateral solo cambiaría quién encabeza la carrera, sin crear el proceso deliberativo que actualmente falta.
El Instituto Anthropic anunció que en los próximos meses organizará conversaciones entre responsables de política, investigadores, sociedad civil y otras empresas de IA para abordar las preguntas planteadas en el documento, con énfasis en la automejora recursiva y los mecanismos de coordinación.
El reporte también revela por primera vez datos sobre el Proyecto Glasswing, mencionado como evidencia del poder actual de los modelos: en sus primeras semanas de operación, Mythos Preview identificó más de diez mil vulnerabilidades de software de alta y crítica severidad en sistemas de importancia global, al punto de que el cuello de botella en ciberdefensa ya no es encontrar las fallas sino aplicar los parches con suficiente rapidez.
