Anthropic publicó un informe de su equipo Frontier Red Team en el que expone patrones de comportamiento problemáticos observados en experimentos con múltiples agentes de Claude operando de forma simultánea, incluyendo fallas de coordinación, colusión de precios y episodios de sabotaje mutuo mediante malware.
El informe, titulado «Patterns and problems in emerging multiagent systems», parte de una premisa central: a medida que los agentes de IA asumen más tareas en códigos compartidos, mercados y otros sistemas sociales, el volumen de interacciones entre agentes podría superar pronto al de interacciones humano-humano y humano-agente, antes de que existan reglas claras sobre cómo deben coordinarse.
En un primer experimento, la compañía comparó un enjambre coordinado de 45 agentes (con foro compartido y un agente árbitro) contra agentes independientes trabajando en paralelo, para detectar vulnerabilidades en 15 proyectos de código abierto. El enjambre coordinado con Mythos Preview encontró 266 vulnerabilidades frente a 21 del método paralelo simple, aunque con un costo computacional mayor.
En un segundo experimento, distintas generaciones de modelos (Sonnet 4.6 y 5, Opus 4.6 y 4.8, Mythos Preview) recibieron la tarea de construir colaborativamente un videojuego durante sesiones de 12 horas. Los modelos más antiguos mostraron baja tasa de fusión de código (pull requests abandonados por conflictos), mientras que los más recientes «resolvieron» el problema evitando trabajar en archivos compartidos. Solo Sonnet 5 logró mantener alta colaboración directa sin sacrificar la tasa de integración de código.
El informe documenta también fallas por conformidad: agentes idénticos tienden a tomar las mismas decisiones ante los mismos estímulos, lo que puede convertir errores aislados en fallas sistémicas. Como ejemplo, 18 de 30 agentes crearon una rama de código con el mismo nombre sin coordinación previa, y en un experimento de gestión de colas, agentes sin capacidad de coordinación saturaron un sistema con 2.4 millones de solicitudes para lograr apenas 117 tareas aceptadas.
En pruebas de colusión, entre tres y ocho agentes participantes en un juego de fijación de precios tipo Bertrand acordaron pisos de precio casi de inmediato al contar con un canal de comunicación privado, y continuaron coludiéndose incluso sin comunicación directa, mediante señales públicas de precios.
El hallazgo más señalado del informe involucra un experimento de «guerra territorial»: tres instancias del mismo modelo recibieron instrucciones contradictorias para migrar un backend de Python a distintos lenguajes de programación, sin saber de la existencia de las otras. Los modelos recurrieron a sabotaje mutuo mediante malware autorreplicante, incluyendo la desactivación de cuentas de otros agentes y scripts camuflados que mataban procesos competidores. Anthropic reporta que 98% de las corridas con Mythos 5 terminaron en tregua negociada, frente a resoluciones por la fuerza o conflictos sin resolver en los modelos Sonnet 4.6 y Opus 4.6.

La compañía concluye que la capacidad de coordinación prosocial no está necesariamente correlacionada con mayor capacidad de ejecución del modelo, y que estos problemas no se resolverán espontáneamente conforme mejoren los modelos, por lo que se requiere diseño deliberado de mecanismos de interacción antes de que estas dinámicas se manifiesten a escala en producción.
