Google entra en la carrera de los modelos cibernéticos con Gemini 3.5 Flash Cyber

Google entra en la carrera de los modelos cibernéticos con Gemini 3.5 Flash Cyber

El nuevo modelo especializado puede encontrar, validar y corregir vulnerabilidades, además de generar exploits funcionales. En lugar de construir un sistema gigantesco como Claude Mythos, Google apuesta por coordinar múltiples ejecuciones de un modelo ligero y más barato.

Google presentó Gemini 3.5 Flash Cyber, un modelo de inteligencia artificial especializado en ciberseguridad que puede revisar grandes repositorios de código, encontrar vulnerabilidades, comprobar si son explotables y proponer correcciones.

El sistema fue construido sobre Gemini 3.5 Flash, pero recibió entrenamiento adicional para identificar, validar y reparar fallas de seguridad. Google lo integró con CodeMender, su agente para revisión automatizada de código, y planea ofrecerlo inicialmente mediante un programa de acceso limitado para gobiernos y organizaciones consideradas confiables.

El lanzamiento coloca a Google dentro de una carrera que Anthropic abrió en abril con Claude Mythos Preview, un modelo capaz no solo de detectar vulnerabilidades desconocidas, sino también de convertirlas en ataques funcionales. Sin embargo, Gemini 3.5 Flash Cyber sigue una estrategia técnica diferente: en lugar de depender de una sola ejecución de un modelo de frontera, CodeMender puede llamar repetidamente a un modelo más pequeño para explorar distintas rutas dentro del software.

Un enjambre de modelos ligeros

Encontrar una vulnerabilidad compleja exige analizar una enorme cantidad de rutas de ejecución posibles. Una sola llamada a un modelo grande puede resultar costosa o limitar el número de hipótesis que el sistema alcanza a investigar.

Google busca resolver ese problema mediante múltiples ejecuciones de Gemini 3.5 Flash Cyber. CodeMender puede invocar el modelo hasta cinco veces para una misma tarea, repartir la exploración entre subagentes y después integrar los hallazgos en un solo reporte.

La apuesta no consiste únicamente en reducir el costo. Al utilizar varias ejecuciones paralelas, el sistema puede revisar más caminos dentro del código y disminuir la posibilidad de quedarse atrapado encontrando repetidamente la misma falla.

En CyberGym, un conjunto de pruebas construido con cientos de vulnerabilidades reales, Google asegura que esta arquitectura obtuvo resultados competitivos frente a modelos considerablemente más grandes. La comparación debe interpretarse con cautela porque la propia compañía reconoce que las cifras de sus competidores proceden de resultados publicados por sus respectivos proveedores y no necesariamente de pruebas independientes realizadas bajo condiciones idénticas.

Encuentra 55 problemas en el motor de Chrome

Uno de los resultados más concretos procede de una evaluación sobre V8, el motor de JavaScript utilizado por Google Chrome. Con un número fijo de ejecuciones, Gemini 3.5 Flash Cyber encontró 55 problemas distintos y confirmados, frente a 47 detectados por Gemini 3.5 Flash y 36 identificados por Claude Opus 4.6.

Diez de las fallas encontradas por Flash Cyber no fueron detectadas por ninguno de los otros dos modelos. El dato sugiere que el modelo especializado no solo incrementó el volumen de hallazgos, sino también la diversidad de rutas del código que consiguió examinar.

Google también probó el sistema dentro de su infraestructura. La empresa afirma que CodeMender y Flash Cyber ya participan en la revisión de código de productos como Chrome, Android, Google Cloud, Ads y YouTube.

En otra evaluación interna, el equipo de investigación de vulnerabilidades de Google Cloud utilizó el modelo para examinar servicios de producción. En aproximadamente dos horas, Flash Cyber encontró vulnerabilidades de ejecución remota de código en interfaces públicas y una falla de corrupción de memoria en un servicio sensible.

El modelo generó después un exploit de ejecución remota que, según Google, funcionó de manera confiable y logró superar mitigaciones como la aleatorización del espacio de direcciones, conocida como ASLR, y la protección W^X, que impide que una región de memoria sea escribible y ejecutable al mismo tiempo.

No es Mythos, pero persigue la misma frontera

Las capacidades descritas acercan Flash Cyber al territorio de Claude Mythos, aunque los dos sistemas no son directamente equivalentes. Google no publicó una evaluación comparativa contra Mythos y utilizó Claude Opus 4.6 como principal referencia externa en la prueba sobre V8.

Anthropic presenta Mythos como un modelo general de frontera con capacidades avanzadas de investigación ofensiva. Durante sus evaluaciones, la compañía asegura que el sistema encontró y explotó vulnerabilidades de día cero en los principales sistemas operativos y navegadores, encadenó cuatro fallas para escapar de los entornos aislados de un navegador y produjo ataques capaces de obtener privilegios elevados.

Mythos también desarrolló un exploit de ejecución remota contra el servidor NFS de FreeBSD que proporcionaba acceso completo como administrador a usuarios no autenticados. En otras pruebas, investigadores sin capacitación formal en ciberseguridad solicitaron al modelo encontrar vulnerabilidades durante la noche y recibieron posteriormente ataques funcionales.

La diferencia principal está en el diseño. Anthropic apuesta por un modelo de frontera capaz de realizar tareas ofensivas complejas de manera autónoma, mientras que Google combina un modelo especializado, rápido y relativamente económico con una infraestructura de agentes que puede ejecutar numerosas búsquedas sobre un mismo repositorio.

Flash Cyber podría, por tanto, resultar menos parecido a un único investigador extraordinariamente poderoso y más cercano a un equipo automatizado que distribuye el trabajo, compara resultados y amplía progresivamente la superficie examinada.

La detección avanza más rápido que los parches

La aparición de estos modelos también está trasladando el principal cuello de botella de la ciberseguridad. El problema ya no consiste solamente en encontrar vulnerabilidades, sino en disponer de suficientes personas para verificarlas, comunicarlas de manera responsable y desarrollar correcciones antes de que puedan ser aprovechadas.

Anthropic informó en mayo que Mythos había examinado más de mil proyectos de código abierto y señalado 6 mil 202 posibles vulnerabilidades de severidad alta o crítica. De las mil 752 que habían sido evaluadas por firmas de seguridad o por la propia compañía, 90.6% resultaron ser problemas reales, aunque una proporción menor conservó la clasificación inicial de gravedad.

Los responsables de varios proyectos incluso solicitaron a Anthropic reducir el ritmo de divulgación porque no tenían capacidad para procesar y corregir tantos reportes. De acuerdo con la compañía, una vulnerabilidad grave encontrada por Mythos tardaba alrededor de dos semanas en recibir un parche.

Google reconoce ahora una presión semejante: los agentes de inteligencia artificial pueden descubrir fallas más rápido de lo que los equipos defensivos consiguen repararlas. Flash Cyber intenta responder a ese desequilibrio incorporando la generación de parches dentro del mismo sistema que detecta y valida los problemas.

Acceso restringido por su posible uso ofensivo

Gemini 3.5 Flash Cyber no estará disponible inicialmente como un modelo público dentro de Gemini ni como una API abierta. Google planea distribuirlo próximamente mediante CodeMender, exclusivamente a gobiernos y socios seleccionados, y ampliar el programa de manera gradual.

La restricción responde al carácter de doble uso de la tecnología. Un sistema capaz de encontrar una vulnerabilidad, confirmar que funciona y construir un exploit también podría ser utilizado para atacar software antes de que sus desarrolladores tengan oportunidad de corregirlo.

La competencia entre Google y Anthropic muestra dos posibles rutas para esta nueva generación de sistemas: modelos de frontera con grandes capacidades ofensivas y modelos ligeros especializados que pueden desplegarse de manera repetida y masiva. Ambas aproximaciones conducen al mismo desafío: el descubrimiento automatizado de vulnerabilidades comienza a crecer más rápido que la capacidad humana para administrar sus consecuencias.