TheVortiq
Inteligencia Artificial

IA multiagente detecta el 90% de bugs: Microsoft y Wiz marcan un antes y después

Los sistemas MDASH y Atlas combinan modelos de IA especializados para encontrar y reparar vulnerabilidades con una eficacia sin precedentes, superando a cualquier modelo único.

1 de agosto de 2026 · 4 min de lectura

an abstract image of a sphere with dots and lines
Foto de Growtika en Unsplash

¿Qué ha ocurrido?

Microsoft y Wiz, empresa propiedad de Google, han anunciado sistemas de inteligencia artificial multiagente para la detección y reparación de vulnerabilidades de software. El sistema de Microsoft, denominado MDASH, combina un modelo pequeño propio (MAI-Cyber-1-Flash) con GPT-5.4, logrando un 95.95% de éxito en el benchmark CyberGym. Por su parte, Wiz presentó Project Atlas, que utiliza Claude Opus 4.6 y GPT-5.5, alcanzando un 90.9% y descubriendo más de 200 vulnerabilidades zero-day en código abierto. Ambos sistemas superan ampliamente a modelos individuales como GPT-5.5 Cyber (85.6%) o Mythos 5 (83.8%).

Según The Register, el secreto del éxito de ambos sistemas radica en usar el modelo adecuado para cada tarea de seguridad. MDASH emplea MAI-Cyber-1-Flash para manejar hasta el 90% de las tareas rutinarias, reservando GPT-5.4 para el 10% restante más complejo. Wiz, por su parte, planea incorporar Gemini a Atlas, aprovechando la reciente colaboración con DeepMind en Gemini Flash Cyber. Estos resultados demuestran que la orquestación de múltiples modelos supera a cualquier modelo individual, marcando un hito en la automatización de la caza de bugs.

¿Por qué es importante?

Históricamente, encontrar y corregir bugs de seguridad ha sido un proceso manual, lento y costoso. Un estudio de 2023 estimó que el tiempo medio para parchear una vulnerabilidad crítica era de 97 días, exponiendo a las empresas a riesgos durante meses. Este avance demuestra que la combinación de modelos especializados puede automatizar gran parte del proceso, con tasas de éxito superiores al 90%. Además, al usar modelos más pequeños para tareas rutinarias y reservar los grandes para casos complejos, se reduce el coste hasta un 50%, según Mustafa Suleyman, CEO de Microsoft AI. Esto hace que la seguridad continua y escalable sea económicamente viable, permitiendo escaneos frecuentes incluso en entornos de desarrollo ágil.

El impacto en el mercado es significativo: según Gartner, el gasto global en seguridad de software superó los 200 mil millones de dólares en 2024, y la automatización con IA podría reducir costes operativos hasta en un 30%. Empresas como Wiz ya han demostrado que es posible descubrir más de 200 zero-days en código abierto, lo que antes requería equipos de élite durante meses. Esto presiona a otros proveedores de seguridad, como CrowdStrike o Palo Alto Networks, a adoptar enfoques multiagente para no quedar rezagados.

Consecuencias y contexto

La estrategia multiagente supone un cambio de paradigma: ningún modelo es el mejor para todo, y la clave está en orquestar varios. Wiz planea añadir Gemini a Atlas, mientras que Microsoft ya integra su modelo propietario MAI con GPT. Esto presiona a otros proveedores de seguridad a adoptar enfoques similares. Sin embargo, la comercialización de Atlas aún no está prevista; por ahora se usa internamente. Para las empresas, esto significa que la caza de bugs podría volverse más rápida, barata y precisa, reduciendo la ventana de exposición a vulnerabilidades críticas.

Históricamente, la detección de vulnerabilidades ha dependido de equipos humanos especializados, con herramientas como fuzzing o análisis estático. Sin embargo, estos métodos tienen limitaciones: el fuzzing encuentra bugs aleatorios pero no garantiza cobertura, y el análisis estático genera muchos falsos positivos. Los sistemas multiagente, al combinar modelos con diferentes fortalezas, ofrecen una solución más completa. Por ejemplo, MDASH utiliza agentes de equipo rojo (red-team) para encontrar vulnerabilidades y agentes de equipo verde (green-team) para repararlas, automatizando todo el ciclo. Wiz, por su parte, ha descubierto zero-days en proyectos críticos como OpenSSL y Kubernetes, lo que demuestra su eficacia en código real.

Sin embargo, existen desafíos: la integración de modelos de diferentes proveedores (Microsoft, OpenAI, Anthropic, Google) plantea retos de interoperabilidad y dependencia. Además, los benchmarks como CyberGym, aunque estándar, no cubren todos los escenarios reales. Como señaló Nir Ohfeld, head of vulnerability research en Wiz, "no hay un único modelo que sea el mejor en todo, y ninguno se mantiene a la vanguardia por mucho tiempo".

Lo que deben saber los lectores

  • Los sistemas multiagente no reemplazan a los equipos de seguridad humanos, sino que los potencian, asumiendo tareas repetitivas y complejas. Según Hayete Gallot, EVP de Microsoft Security, el objetivo es que los humanos se centren en tareas estratégicas mientras la IA maneja la detección y parcheo rutinario.
  • La eficacia varía según el benchmark; CyberGym es un estándar, pero no cubre todos los escenarios reales. Por ejemplo, GPT-5.5 Cyber obtuvo 85.6% en CyberGym, pero en pruebas internas de Wiz, Atlas logró descubrir zero-days que otros modelos pasaron por alto.
  • El coste reducido permite escaneos más frecuentes, lo que es crucial en entornos de desarrollo ágil donde el código cambia constantemente. Microsoft afirma que MDASH puede ejecutarse continuamente, con un coste por escaneo un 50% menor que usar solo modelos grandes.
  • La combinación de modelos de diferentes proveedores sugiere un ecosistema colaborativo, aunque también plantea retos de integración y dependencia. Wiz ya está trabajando en incorporar Gemini, y no se descarta que en el futuro se añadan más modelos.
  • El impacto en el mercado laboral: aunque no reemplaza a los humanos, cambia las habilidades requeridas. Los profesionales de seguridad necesitarán entender cómo orquestar y supervisar estos sistemas, en lugar de realizar tareas manuales de búsqueda de bugs.
"No hay un único modelo que sea el mejor en todo, y ninguno se mantiene a la vanguardia por mucho tiempo" — Nir Ohfeld, head of vulnerability research en Wiz.

En conclusión, los sistemas multiagente como MDASH y Project Atlas representan un avance significativo en la automatización de la caza de vulnerabilidades. Con tasas de éxito superiores al 90% y costes reducidos, están allanando el camino hacia una seguridad más proactiva y escalable. Sin embargo, su adopción generalizada requerirá superar desafíos técnicos y de integración, así como una evolución en las habilidades de los equipos de seguridad.

Puntos clave

  • Microsoft MDASH logra 95.95% de éxito en CyberGym combinando MAI-Cyber-1-Flash con GPT-5.4.
  • Wiz Atlas alcanza 90.9% usando Claude Opus 4.6 y GPT-5.5, descubriendo 200+ zero-days.
  • La estrategia multiagente reduce costes un 50% al usar modelos pequeños para tareas rutinarias.
  • Ningún modelo único es superior; la clave es orquestar varios según la tarea.
  • La caza de bugs automatizada se vuelve más rápida, barata y escalable.

Preguntas frecuentes

¿Qué es MDASH?

MDASH es un sistema de Microsoft que combina agentes red-team (encuentran vulnerabilidades) y green-team (las reparan), usando un modelo propio pequeño (MAI-Cyber-1-Flash) para el 90% de tareas y GPT-5.4 para el resto.

¿Qué es Project Atlas?

Atlas es un sistema de Wiz que utiliza Claude Opus 4.6 y GPT-5.5 para cazar bugs, logrando un 90.9% de éxito en CyberGym y descubriendo más de 200 vulnerabilidades zero-day.

¿Por qué es mejor usar múltiples modelos?

Porque ningún modelo es óptimo para todas las tareas. Algunos son mejores razonando exploits complejos, otros triando con precisión. La combinación permite asignar cada tarea al modelo más adecuado, mejorando resultados y reduciendo costes.

¿Está disponible comercialmente Atlas?

No, Atlas es una herramienta interna de Wiz. La compañía lo usa para entender cómo los modelos de frontera pueden mejorar el escaneo de código, pero no tiene planes inmediatos de comercializarlo.

¿Qué impacto tiene en la seguridad empresarial?

Permite automatizar la detección y reparación de vulnerabilidades con alta eficacia y menor coste, lo que facilita escaneos continuos y reduce la ventana de exposición a ataques.

Fuentes utilizadas

Comentarios

Sé el primero en comentar.

Deja tu comentario