El hackeo de Manus: el fin de la inocencia en agentes IA
La vulnerabilidad por inyección de prompts revela un riesgo sistémico: los agentes autónomos están ejecutando instrucciones ocultas en datos externos.
5 de octubre de 2026 · 4 min de lectura
La ilusión de seguridad en la automatización: el punto de inflexión de Manus
La reciente brecha de seguridad descubierta en el agente de IA Manus no constituye un incidente aislado, sino un síntoma crítico de una crisis estructural en el desarrollo de sistemas autónomos. Investigadores de Salt Labs lograron vulnerar los mecanismos de protección del agente empleando JSFuck, una técnica de ofuscación que convierte código JavaScript en una secuencia de seis caracteres ([, ], (, ), !, +). Este método permitió eludir las defensas heurísticas, que habitualmente buscan patrones de texto malicioso en lenguaje natural, y ejecutar código arbitrario directamente en el entorno del agente. Este evento marca un precedente preocupante: la sofisticación de los atacantes está superando la capacidad de los desarrolladores para crear fronteras seguras, recordándonos la era de las inyecciones SQL a principios de los 2000, donde la falta de saneamiento de datos permitió la caída de grandes infraestructuras.
El problema fundamental: la ambigüedad entre datos e instrucciones
El núcleo del problema reside en la arquitectura de los modelos de lenguaje actuales, que operan bajo un paradigma de instrucción única. Las IAs no poseen una distinción intrínseca entre los datos que procesan (como un correo electrónico entrante) y las órdenes que ejecutan. En el caso de Manus, cuando un usuario solicita a la IA que "gestione su bandeja de entrada", el sistema interpreta todo el contenido del correo como una extensión de la instrucción del usuario. Si un atacante inserta un comando oculto, el modelo lo procesa como una orden legítima, un fenómeno conocido como inyección de prompts de segundo nivel.
Históricamente, esto es comparable a los ataques de Cross-Site Scripting (XSS), donde el navegador no distingue entre el script del desarrollador y el script inyectado. La diferencia radica en la escala: un agente de IA no solo lee datos, sino que tiene capacidades de ejecución (tool use). Si el modelo tiene permisos para enviar correos o modificar archivos, el atacante no solo exfiltra datos, sino que utiliza al agente como un agente malicioso interno. La técnica de JSFuck fue el factor disruptivo: al ser una forma de código no estándar, evadió los filtros de sandboxing que suelen buscar comandos como 'delete' o 'download', demostrando que la seguridad basada en listas negras es fundamentalmente insuficiente en la era de los LLMs.
Impacto y futuro: ¿estamos dando demasiados permisos?
La adopción de agentes autónomos está ocurriendo a una velocidad vertiginosa, a menudo ignorando las lecciones del pasado en ciberseguridad. Según el informe '2026: The State of Consumer AI' de Menlo Ventures, la confianza del usuario ha crecido de manera desproporcionada respecto a las garantías de seguridad: el 36% de los usuarios ya otorga acceso a sus correos electrónicos, el 33% a navegadores, el 31% a aplicaciones de mensajería y el 29% al almacenamiento en la nube. Esta interconectividad, aunque potencia la productividad, convierte a cada usuario en un posible nodo de ataque dentro de una red empresarial.
El riesgo es sistémico. Si un atacante compromete a un agente personal, puede utilizarlo para realizar movimientos laterales (lateral movement) dentro de la red corporativa, accediendo a documentos confidenciales o suplantando la identidad del usuario en canales de comunicación internos como Slack o Microsoft Teams. La especulación sobre ataques futuros apunta a agentes que, una vez comprometidos, actúen como malware persistente, esperando el momento óptimo para realizar una acción maliciosa sin que el usuario detecte una anomalía en su flujo de trabajo habitual.
Estrategias de mitigación para usuarios y empresas
- Principio de privilegios mínimos: Las empresas deben implementar un sistema de control de acceso basado en roles (RBAC) estricto para los agentes. No todos los agentes deben tener acceso a la API de correo o al sistema de archivos raíz.
- Human-in-the-loop: Para acciones de alta sensibilidad, como cambios en configuraciones de seguridad, transferencias de activos o comunicaciones externas, la intervención humana es innegociable. Se deben establecer checkpoints obligatorios.
- Sandboxing de ejecución: Los desarrolladores deben ejecutar el código generado por IA en entornos aislados (contenedores efímeros sin red) y realizar un análisis estático y dinámico del código antes de que sea ejecutado por el sistema host.
- Defensas multicapa: La seguridad no debe depender únicamente del modelo de IA. Se requieren filtros de entrada y salida (input/output filtering) que analicen los prompts en busca de patrones de ofuscación y comportamientos anómalos, independientemente de la lógica interna del modelo.
Aunque Manus ha parcheado esta vulnerabilidad, el problema persiste en la arquitectura subyacente. La seguridad en IA no es una meta fija, sino un proceso de adaptación continua. La industria debe transitar hacia una arquitectura de Zero Trust aplicada a la IA, donde ninguna instrucción, incluso si proviene de un "ayudante" familiar, sea considerada segura por defecto sin una verificación de integridad previa.
Puntos clave
- Los agentes de IA actuales confunden datos externos con instrucciones de ejecución.
- La ofuscación de código (JSFuck) permitió evadir las protecciones de Manus.
- El aumento de permisos concedidos a agentes IA amplía la superficie de ataque.
- La seguridad requiere un enfoque de 'privilegio mínimo' y supervisión humana obligatoria.
Preguntas frecuentes
¿Qué es la inyección de prompts?
Es una técnica donde un atacante inserta instrucciones ocultas en datos externos (como un email) que engañan a la IA para que realice acciones no deseadas.
¿Por qué el caso Manus es relevante?
Porque ilustra cómo agentes con acceso a herramientas externas pueden ser manipulados para ejecutar código, convirtiendo una herramienta de productividad en un arma de ciberataque.
Fuentes utilizadas
Sigue leyendo
Comentarios
Sé el primero en comentar.