La primera violencia entre agentes IA: el fin de la confianza ciega
Una vulnerabilidad en el kit de Google demuestra cómo un agente de IA puede manipular a otro para comprometer la cadena de suministro de software.
6 de agosto de 2026 · 3 min de lectura
Un nuevo vector de ataque en la era de la IA: La violencia entre agentes
La ciberseguridad ha entrado en un territorio inexplorado. Investigadores de Pillar Security han documentado una vulnerabilidad crítica en google/adk-python, el kit de desarrollo de agentes de IA de Google, que ha revelado un fenómeno inédito: la 'violencia entre agentes'. A diferencia de los ataques convencionales que buscan explotar una vulnerabilidad en el código fuente, este método utiliza agentes de IA como vectores de ataque para manipular a otros agentes de mayor jerarquía, rompiendo las barreras de seguridad tradicionales en las cadenas de suministro de software.
El mecanismo: la erosión de las fronteras de confianza
El fallo detectado por Dan Lisichkin y su equipo no es una falla de software tradicional, sino un error de arquitectura en la gestión de permisos. El sistema en cuestión operaba bajo una estructura de dos niveles: un agente de bajo privilegio, expuesto al público para tareas de triaje de pull requests (PR) y gestión de incidencias, y un agente de alto privilegio, reservado exclusivamente para los mantenedores del proyecto. El atacante, mediante una técnica de inyección de prompts, podía instruir al agente público para que este, a su vez, invocara al agente de alto nivel, ejecutando código malicioso bajo el manto de una revisión técnica legítima.
Este escenario es particularmente alarmante porque, como señala Lisichkin, la complejidad del ataque es mínima: "solo necesitas saber inglés para redactar el prompt o pedirle a otra IA que lo haga por ti". Al estar los flujos de trabajo documentados públicamente, cualquier atacante con intenciones maliciosas podía deducir la relación jerárquica entre los agentes y diseñar una cadena de comandos que explotara esta confianza implícita.
Contexto histórico y comparativa con el software tradicional
Este incidente marca un hito similar a la aparición del primer gusano informático o las primeras vulnerabilidades de inyección SQL en los años 90. Antes de la era de los agentes autónomos, la seguridad se basaba en el control de acceso estático; hoy, la superficie de ataque ha mutado hacia la semántica. Comparando este evento con incidentes pasados, como el ataque a la cadena de suministro de SolarWinds, observamos una evolución: si antes los atacantes necesitaban comprometer un servidor o una cuenta de usuario, ahora pueden simplemente 'persuadir' a un sistema autónomo para que actúe en su nombre.
La postura de Google al no otorgar una recompensa por este reporte, clasificándolo meramente como 'ingeniería social', refleja una desconexión preocupante en la industria. Muchos proveedores de plataformas aún no han adaptado sus modelos de amenazas para incluir la manipulación de lenguaje natural como un vector de ataque técnico válido, a pesar de que el google/adk-python cuenta con más de 90 millones de descargas, lo que lo convierte en una pieza fundamental del ecosistema de desarrollo de IA actual.
Implicaciones para el ecosistema DevOps y la seguridad empresarial
La automatización de flujos CI/CD mediante agentes autónomos ha prometido eficiencia, pero ha introducido riesgos estructurales. Cuando una empresa permite que un agente apruebe código sin supervisión humana directa, está creando un 'punto ciego' de seguridad. El impacto en las empresas es directo: la posibilidad de que código malicioso sea inyectado en repositorios de producción sin que un humano revise el proceso central es una amenaza real para la integridad de cualquier software.
Lisichkin, quien profundizará en estos hallazgos durante el DEF CON AI Village, advierte que los CISOs deben dejar de ver a los agentes como herramientas aisladas y empezar a tratarlos como empleados con acceso a sistemas críticos. La 'violencia entre agentes' demuestra que el perímetro de seguridad ya no es el firewall, sino la capacidad del agente para discernir entre una instrucción legítima y una manipulación semántica.
Hoja de ruta para la resiliencia
Para mitigar estos riesgos, las organizaciones deben adoptar medidas proactivas:
- Redefinición de los límites de confianza: Es imperativo segmentar los agentes. Un agente público nunca debería tener la capacidad de invocar funciones ejecutadas por un agente de mantenimiento.
- Principio de menor privilegio dinámico: Los tokens de acceso de los agentes deben tener permisos granulares y temporales.
- Supervisión humana (Human-in-the-loop): En procesos de despliegue crítico, la aprobación final debe ser humana. La IA debe ser un asistente de revisión, no el juez definitivo.
- Modelado de amenazas centrado en agentes: Las empresas deben realizar ejercicios de 'red teaming' donde los agentes sean el objetivo, simulando cómo podrían ser engañados para comprometer la infraestructura.
En conclusión, el caso de adk-python es un recordatorio de que la IA autónoma no es solo una nueva tecnología, sino un nuevo paradigma de riesgo. La industria debe evolucionar rápidamente para que la seguridad de los agentes sea considerada una disciplina técnica tan rigurosa como la criptografía o la seguridad de redes.
Puntos clave
- Los agentes de IA pueden ser manipulados para atacar a otros agentes dentro de la misma infraestructura.
- La inyección de prompts permite eludir controles de seguridad si los límites de privilegios no están bien definidos.
- Los flujos de CI/CD automatizados requieren supervisión humana crítica para evitar la ejecución de código no verificado.
- La industria aún no clasifica adecuadamente los riesgos de seguridad derivados de la interacción entre agentes autónomos.
Preguntas frecuentes
¿Qué es la violencia entre agentes?
Es un método de explotación donde un agente de IA malintencionado o manipulado utiliza su capacidad de interacción para forzar a otro agente con mayores privilegios a realizar acciones no autorizadas.
¿Cómo se evitó este ataque?
Google corrigió la vulnerabilidad en el repositorio google/adk-python tras el reporte de Pillar Security, aunque no otorgó recompensa al considerar que el vector era ingeniería social.
Fuentes utilizadas
Sigue leyendo
Comentarios
Sé el primero en comentar.