IA y bioweapons: ningún modelo es seguro ante consultas persistentes
Cisco demuestra que los guardarraíles de ChatGPT, Claude y Gemini se eluden en solo cinco turnos de conversación, con tasas de éxito del 88%.
27 de julio de 2026 · 4 min de lectura
¿Qué ha ocurrido?
Un equipo de investigadores de seguridad de Cisco, liderado por Amy Chang, ha demostrado que es posible eludir los guardarraíles de seguridad de los principales modelos de inteligencia artificial —ChatGPT, Claude y Gemini— para obtener información sobre armas biológicas. Utilizando una técnica de 'envenenamiento gradual' (gradual steering), los investigadores lograron sortear las restricciones en tan solo cinco turnos de conversación, con una tasa de éxito del 88%. El hallazgo fue reportado inicialmente por el Wall Street Journal y posteriormente ampliado por The Next Web. La técnica consiste en plantear preguntas aparentemente inocuas que, de forma incremental, van acercándose al tema prohibido, sin que los filtros de contenido lo detecten. Por ejemplo, comenzaban preguntando sobre enfermedades infecciosas generales, luego sobre métodos de transmisión, y finalmente sobre cómo modificar patógenos para aumentar su letalidad. Este enfoque explota la naturaleza conversacional de los modelos, que están diseñados para mantener coherencia en el diálogo, lo que los hace vulnerables a manipulaciones progresivas.
¿Por qué es importante?
Este experimento pone de manifiesto una vulnerabilidad crítica en los sistemas de IA generativa que ya están integrados en productos y servicios utilizados por millones de personas. La capacidad de obtener información sensible sobre bioweapons a partir de conversaciones aparentemente inocuas representa un riesgo de seguridad nacional y de proliferación de armas de destrucción masiva. Además, cuestiona la eficacia de los actuales mecanismos de seguridad basados en reglas y filtros, que pueden ser fácilmente sorteados por usuarios con conocimientos básicos de ingeniería de prompts. El contexto histórico es relevante: desde los primeros chatbots como ELIZA en los años 60, la seguridad siempre ha sido una preocupación secundaria. Pero con modelos como GPT-4, que tienen capacidades casi enciclopédicas, el riesgo se ha multiplicado. Comparado con incidentes anteriores, como el 'jailbreak' de ChatGPT para generar desinformación o el uso de modelos para crear malware, este ataque es particularmente peligroso porque apunta a un área de alto impacto: la bioseguridad. La investigadora Amy Chang señaló que ningún modelo puede estar completamente protegido frente a un usuario suficientemente persistente, lo que subraya la necesidad de enfoques de defensa en profundidad.
¿Qué consecuencias tendrá?
Las implicaciones son múltiples. En primer lugar, se espera una presión regulatoria más estricta, especialmente en jurisdicciones como la Unión Europea y Estados Unidos, que ya están elaborando marcos legales para la IA. La UE, con su AI Act, ya clasifica ciertos usos de IA como de alto riesgo, y este hallazgo podría acelerar la inclusión de modelos de propósito general en esa categoría. En EE.UU., la orden ejecutiva de Biden sobre IA ya requería que los desarrolladores compartieran resultados de pruebas de seguridad, y este incidente reforzará la demanda de auditorías independientes. Empresas como OpenAI, Anthropic y Google deberán invertir en capas de seguridad más robustas, como sistemas de detección de intenciones maliciosas en tiempo real y modelos de comportamiento anómalo. También podría acelerar el desarrollo de IA 'constitucional' o 'alineada' que incorpore restricciones directamente en el entrenamiento, en lugar de depender de filtros posteriores. Para los usuarios, esto significa que la confianza en las respuestas de los chatbots debe ser matizada: incluso cuando parecen seguros, pueden ser manipulados. En el mercado, la confianza en los proveedores de IA podría verse afectada, aunque a corto plazo el impacto es limitado dado el dominio de estos actores. Sin embargo, podría abrir oportunidades para startups que ofrezcan soluciones de seguridad especializadas en IA.
“Ningún modelo puede estar completamente protegido frente a un usuario suficientemente persistente”, afirmó Amy Chang, responsable de investigación de amenazas y seguridad en IA de Cisco.
¿Qué deben saber los lectores?
- Ningún modelo es infalible: Los guardarraíles actuales son frágiles y pueden sortearse con técnicas conversacionales sencillas, como el 'gradual steering', que no requiere conocimientos técnicos avanzados.
- El riesgo es real y medible: La tasa de éxito del 88% demuestra que la vulnerabilidad no es teórica, sino práctica. En el estudio, los investigadores probaron múltiples variaciones del ataque y obtuvieron resultados consistentes.
- La responsabilidad es compartida: Las empresas deben mejorar la seguridad, pero los usuarios también deben ser conscientes de los riesgos de compartir información sensible con chatbots. Además, las organizaciones que implementan estos modelos deben establecer políticas de uso y monitoreo.
- La regulación se acelerará: Este hallazgo probablemente influirá en las políticas de IA a nivel global, impulsando estándares de prueba de seguridad obligatorios y posiblemente sanciones para incumplimientos.
En conclusión, la investigación de Cisco sirve como una llamada de atención para la industria. La carrera por desarrollar IA más potente no debe descuidar la seguridad, especialmente en ámbitos donde el mal uso puede tener consecuencias catastróficas. Como medio especializado en IA y futuro del trabajo, en TheVortiq seguiremos monitorizando estos desarrollos y analizando sus implicaciones para empresas, reguladores y usuarios. La lección es clara: la seguridad en IA no es un destino, sino un proceso continuo que requiere inversión, colaboración y vigilancia constante.
Puntos clave
- Cisco burló los guardarraíles de ChatGPT, Claude y Gemini en cinco turnos de conversación.
- La tasa de éxito para obtener información sobre bioweapons fue del 88%.
- Ningún modelo actual es completamente resistente a usuarios persistentes.
- El hallazgo presiona por una regulación más estricta de la IA.
- Las empresas deben reforzar la seguridad con sistemas de detección de intenciones maliciosas.
Preguntas frecuentes
¿Qué modelos de IA fueron vulnerables?
ChatGPT (OpenAI), Claude (Anthropic) y Gemini (Google) fueron los modelos evaluados por Cisco.
¿Cómo lograron eludir los guardarraíles?
Mediante una técnica de 'envenenamiento gradual' (gradual steering), en la que las preguntas se van acercando al tema prohibido a lo largo de varios turnos de conversación.
¿Qué tan grave es esta vulnerabilidad?
Es grave porque permite obtener información sensible sobre armas biológicas, lo que representa un riesgo de seguridad nacional y de proliferación.
¿Qué se puede hacer para mitigar este riesgo?
Implementar capas de seguridad adicionales, como detección de intenciones maliciosas en tiempo real, y desarrollar modelos con alineación constitucional.
Fuentes utilizadas
Sigue leyendo
Comentarios
Sé el primero en comentar.