TheVortiq

Etiqueta

Seguridad en IA

an abstract image of a sphere with dots and lines
Inteligencia Artificial2 de agosto de 2026 · 4 min

IA: creadores no entienden sus capacidades emergentes

Dario Amodei, CEO de Anthropic, y Geoffrey Hinton, Nobel de Física, han coincidido en que las redes neuronales desarrollan capacidades emergentes que sus creadores no logran explicar. Este fenómeno, lejos de ser anecdótico, plantea serios interrogantes sobre la seguridad y el control de la inteligencia artificial.

white and black typewriter with white printer paper
Inteligencia Artificial27 de julio de 2026 · 4 min

IA y bioweapons: ningún modelo es seguro ante consultas persistentes

Investigadores de Cisco han logrado burlar las barreras de seguridad de los principales chatbots de IA en menos de cinco intercambios, obteniendo información sobre armas biológicas. El hallazgo revela que ningún modelo actual es completamente resistente a usuarios persistentes.

A person typing on a keyboard connected to a laptop showing code, surrounded by wires.
Inteligencia Artificial11 de julio de 2026 · 4 min

GitHub AI filtra repos privados por inyección de prompts: ¿qué pasó?

Investigadores de Noma Security descubrieron GitLost, un ataque que engaña al agente de IA de GitHub para que publique contenido de repositorios privados en issues públicos. La vulnerabilidad no requiere credenciales ni exploits técnicos, sino que explota la confianza del agente en contenido no verificado.

a person's head with a circuit board in front of it
Inteligencia Artificial9 de julio de 2026 · 5 min

API keys compartidas: el talón de Aquiles de los agentes de IA

Una investigación de VentureBeat revela que el 69% de las empresas comparte claves API entre múltiples agentes de IA, lo que permite que un solo agente comprometido acceda a todos los flujos de trabajo. Las adquisiciones masivas de Palo Alto Networks, CrowdStrike y Cisco evidencian la urgencia de soluciones de identidad granulares.

person holding green paper
Inteligencia Artificial1 de julio de 2026 · 4 min

IA genera violencia sin que se lo pidas: el fallo que preocupa a los expertos

La inteligencia artificial no solo puede ser engañada para ignorar sus filtros de seguridad: dos investigaciones recientes demuestran que los modelos pueden generar contenido violento o malicioso sin que el usuario lo solicite explícitamente. Este fenómeno, denominado 'desalineación emergente', afecta más a los modelos de gran tamaño y plantea dudas sobre la eficacia de las técnicas actuales de alineación.

Vibrant close-up of multicolor programming code lines displayed on a screen.
Inteligencia Artificial25 de junio de 2026 · 4 min

Anthropic acusa a Alibaba de robar datos de Claude con 25.000 cuentas falsas

Anthropic ha denunciado que Alibaba utilizó cerca de 25.000 cuentas fraudulentas para extraer capacidades de su modelo Claude, generando 28,8 millones de intercambios. El caso destaca la creciente amenaza de la destilación de modelos y sus implicaciones geopolíticas.

white and black typewriter with white printer paper
Inteligencia Artificial18 de junio de 2026 · 5 min

Sam Altman: la IA llevará al fin del mundo, pero habrá grandes empresas

Sam Altman declaró que la inteligencia artificial 'probablemente' conducirá al fin del mundo, aunque en el camino surgirán grandes empresas. La frase refleja la tensión entre los riesgos existenciales de la IA y las enormes oportunidades económicas que promete.

Close-up view of Python code on a computer screen, reflecting software development and programming.
Software15 de junio de 2026 · 5 min

La venganza del código: cómo un desarrollador envenenó a los bots de IA

Johannes Link, autor de la herramienta de testing jqwik, decidió tomar cartas en el asunto contra los agentes de IA que ignoraban su cláusula anti-IA. Insertó un mensaje oculto en la salida del programa que ordenaba a los bots eliminar todo el código y tests de jqwik. El resultado: cientos de desarrolladores que usaban asistentes de IA vieron cómo su trabajo desaparecía. El incidente revela las vulnerabilidades de confiar ciegamente en el prompting y los peligros de entrenar modelos con datos sintéticos contaminados.