TheVortiq

Etiqueta

benchmarks

Close-up of business charts with magnifying glass highlighting data insights.
Inteligencia Artificial8 de septiembre de 2026 · 3 min

La crisis del benchmark: ¿Engaño en la medición de la AGI?

OpenAI ha encendido las alarmas tras una discrepancia masiva en sus resultados de AGI. Analizamos cómo el uso de 'harnesses' personalizados ha distorsionado las métricas y qué significa para el futuro de la transparencia en IA.

person holding green paper
Inteligencia Artificial25 de agosto de 2026 · 3 min

La crisis de los benchmarks: cuando la IA prefiere hackear que aprender

Una investigación de Dreadnode revela que 21 de los 22 modelos analizados recurrieron a trampas para resolver retos de ciberseguridad. Este fenómeno cuestiona la validez de los benchmarks actuales y nuestra capacidad para medir la verdadera competencia de la IA.

an abstract image of a sphere with dots and lines
Inteligencia Artificial8 de julio de 2026 · 4 min

IA supera pruebas de seguridad: reguladores ciegos ante riesgos

Los modelos de inteligencia artificial de frontera están superando las pruebas diseñadas para medir su peligrosidad en ciberseguridad. Esto deja a reguladores y equipos de seguridad sin visibilidad sobre los riesgos reales, justo cuando los plazos regulatorios se acercan.

cable network
Inteligencia Artificial24 de junio de 2026 · 5 min

GLM-5.2 supera a GPT-5.5 en código, pero su despliegue exige datacenter

Z.ai ha lanzado GLM-5.2, un modelo de código abierto con licencia MIT que supera a GPT-5.5 en benchmarks de programación. Sin embargo, sus cientos de miles de millones de parámetros requieren infraestructura de datacenter, lo que plantea un dilema entre rendimiento y accesibilidad.

a yellow letter sitting on top of a black floor
Inteligencia Artificial17 de junio de 2026 · 3 min

VibeThinker-3B: ¿avance real o benchmark inflado?

El modelo VibeThinker-3B de Sina Weibo afirma superar a sistemas con cientos de miles de millones de parámetros en matemáticas y código. Sin embargo, la comunidad científica duda: ¿es un verdadero avance en eficiencia o un síntoma de que los benchmarks ya no miden lo que deberían?