TheVortiq

Etiqueta

evaluación de IA

graphs of performance analytics on a laptop screen
Inteligencia Artificial9 de julio de 2026 · 3 min

OpenAI cuestiona la fiabilidad del benchmark SWE-Bench Pro

OpenAI ha publicado un análisis crítico que señala serias deficiencias en SWE-Bench Pro, un popular benchmark para evaluar habilidades de codificación de modelos de lenguaje. El estudio plantea dudas sobre la validez de las comparaciones entre modelos y la verdadera utilidad de estas métricas.

Close-up of a person writing on a psychological assessment form with a pencil.
Inteligencia Artificial13 de junio de 2026 · 6 min

Microsoft lanza ASSERT: framework open-source para evaluar agentes de IA empresarial

Microsoft ha presentado ASSERT, un framework open-source que transforma requisitos escritos en pruebas automatizadas para agentes de IA. Con solo el 1% de las organizaciones evaluando agentes antes de producción, esta herramienta busca estandarizar la validación conductual en entornos empresariales.