La reciente actualización del Intelligence Index a la versión 4.2 marca un avance significativo en la evaluación de modelos de inteligencia artificial, adaptándose a los rápidos cambios en el campo de la tecnología. Este lanzamiento se enfoca en proporcionar tareas más complejas y realistas, con la inclusión de conjuntos de pruebas privadas que buscan mitigar el fenómeno del «gaming» o manipulación de resultados.
Entre las novedades más destacadas de esta versión se encuentra el **AA-Briefcase**, una evaluación de trabajo del conocimiento que examina modelos en la realización de proyectos de conocimiento a largo plazo, construidos por expertos de la industria. La evaluación combina distintos métodos de calificación para ofrecer una visión holística del rendimiento analítico y la calidad de presentación de los modelos.
Además, se ha introducido el **GDP.pdf**, una herramienta creada por Surge AI que evalúa la capacidad de razonamiento en documentos a lo largo de 4,592 páginas distribuidas en 100 PDFs y diez dominios. La generación de resultados se basa en un conjunto de criterios atomizados que exige un cumplimiento total para validar las respuestas, favoreciendo así un análisis más riguroso.
Una de las modificaciones más relevantes es el aumento al 40% en la ponderación dedicada a conjuntos de pruebas privadas, el doble de su predecesora en la versión 4.1. Esta estrategia tiene como objetivo reducir la posibilidad de que los laboratorios encuentren formas de manipular las evaluaciones. De cara al futuro, se anticipa que esta proporción seguirá aumentando en la versión 5 del Intelligence Index.
Resultados y Rendimiento de Modelos
En el competitivo panorama de inteligencia artificial, Anthropic y OpenAI sobresalen en el índice, con el modelo **Claude Fable 5.1** liderando, seguido por **GPT-6 Astra** de OpenAI, que presenta una mejora notable respecto a su predecesor, **GPT-5.6 Sol**. Meta, SpaceXAI, Moonshot/Kimi, Z.AI y Google completan los rankings, evidenciando un ecosistema dinámico donde los avances tecnológicos son constantes.
Un aspecto crucial del índice es la eficiencia en la generación de tokens. **GPT-6 Astra** se ha posicionado como el modelo más eficiente en este aspecto, mostrando un rendimiento superior al de casi todos los modelos en la frontera de la inteligencia.
Además de los avances en eficacia, la actualización ha abordado la robustez del sistema de calificación, mejorando la infraestructura para ofrecer evaluaciones más precisas, y corrigiendo errores en los criterios de respuesta. Esta atención al detalle es vital, especialmente para las empresas que buscan asegurar resultados fiables y consistentes a medida que despliegan sus tecnologías.
Con esto, el Intelligence Index no solo busca evaluar, sino también adaptarse a un entorno rápidamente cambiante, asegurando que los modelos de inteligencia artificial no solo sean competentes en un entorno controlado, sino también en aplicaciones del mundo real.
