El nuevo banco de pruebas MirrorCode de Epoch AI y METR halló que el mejor modelo de IA reconstruyó correctamente software real solo a partir de su comportamiento en el 56% de los casos, frente a cerca del 30% de los modelos líderes unos ocho meses antes El mejor modelo de IA resuelve el 56% de las pruebas de programación más duras de Epoch AI, frente al 30% hace 8 meses
Verificado 2026-09-09
EL INTELLIGENCE CLUB
Datos como este, seis días a la semana
The Daily Receipts entre semana, The Weekly Brief los sábados — seis datos con fuente al día por email, dos más que la web gratuita. Cada uno trazado hasta el documento del que salió. Gratis.
Gratis para siempre. Seis correos a la semana: The Daily Receipts entre semana y The Weekly Brief los sábados. Cancela cualquiera de los dos con un clic.
Leer la edición de esta mañana →Más sobre Modelos
- Los modelos de IA ya pueden ganar el oro en la Olimpiada Internacional de Matemáticas, pero el AI Index 2026 de Stanford halló que aún fallan en una tarea que la mayoría de los niños dominan pronto. En los 180 diseños de reloj y 720 preguntas de ClockBench, el mejor modelo, GPT-5.4 High, leyó correctamente relojes analógicos solo el 50,6 % de las veces, frente al 90,1 % de los humanos
- Los modelos de IA más avanzados están alcanzando rápidamente a los exámenes diseñados para resistirles. Hace un año obtenían menos del 10 % en Humanity's Last Exam, una prueba de 2700 preguntas diseñada para ser difícil para la IA y favorable a los expertos humanos. Ahora la precisión ha alcanzado 38,3 % en Humanity's Last Exam, frente a menos del 10 % un año antes
- Los agentes de IA que abordan las tareas informáticas reales de OSWorld en Ubuntu, Windows y macOS —operaciones de archivos, flujos de trabajo multiaplicación— históricamente alcanzaban solo entre el 1 % y el 12 % de éxito. El AI Index 2026 de Stanford indica que el mejor modelo, Claude Opus 4.5, ahora llega al 66,3 % de precisión, a solo 6 puntos porcentuales de la línea base humana del 72,35 % 66,3 % de precisión en el benchmark de tareas informáticas reales OSWorld