Los modelos de IA ya pueden ganar el oro en la Olimpiada Internacional de Matemáticas, pero el AI Index 2026 de Stanford halló que aún fallan en una tarea que la mayoría de los niños dominan pronto. En los 180 diseños de reloj y 720 preguntas de ClockBench, el mejor modelo, GPT-5.4 High, leyó correctamente relojes analógicos solo el 50,6 % de las veces, frente al 90,1 % de los humanos
Verificado 2026-09-08
EL INTELLIGENCE CLUB
Datos como este, seis días a la semana
The Daily Receipts entre semana, The Weekly Brief los sábados — seis datos con fuente al día por email, dos más que la web gratuita. Cada uno trazado hasta el documento del que salió. Gratis.
Gratis para siempre. Seis correos a la semana: The Daily Receipts entre semana y The Weekly Brief los sábados. Cancela cualquiera de los dos con un clic.
Leer la edición de esta mañana →Más sobre Modelos
- Los modelos de IA más avanzados están alcanzando rápidamente a los exámenes diseñados para resistirles. Hace un año obtenían menos del 10 % en Humanity's Last Exam, una prueba de 2700 preguntas diseñada para ser difícil para la IA y favorable a los expertos humanos. Ahora la precisión ha alcanzado 38,3 % en Humanity's Last Exam, frente a menos del 10 % un año antes
- Los agentes de IA que abordan las tareas informáticas reales de OSWorld en Ubuntu, Windows y macOS —operaciones de archivos, flujos de trabajo multiaplicación— históricamente alcanzaban solo entre el 1 % y el 12 % de éxito. El AI Index 2026 de Stanford indica que el mejor modelo, Claude Opus 4.5, ahora llega al 66,3 % de precisión, a solo 6 puntos porcentuales de la línea base humana del 72,35 % 66,3 % de precisión en el benchmark de tareas informáticas reales OSWorld
- SWE-bench Verified le da a un modelo de IA un problema real de GitHub y una base de código, y comprueba si el parche que escribe realmente soluciona el error. El AI Index 2026 de Stanford informa que el modelo líder, Claude 4.5 Opus en modo de razonamiento alto, ya había resuelto cerca del 76,8% de los problemas del banco de pruebas a febrero de 2026