Terminal-Bench 2.0 evalua si los agentes de IA pueden encadenar el tipo de trabajo de terminal de varios pasos y sin supervision que un desarrollador realiza en un dia: compilar codigo, entrenar modelos, configurar servidores. El AI Index 2026 de Stanford informa que la precision de los agentes en esta prueba casi se cuadruplico en un ano, alcanzando 77,3% a principios de 2026, frente al 20% de febrero de 2025
Verificado 2026-09-02
EL INTELLIGENCE CLUB
Datos como este, seis días a la semana
The Daily Receipts entre semana, The Weekly Brief los sábados — cada dato trazado hasta el documento del que salió. Gratis.
Gratis para siempre. Seis correos a la semana: The Daily Receipts entre semana y The Weekly Brief los sábados. Cancela cualquiera de los dos con un clic.
Leer la edición de esta mañana →Más sobre Modelos
- Los modelos de IA más avanzados están alcanzando rápidamente a los exámenes diseñados para resistirles. Hace un año obtenían menos del 10 % en Humanity's Last Exam, una prueba de 2700 preguntas diseñada para ser difícil para la IA y favorable a los expertos humanos. Ahora la precisión ha alcanzado 38,3 % en Humanity's Last Exam, frente a menos del 10 % un año antes
- Los agentes de IA que abordan las tareas informáticas reales de OSWorld en Ubuntu, Windows y macOS —operaciones de archivos, flujos de trabajo multiaplicación— históricamente alcanzaban solo entre el 1 % y el 12 % de éxito. El AI Index 2026 de Stanford indica que el mejor modelo, Claude Opus 4.5, ahora llega al 66,3 % de precisión, a solo 6 puntos porcentuales de la línea base humana del 72,35 % 66,3 % de precisión en el benchmark de tareas informáticas reales OSWorld
- El índice de capacidades de Epoch AI puntúa los modelos de frontera en una sola escala agregada y sitúa un quiebre de la tendencia en abril de 2024, cuando los modelos de razonamiento y el aprendizaje por refuerzo se impusieron en el entrenamiento de frontera. Antes del quiebre la frontera ganaba 8,3 puntos al año; después, 15,5 puntos al año, 1,85 veces la velocidad anterior