Volver
ModelosPrimaria
SWE-bench Verified le da a un modelo de IA un problema real de GitHub y una base de código, y comprueba si el parche que escribe realmente soluciona el error. El AI Index 2026 de Stanford informa que el modelo líder, Claude 4.5 Opus en modo de razonamiento alto, ya había resuelto cerca del 76,8% de los problemas del banco de pruebas a febrero de 2026
Verificado 2026-09-04
EL INTELLIGENCE CLUB
Datos como este, seis días a la semana
The Daily Receipts entre semana, The Weekly Brief los sábados — cada dato trazado hasta el documento del que salió. Gratis.
Gratis para siempre. Seis correos a la semana: The Daily Receipts entre semana y The Weekly Brief los sábados. Cancela cualquiera de los dos con un clic.
Leer la edición de esta mañana →El filtro · 72 empresasCada capa de la cadena de la IA, con precios diariosCómo se verificóCada cifra enlaza con el informe del que salió
Más sobre Modelos
- Los modelos de IA más avanzados están alcanzando rápidamente a los exámenes diseñados para resistirles. Hace un año obtenían menos del 10 % en Humanity's Last Exam, una prueba de 2700 preguntas diseñada para ser difícil para la IA y favorable a los expertos humanos. Ahora la precisión ha alcanzado 38,3 % en Humanity's Last Exam, frente a menos del 10 % un año antes
- Los agentes de IA que abordan las tareas informáticas reales de OSWorld en Ubuntu, Windows y macOS —operaciones de archivos, flujos de trabajo multiaplicación— históricamente alcanzaban solo entre el 1 % y el 12 % de éxito. El AI Index 2026 de Stanford indica que el mejor modelo, Claude Opus 4.5, ahora llega al 66,3 % de precisión, a solo 6 puntos porcentuales de la línea base humana del 72,35 % 66,3 % de precisión en el benchmark de tareas informáticas reales OSWorld
- El índice de capacidades de Epoch AI puntúa los modelos de frontera en una sola escala agregada y sitúa un quiebre de la tendencia en abril de 2024, cuando los modelos de razonamiento y el aprendizaje por refuerzo se impusieron en el entrenamiento de frontera. Antes del quiebre la frontera ganaba 8,3 puntos al año; después, 15,5 puntos al año, 1,85 veces la velocidad anterior