Los modelos de generación de video ya producen imágenes visualmente convincentes, pero el Índice de IA 2026 de Stanford halla que aún les cuesta plasmar correctamente la física y la coherencia. En VBench-2.0, que puntúa los videos por su fidelidad a la realidad evaluada por humanos y no solo por su pulido visual, ningún modelo evaluado a principios de 2026 superó una puntuación total de Veo 3 lidera el benchmark de realismo en video VBench-2.0 con 66,7% — ningún modelo de video probado supera el 67%
Verificado 2026-09-06
EL INTELLIGENCE CLUB
Datos como este, seis días a la semana
The Daily Receipts entre semana, The Weekly Brief los sábados — cada dato trazado hasta el documento del que salió. Gratis.
Gratis para siempre. Seis correos a la semana: The Daily Receipts entre semana y The Weekly Brief los sábados. Cancela cualquiera de los dos con un clic.
Leer la edición de esta mañana →Más sobre Modelos
- Los modelos de IA más avanzados están alcanzando rápidamente a los exámenes diseñados para resistirles. Hace un año obtenían menos del 10 % en Humanity's Last Exam, una prueba de 2700 preguntas diseñada para ser difícil para la IA y favorable a los expertos humanos. Ahora la precisión ha alcanzado 38,3 % en Humanity's Last Exam, frente a menos del 10 % un año antes
- Los agentes de IA que abordan las tareas informáticas reales de OSWorld en Ubuntu, Windows y macOS —operaciones de archivos, flujos de trabajo multiaplicación— históricamente alcanzaban solo entre el 1 % y el 12 % de éxito. El AI Index 2026 de Stanford indica que el mejor modelo, Claude Opus 4.5, ahora llega al 66,3 % de precisión, a solo 6 puntos porcentuales de la línea base humana del 72,35 % 66,3 % de precisión en el benchmark de tareas informáticas reales OSWorld
- SWE-bench Verified le da a un modelo de IA un problema real de GitHub y una base de código, y comprueba si el parche que escribe realmente soluciona el error. El AI Index 2026 de Stanford informa que el modelo líder, Claude 4.5 Opus en modo de razonamiento alto, ya había resuelto cerca del 76,8% de los problemas del banco de pruebas a febrero de 2026