Volver
ModelosPrimaria

SWE-bench Verified le da a un modelo de IA un problema real de GitHub y una base de código, y comprueba si el parche que escribe realmente soluciona el error. El AI Index 2026 de Stanford informa que el modelo líder, Claude 4.5 Opus en modo de razonamiento alto, ya había resuelto cerca del 76,8% de los problemas del banco de pruebas a febrero de 2026

FuenteStanford AI Index·Feb 2026

Verificado 2026-09-04

EL INTELLIGENCE CLUB

Datos como este, seis días a la semana

The Daily Receipts entre semana, The Weekly Brief los sábados — cada dato trazado hasta el documento del que salió. Gratis.

Gratis para siempre. Seis correos a la semana: The Daily Receipts entre semana y The Weekly Brief los sábados. Cancela cualquiera de los dos con un clic.

Leer la edición de esta mañana →
cerca del 76,8% de los problemas del banco de pruebas a febr