Volver
ModelosPrimaria

Epoch AI auditó su benchmark FrontierMath después de que OpenAI señalara puntuaciones sospechosamente altas, y su versión v2, publicada el 12 de junio de 2026, corrigió errores en el 42 % de los problemas originales, dejando un conjunto verificado de 338 problemas en cuatro niveles. el 42 % de los problemas originales de FrontierMath tenía errores

FuenteEpoch AI·June 2026 (v2 release)

Verificado 2026-08-24

EL INTELLIGENCE CLUB

Datos como este, seis días a la semana

The Daily Receipts entre semana, The Weekly Brief los sábados — cada dato trazado hasta el documento del que salió. Gratis.

Gratis para siempre. Seis correos a la semana: The Daily Receipts entre semana y The Weekly Brief los sábados. Cancela cualquiera de los dos con un clic.

Leer la edición de esta mañana →