返回
模型一手

Epoch AI在OpenAI反映评分异常后,对旗下数学基准测试FrontierMath进行审查,于2026年6月12日发布v2修订版:原始题目中42%存在计算或表述错误,修正后的题库共保留338道经核实的题目,分布在四个难度级别。 FrontierMath原始题目中42%存在错误

来源Epoch AI·June 2026 (v2 release)

已核实 2026-08-24

情报俱乐部

这样的事实,一周六天送达

The Daily Receipts 工作日送达,The Weekly Brief 周六送达——每一条都可追溯到原始出处。免费。

永久免费。每周六封邮件——The Daily Receipts 工作日送达,The Weekly Brief 周六送达——两者都可一键单独退订。

阅读今晨简报 →
Epoch AI在OpenAI反映评分异常后…