
顶尖AI模型正快速追上那些本应让它们止步的基准测试。一年前,它们在"人类终极考试"(Humanity's Last Exam,一项专为AI设计、对人类专家友好的2700题高难度测试)上的准确率还不到10%。如今准确率已达到 人类终极考试准确率38.3%,高于一年前的不到10%
查看该事实 →档案库
我们发布的每个数字,都附上产生它的机构以及它成立的日期。每张卡片上的等级说明凭据有多强——直接来自源头、经二手转述,或是具名分析师的估算。这里没有无来源的内容。 我们如何溯源.

顶尖AI模型正快速追上那些本应让它们止步的基准测试。一年前,它们在"人类终极考试"(Humanity's Last Exam,一项专为AI设计、对人类专家友好的2700题高难度测试)上的准确率还不到10%。如今准确率已达到 人类终极考试准确率38.3%,高于一年前的不到10%
查看该事实 →









Epoch AI 的 Open Problems 题库收录职业数学家长期未能攻克的研究级数学难题。题库于2026年7月31日扩充至50题,两周后的统计(最新一项AI解答仍标注为暂定)为 4题由AI解出,1题由人类解出,45题仍未解决
查看该事实 →
Epoch AI的能力指数(ECI)用一把尺子衡量语言模型的综合能力。自2023年3月GPT-4发布后稳居榜首约一年以来,再没有模型能守住第一这么久;第二长的纪录由OpenAI的o1保持,仅 三个多月,不到GPT-4在榜首时间的三分之一
查看该事实 →

