返回

档案库

每条事实,都有凭据

我们发布的每个数字,都附上产生它的机构以及它成立的日期。每张卡片上的等级说明凭据有多强——直接来自源头、经二手转述,或是具名分析师的估算。这里没有无来源的内容。 我们如何溯源.

  • 一手直接来自源头
  • 转述经由具名媒体
  • 估算具名分析师的预测
15 条事实
模型转述

顶尖AI模型正快速追上那些本应让它们止步的基准测试。一年前,它们在"人类终极考试"(Humanity's Last Exam,一项专为AI设计、对人类专家友好的2700题高难度测试)上的准确率还不到10%。如今准确率已达到 人类终极考试准确率38.3%,高于一年前的不到10%

来源Stanford AI Index 2026, citing CAIS·2026 AI Index Report
查看该事实
模型一手

Epoch AI 的能力指数把前沿模型放在同一把尺子上衡量,并将趋势拐点定在2024年4月,即推理模型与强化学习成为前沿训练主流之时。拐点之前,前沿水平每年提高8.3分;拐点之后, 每年15.5分,速度是此前的1.85倍

来源Epoch AI·December 2025
查看该事实
模型一手

Epoch AI测试了三款商用AI检测工具——Pangram、GPTZero、Originality.ai——均固定在其2026年6月的版本。面对简单的机器生成文本,它们几乎能全部识别;但当模型获得某位作者的五段文字样本并被要求模仿其写作风格后, AI检测工具漏检了13%模仿特定作者风格的AI文本,而普通AI文本的漏检率不到1%

来源Epoch AI·Jul 2026
查看该事实
模型一手

Epoch AI对发布当日上下文窗口位列前十的模型拟合趋势线,发现自2023年年中以来,前沿模型的上下文窗口长度每年 提高到上一年的约30倍

来源Epoch AI·since mid-2023
查看该事实
模型一手

前沿模型已经开始大规模发现软件漏洞。Epoch AI统计了微软、谷歌、苹果、思科等21家主要厂商披露的高危与严重级别漏洞,2026年7月的数量是: 2026年7月约2,500个高危及严重漏洞,是2026年4月之前月度纪录的5倍

来源Epoch AI·July 2026
查看该事实
模型一手

Epoch AI收集了2010年至2024年5月间发布的重要AI模型的333个算力估算数据,发现处于前沿的模型——即发布时算力排名前十的模型——其训练算力每年都能达到上一年的 5.3倍

来源Epoch AI·2010–May 2024 data
查看该事实
模型一手

Epoch AI在OpenAI反映评分异常后,对旗下数学基准测试FrontierMath进行审查,于2026年6月12日发布v2修订版:原始题目中42%存在计算或表述错误,修正后的题库共保留338道经核实的题目,分布在四个难度级别。 FrontierMath原始题目中42%存在错误

来源Epoch AI·June 2026 (v2 release)
查看该事实
模型估算

AI能力的进步不只是变强,获得同等能力所需的成本也在急剧下降。Epoch AI对比了在其FrontierMath基准测试上达到同样约27%准确率所需的token数——先是2025年4月的o4-mini,再到2025年12月的GPT-5.2——发现 同样的AI能力,成本约8个月降至三分之一,换算下来大约每年降至原来的十分之一到五分之一

来源Epoch AI·Feb 2026
查看该事实
模型估算

Epoch AI 对 42 个重要语言模型的估算显示,前沿训练成本已从 GPT-3 的约 200 万美元升至 单次训练最高接近 3.9 亿美元

来源Epoch AI·2024
查看该事实
模型一手

Epoch AI 的 Open Problems 题库收录职业数学家长期未能攻克的研究级数学难题。题库于2026年7月31日扩充至50题,两周后的统计(最新一项AI解答仍标注为暂定)为 4题由AI解出,1题由人类解出,45题仍未解决

来源Epoch AI FrontierMath·17 August 2026
查看该事实
模型一手

Epoch AI的能力指数(ECI)用一把尺子衡量语言模型的综合能力。自2023年3月GPT-4发布后稳居榜首约一年以来,再没有模型能守住第一这么久;第二长的纪录由OpenAI的o1保持,仅 三个多月,不到GPT-4在榜首时间的三分之一

查看该事实
模型一手

2026 年 1 月至 5 月,Epoch AI 的能力指数显示,最好的开放权重模型落后于闭源前沿模型 平均四个月

来源Epoch AI·Jan-May 2026
查看该事实
模型一手

规模并非人工智能进步的唯一推手。Epoch AI 测算达到固定语言模型性能水平所需的训练算力,发现这一需求正在快速下降: 预训练算力效率每 7.6 个月翻一番

来源Epoch AI·Feb 2026
查看该事实