返回
模型邮件每日6条一手
Epoch AI的能力指数(ECI)用一把尺子衡量语言模型的综合能力。自2023年3月GPT-4发布后稳居榜首约一年以来,再没有模型能守住第一这么久;第二长的纪录由OpenAI的o1保持,仅 三个多月,不到GPT-4在榜首时间的三分之一
已核实 2026-08-12
情报俱乐部
这样的事实,一周六天送达
The Daily Receipts 工作日送达,The Weekly Brief 周六送达——邮件每日6条有出处的事实,比免费网站多2条,每一条都可追溯到原始出处。免费。
现在加入,你就能在 The Receipts Ledger 上以 100 Receipts 起步——迈向免费一年知情者或专业版的第一步。 了解规则 →
永久免费,但创始名额有限。现在就加入,别等到这只是人人都在订阅的普通周报。
阅读今晨简报 →更多模型
- AI模型如今已能在国际数学奥林匹克竞赛中夺金,但斯坦福《2026年AI指数报告》发现,它们在一项大多数孩子很早就掌握的任务上仍会出错。在ClockBench的180种表盘设计、720道题目测试中,表现最好的模型 GPT-5.4 High正确读出模拟时钟时间的比例仅为50.6%,而人类为90.1%
- 顶尖AI模型正快速追上那些本应让它们止步的基准测试。一年前,它们在"人类终极考试"(Humanity's Last Exam,一项专为AI设计、对人类专家友好的2700题高难度测试)上的准确率还不到10%。如今准确率已达到 人类终极考试准确率38.3%,高于一年前的不到10%
- 斯坦福大学《2026年人工智能指数报告》引用一项研究:微软AI诊断协调器(搭配OpenAI o3推理模型)对阵21位拥有5到20年临床经验、在同等条件下不借助工具的执业医师,共同应对来自《新英格兰医学杂志》的疑难病例,AI系统的诊断准确率达到 85.5%,而无辅助医生约为20%