返回
模型转述
视频生成模型如今已能制作出视觉上极具说服力的画面,但斯坦福《2026年AI指数报告》发现,它们在物理规律和一致性方面仍力不从心。VBench-2.0基准以人类评判的真实贴合度而非单纯视觉观感为标准,2026年初测试的所有模型中,没有一个总分超过 Veo 3以66.7%的成绩领跑VBench-2.0视频真实感基准,所有受测AI视频模型均未突破67%
已核实 2026-09-06
情报俱乐部
这样的事实,一周六天送达
The Daily Receipts 工作日送达,The Weekly Brief 周六送达——每一条都可追溯到原始出处。免费。
永久免费。每周六封邮件——The Daily Receipts 工作日送达,The Weekly Brief 周六送达——两者都可一键单独退订。
阅读今晨简报 →更多模型
- 顶尖AI模型正快速追上那些本应让它们止步的基准测试。一年前,它们在"人类终极考试"(Humanity's Last Exam,一项专为AI设计、对人类专家友好的2700题高难度测试)上的准确率还不到10%。如今准确率已达到 人类终极考试准确率38.3%,高于一年前的不到10%
- AI智能体在OSWorld真实电脑任务基准测试中(涵盖Ubuntu、Windows和macOS的文件操作与多应用工作流)的成功率过去长期只有1%至12%。斯坦福《2026年AI指数报告》显示,表现最佳的模型Claude Opus 4.5如今准确率达66.3%,与72.35%的人类基线仅差6个百分点 OSWorld基准测试准确率达66.3%
- SWE-bench Verified会给AI模型一个真实的GitHub问题和对应代码库,检验它写出的补丁能否真正修复漏洞。斯坦福《2026年AI指数报告》显示,截至2026年2月,表现最佳的模型——高推理模式下的Claude 4.5 Opus——已解决了 约76.8%的测试问题