如何解读这份快照
本仪表盘记录的是截至 2026 年 9 月 13 日的公开证据。它不是一个实时更新的排行榜,也不应被悄悄更新。AI 产品、脚手架、评估集与价格的变化速度太快,一份不标注日期的「最新」页面难以保持诚实可信。
能力是多维度的。一个系统可能解得出一道奥赛难题,却读不懂一个指针式时钟;可能答得出专家级的生物学问题,却完成不了一项实验室工作流程;也可能通过某个编程评分系统的测试,却写出一个维护者会拒绝合并的补丁。斯坦福 2026 年 AI 指数将这种模式称为参差不齐的智能(jagged intelligence),并记录了受控环境与真实环境之间的巨大差距(斯坦福 AI 指数,技术表现)。
下表中的评级描述的是现有证据,而不是某种放之四海而皆准的模型。「强」意味着领先系统在相关的公开评估中表现出色。它并不意味着安全、等同于人类水平,或可靠到足以承担自主的高风险任务。
| 维度 | 2026 年 9 月的证据 | 重要局限 |
|---|---|---|
| 语言与知识 | 在广泛的问答与多模态测试中表现强劲 | 幻觉、数据污染与不均衡的事实可靠性依然存在 |
| 数学与结构化推理 | 前沿系统在部分选定题目上达到顶尖竞赛水平的成绩 | 表现仍然参差不齐,且对工具与推理预算敏感 |
| 编程与计算机操作 | 在编程与结构化桌面智能体基准测试上进步迅速 | 通过评分系统的测试,并不保证产出可维护的生产级代码 |
| 长任务自主性 | 所测得的软件任务时长跨度增长迅速 | 主要限于较为「干净」的软件/机器学习/网络安全类任务;并非独立运行的持续时长 |
| 科学辅助 | 领域知识扎实,方案生成与故障排查表现不断改善 | 知识层面的高分,并不能证明具备端到端的实验能力 |
| 网络能力 | 智能体能够发现真实漏洞,并完成部分选定的专家级任务 | 端到端的自主攻击尚未有公开确证的案例 |
| 说服力 | 在受控实验中观察到可测量的意见转变 | 尚未证实存在人群规模的恶意影响 |
| 机器人与具身能力 | 在受控环境中取得显著进展 | 家庭与开放世界环境中的可靠性仍然低得多 |
| 安全性与可靠性 | 保障措施与评估方法正在改进 | 报告披露并不一致,也没有任何方法能够保证可控性 |
推理能力令人印象深刻,但参差不齐
2026 年 AI 指数报告称,一套 Google DeepMind 系统在 2025 年国际数学奥林匹克竞赛(IMO)的比赛时限内,取得了金牌级别的成绩。同一章节还报告称,在 ClockBench 测试中,表现最好的受测模型正确读出指针式时钟的比例仅约一半,而人类的正确率约为 90%。这两项测试的重要性并不对等,但两者之间的反差,足以推翻存在单一标量式「智能水平」的想法。
基准测试上的提升,可能反映的是更好的基础模型、更多的推理阶段计算量、工具的使用、对多个候选答案的采样,或是专门定制的脚手架。一项结果所对应的,是在特定条件下经过完整测试的系统。它不应被随意套用到某个更廉价的产品版本,或某个受时间限制的部署场景之中。
许多测试也很快就会饱和。斯坦福报告称,在「人类的最后一场考试」(Humanity’s Last Exam)上进步陡峭,而在 SWE-bench Verified 上则接近饱和,同时也指出其中存在无效题目以及排行榜可能被针对性优化的问题。饱和意味着一项评估在区分领先系统方面的辨别力下降了;它并不意味着相关领域本身已经被彻底解决。
编程与计算机操作
领先的智能体能够修复选定代码库中的问题,编写大量代码,并操作图形化应用程序。斯坦福报告称,OSWorld 的表现已从约 12% 提升至 66.3%,但仍有大约三分之一的结构化任务无法完成。而在真实的计算机使用场景中,还会遇到不断变化的界面、不明确的目标、身份凭证、对抗性内容,以及基准测试可能遗漏的各种后果。
自动化评分是另一道边界。METR 在 2026 年对 SWE-bench 补丁的一项研究发现,通过该基准测试的测试用例,并不意味着维护者就会真的合并这些改动,这凸显出在功能性测试用例之外还存在其他质量维度(METR 维护者评审研究)。生产环境中的编程工作,需要架构设计、沟通、安全性、维护,以及对故障承担相应责任。
这些证据支持的是:AI 能够为部分选定工作提供实质性的辅助与自动化。它并不支持「软件工程已被解决」这一说法。
长任务自主性
METR 在 2026 年 5 月发布的仪表盘,估算的是智能体能够以 50% 或 80% 的预测成功率完成的任务所对应的人类专家用时时长。这些任务主要涉及软件工程、机器学习与网络安全领域。METR 指出,以目前的测试集而言,超过 16 小时的测量结果并不可靠(METR 任务时长)。
这项指标经常被误读。四小时的时长跨度,并不意味着智能体能够独立运行四个小时;它意味着,对于该难度等级的任务,一名人类专家通常需要约四个小时才能完成。而成功完成任务的智能体,实际耗时可能要快得多。这套测试集本身是自成一体、可客观评分的,这与大多数组织内部的工作大不相同。
METR 还进一步提醒,不同领域之间的差异可达数个数量级,误差范围可能很大,而在需要 98% 可靠性的场合,一个 50% 的时长跨度指标是远远不够的(METR 局限性说明)。这一趋势是选定数字类任务领域快速进展的有力证据——但它并不是一个倒数计时器,不代表就业自动化或 AGI 即将到来。
科学、生物与网络领域
英国 AI 安全研究院报告称,截至 2025 年 10 月接受测试的系统,在部分选定的化学与生物学问题上超过了其博士级专家基线,并在方案生成与实验室故障排查方面有所改善。该机构同时也报告称,系统在端到端质粒设计方面仍持续存在困难(AISI 前沿 AI 趋势报告)。这些是政府层面的评估结果,但专家基线的设定与任务的构造方式,仍然决定着这些结果的实际含义。
网络能力已经从单纯的问答,发展到能够发现漏洞并解决多步骤挑战的智能体阶段。AISI 在 2026 年 2 月报告称,其网络任务测量指标增长速度加快(AISI 网络趋势)。《国际 AI 安全报告》将这一证据与实际部署情况区分开来:攻击者确实在使用 AI,但公开报道中尚未出现完全自主的端到端攻击案例,而攻方与守方谁能从中获益更多,仍不确定(2026 年国际 AI 安全报告)。
说服力与社交能力
在实验中,对话式 AI 能够改变人们的态度。2026 年一项由 AISI 主导、涉及 76977 名参与者的研究发现,相较于规模扩大或基础的个性化定制,提示词工程与专门针对说服力的训练后优化,带来的说服效果更大;个性化定制所带来的效果提升不足一个百分点。而说服力的增强,与事实准确性的下降相关联(AISI 说服力研究)。
这一发现确立的是在实验条件下可测量的能力。它并不能证明存在持久的行为改变、选举层面的影响,或对人群的操控能力。触达范围、平台分发方式、竞争性信息,以及用户信任与效果的持久性,仍是各自独立的变量。
具身能力仍是一大差距
机器人技术最清楚地体现出受控环境与开放环境之间的差异。斯坦福报告称,在一项模拟基准测试中成功率很高,但在实际测试的家庭任务中,成功率仅为 12%。自动驾驶汽车已在受限的服务区域内实现了具有实际意义的规模化运营,而其运行设计范围以及场外人工支持,对于理解这一成果至关重要。
不应把语言模型广泛的数字界面能力,误认为是物理世界中的通用能力。感知、操作、在人类周围的安全性、从新颖错误中恢复的能力、硬件维护以及成本,都在制约着实际部署。本手册的人形机器人章节对基准测试演示与真实世界机器人表现之间的这一差距,按公司逐一进行了更详细的追踪。
可靠性是能力的一部分
一个成功率为 66% 的智能体,在有人工审查的情况下可能是有用的,而在没有审查的情况下则可能是不可接受的。高风险系统需要经过校准的不确定性评估、故障检测、申诉机制、审计日志、回滚能力、安全性,以及人工兜底。平均的基准测试分数,往往掩盖了那些罕见但后果严重的错误。
2026 年 AI 指数发现,开发者披露主流能力基准测试结果的一致性,远高于披露负责任 AI 评估结果的一致性(AI 指数负责任 AI 章节)。公开结果的缺失,并不能证明内部测试也不存在,但它确实限制了外界的比较与公众的信心保障。
这份仪表盘无法证明的事情
它无法证明意识的存在、意图的存在、跨所有工作岗位的经济价值,也无法证明存在一条被普遍接受的 AGI 门槛。它也不能证明,某项基准测试的结果可以迁移到另一种语言、另一群使用者、另一套工具、另一种成本限制,或另一种对抗性环境之中。它也无法解决现有架构是否能够发展为稳健的通用智能这一问题。
就本快照所呈现的证据而言,最站得住脚的结论是:前沿系统在展现出非凡广度与快速进步的同时,依然存在持续的脆弱性、领域差距,以及不完整的安全证据。这一结论,比「不过是自动补全」或「AGI 已经到来」这两种说法,都更具现实意义,也更为准确。