Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

AGI 时间线预测:各实验室与调查究竟怎么说

一份附有时间标注的 AGI 预测、预测性调查与怀疑论指南——以及为何无论信源多么自信,都不应把它们误当作一台倒计时钟。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
5 cited
Reading
1 min

分歧本身才是最重要的结果

对于高度先进或达到人类水平的 AI,预测的时间跨度从几年到几十年不等,还有一些研究者怀疑当前的方法是否根本无法产出这样的系统。这种分歧,并不是围绕某个共同科学模型的一点小小误差。预测者们在「什么才算 AGI」、「还剩哪些技术步骤」、「算力与数据等输入要素能以多快的速度增长」,以及「进展是否会平滑持续」等问题上,都存在分歧。因此,任何时间表都应当被呈现为一项在特定定义之下、附有日期的预测——而不是一台「AGI 倒计时钟」。

Demis Hassabis 提供了一个很好的例子,说明为何精确的归因如此重要。在 2025 年 3 月接受 CNBC 采访时,这位 Google DeepMind 首席执行官表示,达到人类水平的 AI 可能会在五到十年内出现。他并没有说,能够证明 AGI 存在的实质性证据会在「一年之内」出现(CNBC 采访)。即便是被正确引用的这句预测,也留下了一些问题:在哪些任务上达到人类水平?可靠性如何?自主程度又有多高?这句引言记录的是一位专家的判断,而不是一个经过测量的概率。

四类不应被混为一谈的预测

实验室负责人的言论十分显眼,而且是基于对前沿系统的直接接触做出的,但它们并不是中立的测量结果。企业高管掌握着关于实验的宝贵内部信息,但他们同时也在领导着与其他机构争夺资本、人才、客户与政治关注度的组织。他们的言论可能使用各家公司自定的定义,也很少会公开一套完整的预测模型。

研究者调查汇总了众多观点,揭示的是专家意见的分布情况。2024 年发布的《2023 年 AI 进展专家调查》,汇集了 2778 名研究者的意见,报告了关于「机器在一切可能任务上超越人类」这一问题的、跨度极大的估计范围;作者们同时也强调了受访者之间存在的巨大分歧,以及结果对问题措辞的敏感性(Grace 等人,2024 年)。调查描述的是某一时间点上的信念。它们并不能验证这些信念的正确性,也不能保证受访者们对术语的理解是一致的。

预测平台,例如 Metaculus,会持续汇总各方预测。其中位数的更新速度可能快于调查,但结果取决于具体的判定标准与参与者群体。「弱通用 AI」「变革性 AI」与「AGI」是不同的问题。一个市场或社区给出的中位数,应当连同其获取日期、问题措辞、区间范围与判定条件一并展示,而不应被当作一个适用于全站的统一截止日期。

基于模型的推演,是对算力、基准测试表现、算法效率,或智能体能够完成的任务时长等趋势进行外推。这类方法的价值在于让其假设变得可见,但当某项基准测试趋于饱和、某种资源约束开始收紧,或某种新范式改变了原有趋势时,外推就可能失效。一条曲线,是关于过往测量结果的证据;而它的延伸部分,则是一项有条件的预测。

当前的能力趋势究竟表明了什么

确实存在快速进步的真实证据。斯坦福 AI 指数记录了推理成本的下降,以及在高难度基准测试上分数的上升,同时也显示出,困难的评估依然未被攻克,标准化的负责任 AI 评估也参差不齐(斯坦福 2025 年 AI 指数)。METR 报告称,前沿智能体在给定成功概率下所能完成的、以软件类任务为主的人类专家用时时长,已经快速增长(METR 任务时长)。这些都是关于选定系统与测试的观察结果,并不是对 AGI 到来日期的直接观测。

METR 的这项指标尤其容易被误读。一个几小时的 50% 时长跨度,意味着在 METR 的任务集上,拟合出的模型预测,完成需要一名人类专家花费那么长时间的任务的成功概率为 50%。它并不意味着这个 AI 能独立自主运行那么多个小时。这些任务主要集中在软件工程、机器学习与网络安全领域;它们异乎寻常地自成一体、可被客观评分;目前而言,超过 16 小时的估计被认为是不可靠的;而真实的工作要混乱得多。METR 的研究人员曾提醒,误差范围可能达到大约两倍的量级,不同领域之间的差异更可能相差数个数量级(METR 局限性说明)。

这些结果支持的是一个范围更窄的结论:某些形式的数字化任务完成能力正在快速提升。它们本身并不能确立一个系统何时会成为一名可靠的科学家、管理者、照护者、政治决策者,或人类劳动力的全面替代品。

为何合理的预测会出现分歧

预期 AGI 会较早到来的预测者,往往强调扩展趋势的持续性、推理阶段计算量的提升、合成数据、工具使用,以及 AI 辅助研究。如果这些趋势相互强化,进展就可能加速。他们也可能主张,具有变革性经济影响的系统,未必需要复现人类智能的每一个特征;广泛的数字化能力或许就已经足够。

而预期时间表更长的预测者,则更强调可靠性、扎根现实的能力、持续学习能力、因果理解能力、机器人技术,以及基准测试与开放式工作之间的差距。他们还指出了一些现实层面的约束:能源、芯片、数据中心建设、高质量数据、评估工作,以及各类组织安全部署系统的能力。有些人预期需要超越当前大模型方法的架构性突破。这些立场,都无法仅凭自信或资历就能一锤定音。

定义本身也是造成表面分歧的另一个来源。一个能够将大量远程电脑工作自动化的系统,即便在具身任务上表现不佳,也可能具有变革性的经济影响。一个在广泛的考试题库上得分超过普通人类的模型,可能仍然因为不够可靠而无法独立运作。有的预测者可能会把这两种系统都称为 AGI;另一些人则可能把这个词,保留给那种在现实世界中具备稳健、等同于人类水平学习能力的系统。

如何维护一份负责任的时间表追踪记录

一份有用的追踪记录,应当保留原始措辞、发言者、日期、来源、定义与预测区间。它应当把个人估计与机构承诺区分开来,记录后续的修订,并且绝不应悄悄地用新预测替换掉旧预测。汇总性的预测应当展示不确定性区间,而不仅仅是一个中位数。该页面还应当披露潜在的利益驱动因素,以及该预测所依据的究竟是公开证据还是私有证据。

读者可以运用以下五个问题:

  1. 预测的究竟是什么结果? 是 AGI、达到人类水平的 AI、任务自动化,还是超级智能?
  2. 附带的概率与日期分别是什么? 「可能」并不等同于一个中位数预测。
  3. 是什么证据支撑着这一估计? 是扩展趋势、一项调查、私有实验,还是直觉判断?
  4. 什么样的情况会让预测者改变看法? 一项无法被证伪的预测很难被评判。
  5. 这项预测是否被追踪评分过? 过往的预测,在其截止日期过后也应当继续保持可查阅。

实践层面的结论

规划工作不应依赖于选定某一个具体日期。无论 AGI 是在 2028 年、2040 年到来,还是永远不会到来,近期的危害与机遇都值得被应对。政府与各类组织可以采用情景区间的方式:为快速的能力提升做好准备,构建即便在进展放缓的情况下依然有用的政策,并为更强的安全保障措施设定可衡量的触发条件。

这种不确定性本身就是可以据以行动的。它主张的是持续监测能力本身,而不是营销话术;主张投资于评估与韧性建设;并按照固定的周期重新审视各项预测。一份时间表页面若要赢得信任,靠的是坦诚展示这些日期究竟能证明多少东西的局限,而不是把一个不断移动的中位数,包装成一台指向命运的倒计时钟。

References

Summarized position

Demis Hassabis forecast in March 2025 that AGI could start to emerge within five to ten years.

Demis Hassabis, CEO, Google DeepMind
CNBC, Reported interview
  1. Grace 等人,2024 年 arxiv.org
  2. 斯坦福 2025 年 AI 指数 hai.stanford.edu
  3. METR 任务时长 metr.org
  4. METR 局限性说明 metr.org

Type to search the manual.

navigate open esc close