分歧本身才是最重要的结果
对于高度先进或达到人类水平的 AI,预测的时间跨度从几年到几十年不等,还有一些研究者怀疑当前的方法是否根本无法产出这样的系统。这种分歧,并不是围绕某个共同科学模型的一点小小误差。预测者们在「什么才算 AGI」、「还剩哪些技术步骤」、「算力与数据等输入要素能以多快的速度增长」,以及「进展是否会平滑持续」等问题上,都存在分歧。因此,任何时间表都应当被呈现为一项在特定定义之下、附有日期的预测——而不是一台「AGI 倒计时钟」。
Demis Hassabis 提供了一个很好的例子,说明为何精确的归因如此重要。在 2025 年 3 月接受 CNBC 采访时,这位 Google DeepMind 首席执行官表示,达到人类水平的 AI 可能会在五到十年内出现。他并没有说,能够证明 AGI 存在的实质性证据会在「一年之内」出现(CNBC 采访)。即便是被正确引用的这句预测,也留下了一些问题:在哪些任务上达到人类水平?可靠性如何?自主程度又有多高?这句引言记录的是一位专家的判断,而不是一个经过测量的概率。
四类不应被混为一谈的预测
实验室负责人的言论十分显眼,而且是基于对前沿系统的直接接触做出的,但它们并不是中立的测量结果。企业高管掌握着关于实验的宝贵内部信息,但他们同时也在领导着与其他机构争夺资本、人才、客户与政治关注度的组织。他们的言论可能使用各家公司自定的定义,也很少会公开一套完整的预测模型。
研究者调查汇总了众多观点,揭示的是专家意见的分布情况。2024 年发布的《2023 年 AI 进展专家调查》,汇集了 2778 名研究者的意见,报告了关于「机器在一切可能任务上超越人类」这一问题的、跨度极大的估计范围;作者们同时也强调了受访者之间存在的巨大分歧,以及结果对问题措辞的敏感性(Grace 等人,2024 年)。调查描述的是某一时间点上的信念。它们并不能验证这些信念的正确性,也不能保证受访者们对术语的理解是一致的。
预测平台,例如 Metaculus,会持续汇总各方预测。其中位数的更新速度可能快于调查,但结果取决于具体的判定标准与参与者群体。「弱通用 AI」「变革性 AI」与「AGI」是不同的问题。一个市场或社区给出的中位数,应当连同其获取日期、问题措辞、区间范围与判定条件一并展示,而不应被当作一个适用于全站的统一截止日期。
基于模型的推演,是对算力、基准测试表现、算法效率,或智能体能够完成的任务时长等趋势进行外推。这类方法的价值在于让其假设变得可见,但当某项基准测试趋于饱和、某种资源约束开始收紧,或某种新范式改变了原有趋势时,外推就可能失效。一条曲线,是关于过往测量结果的证据;而它的延伸部分,则是一项有条件的预测。
当前的能力趋势究竟表明了什么
确实存在快速进步的真实证据。斯坦福 AI 指数记录了推理成本的下降,以及在高难度基准测试上分数的上升,同时也显示出,困难的评估依然未被攻克,标准化的负责任 AI 评估也参差不齐(斯坦福 2025 年 AI 指数)。METR 报告称,前沿智能体在给定成功概率下所能完成的、以软件类任务为主的人类专家用时时长,已经快速增长(METR 任务时长)。这些都是关于选定系统与测试的观察结果,并不是对 AGI 到来日期的直接观测。
METR 的这项指标尤其容易被误读。一个几小时的 50% 时长跨度,意味着在 METR 的任务集上,拟合出的模型预测,完成需要一名人类专家花费那么长时间的任务的成功概率为 50%。它并不意味着这个 AI 能独立自主运行那么多个小时。这些任务主要集中在软件工程、机器学习与网络安全领域;它们异乎寻常地自成一体、可被客观评分;目前而言,超过 16 小时的估计被认为是不可靠的;而真实的工作要混乱得多。METR 的研究人员曾提醒,误差范围可能达到大约两倍的量级,不同领域之间的差异更可能相差数个数量级(METR 局限性说明)。
这些结果支持的是一个范围更窄的结论:某些形式的数字化任务完成能力正在快速提升。它们本身并不能确立一个系统何时会成为一名可靠的科学家、管理者、照护者、政治决策者,或人类劳动力的全面替代品。
为何合理的预测会出现分歧
预期 AGI 会较早到来的预测者,往往强调扩展趋势的持续性、推理阶段计算量的提升、合成数据、工具使用,以及 AI 辅助研究。如果这些趋势相互强化,进展就可能加速。他们也可能主张,具有变革性经济影响的系统,未必需要复现人类智能的每一个特征;广泛的数字化能力或许就已经足够。
而预期时间表更长的预测者,则更强调可靠性、扎根现实的能力、持续学习能力、因果理解能力、机器人技术,以及基准测试与开放式工作之间的差距。他们还指出了一些现实层面的约束:能源、芯片、数据中心建设、高质量数据、评估工作,以及各类组织安全部署系统的能力。有些人预期需要超越当前大模型方法的架构性突破。这些立场,都无法仅凭自信或资历就能一锤定音。
定义本身也是造成表面分歧的另一个来源。一个能够将大量远程电脑工作自动化的系统,即便在具身任务上表现不佳,也可能具有变革性的经济影响。一个在广泛的考试题库上得分超过普通人类的模型,可能仍然因为不够可靠而无法独立运作。有的预测者可能会把这两种系统都称为 AGI;另一些人则可能把这个词,保留给那种在现实世界中具备稳健、等同于人类水平学习能力的系统。
如何维护一份负责任的时间表追踪记录
一份有用的追踪记录,应当保留原始措辞、发言者、日期、来源、定义与预测区间。它应当把个人估计与机构承诺区分开来,记录后续的修订,并且绝不应悄悄地用新预测替换掉旧预测。汇总性的预测应当展示不确定性区间,而不仅仅是一个中位数。该页面还应当披露潜在的利益驱动因素,以及该预测所依据的究竟是公开证据还是私有证据。
读者可以运用以下五个问题:
- 预测的究竟是什么结果? 是 AGI、达到人类水平的 AI、任务自动化,还是超级智能?
- 附带的概率与日期分别是什么? 「可能」并不等同于一个中位数预测。
- 是什么证据支撑着这一估计? 是扩展趋势、一项调查、私有实验,还是直觉判断?
- 什么样的情况会让预测者改变看法? 一项无法被证伪的预测很难被评判。
- 这项预测是否被追踪评分过? 过往的预测,在其截止日期过后也应当继续保持可查阅。
实践层面的结论
规划工作不应依赖于选定某一个具体日期。无论 AGI 是在 2028 年、2040 年到来,还是永远不会到来,近期的危害与机遇都值得被应对。政府与各类组织可以采用情景区间的方式:为快速的能力提升做好准备,构建即便在进展放缓的情况下依然有用的政策,并为更强的安全保障措施设定可衡量的触发条件。
这种不确定性本身就是可以据以行动的。它主张的是持续监测能力本身,而不是营销话术;主张投资于评估与韧性建设;并按照固定的周期重新审视各项预测。一份时间表页面若要赢得信任,靠的是坦诚展示这些日期究竟能证明多少东西的局限,而不是把一个不断移动的中位数,包装成一台指向命运的倒计时钟。