Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

反对近期 AGI 的怀疑论

由真正具备资历的知名研究者提出的、反对 AGI 即将到来的最有力技术论证——公正地予以呈现,而不是把它塑造成一个便于击倒的稻草人。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
10 cited
Reading
1 min

为什么会有这一页

本手册的大部分内容,都倾向于认真对待 AGI 风险,因为其中大部分篇幅讨论的是「如果乐观派是对的,会发生什么」。这种立场很容易让人把怀疑论者简化为一个稻草人——「他们只是不懂扩展定律」——然后就此略过。但这对那些打造了这个领域部分基础性工具的研究者们所持有的、有实质内容的立场而言,是不公平的。本页呈现的是他们真实的论证,而不是一个被刻意设计成注定会输的版本,也不对谁对谁错做出裁定;关于观点分布通常是如何被报道的,参见如何权衡关于 AGI 的主张AGI 时间线预测

Yann LeCun:没有世界模型,就没有规划能力

Yann LeCun 在 Meta 工作了十二年——包括创立其 FAIR 实验室——之后于 2025 年 11 月离职,到 2026 年 3 月时,他已成为 AMI Labs 的执行董事长兼联合创始人。这是一家总部位于巴黎的初创公司,已完成 10.3 亿美元的种子轮融资——据报道是欧洲有记录以来规模最大的初创公司种子轮融资——用于打造他所称的「世界模型」(TechCrunch)。这一点很重要:LeCun 的怀疑并没有软化为一种留有余地的说法——反而硬化成了一家他正押上自己整个职业生涯去经营的公司。

勒昆的反对意见是一种架构论证,并不是证明 Transformer 无法规划的定理。标准自回归模型在没有显式、持久的世界模型或独立规划器的情况下预测 token。模型的每次前向计算使用固定的计算图,但更大的系统仍可通过生成、评估或修订额外 token 来投入更多推理计算。这可以改善结果,却不能因此证明系统具备扎根现实的长期规划能力。

勒昆提出的替代方案是可配置的世界模型,用来预测合理的未来状态,并配合一个在多个抽象层级搜索行动的执行模块(勒昆的立场论文Meta 的研究概述)。这是他提出的研究方向,并非关于当前语言模型永远无法做到什么的定论。其核心判断是,稳健的自主智能需要从视频、空间经验和感觉运动经验中学习的架构,而不能只依赖文本。

Andrew Ng:提高举证标准

DeepLearning.AI 的创始人、AI Fund 的董事总经理、斯坦福大学兼职教授 Andrew Ng 认为,「AGI 已经变成了一个用来炒作的术语,而不是一个含义精确的术语」,并且这个行业距离打造出一个能完成人类能做的任何智力任务——从开卡车到写博士论文——的系统,还有几十年的路要走(PYMNTS)。他给出的具体贡献是方法论层面的:一项被称为「图灵-AGI 测试」的提案,即由一名评判者设计一场为期数天的真实工作测试——真实的任务,而不是精心挑选的演示——只有当该系统的表现能与一名熟练的人类相当时,才算通过。其要点在于:把评判标准从排行榜分数,转移到持续性的实际表现上,以此化解他所认为的泡沫式炒作风险。

Gary Marcus:幻觉、推理崩溃,以及层层假设复合而成的概率账

纽约大学心理学与神经科学荣休教授、Geometric Intelligence 与 Robust.AI 的创始人 Gary Marcus,构建了一个多线并进的论证体系。在可靠性方面:他指出大语言模型「实际上根本分不清真与假的区别」,并援引一项形式化证明——即便给予完美的数据与无限的算力,这类模型仍然会产生幻觉——他表示,GPT-5(2025 年 8 月)未能解决幻觉问题、OpenAI 的 o3 比其前代产生了更多幻觉,正印证了这一点(Marcus on AI)。在推理方面:他表示「我们不可能靠一个连 8 个圆盘的汉诺塔都玩不转的系统去解决物理学难题」——他援引苹果公司的研究发现,大语言模型的「推理」模型一旦超过某个复杂度门槛,就会崩溃,而不是渐进式地退化。

他被讨论得最多的一次发声,是方法论层面的:他抨击「AI 2027」这一预测情景是「披着科学外衣的虚构小说」——借用了叙事技巧,却把结果包装成引用与脚注齐全、仿佛真是一份预测报告的样子。Marcus 将这一情景拆解为大约八个依次排列的「信念飞跃」式里程碑,把它们各自隐含的概率相乘,结果表明,整条链条按计划全部兑现的复合概率接近于零(Substack)——他还援引了预测行业自身的历史记录作为佐证:2024 年就有人宣称幻觉问题「已经解决」,无人驾驶汽车据说到 2017 年就会「随处可见」。值得注意的是,Marcus 并不是在主张「AGI 不可能实现」——他表示,「任何认为 AGI 不可能实现的人」,和任何认为它即将到来的人一样,都是错的——他如今给出的可信到来时间是 2100 年,而不是 2027 年。这一立场本身就证明了怀疑论阵营内部也是一个分布区间,而不是单一的立场——这一点,时间线预测一页对整个领域也做出了同样的论断。

Tim Dettmers:计算是物理性的

艾伦人工智能研究所(Allen Institute for AI)的研究员 Tim Dettmers 提出了一个不依赖于模型架构的论证——它关乎的是物理学。他认为,GPU 的单位美元性能大约在 2018 年前后就已见顶,此后大部分可见的提升,来自更低精度的数值运算——即用更低的成本完成同样的运算——而不是真正意义上算力的增长。他估计,「或许还剩一到两年的扩展空间」,之后收益就会撞上内存、I/O 与功耗的墙,届时能源与成本将呈指数级增长,而能力提升却只是线性的(timdettmers.com)。他将「AGI」界定为需要在物理任务上具备具有经济意义的胜任能力,而不是基准测试的分数,并将这一逻辑延伸到其终点:即便是一个超级智能,在改进自身推理堆栈时,也会面临同样的物理约束。与上述论证不同,这一论证并不依赖于「关于大语言模型具体判断是否正确」这一前提——它是一种关于任何数字智能所运行的底层基质本身的主张。

更简短的名单:另请参阅

还有一份更简短的名单,补全了这一论证阵营。Robust.AI 的首席技术官、麻省理工学院机器人学荣休教授 Rodney Brooks,每年都会维护一份附有日期、可被证伪的预测记分卡——这在 AI 评论者中是罕见的自律做法——他根据数十年的机器人学经验指出,狭窄基准测试上的进步,一再被误认为是通用能力的提升。ARC-AGI 基准测试的创建者 François Chollet 指出,模型在专门设计用来抵御记忆式作答的任务上得分接近于零——较新的 ARC-AGI-3 测试中,2026 年表现最好的模型得分低于 1%,而人类的得分为 100%——他以此作为证据,说明智能是习得技能的效率,而不是规模本身。亚利桑那州立大学的 Subbarao Kambhampati 认为,无论如何提示,大语言模型都无法进行规划或自我验证,他如今甚至质疑「思维链」式的词元是否真的代表着真正的推理。圣塔菲研究所的 Melanie Mitchell 认为,大语言模型的成功反映的是对训练数据分布的模式匹配,而非因果推理。华盛顿大学语言学家、《随机鹦鹉》(Stochastic Parrots)一文的合著者 Emily Bender 认为,流畅的输出只是没有扎根理解的形式——被训练用来预测词序的模型,并不具备对交流意图的把握能力。

预测方法论本身也是被质疑的目标

除了具体的研究者之外,怀疑论者还直接把矛头对准了 AGI 时间表本身是如何被制造出来的。专家调查方法呈现出一种有据可查的「移动地平线」效应——无论何时被问及,受访者给出的 AGI 到来时间估计,大致都是「往后十五到二十五年」——再加上样本选择效应与措辞敏感性的叠加。2026 年 3 月的一份 RAND 报告,系统性地梳理了调查法、预测市场法与算力外推法这三类方法各自存在的问题(RAND)。

METR 自身的「任务时长」指标——这是被最常引用、用来证明进展正在加速的能力曲线,也是时间线预测一页所讨论的内容——同样受到了审视,其中也包括来自 METR 自身的审视。2026 年 1 月的一份说明披露,该机构对一个固定斜率的逻辑回归拟合应用了 35% 的修正,大约三分之一的任务难度估计是推断得出的、而非实测得出的,而且 METR「并不清楚」某个模型的真实任务时长是否真的落在其所报告的置信区间之内(METR)。一篇几天前发表的独立批评文章走得更远:这些任务被设计得不切实际地「干净」,公开的解决方案可能已经污染了数据,而人类基线用时来自一个规模很小、且受金钱激励驱动的样本,这很可能夸大了这些任务「应当」花费的时间——这使得 AI 表面上看起来的加速,在一定程度上只是这种比较方式本身造成的假象(Transformer News)。无论怎么看,这个领域中相当大一部分关于时间表的推断,都是围绕着这一条充满噪音、连其自身作者都无法完全担保的曲线拟合重新定价的。

这又叠加了一个更古老的问题:古德哈特定律(Goodhart’s Law)在基准测试上的体现。一旦某项基准测试变成了一个优化目标,各实验室就会针对排行榜本身进行微调,而不是针对该测试原本想要衡量的那个构念——MMLU 的得分,从 2020 年 GPT-3 的 43 分(对比人类基线的 90 分),一路发展到 2024 年年中,顶尖模型的得分已经聚集得如此紧密,以至于彼此间的差异已经落在了提示词格式所造成的噪音范围之内。基准测试的数据泄漏污染,使得不断上升的分数更难被解读为真实的能力提升。关于「超越某项基准测试」与「达到 AGI」为何是两种不同的主张,参见如何权衡关于 AGI 的主张能力阶梯

本页并未主张的内容

以上这些都不足以构成「AGI 不可能实现」的论证,上述任何一位研究者也都没有做出这样的断言——Marcus 明确表示两种极端立场都是错的。这些论证真正确立的,是一些实实在在的内容:一些不会随着规模扩大就明显得到解决的架构性限制;一个不受任何路线图影响的物理算力天花板;以及一套预测机制——按照 METR 自己的说法——甚至无法完全为人人都在引用的那条曲线本身担保。这一切究竟意味着「还要几十年」,还是「比本页所暗示的更近」,正是本手册刻意不替读者下定论的地方。但本页绝不会让怀疑论沦为一个被漫画化的靶子。

References

Summarized position

Yann LeCun proposes a configurable predictive world model and hierarchical planner as a route to grounded reasoning and planning, while arguing that current autoregressive language models lack key ingredients for autonomous intelligence.

Yann LeCun, Professor, NYU; Chief AI Scientist, Meta at publication
A Path Towards Autonomous Machine Intelligence, Primary source
Summarized position

Andrew Ng argues AGI is decades away and has proposed a 'Turing-AGI Test' — a multi-day real-work trial — to raise the evidentiary bar above benchmark-score claims.

Andrew Ng, Founder, DeepLearning.AI; Managing General Partner, AI Fund
PYMNTS, Reported interview
Summarized position

Gary Marcus cites a formal proof that large language models will hallucinate even given perfect data and unlimited compute, and says GPT-5 and OpenAI's o3 failed to resolve the problem.

Gary Marcus, Professor Emeritus of Psychology and Neural Science, NYU; founder, Geometric Intelligence and Robust.AI
Marcus on AI (Substack), Primary source
Summarized position

Gary Marcus calls the 'AI 2027' forecasting scenario fiction dressed as science, arguing its roughly eight sequential technical assumptions compound to a near-zero probability of landing on schedule.

Gary Marcus, Professor Emeritus of Psychology and Neural Science, NYU; founder, Geometric Intelligence and Robust.AI
Marcus on AI (Substack), Primary source
Summarized position

Tim Dettmers argues GPU price-performance plateaued around 2018 and that only one or two more years of meaningful compute scaling remain before physical limits on memory, power and I/O bind.

Tim Dettmers, Researcher, Allen Institute for AI (Ai2)
timdettmers.com, Primary source
Summarized position

METR disclosed that its widely cited 'time horizon' capability curve applies a 35% correction to a fitted logistic curve, and that it has 'no idea' whether any model's true time horizon sits inside the reported confidence interval.

METR, "Clarifying Limitations of Time Horizon" notice
METR, Research/report
Summarized position

Nathan Witkin argues METR's time-horizon benchmark rests on unrealistically clean tasks, possible data contamination from public solutions, and a small, financially incentivized human-baseline sample that inflated apparent AI acceleration.

Nathan Witkin, Contributor, Transformer News
Transformer News, Primary source
Summarized position

RAND Corporation catalogs a 'moving horizon' bias across AGI-timeline surveys, in which forecasters place AGI roughly fifteen to twenty-five years out regardless of when they are asked, plus selection and framing effects.

RAND Corporation, "Artificial General Intelligence Forecasting and Scenario Analysis" report
RAND Corporation, Research/report
  1. TechCrunch techcrunch.com
  2. Meta 的研究概述 ai.meta.com

Type to search the manual.

navigate open esc close