Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

01 定义

什么是 AGI,什么不是

「AGI」一词的使用往往并不严谨。在任何关于风险的讨论变得有意义之前,都需要一个可操作的定义,以及一种衡量某个系统究竟离达到这一定义有多近的方法。

Written by
Dwight Ringdahl
Revised
Sources
2 cited

可操作的定义

通用人工智能并没有一个统一公认的测试标准。在本手册中,它指的是这样一种系统: 具备广泛的认知能力、达到或超越人类水平的表现、能够可靠地迁移到陌生任务,并具备 足够的自主性以完成具有实际后果的工作。每一部分都很重要:目前的通用模型在某些方 面确实广泛,在某些评测上表现也相当出色,但仍然存在不可靠、参差不齐的问题,这使 得简单地用「是」或「不是」AGI 来贴标签具有误导性。

真正重要的区别

通用性、表现水平与自主性是三个彼此独立的维度。一个系统可以就许多主题侃侃而谈, 却在长任务上仍不可靠;也可能在某一领域超越专家,却无法将这种能力迁移到其他领 域。因此,本手册追踪的是一组综合指标,而不是把「能否迁移」当作某条神奇的分界线。

值得关注的能力门槛

以下四项信号有助于区分不同情景,但没有一项能构成完整的 AGI 测试。其中一些可以直 接测量;另一些则要通过评测来推断,而这些评测的有效性与覆盖面仍存在争议。

门槛 衡量内容 为何重要
自主任务时长 在给定可靠性水平下,智能体能够完成的基准任务所对应的人类完成时间。 记录了在长时程软件、机器学习与网络安全任务上的快速进展,但并不能衡量所有真实工作,也不等同于字面意义上的自主运行时长。
自主使用工具 自行编写并运行代码、自行调配算力、招募其他软件智能体。 使模型成为一个影响力超出自身上下文窗口的行动者。
情境意识 系统对自身正被评估这一事实、评估者是谁,以及该评估奖励何种行为的认知模型。 会削弱评估本身的有效性:一个知道自己正被测试的系统,在测试中可能表现出不同的行为。
递归自我改进 系统对其后继系统的设计做出实质性贡献。 这是一种被提出的加速机制,而非已被观察到或普遍认可的硬性门槛。

一些研究者与实验室领袖怎么说

预测因人而异,并非测量结果。2025 年 3 月,Google DeepMind 首席执行官给出了这样 一个个人估计:

Summarized position

Demis Hassabis forecast in March 2025 that AGI could start to emerge within five to ten years.

Demis Hassabis, CEO, Google DeepMind
CNBC, Reported interview

另一份 2023 年的联合声明由研究者、企业高管及其他公众人物签署,以政策语言提出了 灾难性风险。该声明记录的是签署者的立场,并不是对概率的估计:

Summarized position

Signatories to the Statement on AI Risk hold that mitigating the risk of extinction from AI should be a global priority alongside pandemics and nuclear war.

Signatories to the Statement on AI Risk, Researchers, executives, and other public figures; statement hosted by the Center for AI Safety
safe.ai, Signed statement

定义为何决定应对方案

本手册后续的每一项应对方案——无论是财务、数字还是物理层面——都取决于这些门槛中 究竟哪一个已被真正跨越。为「更聪明的聊天机器人」制定的家庭方案,与为一个能够自 主管理资金、编写并部署软件、在几乎无人监督的情况下执行长期计划的系统制定的方案, 截然不同。第 02 章将探讨每一项门槛在经济与国家层面可能意味着什么;本章则是理解 那一章所需的基础词汇。

基础 优先阅读

本章内容

16 页 篇,收录于本章

AGI、弱人工智能与超级智能:能力阶梯 根据 DeepMind 的广度-深度框架,阐述专用人工智能、广泛能力系统、AGI 与超级智能之间的区别,以及为何没有任何单一测试能够确定这些边界。
来源已核查 1 min
图灵测试及其后继者 为何类人对话无法确立 AGI 的存在,以及现代评估方法如何借助一整套基准测试组合,来衡量能力、可靠性与自主性。
来源已核查 1 min
前沿 AI 实验室有何不同 利用附有日期的一手信源,比较主要前沿 AI 实验室的所有权结构、治理方式、发布策略与已发布的安全框架。
来源已核查 1 min
算力与扩展定律详解 理解 AI 扩展定律预测的是什么、其预测在何处会失灵,以及为何训练算力仍然是一个不完美却有用的治理信号。
来源已核查 1 min
如何权衡关于 AGI 的主张 一套证据阶梯,用于区分演示案例、评估结果、部署数据、预测与理论性风险论证,并附有一张六字段证据卡。
来源已核查 1 min
当前 AI 能力仪表盘:2026 年 9 月 前沿 AI 能力的一份固定时点、多维度快照——即斯坦福 AI 指数所称的「参差不齐的智能」——以及为何基准测试并不能证明 AGI 的存在。
来源已核查 1 min
AI 加速的 AI 研究与反馈回路 AI 目前对编程与模型研究的实际贡献是什么,以及要发生怎样的变化,才可能出现一场自我强化的能力爆炸——而不仅仅是自动补全。
来源已核查 1 min
AGI 寒冬与虚假的黎明 反向情景分析:为何 AGI 可能无法如期到来、一次 AI 寒冬对安全与人才意味着什么,以及为何「暂停」并不等同于「安全」。
来源已核查 1 min
AI 事件记录:2016-2026 年时间线 一份有据可查、按时间排列的 2016 年至 2026 年 AI 事件与险情记录——真实的伤害与披露,而非假设情景。
来源已核查 5 min
关于 AGI 的常见问题 对人们真正会搜索的 AGI 相关问题给出直接答案——什么是 AGI、它可能何时到来、它有多危险——每个答案都链接到更完整的详情页面。
来源已核查 1 min
公众舆论与对 AI 的信任度 皮尤(Pew)、盖洛普(Gallup)、爱德曼(Edelman)与益普索(Ipsos)的数据显示,自 2021 年以来公众对 AI 的信任度发生了怎样的变化——包括中国与西方受访者之间日益扩大的差距。
来源已核查 1 min
反对近期 AGI 的怀疑论 由真正具备资历的知名研究者提出的、反对 AGI 即将到来的最有力技术论证——公正地予以呈现,而不是把它塑造成一个便于击倒的稻草人。
来源已核查 1 min

Type to search the manual.

navigate open esc close