Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

07 机制

最坏情景背后的各种机制

第02章介绍的是失控的一般性机制。本章则是研究者们实际研究的一系列具体、有名称的路径清单——因为能够阻止其中一种路径的干预措施,未必能阻止另一种。

Written by
Dwight Ringdahl
Revised
Sources
3 cited

为何这并非单一情景

「AI 可能杀死所有人」这句话,把几种结构上截然不同的失败模式压缩成 了一个单一的形象。这种压缩对标题很有用,对预防却毫无意义,因为针 对某一种机制的技术与政策干预,可能对另一种机制收效甚微——例如, 对大型训练运行的管控,本身并不能阻止对一个已经部署的模型的滥用。 2023 年,超过350位研究者与企业高管——其中包括多家主要实验室的相 关人士——联署了一份只有一句话的声明,呼吁政策制定者将灭绝风险视 为全球优先事项。这份声明记录的是知名签署者所持的立场,并不是对伤 害概率的测量:

Summarized position

Signatories to the Statement on AI Risk hold that mitigating the risk of extinction from AI should be a global priority alongside pandemics and nuclear war.

Signatories to the Statement on AI Risk, Researchers, executives, and other public figures; statement hosted by the Center for AI Safety
safe.ai, Signed statement

三大类别

2026年版《国际人工智能安全报告》采用了三大类别。 恶意使用指的是人类蓄意将 AI 能力导向大规模伤 害——例如人工设计的病原体、基础设施攻击或自主武器。 故障失灵包括可靠性方面的失败,以及系统运行脱离任 何人控制的前瞻性失控情景。系统性风险则源于大规模 部署与制度层面的相互作用,包括权力集中、劳动力冲击与人类自主性的 逐步丧失。这些类别之间可能存在重叠,不同机制背后的证据强度也各不 相同。该报告的主席公开强调了失控风险:

Summarized position

Yoshua Bengio warned that future systems exhibiting self-preservation behavior could create a loss-of-control risk.

Yoshua Bengio, Turing Award laureate; chair, International AI Safety Report
AFP, via TechXplore, Secondary coverage

Geoffrey Hinton 也给出过一个个人概率估计。这是在不确定性下的专家 判断,而非经过测量的频率:

Summarized position

Geoffrey Hinton said in a December 2024 BBC interview that he put the chance of AI causing human extinction within thirty years at 10–20%.

Geoffrey Hinton, Nobel and Turing Award laureate; former VP, Google
BBC Radio 4, reported by The Guardian, Secondary coverage

本章不做什么

编辑边界

每一页都会区分已记录的证据与预测、理论,并列出研究者提出的缓解 措施。没有一页会描述合成、漏洞利用或攻击方面的具体细节——这类信 息并不会让读者更安全,而公开它们也不是知情准备所需要的。关于重 要论断的分类与审核方式,参见 信源标准

本章内容

12 页 篇,收录于本章

人为设计的疫情与生物武器风险 AI 生物能力提升研究显示了什么、没有显示什么,以及信息防护措施如何与现实中的生物防御相衔接,包括 Anthropic 启用 ASL-3 的决定。
来源已核查 1 min
AI 助力的针对基础设施的网络攻击 AI 正在改变网络行动的哪些方面、为什么基础设施容易受到冲击,以及攻防平衡为何依然不确定,包括一份2025年的 AI 间谍活动报告。
来源已核查 1 min
自主武器与军事升级 武器自主性究竟意味着什么、冲突中已记录了哪些情况,以及 AI 可能如何改变升级与问责——以存在争议的利比亚 Kargu-2 案例为例。
来源已核查 1 min
渐进式权力丧失 一条理论性的路径:对 AI 日积月累的依赖,如何在没有戏剧性夺权的情况下侵蚀人类的控制权,并在经济、国家与文化领域被系统化阐述。
来源已核查 1 min
奖励破解与规范博弈 优化器如何利用不完美的目标函数、目前已观察到了什么,以及为什么现有的案例本身并不能证明未来会发生失控。
来源已核查 1 min
大规模说服与认知操纵 实验揭示了 AI 说服力的哪些特点、现实世界证据尚未证实什么,以及规模效应可能如何改变这种风险——基于一项涉及76977人的2026年研究。
来源已核查 1 min
AI 风险估计与专家分歧 如何在不制造虚假共识、也不轻视不确定性的前提下解读调查、预测与概率估计——基于一项涉及2778人的调查。
来源已核查 1 min
AI、核指挥与危机稳定性 AI 决策支持即便没有发射授权,也可能如何影响核危机,以及哪些保障措施能降低危机中自动化偏见带来的升级风险。
来源已核查 1 min
食物系统的连锁性崩溃 几乎每一种接近灭绝级别的情景,最终途径都是食物短缺,而非直接的暴力。食物系统如何发生连锁性崩溃,以及究竟什么才会真正压垮它。
来源已核查 1 min
基础设施脆弱性与单点故障 现代生活有多大程度依赖于那些需要数天、数月甚至数年才能更换的组件,以及为什么每一种灾难性情景,归根结底都作用于同一套基础层。
来源已核查 1 min

Type to search the manual.

navigate open esc close