07 机制
最坏情景背后的各种机制
第02章介绍的是失控的一般性机制。本章则是研究者们实际研究的一系列具体、有名称的路径清单——因为能够阻止其中一种路径的干预措施,未必能阻止另一种。
为何这并非单一情景
「AI 可能杀死所有人」这句话,把几种结构上截然不同的失败模式压缩成 了一个单一的形象。这种压缩对标题很有用,对预防却毫无意义,因为针 对某一种机制的技术与政策干预,可能对另一种机制收效甚微——例如, 对大型训练运行的管控,本身并不能阻止对一个已经部署的模型的滥用。 2023 年,超过350位研究者与企业高管——其中包括多家主要实验室的相 关人士——联署了一份只有一句话的声明,呼吁政策制定者将灭绝风险视 为全球优先事项。这份声明记录的是知名签署者所持的立场,并不是对伤 害概率的测量:
Signatories to the Statement on AI Risk hold that mitigating the risk of extinction from AI should be a global priority alongside pandemics and nuclear war.
safe.ai, Signed statement
三大类别
2026年版《国际人工智能安全报告》采用了三大类别。 恶意使用指的是人类蓄意将 AI 能力导向大规模伤 害——例如人工设计的病原体、基础设施攻击或自主武器。 故障失灵包括可靠性方面的失败,以及系统运行脱离任 何人控制的前瞻性失控情景。系统性风险则源于大规模 部署与制度层面的相互作用,包括权力集中、劳动力冲击与人类自主性的 逐步丧失。这些类别之间可能存在重叠,不同机制背后的证据强度也各不 相同。该报告的主席公开强调了失控风险:
Yoshua Bengio warned that future systems exhibiting self-preservation behavior could create a loss-of-control risk.
AFP, via TechXplore, Secondary coverage
Geoffrey Hinton 也给出过一个个人概率估计。这是在不确定性下的专家 判断,而非经过测量的频率:
Geoffrey Hinton said in a December 2024 BBC interview that he put the chance of AI causing human extinction within thirty years at 10–20%.
BBC Radio 4, reported by The Guardian, Secondary coverage
本章不做什么
每一页都会区分已记录的证据与预测、理论,并列出研究者提出的缓解 措施。没有一页会描述合成、漏洞利用或攻击方面的具体细节——这类信 息并不会让读者更安全,而公开它们也不是知情准备所需要的。关于重 要论断的分类与审核方式,参见 信源标准。