Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

04 出路

真正存在的出路

技术与制度层面的管控措施,决定着第02章所述严重情景发生的可能性会上升还是下降;家庭层面的准备无法替代这些措施。

Written by
Dwight Ringdahl
Revised
Sources
2 cited

技术安全杠杆

  • 可解释性研究。 检查模型的内部表征与计算过程,作为行为评估、访问控制与部署监测之外的一种补充手段。
  • 可扩展的监督。 辩论、递归奖励建模、弱到强泛化等技术,旨在帮助能力较弱的监督者监督能力更强的系统。
  • 可纠正性研究。 研究系统如何能够持续接受合法的纠正、修改与关闭;目前尚未证明存在可在大规模下稳健运行的解决方案。
  • 算力治理。 因司法辖区而异的出口管制、基础设施监测,以及被用作能力不完美替代指标的各类阈值——它们并非 AGI 或安全性的定义。

Anthropic 首席执行官在其 2025 年就此主题撰写的文章中,为上述第一项进行了论证:

Summarized position

Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.

Dario Amodei, CEO, Anthropic
The Urgency of Interpretability, Primary source

制度杠杆

协调难题

国际协调之所以重要,是因为单边管控措施既会改变安全激励,也会改变 竞争地位。当前的政策格局已不再完全是自愿性质:欧盟《人工智能法 案》对适用范围内的提供者施加了具有约束力的义务,而各实验室的安全 框架与峰会承诺在很大程度上仍属自愿性质。目前尚不存在具有约束力的 全球性前沿模型军控条约。

一个早期的国际起点,是在首届全球人工智能安全峰会上,由 28 个国家与欧盟共同签署的一份不具约束力的宣言:

Summarized position

28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.

28 nations and the European Union, The Bletchley Declaration, AI Safety Summit
GOV.UK, Signed statement
  • 在不受限制地发布之前,针对危险能力开展与风险相称的部署前评估。
  • 建立事故报告机制,使监管者与开发者能够从严重故障及险些酿成事故的事件中吸取教训。
  • 制定责任规则时,应综合考量控制力、认知程度、因果关系,以及预防伤害的能力。

作为个体的技术从业者能做些什么

读者可以作为选民、劳动者、研究者、客户、投资者以及公民组织的成员去 影响政策。切实可行的做法包括:参与或资助可解释性与对齐研究;若你所 在的组织在生产环境中部署 AI 系统,推动该组织内部落实安全实践;支持 上文所述的报告与评估基础设施,而非将其视为监管方面的阻力;以及在面 对具有说服力的说法时核查其来源与证据,而不是径直假定其为自动化操纵 或真实的共识。

研究 政策 组织

本章内容

11 页 篇,收录于本章

可纠正性:接受纠正的系统 为什么「装一个关停开关」远没有听起来那么简单,可纠正性研究究竟想解决什么问题,包括智能体为何可能抵抗关停。
来源已核查 1 min
AI 实验室内部的举报人保护 举报人权利、报告渠道与反报复规则,如何帮助 AI 实验室员工在安全隐患演变成公共危害之前将其揭露出来。
来源已核查 1 min
2026年的AI法律与执法 截至2026年9月,欧盟、美国与国际框架中,哪些 AI 规则具有约束力、哪些仍属自愿,以及执法实际落地之处。
来源已核查 1 min
前沿 AI 实验室安全框架比较 六家实验室的安全框架比较:阈值、防护措施,以及触发阈值后会发生什么,并对照独立审计核实其实际执行情况。
来源已核查 2 min

Type to search the manual.

navigate open esc close