04 出路
真正存在的出路
技术与制度层面的管控措施,决定着第02章所述严重情景发生的可能性会上升还是下降;家庭层面的准备无法替代这些措施。
技术安全杠杆
- 可解释性研究。 检查模型的内部表征与计算过程,作为行为评估、访问控制与部署监测之外的一种补充手段。
- 可扩展的监督。 辩论、递归奖励建模、弱到强泛化等技术,旨在帮助能力较弱的监督者监督能力更强的系统。
- 可纠正性研究。 研究系统如何能够持续接受合法的纠正、修改与关闭;目前尚未证明存在可在大规模下稳健运行的解决方案。
- 算力治理。 因司法辖区而异的出口管制、基础设施监测,以及被用作能力不完美替代指标的各类阈值——它们并非 AGI 或安全性的定义。
Anthropic 首席执行官在其 2025 年就此主题撰写的文章中,为上述第一项进行了论证:
Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.
The Urgency of Interpretability, Primary source
制度杠杆
国际协调之所以重要,是因为单边管控措施既会改变安全激励,也会改变 竞争地位。当前的政策格局已不再完全是自愿性质:欧盟《人工智能法 案》对适用范围内的提供者施加了具有约束力的义务,而各实验室的安全 框架与峰会承诺在很大程度上仍属自愿性质。目前尚不存在具有约束力的 全球性前沿模型军控条约。
一个早期的国际起点,是在首届全球人工智能安全峰会上,由 28 个国家与欧盟共同签署的一份不具约束力的宣言:
28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.
GOV.UK, Signed statement
- 在不受限制地发布之前,针对危险能力开展与风险相称的部署前评估。
- 建立事故报告机制,使监管者与开发者能够从严重故障及险些酿成事故的事件中吸取教训。
- 制定责任规则时,应综合考量控制力、认知程度、因果关系,以及预防伤害的能力。
作为个体的技术从业者能做些什么
读者可以作为选民、劳动者、研究者、客户、投资者以及公民组织的成员去 影响政策。切实可行的做法包括:参与或资助可解释性与对齐研究;若你所 在的组织在生产环境中部署 AI 系统,推动该组织内部落实安全实践;支持 上文所述的报告与评估基础设施,而非将其视为监管方面的阻力;以及在面 对具有说服力的说法时核查其来源与证据,而不是径直假定其为自动化操纵 或真实的共识。