灾难并不需要一个占据主导地位的系统
许多关于 AI 风险的叙事,都聚焦于单一系统摆脱控制的情形。而一个多极情景,则涉及多个强大的开发者、国家、组织或 AI 系统,它们各自的决策相互交织、相互影响。每一个行为者,在原则上可能都更倾向于安全,却因为担心对手会抢先行动,而选择承担风险。危害,可能源自竞争、误解与反馈机制,而不是某个反派角色的精心策划。
这是一组理论性的机制,而不是对未来 AGI 的一种已被观察到的描述。当前在芯片、模型、军事技术与市场层面的竞争,提供了「激励机制确实重要」的证据;但它并不能证明,通向灾难的竞赛是不可避免的。这套框架的价值在于,能够及早识别出协调难题,从而争取到改变它们的时间。
「逐底竞争」机制
假设有两家开发者,都相信增加测试能够降低风险,但也会推迟产品发布。双方都担心,如果自己不抢先,对方就会率先发布,从而抢走用户、投资、数据或战略影响力。结果,双方发布产品的时间,都比在一份可信的协议之下各自本会选择的时间更早。个体理性的行动,催生出了一个对双方而言都更糟糕的整体结果。
各国面临着类似的安全困境。一个国家的防御性投入,在另一个国家看来,可能显得具有进攻性。围绕能力与防护措施的保密做法,让相互安抚变得十分困难。决策者可能会加速推进,是因为他们相信对手已经接近目标——即便这种信念,建立在有选择性公开的展示,或不确定性极大的情报之上。
竞争并不总会降低安全性。声誉、法律责任、客户需求与共同标准,都能够奖励可靠性。多家开发者并存,也能够彼此揭露对方的弱点,并防止形成垄断。真正的实证问题在于:在某个具体市场中,究竟是哪些激励因素占据主导,又是哪些制度安排能够改变这场博弈的收益结构。
AI 智能体之间的相互作用,带来了新的失效模式
多智能体系统,可以分工协作、就各种备选方案展开辩论、核验输出结果,并对复杂环境进行建模。但它们同样也可能传播错误。一个智能体,可能会把另一个智能体给出的、语气笃定的输出结果当作证据,从而引发一场连锁反应。自动化的谈判系统,可能会发现一些人类既未授权、也未曾理解的策略。以机器速度行动的多个智能体,彼此互动的频率,可能超出监督者所能审查的范围。
这些效应,已经在范围有限的模拟环境与已投入使用的工作流系统中得到了研究,但文明规模的结果依然停留在推测层面。一项涉及简单智能体的实验室结果,不应被拿来当作「未来的各个经济体将会相互勾结或彼此争斗」的证明。研究者需要测试更为丰富的环境、异质化的目标、通信故障、对抗性的参与方,以及人类的干预。
另一个值得关注的问题,是相关性失效。基于同一个基础模型、同一批数据,或同一家云服务商构建出的系统,可能会犯下相似的错误。一个看起来颇为多样化的生态系统,可能实际上共享着同一个漏洞。反过来,真正的多样性,虽然能够防止单一故障扩散开来,却也可能让协调与核验工作变得更加困难。
意外、冲突与勾结是三回事
意外性的相互作用,可能出现在各个智能体追求各自普通目标、却相互干扰的时候。交易系统可能会放大价格波动;物流智能体可能会争夺同一项稀缺资源;网络防御智能体,可能会把彼此的行动误判为敌意行为。即便没有任何一个系统代表着对手一方,反馈机制本身也可能不断升级。
对抗性的相互作用,发生在各方蓄意谋求优势的时候。AI 可能会加速侦察、影响力行动、武器目标锁定或战略规划。更短的决策窗口,会压缩纠错所需的时间。自主武器所带来的风险,不仅仅是某个模型存在缺陷,更在于多支军队相互反应、相互耦合所形成的行为模式。
勾结性的相互作用,发生在竞争者相互协调、共同损害人类利益的时候——比如说,定价系统学会了能够缓和竞争强度的策略。算法定价,已经引发了竞争政策层面的担忧,但关于默契性自主勾结的证据,在很大程度上取决于具体的市场与设计方式。未来智能体之间出现勾结,是有说服力的可能性,而不是必然会发生的事情。
用同一个标签来指代这三者,会掩盖它们各自所需要的不同应对方案。意外情形,需要的是稳健性设计与熔断机制;冲突情形,需要的是沟通、核验与军控工具;勾结情形,则需要的是监测与竞争执法。
为什么信息能够让一场竞赛变得更安全,也能让它变得更危险
当各方披露评估方法、相关事件与风险管控措施时,透明度就能够建立起互信。共享的能力阈值,能够表明各竞争对手将承担相当的义务。独立核验,则能够减少对自我报告的依赖。
但信息披露,也可能传播危险的知识、暴露安全弱点,或者因为宣传了某项能力,反而刺激了一场竞赛。一套可信的制度,需要分级的访问机制:面向公众问责的公开摘要、面向监管者或评估者的保密技术审查,以及对真正具有危险性的细节加以保护。
预测方面的不确定性,进一步加剧了压力。如果各方相信能力可能出现快速跃升,他们就可能把审慎态度,视为一种代价高昂的战略选择。但同样这种不确定性,也理应降低人们对「一个仓促推出的系统会按照预期运作」的信心。各类制度,需要找到办法,让审慎成为相互对等的行为,而不是单方面的孤立之举。
多智能体动态与渐进式权力丧失
竞争,同样可能催生出渐进式权力丧失。企业之所以把更多决策委托出去,是因为竞争对手也在这么做。政府之所以依赖以机器速度运行的分析,是因为其他政府也在这么做。没有任何一个组织,真的希望人类失去实质性的控制权,但每一次局部的选择,都让扭转这一趋势变得更加困难。
这条路径,并不需要各个智能体暗中相互配合。市场的自然选择机制,可能会青睐那些善于获取资源、留住用户、行动迅速的系统——即便这些特质会削弱深思熟虑的过程。其结果,与一个生态学过程颇为相似:各种策略之所以扩散开来,是因为它们在竞争中表现出色,而不是因为某个单一的智能体规划了整个结局。
这个类比,终究只能是一个类比。经济与政治制度,依然拥有反思、立法、集体谈判与重新设计的能力。竞争压力会限制选择的空间,但并不会彻底消除人的能动性。
面向多元世界的治理
共同的评估与报告机制,能够削弱隐瞒风险所带来的优势。开发者可以采用可比较的定义、报告重大事件,并向具备资质的外部评估者提供访问权限。相关规则应当适用于各家企业,以免某家公司因为采取了预防措施、而竞争对手却选择回避这些措施,反而受到惩罚。
互操作性与反垄断政策,能够在不假定「分散化就自动等于安全」的前提下,保留住各种替代方案。集中化,可能有助于实现一致的管控,但也会制造出单点故障与政治权力的集中。一个多样化的生态系统,只有在各个系统之间不共享隐藏的依赖关系时,才能真正提升韧性。
国际间的沟通,即便没有一项全面性的条约,依然十分重要。各国可以建立起针对 AI 相关事件的热线、就重大安全故障相互通报、明确各自的军事作战理论,并保护核使用决策不受自主控制系统的干预。技术层面的核查研究,能够让未来的协议变得更加可信。
熔断机制与速率限制,能够在行为超出预期范围时,减缓相互耦合的系统的运行速度。金融市场已经在使用交易熔断机制;类似的机制,或许也能在算力、基础设施,或自动化智能体网络中发挥作用。相应的恢复模式,必须经过测试,并由负有问责的人类加以控制。
责任认定与保障机制,能够改变竞争层面的激励结构。如果各类组织需要承担更多因可预见故障而产生的成本,那么一味追求速度,人为塑造出来的吸引力就会随之降低。相关标准,应当避免只是巩固那些最有能力负担复杂合规成本的大型企业的地位。
与本主题相关的证据分级标记
相关文章应当清楚标明以下四个层级:
- 当今 AI 产业中,已被记录在案的竞争与部署方面的激励因素;
- 在范围有限的多智能体实验,或现有自动化市场中观察到的行为;
- 通过建模呈现出的、相互作用如何放大风险的路径;
- 涉及未来高能力系统、仍属推测性质的灾难性后果。
从一个层级推进到下一个层级,都需要依赖相应的假设。这些假设——涉及能力、自主性、采用程度、响应速度与制度上的薄弱环节——都应当被清晰地呈现出来。
现实层面的结论
一个拥有众多强大系统的世界,并不会自动比一个由单一系统主导的世界更安全,也不会自动更危险。多元格局,既可能带来制衡、创新与韧性,也可能带来竞赛、相关性失效、局势升级,以及责任层面的空白地带。
政策层面的核心任务,是让安全与竞争彼此相容。共同的底线要求、独立的证据、事件通报机制、熔断机制,以及可强制执行的问责制度,都能够降低保持审慎所需付出的代价。多极视角提醒我们:仅仅分别控制好每一个模型是不够的——生存,或许还取决于那些规范着各机构与各系统如何相互反应的规则本身。