请将本文视为一份附有时间标注的机构对比
前沿 AI 实验室在所有权、资金来源、发布策略,以及已发布的风险控制措施方面各不相同。这些差异会影响谁来做出部署决策,以及外部监督在多大程度上可行。但一份政策文件,证明的只是存在一套宣称中的流程,而不能证明某个模型是安全的,也不能证明领导层在压力之下会做出正确的决定。以下描述的现状截至 2026 年 9 月 13 日,应当每季度重新核实一次。
| 开发者 | 机构结构 | 已发布的前沿风险应对方式 |
|---|---|---|
| OpenAI | OpenAI 基金会控制 OpenAI Group PBC | 「预备度」评估与系统卡 |
| Google DeepMind | Google/Alphabet 内部的 AI 研究机构 | 《前沿安全框架》 |
| Anthropic | 设有长期利益信托的公益公司 | 《负责任扩展政策》与风险报告 |
| Meta | Meta Platforms 内部的上市公司业务与研究机构 | 《高级 AI 扩展框架》;部分模型采用开放权重发布 |
| xAI | 与 X 平台合并、由私人控制的公司 | 模型卡与部分选定的安全报告;公开的门槛治理细节较少 |
这张表比较的是公开信息,而不是内部实践。各家框架变动频繁,采用不同的风险分类方式,且大多是由其自身所约束的机构自行撰写的。
OpenAI
如今再把 OpenAI 简单描述为「由非营利董事会控制的封顶利润公司」已经不准确了。2025 年 10 月的一次重组,将其非营利实体更名为 OpenAI 基金会,营利实体更名为 OpenAI Group PBC,后者是一家公益公司。该基金会控制着这家 PBC,并持有其股权(OpenAI 的结构)。公益公司这一形式,可以要求在考虑股东利益的同时也顾及企业使命,但它并不能消除商业激励,也不能替代公共监管。
OpenAI 宣称的做法一直强调迭代式部署:发布系统、从实际使用中学习,并随着能力的变化不断强化安全保障措施。它会发布系统卡,并使用一套「预备度框架」来评估严重危害类别。读者应当审视当前的框架以及针对具体模型的证据,而不应仅凭品牌名称就推断其安全性。值得追问的相关问题包括:谁有权推翻一项风险判定?出于安全考虑,哪些结果仍未公开?一项评估所覆盖的,究竟是已部署、配备实际工具的智能体,还是仅仅是一个基础模型?
Google DeepMind
Google DeepMind 隶属于 Alphabet 旗下的 Google 内部运作。它将强大的研究能力,与 Google 的产品、数据中心及分发渠道结合在一起。这既为大规模测试与防御性部署创造了机会,同时也带来了外部读者无法完全观察到的商业与组织压力。
其《前沿安全框架》界定了能力等级、评估流程,以及针对严重风险的缓解措施。3.0 版本于 2025 年 9 月发布,3.1 版本则于 2026 年 4 月新增了「受追踪能力等级」,以便更早识别不那么极端的风险(Google DeepMind 前沿安全)。Google 方面描述的是整体性的风险评估,并辅以门槛式评估。这些都是该公司自身的主张与流程;要判断实际表现,仍需依靠模型卡、外部评估以及事件证据。
Anthropic
Anthropic 是一家公益公司。其治理结构中包含一个「长期利益信托」,旨在随着时间推移逐步获得对董事会人选的决定权。此类机制在实践中的独立性与有效性,必须通过实际决策、信息披露与可强制执行的权利来评判,而不能仅凭组织架构图来判断。
Anthropic 的《负责任扩展政策》已经历过多次修订。截至 2026 年 8 月,其公开档案列出的是 3.4 版本,以及当年内的多次修订(Anthropic RSP 存档)。第 3 版转向了定期发布的风险报告、一份《前沿安全路线图》,以及独立的公司计划与行业建议。Anthropic 表示,风险报告将威胁模型、能力、缓解措施与剩余风险串联在一起,并在特定情形下接受外部评审。该公司也表示,部分内容已被删减。
这些修订值得从正反两个方向来看待。更新门槛既可能反映出经验的积累与威胁模型的改进,也可能削弱或改变此前的承诺。一种负责任的比较方式,是保留旧版本并对比修订痕迹,而不是把「这份 RSP」当作一成不变的东西来引用。Anthropic 自身发布的报告属于一手材料,应当被明确标注为出自厂商自身。
Meta
Meta 的做法是将封闭式服务,与部分模型系列的权重开放发布结合在一起。开放权重能够支持独立研究、本地化适配、审计与竞争。但它们也让由中心方设定的安全防护措施更容易被移除,一旦文件被广泛复制,召回也会变得困难得多。这种权衡取决于能力水平、发布物的具体形式、许可限制,以及滥用该模型所需的资源——而不取决于「开放」本身是天然安全还是天然危险。
2026 年 4 月,Meta 用一套**《高级 AI 扩展框架》**取代或扩充了此前的《前沿 AI 框架》,新增了更广泛的化学/生物、网络安全与失控风险评估,以及针对具体模型的《安全与预备度报告》(Meta 公告)。同样,这也是 Meta 对自身流程的自述。独立的访问渠道、有意义结果的公开发布,以及与门槛挂钩的实际后果,共同决定了这套框架能够提供多少保障。
xAI
xAI 是一家与社交平台 X 深度整合的私营前沿开发商。与本文列出的其他机构相比,该公司历来公开的关于能力挂钩式暂停门槛及独立治理的详细信息较少。这只是关于公开可查阅文档的一种客观陈述,并不能证明其内部不存在安全工作。恰当的应对方式,是标注出这一证据缺口,而不是用假设去填补它。
对于任何一款 xAI 模型,读者都应当去寻找具体的模型卡、评估日期、受测配置、红队测试范围,以及发布层面的管控措施。私人所有权可以带来更快的决策速度,但相比上市公司的信息披露要求,能自动提供的透明度渠道更少。而能够接触庞大的社交平台,也使得分发与反馈回路成为部署风险中一个相关的组成部分。
最重要的那些差异
使命宣言是很糟糕的比较工具,因为每一家实验室都可以承诺自己会造福社会、承担责任。更具诊断价值的问题是:
- 决策权: 谁有权推迟训练或部署,而这个人能否被其所审查计划的同一批高管撤换?
- 预先承诺的门槛: 该框架是否明确规定了,什么样的证据会触发更强的安全措施、受限的部署,或是暂停?
- 独立访问权: 具备资质的外部人员能否测试实际系统,并公开发表批评性发现?
- 透明度: 方法、局限性、严重故障、框架修订与各类事件,是否得到及时披露?
- 安全保障: 模型权重与研究系统所受到的保护程度,是否与其被滥用的价值相匹配?
- 发布管控: 安全防护措施能否被更新?一旦权重可供下载,会发生什么?
- 问责机制: 相关承诺是否具有法律或合同上的约束力,还是完全自愿、可随时更改?
自愿性框架可以形成有益的内部纪律与共同的术语体系。它们的变化速度也可能快于立法进程,并能揭示新兴的风险模型。然而,它们也存在利益冲突:往往是由开发者自己来定义测试、执行测试、解读测试结果,并决定公开哪些内容。2026 年《国际 AI 安全报告》指出,在评估的有效性、外部访问权限,以及风险管理证据方面,依然存在持续存在的局限(2026 年国际 AI 安全报告)。
如何使用这份对比
不要把一张表格变成一份安全排行榜。一家实验室可能在某个领域表现更强,在另一个领域则较弱,而且这种状况可能在几个月内就发生变化。应当比较针对具体模型的证据与真实的决策:某次发布是否在测试后被修改过?研究人员能否上报担忧并得到重视?外部评估者是否获得了充分的访问权限?各类事件是否催生了可衡量的改革措施?
企业治理之所以重要,是因为少数几家机构掌控着前沿模型的训练与部署。但它无法替代民主治理。即便每一家开发商都采用了一套精细的内部框架,统一的评估标准、事件报告机制、举报人保护、竞争政策、责任认定与公众监督,仍然是必不可少的。