首先厘清术语
「开源 AI」这个说法,常常用来描述性质截然不同的发布方式。一名开发者可能公开模型权重,却保留训练数据、训练代码、数据处理方法、评估细节,或修改与再分发方面的广泛权利。开源软件的定义,并不能自动套用到一个数据来源本身就不透明的已训练模型上。
因此,本文在指「运行与修改一个模型所需的数值参数已被广泛公开」时,使用开放权重这一说法。一次发布,可能是在限制性许可下公开权重,也可能只公开代码而不公开权重。文档完整性与可复现性,是两个各自独立的维度。
术语之所以重要,是因为收益与风险取决于究竟公开了什么。仅凭权重,研究者无法复现训练过程,但权重依然能够支持本地推理、微调,以及一个 API 所无法实现的内部分析。
支持更广泛访问的论点
开放权重可以降低对少数几家托管服务提供者的依赖。开发者可以在自己的基础设施上运行模型、避免把敏感的提示词交给第三方服务、把系统适配到本地语言与专业领域,并在供应商调整价格或政策之后依然能够继续运行。竞争可以压低成本,并扩散技术能力。
研究者可以在无需等待提供者批准的情况下,检查激活值、测试模型编辑、复现各项评估,并研究其中的偏见或安全问题。公民社会组织与高校,可以审视一个其开发者本不会授予特殊 API 访问权限的模型。本地部署,也可以支持对隐私有要求、或网络连接受限的使用场景。
开放性也有助于保存知识。一项闭源服务可能会消失;而一次权重发布,却可以被存档并供后续研究。社区可以构建出对大型供应商而言并不划算、但有价值的无障碍功能与语言支持功能。
这些好处并非自动实现。运行一个大型模型,依然需要硬件与专业知识。所谓的「民主化」,实际上可能意味着资金雄厚的公司能够获得访问权限,而不是普通人。一家开放权重的提供者,也可能从生态系统的贡献、云服务需求或标准制定权中获得商业上的好处。这些利益动机应当被公开披露,但这并不意味着应当因此否定其公共价值。
支持受控访问的论点
一旦权重被广泛镜像,就无法再被可靠地收回。用户可以移除拒答训练、针对滥用目的进行微调、让自己的活动脱离中央监测系统的视野,并部署多个副本。这一点已经得到证实,而非纯属假设:研究者曾使用一种轻量级微调技术,在单张 GPU 上,以不到200美元的成本,撤销了 Llama 2-Chat 70B 的安全训练(Lermen 等,2023年)。一家托管服务提供者可以进行速率限制、监测使用模式、修补行为并终止账号;而本地运行,则去除了这些控制手段中的大部分。
边际风险,取决于这个模型相较于现有工具、闭源 API、专家知识与此前的开放模型,究竟增加了什么。如果某种能力已经能够以低成本从别处获得,那么限制权重带来的安全增益可能十分有限。但如果这些权重能大幅提升网络攻击、生物协助、欺诈或自主行动方面的有效性,那么一次不可逆的发布,其影响就可能十分重大。
真正相关的问题,不在于某项信息是否有朝一日可能被滥用,而在于这次发布,是否改变了可能造成伤害的行为者在能力、规模、成本、可追溯性或可及性方面的处境。
美国证据审查得出了什么结论
美国国家电信和信息管理局(NTIA)于2024年审查了332份公众意见与现有证据。该局的结论是,当时的证据不足以支持立即对模型权重的最广泛可获得性,实施一刀切的限制,但同时建议持续开展监测,并建立起相应的政府能力,以便在风险发生变化时作出响应(NTIA,2024年7月)。
这一结论既有时效性,也是有条件的。它并不能证明未来的前沿模型发布都是安全的,也不能证明限制措施永远没有正当理由。NTIA 是一个需要在创新、竞争与安全之间加以权衡的政府机构;其中许多意见,都来自有利害关系的企业与倡导团体。它的报告是一份有力的政策综述,而不是一项能够证明其净社会效应的实验。
欧盟的差异化路径
欧盟《人工智能法案》,为符合条件的免费开源通用模型,提供了一部分针对特定文档义务的豁免,但这并非一揽子豁免。具有系统性风险的通用模型提供者,依然须承担额外的义务。一次发布是否符合豁免条件,取决于法律标准,包括访问方式与信息披露程度——而不是取决于其营销措辞(欧盟委员会关于通用人工智能的指导意见,2025年)。
这体现了一种按能力分级的治理思路:在边际风险可控的领域鼓励开放,同时对具有系统性风险的模型保留相应义务。而在执法层面,依然面临着一个难题——如何在一次不可逆的公开发布之前,就先行评估出模型的能力水平。
二元选择之外的其他方案
访问权限可以分阶段开放。开发者可以先从内部评估与独立评估做起,再依次提供受控的研究访问权限、一项托管服务、在安全条件下向经过审查的机构提供权重,最后在证据支持的情况下,再进行公开发布。延迟发布,可以让防御方有时间修补漏洞,也能让监管机构有时间做好准备。
结构化的访问机制,可以在限制扩散的同时,保留一部分研究方面的收益,但这也会催生出「把关人」的角色,而这些把关人可能会把批评者或竞争对手排除在外。为此,有必要建立起明确的遴选标准、利益冲突规则、申诉机制、发布权利与监督安排。一个完全由模型开发者自行掌控的「可信研究者」计划,并不等同于独立的透明度。
其他可选方案还包括:发布规模更小或经过蒸馏的模型、公开代码与详细评估结果但不公开前沿权重、为分析工作提供安全的隔离环境,或使用禁止某些行为的许可条款。许可条款能够约束守法用户,但对于心怀恶意的行为者而言,只是一道很脆弱的技术屏障。
如何作出发布决策
一次严肃的发布评估,应当比较以下各项:
- 相较于现有的开放与闭源替代方案,其危险能力如何;
- 移除防护措施或进行微调所需的算力与专业知识;
- 哪些收益是只有通过权重、而非 API 访问才能获得的;
- 尚未发布权重的安全性,以及被窃取的风险;
- 发布之后监测滥用行为的能力;
- 受影响的群体,包括身处欠富裕国家的研究者;
- 可逆性,以及分阶段开放访问的各种选项;
- 模型文档、许可权利与数据来源。
相关评估应当涵盖网络、化学与生物协助、说服力、自主复制、隐私,以及在相关的情况下,普通的歧视或欺诈问题。如果一个基准阈值未能反映真实的工作流程,那么仅凭它本身是不够的。
「靠隐蔽实现安全」并非唯一的问题
批评闭源系统的人士指出,保留权重可能会掩盖漏洞,并使信任过度集中。批评开放做法的人士则指出,公开一项与武器相关的能力,并不等同于负责任地披露一个软件漏洞。这两种观察,都可能同时成立。
负责任的披露方式,通常能给受影响的防御方留出行动时间。对某些模型而言,广泛的审视可能带来的防御效果大于危害;而对另一些模型而言,广泛的访问权限却可能在缓解措施出现之前,就已经制造出一种不可逆的危险。关于边际风险与应对准备程度的证据,应当决定发布的先后顺序。
AGI 会改变利害关系,但不会改变对证据的需求
目前没有任何一个开放模型,经由一项获得公认的测试被确认为 AGI。关于「发布 AGI 权重」的种种说法,属于情景分析。如果一个模型能够自主开展高水平的研究、利用系统漏洞、获取资源或改进其后继版本,那么对它进行复制,就可能大幅削弱围堵能力。反过来,把这种能力置于某家企业或某个国家的排他性控制之下,同样可能带来严重的权力集中与滥用风险。
这正是各种口号式说法之所以站不住脚的原因。「开放总是更安全」忽视了不可逆性;「闭源总是更安全」则忽视了权力集中、被窃取的风险,以及缺乏外部审视的问题。未来的政策,应当界定能力与访问方面的具体条件,而不是去监管一个笼统的品牌类别。
一个持平的立场
就目前风险较低的模型而言,开放性可以带来可观的竞争、研究、韧性、隐私与包容性方面的收益。而对于能力日益增强的模型而言,分阶段发布与基于证据的评估,则变得愈发重要。任何限制措施,都应当证明存在具体的边际风险、提供正当程序,并接受定期复审;而任何发布决定,也都应当说明为什么一次不可逆的开放访问是正当的。
这场争论,并不是在自由与安全之间做一个非此即彼的选择。它是一个涉及能力、访问、权力集中、问责与可逆性的设计问题。精确的术语与透明的证据,能够让这个问题变得可以被治理。