Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

算力与扩展定律详解

理解 AI 扩展定律预测的是什么、其预测在何处会失灵,以及为何训练算力仍然是一个不完美却有用的治理信号。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
4 cited
Reading
1 min

扩展定律是一种经验关系

在机器学习中,扩展定律描述的是某个被测量的量,会随着某项输入的增长而如何变化。对于大语言模型而言,研究者发现,随着模型规模、训练数据量与计算量的增加,训练损失往往会以相对平滑、可预测的方式改善。OpenAI 2020 年的研究报告称,在其所测试的范围内存在幂律关系(Kaplan 等人)。DeepMind 后来的「Chinchilla」研究表明,在固定的算力预算下,许多模型此前所使用的训练数据量其实过少,参数量与训练词元数应当更均衡地一同扩展(Hoffmann 等人)。

这些结果之所以重要,是因为它们让代价高昂的训练运行变得更可预测。一个实验室可以先进行较小规模的实验,估算损失在更大规模下将如何变化,并在数据、参数与算力之间分配预算。但这条定律描述的是在一个已被观察的区间内的测量结果。它并不是一种物理层面的保证,不能保证每一种能力都会无限期地持续改善,也不能保证只要堆砌足够多的图形处理器就能自动产出 AGI。

算力只是其中一项要素

「算力」通常指的是训练或推理过程中所使用的数值运算次数,但即便是这一简化说法,也掩盖了一些重要的差异。两次名义运算量相同的训练运行,可能因芯片利用率、数值精度、数据质量、架构、优化方法与软件的不同,而产生截然不同的系统。算法上的改进可以从同样的硬件中获得更好的性能。而微调、检索、工具、记忆与智能体脚手架,都可以在预训练完成之后大幅改变系统部署后的实际行为。

数据在数量与构成两方面都很重要。重复的、低质量的或受污染的样本,并不等同于经过精心筛选的信息。合成数据可以扩充或定向补充语料库,但如果生成与过滤环节把关不严,其中的错误也可能被放大。数据权利、隐私、语言覆盖面与代表性,同样会影响模型学到的内容。

推理阶段的计算量增添了另一个维度。有些系统会为一个困难的提示词投入更多运算量,用以生成并核验中间候选答案。这可以在不改变预训练模型本身的情况下提升表现,但也会增加成本与延迟,并不能保证结果的正确性。如今,一场完整的扩展讨论,至少需要同时纳入训练算力、推理算力、数据、算法,以及围绕系统运行的整个环境。

损失曲线不等于能力曲线

训练损失衡量的是在海量数据集上取平均的预测误差。损失的平滑下降,可能伴随着面向人类使用场景的各项任务上参差不齐的变化。一项基准测试可能呈现出某种「阈值」现象,原因可能是某种潜藏的改进终于跨过了及格线,可能是模型学会了若干项必需的子技能,也可能是评分方式把渐进式的进步转换成了一个二元结果。而其他能力则可能平滑地改善,保持不变,或在安全微调或系统变更之后出现倒退。

这一区分可以防止两类相反的错误。第一类错误是认为,一条可预测的损失曲线,就意味着未来所有的行为都是可预测的——事实并非如此。第二类错误是断言,所有能力上的提升都是神秘的非连续跃迁。研究者发现,当采用连续型指标或信息量更大的测试方式时,许多看似陡然的基准测试提升会变得更加平滑(Schaeffer、Miranda 与 Koyejo,2023 年)。不确定性与部分可预测性可以同时成立。

扩展也会与评估设计相互作用。公开测试可能达到饱和,也可能泄漏进训练数据之中。一个模型可能在「应试能力」上有所提升,却没有获得相应的现实世界可靠性提升。反过来,现有的基准测试也可能遗漏了一些有用的能力。要真正理解损失下降换来了什么,需要综合运用多种评估方式、私有任务、人类专家评审以及部署层面的证据。

这一趋势可能在何处出现拐点

物理层面的产能并非无限。前沿模型的训练与服务依赖先进芯片、高带宽内存、网络、电力、冷却、土地、建设与供应链。国际能源署预计,到 2030 年,数据中心的用电需求将大幅上升,同时也强调了其中的不确定性以及在地理上高度集中的特点(国际能源署,《能源与 AI》)。即便全球能源总量充足,当地电网的延迟也可能造成实质影响。

高质量的人类生成数据同样是有限的,不过这一约束的实际影响,取决于新数据来源、多模态训练、合成数据,以及对现有语料库更高效的利用方式。经济上的限制可能比技术上的限制更早到来:一个更大的模型必须创造出足够的价值,才能证明其训练、服务与机会成本的合理性。即便总运算量供给充足,延迟与内存带宽仍可能制约产品的实际表现。

收益递减是内嵌在扩展过程之中的。幂律关系可能会持续存在,但每一点额外的改进都需要付出高得多的成本。这并不意味着进展会就此停止,但它会改变背后的经济账。一种新的架构或算法可以移动整条曲线,而安全性、可靠性或具身能力,可能需要一些无法仅靠「预测下一个词元」这一损失指标所捕捉到的突破。仅凭当前的扩展定律,没有人能够断定这些突破会出现在何处。

为何算力仍然是一个治理杠杆

尽管存在上述种种但书,先进算力仍然具有异乎寻常的物理属性与集中程度。前沿芯片是通过一条狭窄的全球供应链制造出来的,而最大规模的训练集群需要看得见的资本、电力与网络投入。因此,各国政府将芯片出口管制、报告要求与数据中心规则,作为衡量前沿能力的替代指标来使用。相比算法或被复制的软件,算力往往更容易被监测。

但这一替代指标并不完美。随着算法效率不断提高,阈值可能变得过时。分布式训练与分布式推理让核算变得更为复杂。如果制定不当,一项算力规则可能给合法研究带来负担,巩固大型在位者的地位,或诱使人们想方设法规避监管。训练算力这一指标,同样会遗漏那些通过微调、工具使用或大量推理调用而组装出强大能力的系统。有效的政策应当及时更新阈值、纳入效率因素的考量、保护隐私,并将监管义务聚焦于风险本身,而不是把「运算量」本身当作危害来对待。

算力治理与能力评估配合使用时效果最强。算力可以帮助识别哪些训练运行值得深入审查;评估可以检验由此产生的系统是否跨过了某个危险能力的门槛;部署监控则可以揭示滥用与故障。任何单一指标都不应承担整个监管体系的全部重量。

扩展并不能一锤定音地确定 AGI 的时间表

快速的投资,证明的是开发者预期更大、更高效的系统能够带来回报。历史上的扩展经验,证明的是追加资源往往能够改善可测量的表现。但两者都无法证明 AGI 会在某个具体日期出现。对时间表的预测,必须对硬件、能源、数据、算法、推理、可靠性,乃至 AGI 本身的定义,都建立相应的模型。

宣称「扩展已经到头了」,就必须说明具体是哪一项指标、哪一个系统。宣称「有了扩展就万事俱备」,就必须证明剩余的差距都可以被归结为同一条趋势线所能解释的范畴。介于这两种口号之间的,才是站得住脚的立场:扩展定律是现代 AI 领域中最有用的经验规律之一,但它们在预测特定区间内的平均表现方面,要远比在预测质变性的社会后果方面更为可靠。

读者应当追问的问题

当一款新模型的进步被归因于「规模扩大」时,应当追问:究竟是哪一项资源增加了,增加了多少,对比的基线又是什么?这一比较是否在算力最优的条件下进行?数据或算法是否也发生了变化?所报告的提升,究竟是在训练损失上、某项基准测试上、专家工作上,还是在实际部署结果上?可靠性与成本表现如何?结果是否经过独立复现?

这些问题,能够在不将扩展定律神化的前提下,保留其真正的启示。更多的算力确实一再促成了更好的模型。它是一项重要的工业投入,也是一个切实可行的监督着力点。但它不是衡量智能的通用单位,不是安全行为的保证,更不是通往 AGI 的倒计时。

Type to search the manual.

navigate open esc close