Z.ai创始人Jie Tang。图片来源:其X账号

“决定AI模型性能的,不是单一的参数量。还要同时考虑数据规模、算力投向,以及模型由谁、在什么条件下运行。”

清华大学教授、AI初创公司Z.ai创始人Jie Tang近日在X平台发文讨论AI模型Scaling Law的新变化时表示,这一判断来自持续试错后的总结。

围绕大模型扩展规律,行业判断已发生过多次转向。2020年,OpenAI研究员Jared Kaplan在论文《Scaling Laws for Neural Language Models》中提出,参数规模的扩张速度应显著快于数据规模。此后,GPT-3、Gopher、MT-NLG等大模型相继推出,行业一度快速走向“堆参数”。

到2022年,DeepMind的Hoffmann团队在重新分析400个模型后得出了相反结论:更高效的训练方式,是每1个参数对应约20个token;随着算力提升,参数和数据应按相近速度同步扩展,这就是后来被广泛提及的Chinchilla缩放法则。

Jie Tang表示,早期计算中的误差会随着算力规模扩大而被进一步放大,彼时出现的“万亿级参数模型”,某种程度上正是这种偏差累积后的结果,也因此并不高效。

不过,在Chinchilla缩放法则之后,关于Scaling Law的讨论并未停止。Jie Tang认为,Chinchilla缩放法则建立在“一次性训练、随后评测”的前提之上;但如今AI模型每天可能被调用数十亿次,从部署到退出使用的整个生命周期总成本中,推理环节已占据大头。

他指出,一旦将推理成本计入,总体最优策略也会随之变化。相比单纯做大模型规模,“更小模型、延长训练周期”可能反而更有优势。Llama2-7B与Gemma2-9B之所以把“每参数对应训练token数”分别提升至290和889,背后正是这一逻辑。

在他看来,MoE(混合专家)架构也明显改变了衡量模型性能的方式。总参数更接近模型的知识容量,而真正决定模型能否完成长链条推理的,则是实际参与计算的激活参数规模以及有效深度(Effective depth)。

这也意味着,Chinchilla提出的“20:1”配比在MoE架构下已不再适用。Jie Tang表示,以记忆为主的任务更适合增加参数,以推理为主的任务则更适合增加数据。后续研究还显示,在token配比固定的情况下,如果只增加总参数,反而可能削弱推理能力;相较之下,提升被激活的专家数量,更有助于增强推理表现。

“总参数对应知识量,激活参数和有效深度决定推理能力”这一思路,也被Z.ai用于GLM模型设计。

Jie Tang举例说,漏洞发现能力并不取决于模型记住了多少CVE(安全漏洞信息),而在于它能否完整走完一条20步的推理链;这种能力不会因为单纯堆砌参数而自然出现。

他还介绍,Z.ai近期公开的GLM-5.3正是这一判断的一个验证样本。在基础模型、模型架构、总参数规模和激活参数规模均与GLM-5.2相同的前提下,仅将长期强化学习(RL)环境训练再延长一个月,结果就“非常明确”。

Jie Tang强调,这次调整的仅是后训练(post-training)阶段,因为这里仍是当前改进空间最大的环节之一。这并不意味着其他要素已经触顶,基础模型规模、预训练数据,以及每次前向传播(forward pass)中的算力投入,仍有进一步优化空间。

他表示,没有必要一次性把所有“旋钮”都拧到头,因为下一阶段真正需要调整的变量,很可能已经发生变化。“Scaling仍未结束。”

关键词

#Z.ai #Jie Tang #Scaling Law #Chinchilla缩放法则 #推理成本 #MoE #GLM-5.3 #后训练 #长期RL #大模型
版权所有 © DigitalToday。未经授权禁止转载或传播。