智谱创始人唐杰聊Scaling Law:大模型万亿参数曾是行业走的弯路,下一步关键在后训练

华尔街见闻
Aug 19

智谱人工智能创始人唐杰19日在X平台发文,系统阐述其对Scaling Law的最新理解,并以GLM-5.3作为"控制变量实验"佐证这一判断。这篇帖子的发布,恰好回应了外界对智谱未训练全新基座模型的质疑。

唐杰在文中指出,参数量从来不是评估模型能力的唯一维度,数据规模、算力分配与推理部署条件同样不可或缺。他表示,GLM-5.3与上一代GLM-5.2共用相同基座、相同架构、相同的753B总参数与40B激活参数,差异仅在于增加了一个月的长时域环境训练与强化学习(RL)后训练——而由此带来的能力提升"并非微小"。在AA评测指数中,GLM-5.3获得60分,较GLM-5.2的53分提升7分。

这一实验结论的核心在于:当基座模型参数规模已足以承载足够的知识,额外的能力提升往往来自"拨动其他旋钮"——尤其是后训练阶段,而非继续堆砌参数。这一判断对当前整个AI行业如何分配训练资源,具有直接的参考价值。

万亿参数:行业曾共同走过的弯路

唐杰在文中梳理了Scaling Law的演变脉络。2020年,Kaplan等人得出结论,认为参数规模的增长应快于数据增长,比例约为2.7:1。这一结论推动了GPT-3、Gopher、MT-NLG等超大规模模型的集中涌现,万亿参数一度被视为行业进步的必经路径。

然而,2022年Hoffmann等人对400余个模型重新开展实验后发现,算力最优的分配应接近每参数20个Token,且随着算力持续扩大,参数量与数据量应以大致相同的速度共同增长,而非持续拉大差距。这即是被广泛引用的"Chinchilla Scaling Law"。

唐杰在帖子中直言,早期拟合误差随着算力量级的提升被不断放大,导致当时规模最大的一批模型恰恰是算力分配最失衡的:

"万亿参数这一轮,回头来看,是整个领域一起走了一段弯路,然后又一起折返。"

推理成本与MoE:最优解持续移动

Chinchilla之后,最优解并未就此固定。唐杰指出,Chinchilla优化的目标是"训练一次、评测一次"的模型,而今天的主流模型每天可能被调用数十亿次,推理成本在全生命周期中远超一次性训练成本。

将推理成本纳入目标函数后,最优解将向"更小模型、训练更久"的方向移动。他援引Llama-2-7B与Gemma-2-9B为例,两者每参数对应Token数分别约为290和889,均属刻意"过训练"的范畴。

混合专家架构(MoE)的普及进一步使问题复杂化。唐杰区分了两个在MoE语境下必须分开讨论的维度:总参数量决定模型能够存储多少知识、事实与长尾信息;激活参数与每次前向计算的有效深度,则决定模型的长程推理能力。

他援引Roberts等人2025年的研究发现,最优的每参数Token数因任务而异——记忆类任务倾向于更多参数,推理类任务倾向于更多数据;而在固定每参数Token数的条件下,继续增加总参数会降低推理能力,激活更多专家则能稳定提升推理表现。唐杰据此指出,识别漏洞这类需要二十步因果链推理的任务,其核心能力并不存在于总参数量之中。

GLM-5.3:一次控制变量实验

基于上述判断,唐杰将GLM-5.3定位为一次有意为之的"控制变量实验"。相较于GLM-5.2,GLM-5.3保持基座、架构、总参数与激活参数完全不变,唯一的变量是增加了一个月的长时域环境Scaling与强化学习后训练。

他坦言,此次选择后训练这一"旋钮",是因为它当前拥有最大的改进空间,而非其他维度已无潜力可挖——"这并不意味着其他旋钮已经转到头了。"他明确表示,基座模型规模、预训练数据以及每次前向计算的算力投入,均仍在考量之列,下一步可能还会涉及中间训练(mid-training)与预训练层面的调整。

这一思路与外界此前对智谱"为何不训新基座"的质疑形成直接回应。在唐杰的框架中,各旋钮无需同步调节,关键在于判断"下一个最值得拨动的是哪一个"。目前,GLM-5.3的Coding能力已被多位开发者评价为国产模型中的当前最优水平。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10