智谱唐杰解析Scaling Law:总参数量与激活参数决定不同能力
刚刚,智谱创始人唐杰老师,在X上发了一篇超棒的帖子,专门说了下他对Scaling Law的理解。 正好今天AA的成绩也出来了,我把原帖和AA指数都放在评论区了。 GLM-5.3拿到了60分,上一代GLM-5.2是53分,基座是完全相同的,总参数753B,激活40B,而且大家Coding体感也都很棒,都觉得是国产SOTA了。 但也有很多人也在说为啥智谱这次不训个新的基座模型。 唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。 他说,Scaling,从来不只有参数量这一个点。 我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。 现在它至少还得跟另外三个问题放在一起看: 模型有多少数据。 算力花在了哪。 谁在什么条件下运行它。 这背后,其实是Scaling Law过去几年一直在发生的变化。 2020年,Kaplan等人算出一个比例,认为参数增长应该比数据增长快得多,大概是2.7比1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。 到了2022年,Hoffmann等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数20个Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。 这就是Chinchilla Scaling Law。 其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。 但版本还在变化, 因为Chinchilla考虑的是一个模型训练一次,然后拿去评测。 但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。 所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。 到了MoE时代,那个简单的20比1也不够用了。 唐老师在帖子里区分了两个很重要的东西。 总参数量,大概决定模型能装下多少知识、事实和长尾信息。 激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。 需要记忆的任务,更吃参数量。 需要推理的任务,更吃数据。 后续研究甚至发现,在每个参数对应Token数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。 所以,大模型到底有多聪明,早就没法被一个总参数量概括了。 GLM-5.3这次,唐老师说,它更像…
唐杰亲自拆解Scaling Law在MoE时代的最新认知,区分了总参数量与激活参数的作用边界,对理解当前模型优化方向极具参考价值,建议收藏细读。
刚刚,智谱创始人唐杰老师,在X上发了一篇超棒的帖子,专门说了下他对Scaling Law的理解。
正好今天AA的成绩也出来了,我把原帖和AA指数都放在评论区了。
GLM-5.3拿到了60分,上一代GLM-5.2是53分,基座是完全相同的,总参数753B,激活40B,而且大家Coding体感也都很棒,都觉得是国产SOTA了。
但也有很多人也在说为啥智谱这次不训个新的基座模型。
唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。
他说,Scaling,从来不只有参数量这一个点。
我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。
现在它至少还得跟另外三个问题放在一起看:
模型有多少数据。
算力花在了哪。
谁在什么条件下运行它。
这背后,其实是Scaling Law过去几年一直在发生的变化。
2020年,Kaplan等人算出一个比例,认为参数增长应该比数据增长快得多,大概是2.7比1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。
到了2022年,Hoffmann等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数20个Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。
这就是Chinchilla Scaling Law。
其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。
但版本还在变化,
因为Chinchilla考虑的是一个模型训练一次,然后拿去评测。
但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。
所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。
到了MoE时代,那个简单的20比1也不够用了。
唐老师在帖子里区分了两个很重要的东西。
总参数量,大概决定模型能装下多少知识、事实和长尾信息。
激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。
需要记忆的任务,更吃参数量。
需要推理的任务,更吃数据。
后续研究甚至发现,在每个参数对应Token数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。
所以,大模型到底有多聪明,早就没法被一个总参数量概括了。
GLM-5.3这次,唐老师说,它更像一次控制变量实验。
大模型Scaling依然在继续。
只是它已经从一个越来越大的数字。
变成了寻找最优解的游戏。
作者: 数字生命卡兹克
查看原文 →
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力