跳到主内容
精选80meng shao模型发布/更新多源精选 ×6

GLM-5.3发布:后训练规模化带来能力跃升

原来 @jietang 唐杰教授的「sooooooon」是按小时算的吗 😃

原文
推荐理由

GLM-5.3作为国产开源模型的新旗舰,后训练规模化带来的能力跃升值得关注,做模型应用或研究的同学可以重点测试其长程任务表现。

原来 @jietang 唐杰教授的「sooooooon」是按小时算的吗 😃

GLM-5.3 在唐杰教授发帖后几小时就正式发布了,又是后训练的一个典型案例!中国开源模型这一轮热潮也是 GLM-5.2 带起来的。 https://z.ai/blog/glm-5.3

GLM-5.3 和 GLM-5.2 沿用了同一套基座模型,所有可观测的能力提升,都来自后训练阶段的持续规模化。

过去一个月 @Zai_org 在 GLM-5.2 已搭好的技术栈上持续加码: · IndexShare:长上下文的高效处理机制; · SAO(含 compaction):面向长程任务的强化学习算法,使增益不只在短任务上显现,也能在长程任务上保持; · slime:大规模异步后训练框架,训练侧用 Megatron,rollout 侧用 SGLang。

GLM-5.3 在此之上做了三件事:更多环境、更多样任务、更多算力。在复杂编码与长程任务上对 GLM-5.2 形成明显代差,并在网络安全方向上出现了团队自己也未完全预期的"涌现式"能力跃升。

btw... GLM-5.3 是一个只有 743B 的模型,综合能力和 Kimi K3 互有胜负,厉害!

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近