精选80meng shao模型发布/更新多源精选 ×6
GLM-5.3发布:后训练规模化带来能力跃升
原来 @jietang 唐杰教授的「sooooooon」是按小时算的吗 😃
推荐理由
GLM-5.3作为国产开源模型的新旗舰,后训练规模化带来的能力跃升值得关注,做模型应用或研究的同学可以重点测试其长程任务表现。
原来 @jietang 唐杰教授的「sooooooon」是按小时算的吗 😃
GLM-5.3 在唐杰教授发帖后几小时就正式发布了,又是后训练的一个典型案例!中国开源模型这一轮热潮也是 GLM-5.2 带起来的。 https://z.ai/blog/glm-5.3
GLM-5.3 和 GLM-5.2 沿用了同一套基座模型,所有可观测的能力提升,都来自后训练阶段的持续规模化。
过去一个月 @Zai_org 在 GLM-5.2 已搭好的技术栈上持续加码: · IndexShare:长上下文的高效处理机制; · SAO(含 compaction):面向长程任务的强化学习算法,使增益不只在短任务上显现,也能在长程任务上保持; · slime:大规模异步后训练框架,训练侧用 Megatron,rollout 侧用 SGLang。
GLM-5.3 在此之上做了三件事:更多环境、更多样任务、更多算力。在复杂编码与长程任务上对 GLM-5.2 形成明显代差,并在网络安全方向上出现了团队自己也未完全预期的"涌现式"能力跃升。
btw... GLM-5.3 是一个只有 743B 的模型,综合能力和 Kimi K3 互有胜负,厉害!
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力