跳到主内容
@wquguru
精选80雪球·今日话题(RSS)研究与分析多源精选 ×2

中国开源模型DeepSeek与GLM的技术创新解析

明日的世界(5)中国开源模型做对了什么

原文
发到 X

2026 年 6 月 21 日,Guillermo Rauch 在 X 上提到智谱的 GLM-5.2 的出色表现。编程是非常考验模型细节的场景。惊讶 GLM 表现的海外资深软件工程师还不少。读完论文,大概明白了中国开源模型 DeepSeek 和 GLM 的很多设计精妙在哪里。以下涉及 Transformer 模型概念的回顾和延伸,枯燥的部分可以跳过。Transformer是一个利用注意力机制来提高模型训练速度的模型。在生成式AI 领域,Transformer 彻底改变了文本生成、翻译和摘要等任务。一句话进入模型之前,先被分词器切成 token。中文里的 token 有时是字,有时是词,也可能只是词片段。每个 token 先变成编号,再查到一组向量。模型后面比较的,已经不是我们眼里的字面意思,它比较的是这些向量之间的关系。一次推理里,用户问题、历史对话、系统提示、工具返回、长文档和代码仓库,最后都会排成 token 列表。窗口变长以后,难处不止是装进去。每生成一步,模型还要从这串列表里找出该看的部分。Attention 常译作注意力机制。放到推理现场看,它更像一次带权检索。当前 token 生成 Query,上下文里的位置带着 Key 和 Value。Query 和 Key 打分,分数再决定每个 Value 被读回多少。比如“苹果发布了新芯片,它的性能提升很大”这句话里,“它”更该指向“新芯片”,不是“苹果”。模型不能只靠“它”这个字作判断;它要让当前 token 和前文 token 建立关系。Attention 做的就是这次关系搜索。标准全注意力保留所有关系,代价也直接。上下文有 1,000 个 token,关系计算接近一百万次;上下文拉到一百万 token,完整关系矩阵已经不能按朴素办法处理。长上下文的难处,不在宣传页上的窗口数字,而在每一步还能不能付得起这次搜索。稀疏注意力的做法很直白:不要每个 token 都看全部上下文,只看最相关的前 k 个。Top-K 先打分、排序、取前 k 个,再把主 attention 从“看所有材料”改成“只看筛出来的材料”。不过筛选本身也要花钱。答案在哪里,有时比答案怎么算更费劲。模型回答时是逐个 token 往前写,不是一次吐出完整段落。每写一个新 token,都要回头看前文。历史 token 的 Key 和 Value 已经算过,再算一遍太贵,系统就把它们存下来,这就是 KV Cache。缓存省了重算,也占显存。窗口越长,历史 token 越多,每一步读写缓存越重,HBM 带宽先承压。MLA 就从这里切进去。MLA,Multi-head Latent Attention,是 DeepSeek 处理缓存成本的一项设计。它不再把历史 K/V 原样摊开存放,而是做低秩联合压缩,让历史信息进入更小的 latent cache。在 DeepSeek-V2 的公开材料里,通过 MLA 和 MoE 相比 DeepSeek 67B,训练成本节省 42.5%,KV Cache 减少 93.3%,最大生成吞吐提升到 5.76 倍。缓存小了,HBM 读写少了,每个 token 激活的计算少了,价格才有余地。MoE 省的是另一块成本。Dense 模型每个 token 都要穿过全部参数;MoE 把前馈网络拆成许多专家,路由器只选少数几个参与这一轮计算。DeepSeek-V3 报告里是 671B 总参数,每个 token 激活 37B 参数。难处随之转到路由和负载。某些专家如果总被点名,机器会堵;另一些专家长期闲着,容量又浪费。DeepSeek-V3 把 auxiliary-loss-free load balancing 写成架构创新之一,让专家分工更均匀,同时少让平衡目标干扰主任务。到 DeepSeek Sparse Attention,成本控制继续往前挪。DSA 先用 lightning indexer 扫上下文,选出 top-k,再把这些 token 交给主 attention。主 attention 不再看全量上下文,长窗口里的矩阵计算会轻很多。但索引器不是免费的。它仍要扫很长的 Key,像数据库查询前先建索引。主 attention 变轻以后,“找谁值得看”会变成新的开销。GLM-5.2 提到 1M 上下文时,也把 IndexShare 放进长上下文成本里。DeepSeek DSA 每一层都要重新问:这一层该看哪些 token?层数一多,问题会重复很多次。GLM 的判断是,相邻层选中的重要位置有相似性,可以复用一段。IndexShare 的做法是第一层建索引,后面几层复用;隔几层再重建。KV Cache 存的是历史 Key/Value,IndexShare 存的是“哪些位置值得看”。两者都利用了 Transformer 内部的连续性。智谱对 GLM-5.2 的 IndexShare 在每四个稀疏注意力层之间复用同一个 indexer,1M 上下文长度下每 token FLOPs 降低 2.9 倍;MTP 层改进后,speculative decoding 的接受长度最多提高 20%。这些数字比“支持 1M 上下文”更有用,因为它们落在每个 token 的成本上。MTP,Multi-Token Prediction,是 DeepSeek 和 GLM 都在用的方向。普通语言模型训练时预测下一个 token;MTP 让模型同时预测未来多个 token。训练时,它要学一点局部规划;推理时,它可以先草拟几个 token,再交给验证步骤决定接受还是回退。接受得越多,逐 token 等待越短。DeepSeek-R1 这一支没有继续改 attention,它改的是训练方式。R1-Zero 直接在 base model 上做大规模强化学习,没有先用 SFT 冷启动。DeepSeek 的公开材料说,这条路线让模型自然出现 self-verification、reflection 和长 CoT 行为。它也带来重复、可读性差、语言混杂等问题,所以后来的 R1 又补上冷启动数据和多阶段训练。这件事降低了对人工高质量推理链的依赖。以前常见做法是人写推理过程,模型模仿;R1-Zero 更像是给结果奖励,让模型自己试出路径。它和 MLA、MoE、DSA 不在同一层,但都在减少人工标注、重复计算或等待时间。DeepSeek 的几项设计各自对着一个瓶颈。KV Cache 太大,用 MLA 压缩;Dense 模型太贵,用 MoE 少激活;MoE 路由不均衡,就改负载平衡;长上下文太贵,用 DSA 先筛 top-k;生成慢,用 MTP 缩短等待;训练昂贵,则用 FP8、并行和系统工程继续减少成本。成本节约在 HBM 读写、矩阵计算、机器间通信、生成等待和索引重建。每一项少一点,价格、吞吐、开放部署和社区复现才会一起变化。中国开放权重模型这几年没有只把开源当成口号。严格说,它们开放的主要是权重、技术报告、推理适配、部署路径和一部分可验证的工程细节;训练数据和完整训练流程并不总是公开,不能把它们等同于传统软件开源。但开放权重已经足够改变竞争方式。闭源模型把大部分过程放在 API 背后。用户能看到输出、价格和榜单,却很难知道问题出在哪里。开放模型把一部分判断权交给工程现场。模型稳不稳,长上下文贵不贵,MoE 路由能不能部署,KV Cache 有没有压缩,代码 agent 能不能跑完测试,这些问题会被开发者、企业和推理框架逐项拷问。这是中国开源模型最值得看的地方,而便宜只是一方面。国内大模型实验室的算力和组织规模未必比美国头部闭源实验室更大,但开放权重会改变协作方式。模型公司通过开源进入良性竞争,开发者在本地验证,推理框架跟着适配。如果 API 的价格打到很低,它的意义就不只是收入,也包括收集真实使用中的反馈和训练信号。开放权重还会和主权 AI 连在一起。很多国家和企业未必想长期购买一个黑箱 token,也未必愿意把关键工作流完全交给海外闭源服务。次 SOTA、可部署、可审计、成本低的模型,在这种场景里会变得很实用。如果能和推理硬件、部署工具、合规版本一起出海,就不只是模型公司之间的竞争,而是软硬件和工程生态一起竞争。下一轮模型的竞争,除了上下文大小,很可能还有路由方式。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
Vercel CEO称赞Z.AI的GLM-5.2编码能力
Crypto Briefing(RSS)原文

相似阅读

另一事件,读法相近