跳到主内容
@wquguru
精选70律动 BlockBeats(Telegram)研究与分析多源精选 ×4

腾讯混元Hy4重构底层架构,引入DeepSeek稀疏注意力与智谱IndexCa

腾讯混元Hy4重做底层:DeepSeek稀疏注意力+智谱IndexCache一起上

原文
发到 X

腾讯混元Hy4重做底层:DeepSeek稀疏注意力+智谱IndexCache一起上 动察 Beating AI 快讯,腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。 Hy4 还给 DSA 加上了 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。 腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。 另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。 原文链接 https://m.theblockbeats.info/flash/364046

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近