跳到主内容
@wquguru
精选70IT之家(RSS)行业动态多源精选 ×12

摩尔线程完成Kimi K3适配,MTT S5000支撑2.8万亿参数模型

摩尔线程宣布完成 Kimi K3 适配:MTT S5000 国产 GPU 支撑 2.8 万亿参数大模型

原文
发到 X

IT之家 7 月 29 日消息,月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。

同日,摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈,宣布完成 Kimi K3 的 Day-0 支持。

Kimi K3 是全球首个开源的 3 万亿级别模型,总参数达 2.8 万亿,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,采用 Gated MLA 与 Stable Latent MoE 等架构创新,原生支持视觉理解,并拥有 100 万 token 上下文窗口。

与传统 Transformer 模型不同,Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干,Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。

面对新架构对 AI 芯片软件栈提出的系统性挑战,摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新,团队分别完成了 Prefill 与 Decode 阶段的关键路径适配,并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool,用于管理 KDA 递归状态与卷积状态,覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。

针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模,摩尔线程快速完成了 DeepEP 适配,打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配,通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint,摩尔线程设计了加载期在线逐层量化方案,无需离线转换即可快速拉起推理。

IT之家查询获悉,MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡,单卡 AI 稠密算力最高可达 1000TFLOPS,配备 80GB 显存,显存带宽达 1.6TB/s,卡间互联带宽为 784GB/s,完整支持从 FP8 到 FP64 的全精度计算。

相关阅读:

  • 《Day0 适配:阿里云灵骏真武 M890 超节点实例现已支持月之暗面 Kimi K3 大模型》
  • 《月之暗面开源 Kimi K3 模型,2.8 万亿参数》

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源
Kimi K3开源权重模型发布,2.8万亿参数
Two Minute Papers(YouTube)原文
Kimi K3在WeirdML上接近Opus 4.8水平
Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞)原文
Kimi K3开源,2.8万亿参数全面开放
华尔街见闻(RSS)原文
开源权重争议与Kimi K3发布
Latent Space(RSS)原文
黄仁勋、Kimi K3与开源战争
数字生命卡兹克原文
月之暗面开源Kimi K3模型权重,2.8万亿参数
Simon Willison 博客(RSS)原文
月之暗面开源Kimi K3权重与基础设施
The Decoder(RSS)原文
Kimi K3 上线 Together AI
Kimi.ai原文
Kimi K3 开放权重,108B 参数
实践哥MinLi原文
Kimi K3 开源权重
宝玉原文
Kimi K3:2.8T参数开源模型发布
Hugging Face 每日论文(json_list)原文

相似阅读

另一事件,读法相近