跳到主内容
精选85meng shao模型发布/更新多源精选 ×4

美团发布 LongCat-2.0,1.6T 参数 MoE,全链路国产化

美团发布 LongCat-2.0 了,1.6T 参数 MoE 架构,激活参数 48B,上下文窗口 1M(最大输出 128K),采用 5-6 万张中国国产加速卡训…

原文
推荐理由

做 Agent 和 Coding 方向的同学重点关注,LongCat-2.0 在国产算力全栈自研上迈出关键一步,1M 上下文和 48B 激活参数在长文本 Agent 场景有实用价值,建议在 OpenRouter 上试用其 Preview 版本。

美团发布 LongCat-2.0 了,1.6T 参数 MoE 架构,激活参数 48B,上下文窗口 1M(最大输出 128K),采用 5-6 万张中国国产加速卡训练,训练推理全程零英伟达依赖。

三项关键技术 1. N-gram Embedding:参数前移 embedding 层,减 MoE 路由与通信开销 2. 稀疏注意力 + 跨层索引:支撑 1M 上下文,控制计算成本 3. 底层算子自研:确定性 FAG、Scatter 重写等,弥补国产芯片生态短板

能力定位 Agent + Coding 优先,非通用对话。Preview 在 OpenRouter 开发者调用量居前,Claude Code / Hermes 生态采用度高。

与 DeepSeek V4 的差异 参数量级相近(1.6T / ~48B / 1M),路径不同:DeepSeek 开源 + 双栈适配;LongCat 强调训推全链路国产化。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近