Kimi K3 被列入自身技术报告贡献者名单
Kimi K3 登上 K3 贡献者名单:写代码、做实验、设计推理芯片原型
Kimi K3展示模型自主参与研发的能力,包括代码编写、实验、芯片设计等,对AI从业者极具启发,建议关注其技术报告和开放权重。
2026 年 7 月 28 日,月之暗面发布的 Kimi K3 技术报告出现了一个不同寻常的贡献者:Kimi K3。
在数百名研发人员姓名之后,报告将「Kimi K3」模型本身也列入了贡献者名单。
从技术报告披露的案例看,Kimi K3 已经被用于大量复杂研发任务。
在 GPU 内核优化方面,Kimi K3 被放入配置相同的沙箱环境中,针对 Attention Residuals、DeepSeek Sparse Attention、Kimi Delta Attention 和 MLA 等 4 类代表性内核,自主完成性能分析、代码重写与基准测试,每项任务最长运行 24 小时。
结果显示,Kimi K3 将 AttnRes 延迟从 283.6 毫秒降至 114.4 毫秒,同时将 DSA 和 KDA 的运行时间分别缩短 55.1% 和 73.6%;在 MLA 任务中,计算性能达到硬件峰值算力的一半以上。
报告称,在这些任务上,Kimi K3 的整体表现与 Claude Fable 5 接近,并明显领先 Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5。
在此基础上,Kimi K3 还从零开发了 MiniTriton。
这是一套类似 Triton 的轻量级 GPU 编译器,包含基于 Python 的 tile 级前端、自定义布局系统、MLIR 优化层和 PTX 代码生成流程,并配套实现了张量库、自动微分、神经网络模块及 NCCL 分布式训练能力。
技术报告称,MiniTriton 在 NVIDIA L20 上的核心测试中超过 PyTorch eager 和 torch.compile,其矩阵乘法性能在大规模计算时接近 cuBLAS,还能够端到端训练 GPT 模型。
MiniTriton 仓库的首次提交由“Kimi K3”账号完成。
芯片设计方面,Kimi K3 还在一次持续 48 小时的自主运行中,使用开源电子设计自动化工具,为一个采用混合 KDA、MLA 注意力和 MoE 路由结构的微型模型设计推理芯片原型。该设计使用 Nangate45 标准单元库,在 4 平方毫米面积预算内完成时序收敛,运行频率达到 100 MHz;RTL 仿真显示,其解码吞吐量超过每秒 8700 个 token,并集成约 146 万个标准单元、0.277 MiB SRAM 和支持融合反量化的 INT4 乘加阵列。
在科研编程方面,Kimi K3 还完成了一项计算天体物理学任务。为复现 I–Love–Q 普适关系,模型阅读并交叉验证了 20 多篇论文,搭建完整数值计算流程,评估 300 多种状态方程,发现已发表公式中的不一致,编写超过 3000 行 Python 代码,并制作交互式 HTML 仪表盘。整个过程约耗时 2 小时,而经验丰富的研究人员通常需要 1 至 2 周。
在其他案例中,它还负责资料搜索、数据分析、网页制作、视频剪辑和动画设计。
因此,将 Kimi K3 列入贡献者名单,可能是月之暗面对“AI 参与研发”事实的一种公开确认。
模型已经不只是辅助润色论文,而是开始承担代码、实验、研究和内容生产等具体工作。
2.8 万亿参数,开放完整权重。
Kimi K3 是月之暗面最新一代旗舰模型,采用混合专家架构,总参数规模达到 2.8 万亿,每次推理激活约 1040 亿参数,并支持原生视觉能力和最高 100 万 token 上下文。
Kimi K3 称其为首个开放权重的 3T 级模型。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。
查看原文 →
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力