Kimi K3 (2.8T) 在 MacBook Pro 上以每秒1
Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
推荐理由
在消费级硬件上运行万亿参数模型的极致工程实践,SSD 流式加载权重的方案对边缘部署极具参考价值,建议收藏并测试其性能瓶颈。
GitHub 项目 deltafin 展示了如何在单台 MacBook Pro 设备上运行 Kimi K3 模型。该模型参数量高达 2.8T,通过从四个 SSD 中流式读取权重数据来实现推理。实测推理速度约为每秒 1 个 token。该项目提供了具体的工程实现方案,展示了利用本地存储带宽处理超大规模模型权重的可行性。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力