精选75Hacker News Best(web_list)技巧与观点
在48GB内存Mac上运行104GB Qwen3.8-Flash模型
Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s
项目 SlotStream 展示了如何在配备 48GB 统一内存的 Mac 设备上运行参数量高达 104GB 的 Qwen3.8-Flash-Next 大语言模型。该方案通过特定的内存管理或量化技术,突破了硬件显存限制,实现了约每秒 12 个 token 的推理速度。这一实践为开发者提供了在消费级高性能电脑上部署超大规模模型的可行路径,降低了本地运行前沿 AI 模型的硬件门槛。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力