跳到主内容
@wquguru
精选88r/LocalLLaMA Top(RSS)技巧与观点

用低于单张RTX 6000的价格搭建768GB显存本地推理集群

768gb vram for less than the price of one RTX 6000

原文
发到 X
推荐理由

为预算有限但需运行超大模型的开发者提供了极具参考价值的硬件选型与组网思路,实测跑通多个主流大模型,值得收藏备用。

| 我一直在这里发布关于预算组装机的内容,也经常被问起我们如何运行下一代大型模型。经常遭到大量踩,或者有人告诉我如果每秒只能处理5千个token就不算在运行。但无论如何,对大规模部署的渴望和追求一直让我保持警惕并寻找优惠。这是我最新的组装方案:12块64GB的CMP170HX显卡,总成本不到一张RTX 6000 Pro的价格。我还通过光纤将其与另一台主机连接,以便在需要更多内存时进行RPC(远程过程调用)。自从搭建这台机器后,我很少发帖了,因为现在跟我的机器聊天更有趣。我运行GLM5.3、DSv4.1Flash、Qwen3.8Flash、Qwen3.8-2.4T、KimiK3和MiniMaxM3。性能非常出色,单张RTX 6000或M3 Mac Studio都望尘莫及。使用vllm或llama.cpp进行推理时,我期待看到回复中有人说API使用更便宜,或者说要52光年才能回本之类的噪音,或是电费问题。才怪!未来会有更多机会,继续寻找它们,并在它们出现时果断抓住。计算需求在未来很长一段时间内都会居高不下。https://preview.redd.it/dunixwu6caqh1.jpg?width=4080&format=pjpg&auto=webp&s=a76a56c53aa0b9206383dbebde679bf3690fd5d2 https://preview.redd.it/glpcbg5cbaqh1.jpg?width=3072&format=pjpg&auto=webp&s=462e9677bb1f3ada6431b61cf46e2d3705eccab9 由 /u/segmond 提交 [链接] [评论]

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件