04:35·Avi Chawla
本文深入解析MoE模型在推理阶段的一个关键系统工程问题:路由机制如何将批量Token分散至不同专家,导致原本统一的矩阵乘法(GEMM)分裂为多个大小不一的专家子批次。在低并发场景下,如仅1-3个请求时,多数专家仅处理单行数据,操作退化为通用矩阵向量乘法(GEMV),使得Grouped GEMM难以复用权重,效率受限。文章以Qwen-3.5-397B-A17B-FP8在Ironwood TPU上的优化为例,介绍通过自定义内核预取专家权重至TPU高速VMEM并直接处理GEMV操作,实现并发为1时MoE块加速3.6倍。
#MoE#推理优化#Qwen-3.5
01:23·Cloudflare 博客(RSS)
Cloudflare工程师Ivan发现内部负载均衡服务Pingora Backend Router因pingora-ketama库的一致性哈希实现导致内存占用过高。团队通过引入数学分析,指出增加每个服务器的哈希点数可降低负载分布的变异系数,从而平衡负载并减少内存消耗。这一算法优化使该服务在全球范围内节省了超过100TB的RAM,加上DNS团队此前节省的100TB,总计释放200TB资源。文章详细解释了从环形空间到数轴映射的一致性哈希原理、期望值与标准差在负载不均中的应用,以及通过增加哈希点利用大数定律优化分布的工程实践。
#Cloudflare#一致性哈希#内存优化
23:32·Hacker News Best(web_list)
本文提出利用大语言模型辅助写作的两条核心规则。第一条禁止采纳模型建议的任何具体措辞,防止文章被模型特有的“头条式”华丽辞藻污染,保持作者个人声音;第二条严禁接受模型的鼓励性反馈,避免模型对初稿的盲目肯定导致作者固守缺陷而非进行深度重构。作者主张将LLM定位为严格的校对者而非代笔者,通过构建包含Python、HTMX和SQLite的工具链,自动化执行风格检查(如被动语态、冗余副词)与段落优化。该方法强调读者需自行重写问题部分,并参考《Style: Lessons in Clarity and Grace》建立提示词清单,以实现高效且保留个人风格的编辑流程。
#LLM#写作技巧#Prompt工程
22:04·r/LocalLLaMA Top(RSS)
Reddit用户分享了一套高性价比的本地大模型推理硬件配置方案。该方案采用12块AMD CMP 170HX显卡,每块配备64GB显存,总显存容量达到768GB,整体成本低于单张NVIDIA RTX 6000 Ada Generation专业卡。作者通过光纤连接其他计算资源以支持远程过程调用(RPC),从而进一步扩展可用内存。在vLLM或llama.cpp框架下,该配置能够流畅运行GLM-5.3、DeepSeek-V4.1 Flash、Qwen3.8系列及Kimi K3等大规模模型,推理性能表现优异,甚至优于部分高端消费级或工作站级GPU。
#LocalLLaMA#硬件搭建#推理优化
20:36·r/MachineLearning Top(RSS)
该项目利用2011至2018年约2.15万人的NHANES数据,对比逻辑回归、随机森林与梯度提升模型预测冠心病风险。作者重点披露了数据泄露审计过程:若纳入其他心血管诊断问卷,PR-AUC会从0.23升至0.51,但这属于标签泄露而非真实风险因子,故予以剔除。针对类别不平衡(患病率4%),采用加权逻辑回归并通过Sigmoid校准修正概率偏差,将平均预测风险从30%校正至接近真实水平。在开发集确定阈值后测试,最终ROC-AUC为0.875,但PPV仅0.13。项目开源代码并详细记录了处理流程与局限性。
#NHANES#数据泄露#模型校准
18:27·WquGuru
PrismML 将 Qwen3.8 27B 模型通过三值量化压缩至 5.9GB(约 1.72 bit/weight),体积缩小约 9 倍,综合基准保留原版 98.2%,支持 262K 上下文与视觉能力。在此基础上,OrcaRouter 提出一种无需修改权重的运行时干预方案,通过 129 个残差干预点将拒答方向在推理时切除,实现原包 bit-identical 且 alpha 可调。该组合方案旨在让网络安全研究者在小内存机器上部署媲美大模型的越狱能力,无需 DGX Spark 或 M5 Ultra 等高端硬件。项目代码与权重已开源。
#Qwen3.8#OrcaRouter#PrismML
17:16·Avi Chawla
该资讯深入解析了混合专家模型(MoE)的推理工程实现细节。内容涵盖推理引擎如何对Token进行路由分发,如何在GPU集群中并行执行专家计算,以及权重在多卡间的分布式存储策略。此外,还重点讨论了通信开销管理与负载不均衡问题的优化方案,旨在帮助开发者理解MoE服务引擎的核心机制与性能瓶颈应对方法。
#MoE#推理工程#LLM部署
16:50·meng shao
Cua发布jev-use,将Fast Computer Use拆分为两层架构。Jev负责轻量快速的决策判断,从候选动作中选定ID;Cua Driver负责跨平台观察(截屏、AX、DOM)与执行验证。该架构通过确定性基础设施包裹极小模型决策点,把开放式生成收敛为有界选择。实测在2048游戏中,Jev比Astra快5倍且成本降低约1000倍(单次约$0.001)。Driver保持模型无关,支持替换感知组件,旨在解决Computer Use的延迟与成本瓶颈。
#Cua#Computer Use#架构设计