跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)技巧与观点

FreeToken:边缘端 MoE 推理系统,带宽自适应执行

FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution

原文
发到 X

前沿开放权重模型日益普及,但服务这些模型仍主要假设依赖数据中心基础设施。我们提出FreeToken,一个边缘原生的MoE服务系统,它将个人机器不仅视为小型GPU,而是作为一个统一、弹性的推理平台。FreeToken协同设计整个服务栈,包括模型布局与加载、专家驻留、CPU-GPU执行、代理状态复用及运行时内存管理,围绕本地AI的两个现实:代理工作负载持续改变其执行模式,以及边缘硬件暴露异构资源,其平衡因机器而异。FreeToken不采用固定的卸载策略,而是持续将计算和模型状态映射到实际可用的资源上。FreeToken支持超过20种MoE模型及真实编码和工具使用代理,硬件范围从8GB笔记本GPU到单工作站GPU。更重要的是,它改变了这些机器实际能服务的规模,从笔记本上的35B模型到游戏台式机上的284B模型,以及单工作站GPU上的753B GLM-5.2。FreeToken将开放权重转化为可部署的本地软件,使用户已拥有的机器成为前沿规模智能的实用平台。我们在flashml.ai发布该系统。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近