精选75Hugging Face 每日论文(json_list)论文研究
Mobius架构解耦知识与推理,7B模型训练数据减37%
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
我们介绍了Mobius-v0架构,该架构包含一个全局共享的记忆(FFN),用于存储知识向量,以及多个推理器(Self-Attn),它们迭代地实现组合推理。利用隐藏状态作为缓存和载体,推理器反复查询记忆以获取所需的知识向量,而知识则被传回推理操作符。通过这种知识-推理分离架构,Mobius实现了更好的知识压缩和推理效率。基于Mobius-v0架构:1)我们从头训练的7B模型在仅使用基线62.6%训练数据的情况下,达到了与7B Transformer基线相当的下游任务得分。2)我们的Intern-S2-Mobius,从Qwen3.5-35B持续预训练而来,在实现近4倍端到端推理加速的同时,达到了相当的下游任务得分。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力