跳到主内容
@wquguru
精选80Hugging Face 每日论文(json_list)模型发布/更新

MOSS-VL技术报告:开源实时视觉语言模型

MOSS-VL Technical Report

原文
发到 X

我们提出MOSS-VL,一个开放视觉语言模型家族,将实时交互——边说话边感知——视为一等能力。它在整个技术栈上协同设计:语言解码器仅通过门控交叉注意力关注视觉,使模型在生成时能自然看到传入帧;一个合成的交互语料库监督何时说话、何时保持沉默以及何时修正;分阶段课程将所有实时特定训练集中在一个轻量级最终阶段,基于强大的离线基础。离线状态下,MOSS-VL-Instruct在可比规模上具有竞争力,并在时间推理视频集上领先。在四个流式基准测试中,MOSS-VL-Realtime在开源流式模型中平均得分最高(在第四个上排名第二),横扫三个直接测试主动行为的子集——在OmniMMI主动提醒上,以66.0对比最佳基线的37.5。尽管拥有113亿参数但视觉标记位于解码序列之外,MOSS-VL在视觉上下文增长时,将其相对于同骨干Qwen3-VL-8B的首令牌时间优势从2.8倍扩大到5.1倍。我们发布全部五个检查点、训练课程和实时推理代码,网址为https://github.com/OpenMOSS/MOSS-VL。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近