精选70Hugging Face 每日论文(json_list)论文研究
MoTE:面向多任务视频理解的任务专家混合解码器
MoTE: Mixture of Task Experts for Multi-Task Video Understanding
程序性视频语言模型必须从相同的视觉证据中解决异构任务,包括动作识别、预测和程序预测。密集Transformer解码器在所有任务中共享相同的前馈网络,这可能会纠缠任务行为,并使受控能力扩展变得困难。稀疏专家混合(MoE)解码器提供条件计算,但基于令牌的学习路由并不自然地与任务级程序性目标对齐。我们提出MoTE(任务专家混合),一种解码器架构,将大语言模型的前馈网络转换为任务特定专家,同时保持多模态骨干网络共享。每个示例遵循一条样本级任务路由,因此活跃的任务专家计算与存储的任务专家数量无关。我们将此设计实例化为VideoLLM-MoTE,并使用显式任务路由在五个COIN基准上进行评估。五专家模型每个样本激活约2B LLM参数,并实现了比近期VideoLLM基线更高的平均top-1准确率。在相同的专家拓扑下,它优于密集全专家激活和学习稀疏路由控制。这些结果表明,任务结构化路由为多任务视频语言学习提供了一种可解释且计算高效的解码器替代方案。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力