跳到主内容
@wquguru
精选86Hugging Face 每日论文(json_list)论文研究

Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型

Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

原文
发到 X
推荐理由

将通用 VLM 扩展至自动驾驶全栈任务(感知+规划)的早期探索,架构设计兼顾了通用能力保留与垂直领域性能,对做多模态 Agent 或具身智能的同学有参考价值。

我们推出了 Qwen-Drive-1.0,这是迈向自动驾驶视觉语言基础模型的第一步。Qwen-Drive-1.0 保留了预训练视觉语言模型(VLM)的架构,并在统一框架内集成了 3D 感知、视觉问答和运动规划。一个外部的鸟瞰图(BEV)感知头联合执行 3D 目标检测、语义占据预测和 BEV 地图分割。它作为探测共享表示中可访问的 3D 信息的探针,并为 3D 场景结构提供了一个显式的、可检查的接口。规划专家基于共享的 VLM 表示来生成未来的自车轨迹。分阶段训练配方将驾驶监督与通用视觉语言数据相结合,以获取特定于驾驶的能力,同时有助于保留广泛的视觉理解和指令遵循能力。实验表明,该模型在 3D 感知和驾驶场景理解方面表现强劲,同时很大程度上保留了通用的视觉语言能力。在开环、伪闭环和闭环设置下的全面评估进一步展示了极具竞争力的运动规划性能。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近