World Labs 发布世界模型 Atlas:统一多模态生成与 3D 重建
World Labs 推出的"全能型"世界模型「Atlas」
世界模型是近期 AI 前沿热点,Atlas 提出用单一架构统一多模态生成与 3D 重建,特别是将相机轨迹作为几何输入的创新设计,对具身智能和数据生成有重要参考价值,值得关注。
World Labs 推出的"全能型"世界模型「Atlas」
Atlas 是一个从零预训练、原生统一处理文本/图像/视频/3D 的「多模态自回归扩散 Transformer」,用单一架构同时完成世界的生成、重建与仿真。 https://www.worldlabs.ai/blog/atlas
Atlas 的关键创新是"空间上下文"(spatial context):每张图像/深度图都被显式地"放置"在 3D 空间的某个位姿上。这带来两个结果: · 像素级相机控制:相机轨迹是几何输入而非自然语言提示,这是它与所有文本控制镜头运动的视频模型的本质区别; · 上下文即世界:把两张无关照片放进 3D 上下文的不同位置,模型会"脑补"出连接它们的走廊、门洞。这把 LLM 的 in-context 能力第一次赋予了空间语义。
Atlas 的四个能力和技术含量 1. 相机可控生成 单图/多图输入 + 精确相机路径 → 最长 1 分钟、1440p 视频。亮点是"超出视野的合理外推"(生成机器人背面、泳池边的草坪)。1 分钟 @1440p 且全程 3D 一致,若演示无水分,是目前公开模型中的顶级水平。 2. 空间重建(技术含量最高的一项) · 从 1 张到 100+ 张稀疏图像重建场景,2–3 张即可超过专用 SOTA 重建模型(对标 VGGT、π³、Depth Anything 3 等); · 原生输出点云和 3D Gaussian Splat——即 Marble 产品所用表示,意味着"生成→可渲染资产"的管线被打通; · "看得越多,想象越少":输入图像数量成为控制"忠实重建 vs 创造性补全"的旋钮,这个交互设计很优雅。 3. 时空仿真 · 视频重取景:3–5 台手机拍的多视角素材 → "子弹时间"效果,把昂贵的多机位捕捉棚平民化; · Real-to-Sim 机器人仿真:24 帧手机视频重建环境 → 生成机器人本体相机的 RGB+深度 → 支持刚体/铰接/可变形物体的操作仿真,且可程序化变换物体、光照、背景来规模化造训练数据。这可能是商业价值最高的一块——直接切入具身智能的数据瓶颈。 4. 图像生成 文本生图、文字渲染、360° 全景。官方自己说是"副产品",属于展示模型的通用性下限。
基准与 Scaling 信号 · 相机控制生成:第三方人工评测,胜率随相机轨迹复杂度上升而扩大——这个趋势比绝对胜率更有说服力,说明几何输入的优势是结构性的; · 稀疏视角 3D 重建:在多个学术基准上误差低于最佳开源专用模型,且官方复现了全部基线保证公平; · Scaling:每一档算力提升都解锁了新能力,值得期待:如果世界模型也遵循 scaling law,World Labs 的护城河就是算力+数据飞轮,而非单点算法。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力