AI News字数 2931阅读时长8 分钟

World Labs 发布 Atlas:原生相机控制与 3D 重建

World Labs 的 Atlas 将原生相机控制、稀疏视角 3D 重建、视频重构视角和机器人仿真整合到一个模型中。

文章目录 · 12
  1. 一、Atlas 将多项空间任务统一于一个模型中
  2. 二、原生相机几何改变镜头控制方式
  3. 三、稀疏图像可转化为点云和高斯泼溅
  4. 四、视频重构视角和机器人技术延伸至场景生成之外
  5. 五、基准测试结果令人期待,但由公司报告
  6. 常见问题
  7. Atlas 已向公众开放吗?
  8. Atlas 能否根据一张图像生成 3D 场景?
  9. Atlas 可以生成哪些 3D 格式?
  10. Atlas 生成的视频可以有多长?
  11. Atlas 会取代 Marble 吗?
  12. 参考来源

World Labs 于 2026 年 9 月 1 日推出 Atlas,并将其定位为一种多模态世界模型:可生成由相机控制的图像和视频、将场景重建为显式 3D,并从新视角重新呈现已记录的事件。

最具影响力的变化在于,Atlas 将相机几何信息作为原生输入。用户不必要求视频生成器理解“摇摄”“横移”或“升降”等文字,而是可以在共享的三维上下文中指定相机位置和轨迹。World Labs 表示,Atlas 可根据少量参考图像和人工设计的相机路径,生成最长达一分钟、分辨率为 1440p 的视频。

Atlas 尚非全面公开的产品。它正与选定合作伙伴进入早期访问阶段,World Labs 尚未公布公开定价、模型标识符、API 发布日期或广泛访问条件。

一、Atlas 将多项空间任务统一于一个模型中

World Labs 将 Atlas 描述为从头开始预训练的“全能模型”。其架构结合了自回归 Transformer 与潜空间扩散:多模态元素以序列形式处理,而图像及其他连续输出则通过整流流去噪过程生成。

该模型目前可处理文本、图像、相机位姿和 3D 深度图。视频被表示为图像序列。每张图像和深度图都可关联明确的相机位姿,从而使输入植根于 World Labs 所称的空间上下文之中。

这一设计使一个模型能够处理多项通常分散在不同系统中的任务:

  • 根据参考图像生成图像和视频;
  • 控制生成画面的视角和相机路径;
  • 合成现有场景的新视角;
  • 估计深度并重建显式 3D 几何;
  • 从新角度重新呈现同步视频素材;
  • 为仿真机器人生成传感器观测;
  • 根据提示词创建常规图像和 360 度全景图。

World Labs 将 Atlas 宣传为首创的多模态世界模型,但这一优先性主张尚未得到独立证实。该公司曾于 2025 年 11 月将其早期的 Marble 系统描述为多模态世界模型。Atlas 背后更具体的技术主张是,生成、重建、相机条件、深度和时间仿真已被整合到同一预训练架构中。

二、原生相机几何改变镜头控制方式

在发布时展示的相机控制视频示例中,Atlas 可接收 1-6 张参考图像。用户将这些图像置于空间上下文中,并指定虚拟相机的移动方式。随后,模型会沿该轨迹生成视图,同时尝试保持场景的外观和几何结构。

这与仅通过文本提示相机运动存在实质差异。“缓慢环绕主体”这样的表述,会让模型自行推断环绕半径、方向、高度、速度和构图。原生相机输入可直接编码这些选择,为电影制作人和可视化团队提供更精确的控制界面。

World Labs 将这一结果称为“像素级完美的相机控制”。这一表述应被视为公司的描述,而非经过独立测量的准确性保证。已公布的评估测试的是人类评分者是否认为 Atlas 比对比模型更好地遵循了预期相机路径;它并未证明像素层面零误差。

空间上下文也支持构图。World Labs 展示了两张原本互不相关的参考图像,被放置在 3D 空间中的不同位置。Atlas 会生成中间空间——例如门口、走廊和连接房间——从而在两者之间形成一个连续世界。

这种生成行为有助于世界构建,但也明确了一个重要边界:连续性并不必然意味着重建准确性。当输入未揭示场景的某一部分时,Atlas 会根据其学习到的先验生成合理的补全内容。

三、稀疏图像可转化为点云和高斯泼溅

Atlas 可根据一张或多张带位姿的图像重建场景,并可在同一空间上下文中使用超过 100 张图像。World Labs 表示,2 或 3 个视角通常足以实现忠实重建,而更多视角可减少模型必须生成的未见内容。

单图结果必然是观测与合成的混合体。在一个公司示例中,Atlas 保留了地面照片中可见的花园部分,但生成了周围的建筑和地形。加入附近小屋和主屋的照片后,生成场景受到的约束会逐步增强。

Atlas 可输出新视角图像、深度信息、点云和 3D 高斯泼溅。根据一张图像,它会在估计其几何结构的同时生成额外视图;根据一段视频,它会预测逐帧深度并将画面组合为重建结果。相机从未捕捉到的区域则由模型填补。

高斯泼溅提供的是一种可渲染表示,而不仅是一组生成画面。它们可从不断变化的位置进行查看,并整合到下游 3D 工作流中。Atlas 使用与 Marble 相同的广义表示,这应使模型输出与 World Labs 现有产品的未来版本兼容。

对于视觉特效和设计团队而言,这可能减少建立可导航场景所需的密集摄影采集量。其代价是,观测视图之外生成的几何结构可能看起来连贯,却未必与原始地点完全一致。

四、视频重构视角和机器人技术延伸至场景生成之外

Atlas 能够从多个同步相机重建已记录事件,并从物理相机从未存在过的视角进行渲染。World Labs 展示了“子弹时间”式重构视角,其素材来自 3 至 5 部普通手机,以及安装在三脚架或夹具上的运动相机。

该系统利用多视图估计事件的空间和时间结构。编辑人员随后可冻结动作,或让虚拟相机围绕其移动。这提供了比传统多视图工作室更轻量的采集设置,尽管发布材料并未披露处理时间、硬件要求或失败率。

对于机器人技术,Atlas 将重建与生成的传感器观测相结合。在两项导航演示中,World Labs 使用手机视频采集了大型环境,为每次重建选取 24 帧,并模拟机器人沿不同路径移动。Atlas 生成了安装在机身上的相机沿这些路径会观测到的 RGB 图像和深度数据。

该公司还展示了用于操控的 Real-to-Sim 工作流。少量录制内容可被转换为模拟任务,之后开发者可改变物体、位置、机器人运动、光照或背景。演示涵盖刚性、关节式和可变形物体。

这些输出可在无需反复于物理硬件上布置每一种变体的情况下,提供训练和测试环境。不过,Atlas 公告并未量化生成的动力学是否足够准确地再现真实世界的力、接触行为、摩擦或形变,以便机器人策略能够可靠迁移。

五、基准测试结果令人期待,但由公司报告

World Labs 发布了相机条件生成和稀疏视角 3D 重建的评估结果。对于相机控制,每次试验均从一张输入图像和一条包含 1 至 3 种电影镜头运动的轨迹开始。第三方人工评分者比较输出对所要求路径的遵循程度。

Atlas 通过其原生相机表示接收路径。由于竞争视频模型不接受相同的相机格式,它们接收的是使用常规电影术语的文字描述。World Labs 承认,更复杂的提示可能会改善一些竞争模型的表现,因此这部分是对控制界面的比较,而非输入严格相同的测试。

对于重建,公司报告称,在其复现的评估协议下,Atlas 的误差低于包括 Pi3X、π³、VGGT-Ω 1B、Depth Anything 3 和 MapAnything 在内的专用开源系统。发布页面未提供配套的同行评审论文,也没有给出足以独立复现全部报告结果的方法细节。

World Labs 也未在发布材料中披露 Atlas 的参数量、训练数据构成、推理成本、生成速度、安全控制措施或评估样本量。因此,其演示和基准测试证明的是公司报告的能力,而不是对不受控制素材或生产工作负载的独立验证。

相比之下,Marble 于 2025 年 11 月全面公开,可根据文本、图像、视频或粗略布局生成持久化 3D 世界,导出内容包括高斯泼溅、网格和视频。Atlas 旨在为 Marble 及其他 World Labs 产品的未来版本提供支持。因此,对大多数用户而言,这一公告是技术预览,而非对当前可用平台的即时替代。

常见问题

Atlas 已向公众开放吗?

没有。World Labs 表示,Atlas 正与选定合作伙伴进行早期访问。感兴趣的组织可以提交访问申请,但公开资格规则尚未公布。

Atlas 能否根据一张图像生成 3D 场景?

可以,但未见区域是生成的,而不是根据证据恢复的。加入更多图像会对模型形成约束,并减少它必须生成的内容。

Atlas 可以生成哪些 3D 格式?

该公司表示,除常规图像和视频帧外,Atlas 还可生成深度图、点云和 3D 高斯泼溅。

Atlas 生成的视频可以有多长?

World Labs 展示了最长达一分钟、分辨率为 1440p 的相机控制输出。它尚未公布生成时间或硬件要求。

Atlas 会取代 Marble 吗?

不会立即取代。World Labs 表示,Atlas 将为 Marble 及其他产品的未来版本提供支持,而 Atlas 本身仍处于有限的早期访问阶段。

参考来源

Share

分享这篇文章