World Labs 发布 Atlas:原生相机控制与 3D 重建
World Labs 的 Atlas 将原生相机控制、稀疏视角 3D 重建、视频重构视角和机器人仿真整合到一个模型中。
文章目录 · 12
World Labs 于 2026 年 9 月 1 日推出 Atlas,并将其定位为一种多模态世界模型:可生成由相机控制的图像和视频、将场景重建为显式 3D,并从新视角重新呈现已记录的事件。
最具影响力的变化在于,Atlas 将相机几何信息作为原生输入。用户不必要求视频生成器理解“摇摄”“横移”或“升降”等文字,而是可以在共享的三维上下文中指定相机位置和轨迹。World Labs 表示,Atlas 可根据少量参考图像和人工设计的相机路径,生成最长达一分钟、分辨率为 1440p 的视频。
Atlas 尚非全面公开的产品。它正与选定合作伙伴进入早期访问阶段,World Labs 尚未公布公开定价、模型标识符、API 发布日期或广泛访问条件。
一、Atlas 将多项空间任务统一于一个模型中
World Labs 将 Atlas 描述为从头开始预训练的“全能模型”。其架构结合了自回归 Transformer 与潜空间扩散:多模态元素以序列形式处理,而图像及其他连续输出则通过整流流去噪过程生成。
该模型目前可处理文本、图像、相机位姿和 3D 深度图。视频被表示为图像序列。每张图像和深度图都可关联明确的相机位姿,从而使输入植根于 World Labs 所称的空间上下文之中。
这一设计使一个模型能够处理多项通常分散在不同系统中的任务:
- 根据参考图像生成图像和视频;
- 控制生成画面的视角和相机路径;
- 合成现有场景的新视角;
- 估计深度并重建显式 3D 几何;
- 从新角度重新呈现同步视频素材;
- 为仿真机器人生成传感器观测;
- 根据提示词创建常规图像和 360 度全景图。
World Labs 将 Atlas 宣传为首创的多模态世界模型,但这一优先性主张尚未得到独立证实。该公司曾于 2025 年 11 月将其早期的 Marble 系统描述为多模态世界模型。Atlas 背后更具体的技术主张是,生成、重建、相机条件、深度和时间仿真已被整合到同一预训练架构中。
二、原生相机几何改变镜头控制方式
在发布时展示的相机控制视频示例中,Atlas 可接收 1-6 张参考图像。用户将这些图像置于空间上下文中,并指定虚拟相机的移动方式。随后,模型会沿该轨迹生成视图,同时尝试保持场景的外观和几何结构。
这与仅通过文本提示相机运动存在实质差异。“缓慢环绕主体”这样的表述,会让模型自行推断环绕半径、方向、高度、速度和构图。原生相机输入可直接编码这些选择,为电影制作人和可视化团队提供更精确的控制界面。
World Labs 将这一结果称为“像素级完美的相机控制”。这一表述应被视为公司的描述,而非经过独立测量的准确性保证。已公布的评估测试的是人类评分者是否认为 Atlas 比对比模型更好地遵循了预期相机路径;它并未证明像素层面零误差。
空间上下文也支持构图。World Labs 展示了两张原本互不相关的参考图像,被放置在 3D 空间中的不同位置。Atlas 会生成中间空间——例如门口、走廊和连接房间——从而在两者之间形成一个连续世界。
这种生成行为有助于世界构建,但也明确了一个重要边界:连续性并不必然意味着重建准确性。当输入未揭示场景的某一部分时,Atlas 会根据其学习到的先验生成合理的补全内容。
三、稀疏图像可转化为点云和高斯泼溅
Atlas 可根据一张或多张带位姿的图像重建场景,并可在同一空间上下文中使用超过 100 张图像。World Labs 表示,2 或 3 个视角通常足以实现忠实重建,而更多视角可减少模型必须生成的未见内容。
单图结果必然是观测与合成的混合体。在一个公司示例中,Atlas 保留了地面照片中可见的花园部分,但生成了周围的建筑和地形。加入附近小屋和主屋的照片后,生成场景受到的约束会逐步增强。
Atlas 可输出新视角图像、深度信息、点云和 3D 高斯泼溅。根据一张图像,它会在估计其几何结构的同时生成额外视图;根据一段视频,它会预测逐帧深度并将画面组合为重建结果。相机从未捕捉到的区域则由模型填补。
高斯泼溅提供的是一种可渲染表示,而不仅是一组生成画面。它们可从不断变化的位置进行查看,并整合到下游 3D 工作流中。Atlas 使用与 Marble 相同的广义表示,这应使模型输出与 World Labs 现有产品的未来版本兼容。
对于视觉特效和设计团队而言,这可能减少建立可导航场景所需的密集摄影采集量。其代价是,观测视图之外生成的几何结构可能看起来连贯,却未必与原始地点完全一致。
四、视频重构视角和机器人技术延伸至场景生成之外
Atlas 能够从多个同步相机重建已记录事件,并从物理相机从未存在过的视角进行渲染。World Labs 展示了“子弹时间”式重构视角,其素材来自 3 至 5 部普通手机,以及安装在三脚架或夹具上的运动相机。
该系统利用多视图估计事件的空间和时间结构。编辑人员随后可冻结动作,或让虚拟相机围绕其移动。这提供了比传统多视图工作室更轻量的采集设置,尽管发布材料并未披露处理时间、硬件要求或失败率。
对于机器人技术,Atlas 将重建与生成的传感器观测相结合。在两项导航演示中,World Labs 使用手机视频采集了大型环境,为每次重建选取 24 帧,并模拟机器人沿不同路径移动。Atlas 生成了安装在机身上的相机沿这些路径会观测到的 RGB 图像和深度数据。
该公司还展示了用于操控的 Real-to-Sim 工作流。少量录制内容可被转换为模拟任务,之后开发者可改变物体、位置、机器人运动、光照或背景。演示涵盖刚性、关节式和可变形物体。
这些输出可在无需反复于物理硬件上布置每一种变体的情况下,提供训练和测试环境。不过,Atlas 公告并未量化生成的动力学是否足够准确地再现真实世界的力、接触行为、摩擦或形变,以便机器人策略能够可靠迁移。
五、基准测试结果令人期待,但由公司报告
World Labs 发布了相机条件生成和稀疏视角 3D 重建的评估结果。对于相机控制,每次试验均从一张输入图像和一条包含 1 至 3 种电影镜头运动的轨迹开始。第三方人工评分者比较输出对所要求路径的遵循程度。
Atlas 通过其原生相机表示接收路径。由于竞争视频模型不接受相同的相机格式,它们接收的是使用常规电影术语的文字描述。World Labs 承认,更复杂的提示可能会改善一些竞争模型的表现,因此这部分是对控制界面的比较,而非输入严格相同的测试。
对于重建,公司报告称,在其复现的评估协议下,Atlas 的误差低于包括 Pi3X、π³、VGGT-Ω 1B、Depth Anything 3 和 MapAnything 在内的专用开源系统。发布页面未提供配套的同行评审论文,也没有给出足以独立复现全部报告结果的方法细节。
World Labs 也未在发布材料中披露 Atlas 的参数量、训练数据构成、推理成本、生成速度、安全控制措施或评估样本量。因此,其演示和基准测试证明的是公司报告的能力,而不是对不受控制素材或生产工作负载的独立验证。
相比之下,Marble 于 2025 年 11 月全面公开,可根据文本、图像、视频或粗略布局生成持久化 3D 世界,导出内容包括高斯泼溅、网格和视频。Atlas 旨在为 Marble 及其他 World Labs 产品的未来版本提供支持。因此,对大多数用户而言,这一公告是技术预览,而非对当前可用平台的即时替代。
常见问题
Atlas 已向公众开放吗?
没有。World Labs 表示,Atlas 正与选定合作伙伴进行早期访问。感兴趣的组织可以提交访问申请,但公开资格规则尚未公布。
Atlas 能否根据一张图像生成 3D 场景?
可以,但未见区域是生成的,而不是根据证据恢复的。加入更多图像会对模型形成约束,并减少它必须生成的内容。
Atlas 可以生成哪些 3D 格式?
该公司表示,除常规图像和视频帧外,Atlas 还可生成深度图、点云和 3D 高斯泼溅。
Atlas 生成的视频可以有多长?
World Labs 展示了最长达一分钟、分辨率为 1440p 的相机控制输出。它尚未公布生成时间或硬件要求。
Atlas 会取代 Marble 吗?
不会立即取代。World Labs 表示,Atlas 将为 Marble 及其他产品的未来版本提供支持,而 Atlas 本身仍处于有限的早期访问阶段。
参考来源
Share