AI News字數 2861閱讀時長8 分鐘

World Labs 發表具備原生鏡頭控制及 3D 重建功能的 Atlas

World Labs 的 Atlas 將原生鏡頭控制、稀疏視角 3D 重建、影片重新取景及機械人模擬整合於同一模型。

文章目錄 · 12
  1. 一、Atlas 在同一模型中整合多項空間任務
  2. 二、原生鏡頭幾何資訊改變鏡頭控制方式
  3. 三、稀疏圖像可轉化為點雲及 Gaussian splats
  4. 四、影片重新取景及機械人技術延伸至場景生成以外
  5. 五、基準測試結果令人鼓舞,但由公司自行報告
  6. 常見問題
  7. Atlas 是否公開提供?
  8. Atlas 能否從一張圖像生成 3D 場景?
  9. Atlas 可生成哪些 3D 格式?
  10. Atlas 生成的影片可以有多長?
  11. Atlas 正在取代 Marble 嗎?
  12. 參考來源

World Labs 於 2026 年 9 月 1 日推出 Atlas,將其定位為多模態世界模型,可生成可控制鏡頭的圖像及影片、以顯式 3D 重建場景,並從新視角為已錄製事件重新取景。

最具影響力的改變,是 Atlas 可將鏡頭幾何資訊作為原生輸入。使用者毋須要求影片生成器理解「pan」、「truck」或「crane」等字詞,而是可在共享的三維語境中指定鏡頭位置及軌跡。World Labs 表示,Atlas 可根據少量參考圖像及人手設計的鏡頭路徑,生成長達一分鐘、1440p 的影片。

Atlas 尚未成為普遍可用的產品。它正與獲選合作夥伴展開早期存取,而 World Labs 尚未公布公開定價、模型識別碼、API 發布日期或廣泛存取條件。

一、Atlas 在同一模型中整合多項空間任務

World Labs 將 Atlas 描述為從零開始預先訓練的「全能模型」。其架構結合自回歸 Transformer 與潛在擴散:多模態元素會作為序列處理,而圖像及其他連續輸出則透過 rectified-flow 去噪程序生成。

該模型目前可處理文字、圖像、鏡頭姿態及 3D 深度圖。影片會表示為圖像序列。每張圖像及深度圖均可配對一個明確的鏡頭姿態,使輸入植根於 World Labs 所稱的空間語境。

這項設計讓同一模型可處理多項通常分散於不同系統的任務:

  • 根據參考圖像生成圖像及影片;
  • 控制生成畫面的視角及鏡頭路徑;
  • 合成既有場景的新視角;
  • 估算深度並重建顯式 3D 幾何;
  • 從新角度為同步影片素材重新取景;
  • 為模擬機械人生成感測器觀測結果;
  • 根據提示建立傳統圖像及 360 度全景圖。

World Labs 將 Atlas 推廣為首創的多模態世界模型,但這項優先權主張尚未獲獨立證實。該公司在 2025 年 11 月已將其早期的 Marble 系統描述為多模態世界模型。Atlas 背後較具體的技術主張,是在同一個預先訓練架構中結合了生成、重建、鏡頭條件化、深度及時間模擬。

二、原生鏡頭幾何資訊改變鏡頭控制方式

在發表時展示的鏡頭控制影片範例中,Atlas 可接收一至六張參考圖像。使用者將這些圖像置於空間語境中,並指定虛擬鏡頭應如何移動。模型隨後會沿該軌跡生成視角,同時嘗試保留場景的外觀及幾何結構。

這與只以文字提示鏡頭有實質分別。「慢慢環繞主體」這類語句,會讓模型自行推斷環繞的半徑、方向、高度、速度及構圖。原生鏡頭輸入可直接編碼這些選擇,為電影製作人及視覺化團隊提供更精確的控制介面。

World Labs 稱結果為「像素級精確的鏡頭控制」。此說法應視為公司描述,而非獨立量度的準確度保證。已發布的評估測試人類評分員是否認為 Atlas 比對照模型更能遵循預定鏡頭路徑;它並未證明像素層面零誤差。

空間語境亦支援構圖。World Labs 展示了兩張原本互不相關、放置於 3D 空間不同位置的參考圖像。Atlas 會生成中間空間,例如門口、走廊及連接房間,從而在兩者之間形成連續世界。

這種生成行為有助於世界建構,但亦確立了一項重要界線:連續性未必代表重建準確度。當輸入未有顯示場景某部分時,Atlas 會根據其學得的先驗知識,創作看似合理的補全內容。

三、稀疏圖像可轉化為點雲及 Gaussian splats

Atlas 可從一張或多張具姿態資訊的圖像重建場景,並可在同一空間語境中使用超過 100 張圖像。World Labs 表示,兩至三個視角通常已足以進行忠實重建,而額外視角可減少模型需要生成的未見內容。

單張圖像的結果必然混合觀察與合成。在一個公司示例中,Atlas 保留了一張地面高度照片中可見的花園部分,但創作了周邊建築物及地形。加入附近小屋及主屋的相片後,所得場景便會逐步受到更多約束。

Atlas 可輸出新視角圖像、深度資訊、點雲及 3D Gaussian splats。從一張圖像開始,它會在估算其幾何結構的同時生成額外視角;從影片開始,它會預測每幀深度,並將各幀整合為重建結果。鏡頭從未拍攝到的區域會由模型填補。

Gaussian splats 提供可渲染的表示方式,而不只是生成畫面的集合。它們可從變動位置觀看,並整合至下游 3D 工作流程。Atlas 使用與 Marble 相同的廣泛表示方式,這應可讓模型輸出與未來版本的 World Labs 現有產品相容。

對視覺特效及設計團隊而言,這或可減少建立可導航場景所需的密集攝影採集量。取捨在於,觀察視角以外的生成幾何結構可能看起來連貫,卻未必與原有地點完全一致。

四、影片重新取景及機械人技術延伸至場景生成以外

Atlas 可從多部同步鏡頭重建已錄製事件,並從實體鏡頭從未出現的位置渲染視角。World Labs 展示以三至五部普通手機及固定於三腳架或夾具上的動作相機拍攝素材,實現「bullet time」重新取景。

系統利用多個視角估算事件的空間及時間結構。編輯人員其後可定格動作,或讓虛擬鏡頭在其周圍移動。這種採集設定比傳統多視角攝影棚更輕便,但發表材料未有披露處理時間、硬件要求或失敗率。

在機械人方面,Atlas 將重建與生成的感測器觀測結果結合。在兩個導航示範中,World Labs 使用手機影片拍攝大型環境,為每個重建挑選 24 幀,並模擬機械人沿不同路徑移動。Atlas 生成了固定於機身的鏡頭在這些路徑上所會觀察到的 RGB 圖像及深度資料。

該公司亦展示用於操控的 Real-to-Sim 工作流程。少量錄影可轉換為模擬任務,之後開發者可改變物件、位置、機械人動作、燈光或背景。示範包括剛性、可活動及可變形物件。

這些輸出可提供訓練及測試環境,而毋須在實體硬件上反覆搭建每個變化。不過,Atlas 公告未有量化生成的動態是否能足夠準確地重現真實世界的力、接觸行為、摩擦或變形,以使機械人策略能可靠地遷移。

五、基準測試結果令人鼓舞,但由公司自行報告

World Labs 發布了鏡頭條件生成及稀疏視角 3D 重建的評估。就鏡頭控制而言,每次試驗均從一張輸入圖像及包含一至三種電影式運鏡的軌跡開始。第三方人類評分員比較各輸出遵循指定路徑的程度。

Atlas 透過其原生鏡頭表示方式接收路徑。競爭影片模型則透過傳統電影術語的文字描述接收路徑,因為它們不接受同一鏡頭格式。World Labs 承認,更精細的提示或可改善部分競爭模型,因此這部分是控制介面的比較,而非輸入完全相同的嚴格測試。

就重建而言,公司根據其重現的評估協議,報告其誤差低於包括 Pi3X、π³、VGGT-Ω 1B、Depth Anything 3 及 MapAnything 在內的專門開源系統。發表頁面未有提供相應的同行評審論文,亦沒有足夠方法細節讓外界獨立重現所有已報告結果。

World Labs 亦未在發表材料中披露 Atlas 的參數數量、訓練資料組成、推論成本、生成速度、安全控制措施或評估樣本數量。因此,其示範及基準測試所確立的是公司報告的能力,而非在未受控制的素材或生產工作負載中的獨立驗證。

相比之下,Marble 於 2025 年 11 月已普遍推出,可根據文字、圖像、影片或粗略佈局生成持久的 3D 世界,並可輸出包括 Gaussian splats、網格及影片。Atlas 擬為未來版本的 Marble 及其他 World Labs 產品提供技術支援。因此,對大多數使用者而言,這項公告屬技術預覽,而非即時取代現時可用平台的產品。

常見問題

Atlas 是否公開提供?

否。World Labs 表示 Atlas 正與獲選合作夥伴進行早期存取。有興趣的機構可提交存取申請,但公開資格規則尚未公布。

Atlas 能否從一張圖像生成 3D 場景?

可以,但未見區域是生成出來,而非根據證據復原。加入更多圖像可約束模型,並減少其必須創作的內容。

Atlas 可生成哪些 3D 格式?

該公司表示,Atlas 除了傳統圖像及影片幀以外,亦可生成深度圖、點雲及 3D Gaussian splats。

Atlas 生成的影片可以有多長?

World Labs 展示了長達一分鐘、1440p 的鏡頭控制輸出。它尚未公布生成時間或硬件要求。

Atlas 正在取代 Marble 嗎?

不會即時取代。World Labs 表示 Atlas 將為未來版本的 Marble 及其他產品提供技術支援,而 Atlas 本身仍處於有限的早期存取階段。

參考來源

Share

分享這篇文章