AI News文字数 4248読了時間11

World Labs、ネイティブなカメラ制御と3D再構築を備えたAtlasを発表

World LabsのAtlasは、ネイティブなカメラ制御、疎な視点からの3D再構築、動画のリフレーミング、ロボティクス・シミュレーションを1つのモデルに統合している。

目次 · 12
  1. 一、Atlasは複数の空間タスクを1つのモデルに統合する
  2. 二、ネイティブなカメラジオメトリがショット制御を変える
  3. 三、疎な画像からポイントクラウドとガウシアンスプラットを生成できる
  4. 四、動画リフレーミングとロボティクスはシーン生成を超えて広がる
  5. 五、ベンチマーク結果は有望だが企業報告によるもの
  6. よくある質問
  7. Atlasは一般公開されていますか?
  8. Atlasは1枚の画像から3Dシーンを生成できますか?
  9. Atlasはどのような3D形式を生成できますか?
  10. Atlasが生成する動画はどのくらいの長さですか?
  11. AtlasはMarbleを置き換えますか?
  12. 参考ソース

World Labsは2026年9月1日、カメラ制御可能な画像と動画を生成し、シーンを明示的な3Dで再構築し、記録済みの出来事を新たな視点からリフレーミングできるマルチモーダル世界モデルとしてAtlasを発表した。

最も重要な変更点は、Atlasがカメラジオメトリをネイティブな入力として受け取ることだ。動画生成モデルに「pan」「truck」「crane」といった言葉を解釈させる代わりに、ユーザーは共有された三次元コンテキスト内でカメラ位置と軌道を指定できる。World Labsによれば、Atlasは少数の参照画像と手動で設計したカメラパスから、1440pで最大1分間の動画を生成できる。

Atlasはまだ一般提供されている製品ではない。一部のパートナーを対象に早期アクセスへ移行しており、World Labsは公開価格、モデル識別子、APIのリリース日、または広範なアクセス条件を発表していない。

一、Atlasは複数の空間タスクを1つのモデルに統合する

World LabsはAtlasを、ゼロから事前学習した「omni model」と説明している。そのアーキテクチャは自己回帰トランスフォーマーと潜在拡散を組み合わせたもので、マルチモーダル要素はシーケンスとして処理される一方、画像などの連続的な出力はrectified-flowによるノイズ除去プロセスで生成される。

このモデルは現在、テキスト、画像、カメラポーズ、3D深度マップを扱う。動画は画像のシーケンスとして表現される。各画像と深度マップには明示的なカメラポーズを関連付けられ、入力はWorld Labsが空間コンテキストと呼ぶものに基づいて配置される。

この設計により、通常は別々のシステムに分かれる複数のタスクを1つのモデルで処理できる。

  • 参照画像からの画像・動画生成
  • 生成フレームの視点とカメラパスの制御
  • 既存シーンの新規視点の合成
  • 深度推定と明示的な3Dジオメトリの再構築
  • 同期した動画映像を新しいアングルからリフレーミングすること
  • シミュレーションされたロボット向けのセンサー観測の生成
  • プロンプトからの通常画像および360度パノラマの作成

World LabsはAtlasを初のマルチモーダル世界モデルとして販売しているが、この優先性に関する主張は独立して確立されていない。同社は2025年11月、以前のMarbleシステムについてもマルチモーダル世界モデルと説明していた。Atlasのより具体的な技術的主張は、生成、再構築、カメラ条件付け、深度、時間的シミュレーションを1つの事前学習済みアーキテクチャに統合したことにある。

二、ネイティブなカメラジオメトリがショット制御を変える

Atlasは、発表時に示されたカメラ制御動画の例では1枚から6枚の参照画像を受け取れる。ユーザーはそれらの画像を空間コンテキスト内に配置し、仮想カメラの移動先を指定する。モデルはその後、シーンの外観とジオメトリの維持を試みながら、その軌道に沿った視点を生成する。

これはテキストのみでカメラをプロンプトする方法とは実質的に異なる。「slowly orbit the subject」のようなフレーズでは、軌道の半径、方向、高さ、速度、フレーミングをモデルに推論させることになる。ネイティブなカメラ入力ではこれらの選択を直接エンコードでき、映像制作者やビジュアライゼーションチームに、より精密な制御インターフェースを提供する。

World Labsはこの結果を「pixel-perfect camera control」と呼ぶ。この表現は、独立して測定された精度保証ではなく、企業による説明として扱うべきだ。公開された評価は、人間の評価者がAtlasが比較モデルより意図したカメラパスに従っていると考えるかを検証するものであり、ピクセルレベルの誤差がゼロであることを示すものではない。

空間コンテキストは構図も支援する。World Labsは、3D空間内の異なる位置に配置された、他に関係のない2枚の参照画像を実演している。Atlasは、その間に連続した世界を形成するため、出入口、廊下、接続する部屋などの中間空間を生成する。

この生成的な挙動はワールド構築に有用だが、同時に重要な境界も示している。連続性は必ずしも再構築精度を意味しない。入力がシーンの一部を示していない場合、Atlasは学習済みの事前分布に基づき、もっともらしい補完を発明する。

三、疎な画像からポイントクラウドとガウシアンスプラットを生成できる

Atlasは1枚以上のポーズ付き画像からシーンを再構築し、同じ空間コンテキスト内で100枚を超える画像を使用できる。World Labsによれば、忠実な再構築には通常2〜3視点で十分だが、視点を追加すると、モデルが生成しなければならない未観測コンテンツの量を減らせる。

単一画像による結果は必然的に、観測と合成の混合となる。ある企業例では、Atlasは地上レベルで撮影された庭園写真の可視部分を保持する一方、周囲の建物や地形を発明している。近くのコテージと主屋の写真を追加すると、生成されるシーンは段階的に制約される。

Atlasは、新規視点画像、深度情報、ポイントクラウド、3Dガウシアンスプラットを返せる。1枚の画像からは、ジオメトリを推定しながら追加の視点を生成する。動画からはフレームごとの深度を予測し、フレームを組み合わせて再構築を作成する。カメラに一度も捉えられなかった領域はモデルが埋める。

ガウシアンスプラットは、生成フレームの集合だけでなく、レンダリング可能な表現を提供する。位置を変えながら閲覧でき、後続の3Dワークフローに統合できる。AtlasはMarbleと同じ大枠の表現を用いており、モデルの出力はWorld Labsの既存製品の将来バージョンと互換性を持つはずだ。

視覚効果チームやデザインチームにとっては、移動可能なシーンを構築するために必要な高密度の写真撮影量を減らせる可能性がある。トレードオフとして、観測された視点の外に生成されたジオメトリは、一貫して見えても元の場所と正確には一致しない可能性がある。

四、動画リフレーミングとロボティクスはシーン生成を超えて広がる

Atlasは、複数の同期カメラから記録された出来事を再構築し、物理カメラが存在しなかった視点からレンダリングできる。World Labsは、三脚またはクランプに取り付けた3台から5台の一般的なスマートフォンとアクションカメラによる映像を使い、「bullet time」リフレーミングを実演している。

システムは複数の視点を用いて、出来事の空間的・時間的構造を推定する。その後、編集者はアクションを静止させたり、その周囲を仮想カメラで移動したりできる。これは従来のマルチビュー・スタジオより軽量な撮影セットアップを提供するが、発表資料では処理時間、ハードウェア要件、失敗率は開示されていない。

ロボティクス向けには、Atlasは再構築と生成されたセンサー観測を組み合わせる。2つのナビゲーション実演で、World Labsはスマートフォン動画を使って大規模環境を撮影し、各再構築に24フレームを選択し、異なるパスを移動するロボットをシミュレートした。Atlasは、それらのパスで胴体搭載カメラが観測するRGB画像と深度データを生成した。

同社はマニピュレーション向けのReal-to-Simワークフローも示している。少数の記録をシミュレートされたタスクに変換でき、その後、開発者は物体、位置、ロボットの動作、照明、背景を変化させられる。実演には剛体、関節を持つ物体、変形可能な物体が含まれる。

こうした出力は、物理ハードウェア上であらゆる変化を繰り返し演出することなく、訓練・テスト環境を提供し得る。ただし、Atlasの発表では、生成されたダイナミクスが現実世界の力、接触挙動、摩擦、変形を、ロボット方策が信頼性をもって転移できるほど正確に再現するかは定量化されていない。

五、ベンチマーク結果は有望だが企業報告によるもの

World Labsは、カメラ条件付き生成と疎視点3D再構築の評価を公開した。カメラ制御では、各試行は1枚の入力画像と、1〜3個のシネマティックな動きを含む軌道から始まった。第三者の人間評価者が、出力が要求されたパスにどの程度従ったかを比較した。

Atlasはネイティブなカメラ表現を通じてパスを受け取った。競合動画モデルは同じカメラ形式を受け付けなかったため、従来の映像用語を使ったテキスト説明を受け取った。World Labsは、より精緻なプロンプトによって一部の競合モデルが改善する可能性を認めており、これは厳密に同一の入力テストというより、部分的には制御インターフェースの比較となっている。

再構築について同社は、再現した評価プロトコルにおいて、Pi3X、π³、VGGT-Ω 1B、Depth Anything 3、MapAnythingを含む特化型オープンソースシステムより低い誤差を報告している。発表ページには、査読済み論文の付属も、報告されたすべての結果を独立して再現するために十分な方法論の詳細もない。

World Labsはまた、発表資料においてAtlasのパラメータ数、訓練データの構成、推論コスト、生成速度、安全制御、評価サンプル数を開示していない。そのため、実演とベンチマークが示すのは同社が報告する能力であり、制御されていない映像や本番ワークロード全体での独立した検証ではない。

比較すると、Marbleは2025年11月に一般提供され、テキスト、画像、動画、または粗いレイアウトから永続的な3D世界を生成できる。エクスポートにはガウシアンスプラット、メッシュ、動画が含まれる。AtlasはMarbleおよびその他のWorld Labs製品の将来バージョンを支えることを意図している。したがって大半のユーザーにとって、この発表は現在利用可能なプラットフォームの即時の代替ではなく、技術プレビューである。

よくある質問

Atlasは一般公開されていますか?

いいえ。World Labsによれば、Atlasは一部のパートナーを対象とした早期アクセス段階にある。関心を持つ組織はアクセスを申請できるが、公開された適格性ルールは発表されていない。

Atlasは1枚の画像から3Dシーンを生成できますか?

はい。ただし、見えていない領域は証拠から復元されるのではなく生成される。画像を追加するとモデルへの制約が増え、発明する必要がある部分は減る。

Atlasはどのような3D形式を生成できますか?

同社によれば、Atlasは通常の画像・動画フレームに加え、深度マップ、ポイントクラウド、3Dガウシアンスプラットを生成できる。

Atlasが生成する動画はどのくらいの長さですか?

World Labsは、1440pで最大1分間のカメラ制御出力を実演している。生成時間やハードウェア要件は公開していない。

AtlasはMarbleを置き換えますか?

すぐには置き換わらない。World Labsによれば、AtlasはMarbleおよび他製品の将来バージョンを支える予定だが、Atlas自体は限定的な早期アクセス段階にとどまる。

参考ソース

Share

この記事を共有