AI News글자 수 3663읽는 시간10

World Labs, 네이티브 카메라 제어와 3D 재구성을 갖춘 Atlas 공개

World Labs의 Atlas는 네이티브 카메라 제어, 희소 뷰 3D 재구성, 비디오 리프레이밍, 로보틱스 시뮬레이션을 하나의 모델에 결합한다.

목차 · 12
  1. 1. Atlas는 여러 공간 작업을 하나의 모델에 통합한다
  2. 2. 네이티브 카메라 기하 정보는 샷 제어 방식을 바꾼다
  3. 3. 희소 이미지는 포인트 클라우드와 가우시안 스플랫이 될 수 있다
  4. 4. 비디오 리프레이밍과 로보틱스는 장면 생성을 넘어선다
  5. 5. 벤치마크 결과는 유망하지만 회사 자체 보고다
  6. 자주 묻는 질문
  7. Atlas는 공개적으로 이용할 수 있나요?
  8. Atlas는 한 장의 이미지로 3D 장면을 생성할 수 있나요?
  9. Atlas는 어떤 3D 형식을 생성할 수 있나요?
  10. Atlas가 생성하는 비디오는 얼마나 길 수 있나요?
  11. Atlas가 Marble을 대체하나요?
  12. 참고 자료

World Labs는 2026년 9월 1일 Atlas를 공개하며, 카메라 제어 이미지와 비디오를 생성하고 장면을 명시적 3D로 재구성하며 녹화된 사건을 새로운 시점에서 리프레이밍하는 멀티모달 월드 모델이라고 소개했다.

가장 중요한 변화는 Atlas가 카메라 기하 정보를 네이티브 입력으로 받는다는 점이다. 사용자는 비디오 생성 모델에 “pan”, “truck”, “crane” 같은 단어를 해석하도록 요청하는 대신, 공유된 3차원 맥락 안에서 카메라 위치와 궤적을 지정할 수 있다. World Labs는 Atlas가 적은 수의 참조 이미지와 수동으로 설계한 카메라 경로만으로 최대 1440p, 최대 1분 길이의 비디오를 생성할 수 있다고 밝혔다.

Atlas는 아직 일반 제공 제품이 아니다. 일부 선정된 파트너를 대상으로 얼리 액세스에 들어가며, World Labs는 공개 가격, 모델 식별자, API 출시일, 광범위한 접근 조건을 발표하지 않았다.

1. Atlas는 여러 공간 작업을 하나의 모델에 통합한다

World Labs는 Atlas를 처음부터 사전 학습한 “omni model”이라고 설명한다. 그 아키텍처는 자기회귀 트랜스포머와 잠재 확산을 결합한다. 멀티모달 요소는 시퀀스로 처리되고, 이미지와 기타 연속 출력은 rectified-flow 디노이징 과정을 통해 생성된다.

이 모델은 현재 텍스트, 이미지, 카메라 포즈, 3D 깊이 맵을 처리한다. 비디오는 이미지 시퀀스로 표현된다. 각 이미지와 깊이 맵은 명시적 카메라 포즈와 연결될 수 있으며, 이를 통해 입력은 World Labs가 공간 맥락이라고 부르는 환경에 배치된다.

이 설계는 흔히 서로 다른 시스템에 분리되어 있는 여러 작업을 하나의 모델이 처리할 수 있게 한다.

  • 참조 이미지로부터 이미지와 비디오 생성;
  • 생성 프레임의 시점과 카메라 경로 제어;
  • 기존 장면의 새로운 뷰 합성;
  • 깊이 추정 및 명시적 3D 기하 재구성;
  • 동기화된 비디오 영상을 새로운 각도에서 리프레이밍;
  • 시뮬레이션된 로봇을 위한 센서 관측값 생성;
  • 프롬프트로부터 일반 이미지와 360도 파노라마 생성.

World Labs는 Atlas를 최초의 멀티모달 월드 모델로 홍보하지만, 이 우선권 주장은 독립적으로 입증되지 않았다. 회사는 2025년 11월에 이전 Marble 시스템 역시 멀티모달 월드 모델이라고 설명했다. Atlas의 보다 구체적인 기술적 주장은 생성, 재구성, 카메라 컨디셔닝, 깊이, 시간적 시뮬레이션을 하나의 사전 학습 아키텍처 안에 결합했다는 것이다.

2. 네이티브 카메라 기하 정보는 샷 제어 방식을 바꾼다

Atlas는 출시 시점에 공개된 카메라 제어 비디오 예시에서 하나에서 여섯 장의 참조 이미지를 입력으로 받을 수 있다. 사용자는 이 이미지를 공간 맥락에 배치하고 가상 카메라의 이동 위치를 지정한다. 그러면 모델은 장면의 외관과 기하를 보존하려 하면서 해당 궤적을 따라 뷰를 생성한다.

이는 텍스트 전용 카메라 프롬프팅과 실질적으로 다르다. “피사체 주위를 천천히 공전” 같은 문구는 모델이 공전 반경, 방향, 고도, 속도, 프레이밍을 추론하도록 남겨 둔다. 네이티브 카메라 입력은 이러한 선택을 직접 인코딩할 수 있어, 영화 제작자와 시각화 팀에 더 정밀한 제어 인터페이스를 제공한다.

World Labs는 이 결과를 “pixel-perfect camera control”이라고 부른다. 이 표현은 독립적으로 측정된 정확도 보장이 아니라 회사의 설명으로 받아들여야 한다. 공개된 평가는 사람이 평가했을 때 Atlas가 비교 모델보다 의도한 카메라 경로를 더 잘 따르는지를 시험하며, 픽셀 수준 오류가 없음을 입증하지는 않는다.

공간 맥락은 구도도 지원한다. World Labs는 서로 관련이 없는 두 참조 이미지를 3D 공간의 서로 다른 위치에 배치하는 사례를 보여준다. Atlas는 그 사이에 출입구, 복도, 연결된 방과 같은 중간 공간을 생성해 두 이미지 사이에 연속적인 세계를 형성한다.

이러한 생성 동작은 월드 빌딩에 유용하지만, 중요한 경계도 드러낸다. 연속성이 반드시 재구성 정확도를 뜻하지는 않는다. 입력이 장면 일부를 보여주지 않을 경우 Atlas는 학습된 사전지식을 바탕으로 그럴듯한 완성을 만들어 낸다.

3. 희소 이미지는 포인트 클라우드와 가우시안 스플랫이 될 수 있다

Atlas는 포즈가 지정된 하나 이상의 이미지로 장면을 재구성하며, 동일한 공간 맥락에서 100장 이상의 이미지를 사용할 수 있다. World Labs는 일반적으로 두세 개의 뷰만으로도 충실한 재구성에 충분하며, 추가 뷰는 모델이 생성해야 하는 미관측 콘텐츠의 양을 줄인다고 밝혔다.

단일 이미지 결과는 필연적으로 관측과 합성의 혼합물이다. 한 회사 예시에서 Atlas는 지면 높이 사진에 보이는 정원 부분은 보존하지만, 주변 건물과 지형은 만들어 낸다. 인근 오두막과 본채 사진을 추가하면 결과 장면은 점진적으로 더 제약된다.

Atlas는 새로운 뷰 이미지, 깊이 정보, 포인트 클라우드, 3D 가우시안 스플랫을 반환할 수 있다. 한 장의 이미지로부터 추가 뷰를 생성하는 동시에 그 기하를 추정하며, 비디오로부터는 프레임별 깊이를 예측하고 프레임을 결합해 재구성을 만든다. 카메라가 한 번도 촬영하지 않은 영역은 모델이 채운다.

가우시안 스플랫은 생성된 프레임 모음만이 아니라 렌더링 가능한 표현을 제공한다. 위치를 바꾸며 볼 수 있고 후속 3D 워크플로에 통합할 수 있다. Atlas는 Marble과 같은 광범위한 표현을 사용하므로, 모델 출력은 향후 World Labs 기존 제품의 버전과 호환될 수 있다.

시각효과 및 디자인 팀에게 이는 탐색 가능한 장면을 구축하기 위해 필요한 고밀도 사진 촬영량을 줄일 수 있다. 그 대가로, 관측된 뷰 밖의 생성 기하는 원래 장소와 정확히 일치하지 않더라도 일관되게 보일 수 있다.

4. 비디오 리프레이밍과 로보틱스는 장면 생성을 넘어선다

Atlas는 여러 대의 동기화된 카메라로 녹화된 사건을 재구성하고 실제 카메라가 없었던 시점에서 이를 렌더링할 수 있다. World Labs는 삼각대나 클램프에 장착한 일반 스마트폰과 액션 카메라 세 대에서 다섯 대로 촬영한 영상을 이용해 “bullet time” 리프레이밍을 시연한다.

이 시스템은 다중 뷰를 사용해 사건의 공간적·시간적 구조를 추정한다. 이후 편집자는 동작을 정지하거나 그 주위로 가상 카메라를 이동시킬 수 있다. 이는 기존 멀티뷰 스튜디오보다 간소한 촬영 구성을 제공하지만, 출시 자료는 처리 시간, 하드웨어 요구 사항, 실패율을 공개하지 않는다.

로보틱스 분야에서 Atlas는 재구성과 생성된 센서 관측값을 결합한다. 두 가지 내비게이션 시연에서 World Labs는 스마트폰 비디오로 대형 환경을 촬영하고, 각 재구성에 24개 프레임을 선택한 뒤, 서로 다른 경로를 이동하는 로봇을 시뮬레이션했다. Atlas는 해당 경로에서 몸체 장착 카메라가 관측할 RGB 이미지와 깊이 데이터를 생성했다.

회사는 조작 작업을 위한 Real-to-Sim 워크플로도 보여준다. 소수의 녹화본을 시뮬레이션 작업으로 변환한 뒤, 개발자는 물체, 위치, 로봇 움직임, 조명, 배경을 바꿀 수 있다. 시연에는 강체, 관절형 물체, 변형 가능한 물체가 포함된다.

이러한 출력은 물리 하드웨어에서 모든 변형을 반복적으로 연출하지 않고도 훈련 및 테스트 환경을 제공할 수 있다. 그러나 Atlas 발표는 생성된 동역학이 실제 세계의 힘, 접촉 거동, 마찰, 변형을 로봇 정책이 신뢰성 있게 전이될 만큼 정확히 재현하는지 정량화하지 않는다.

5. 벤치마크 결과는 유망하지만 회사 자체 보고다

World Labs는 카메라 조건부 생성과 희소 뷰 3D 재구성에 대한 평가를 공개했다. 카메라 제어의 경우, 각 시험은 하나의 입력 이미지와 하나에서 세 개의 시네마틱 움직임으로 구성된 궤적으로 시작했다. 제3자 인간 평가자는 출력이 요청된 경로를 얼마나 잘 따르는지 비교했다.

Atlas는 네이티브 카메라 표현을 통해 경로를 받았다. 경쟁 비디오 모델은 같은 카메라 형식을 받지 못했기 때문에 기존 시네마 용어를 사용한 텍스트 설명을 받았다. World Labs는 더 정교한 프롬프팅이 일부 경쟁 모델을 개선할 수 있음을 인정하며, 이는 엄격히 동일한 입력 시험이라기보다 부분적으로 제어 인터페이스의 비교가 된다.

재구성의 경우, 회사는 자체 재현 평가 프로토콜에서 Pi3X, π³, VGGT-Ω 1B, Depth Anything 3, MapAnything을 포함한 전문 오픈소스 시스템보다 낮은 오류를 보고했다. 출시 페이지는 동반된 동료 심사 논문이나 보고된 모든 결과를 독립적으로 재현하기에 충분한 방법론적 세부 사항을 제공하지 않는다.

World Labs는 또한 출시 자료에서 Atlas의 파라미터 수, 학습 데이터 구성, 추론 비용, 생성 속도, 안전 제어, 평가 표본 크기를 공개하지 않았다. 따라서 시연과 벤치마크는 통제되지 않은 영상이나 프로덕션 워크로드 전반에 걸친 독립 검증이 아니라 회사가 보고한 역량을 보여준다.

비교하자면 Marble은 2025년 11월 일반 제공되었으며, 텍스트, 이미지, 비디오, 또는 거친 레이아웃으로부터 지속적인 3D 세계를 생성할 수 있고 가우시안 스플랫, 메시, 비디오를 포함한 결과물을 내보낼 수 있다. Atlas는 Marble 및 다른 World Labs 제품의 향후 버전을 구동하도록 설계되었다. 따라서 대부분의 사용자에게 이번 발표는 현재 제공되는 플랫폼을 즉시 대체하는 제품이 아니라 기술 프리뷰다.

자주 묻는 질문

Atlas는 공개적으로 이용할 수 있나요?

아니요. World Labs는 Atlas가 일부 선정된 파트너를 대상으로 얼리 액세스 중이라고 밝혔다. 관심 있는 조직은 접근 요청을 제출할 수 있지만, 공개 자격 규정은 발표되지 않았다.

Atlas는 한 장의 이미지로 3D 장면을 생성할 수 있나요?

예. 다만 보이지 않는 영역은 증거로부터 복원되는 것이 아니라 생성된다. 이미지를 더 추가하면 모델에 제약이 가해지고, 만들어 내야 하는 부분의 양이 줄어든다.

Atlas는 어떤 3D 형식을 생성할 수 있나요?

회사는 Atlas가 일반 이미지 및 비디오 프레임 외에도 깊이 맵, 포인트 클라우드, 3D 가우시안 스플랫을 생성할 수 있다고 밝혔다.

Atlas가 생성하는 비디오는 얼마나 길 수 있나요?

World Labs는 최대 1440p에서 최대 1분 길이의 카메라 제어 출력을 시연했다. 생성 시간이나 하드웨어 요구 사항은 공개하지 않았다.

Atlas가 Marble을 대체하나요?

당장은 아니다. World Labs는 Atlas가 Marble 및 다른 제품의 향후 버전을 구동할 것이라고 밝혔으며, Atlas 자체는 제한된 얼리 액세스 상태로 남아 있다.

참고 자료

Share

이 글 공유