본문으로 건너뛰기

Atlas, 영상에서 3D 세계를 만든다

Atlas는 스마트폰 3~5대의 영상에서 3D 장면과 물리 시뮬레이션을 함께 생성합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

World Labs가 텍스트, 이미지, 영상, 3D 기하를 하나의 구조에서 처리하는 공간 지능 모델 Atlas를 발표했습니다. Atlas는 autoregressive diffusion transformer를 사용해 입력을 공통 3D 공간 맥락에 배치하며, 3~5대의 일반 스마트폰 영상만으로 동적 장면을 재구성하고 새로운 카메라 궤적을 생성합니다. 로봇 이동 경로에 맞춰 RGB와 metric depth 센서 스트림을 합성하고, 강체·관절형·변형 가능 물체의 물리 동작을 포함한 시뮬레이션도 구성합니다. 또한 point cloud와 3D Gaussian splats를 직접 출력하며 DTU, ETH3D, ScanNet에서 전용 3D 재구성 기준선보다 높은 성능을 기록했다는 내용입니다.

섹션별 상세

01
World Labs의 Atlas는 텍스트, 이미지, 영상, 3D geometry를 하나의 아키텍처 안에서 처리하도록 설계됐습니다. autoregressive diffusion transformer가 각 입력을 공통 3D spatial context에 연결해 영상 정보를 단순한 2D pixel grid가 아닌 공간과 시간의 장면으로 취급합니다. 이 구조의 목표는 새 이미지를 만드는 수준을 넘어 실제 환경의 형태와 변화까지 시뮬레이션하는 데 있습니다.
02
Atlas는 특수 촬영 장비 없이 일반 스마트폰 3~5대에서 촬영한 영상으로 동적 사건을 재구성합니다. 여러 시점의 영상을 결합해 시간을 멈춘 듯한 장면과 실제 촬영으로 얻기 어려운 카메라 이동 경로를 합성합니다. 따라서 입력 데이터가 제한된 상황에서도 사건의 3D 구조와 새로운 시점의 영상을 만드는 방식입니다.
03
정적인 장면 스캔에 그치지 않고 로봇의 이동과 물체 조작을 포함한 real-to-sim 과정에도 사용됩니다. 로봇이 특정 경로로 움직인다고 가정하면 Atlas가 그 경로에서 탑재 센서가 얻을 RGB 영상과 metric depth 스트림을 합성합니다. 실제 로봇 데이터를 직접 반복 수집하지 않고도 이동 경로에 따른 센서 입력을 생성할 수 있다는 점이 핵심 활용 사례입니다.
04
일반적인 현실 영상을 강체, 관절형, 변형 가능 물체의 동역학을 포함한 상호작용 가능한 시뮬레이션으로 변환합니다. 연구자는 물체 위치, 조명, 카메라 경로를 바꿔 합성 학습 데이터를 만들 수 있으며, 모델은 새로운 영상 시점과 함께 point cloud 및 3D Gaussian splats를 직접 출력합니다. 게시물은 DTU, ETH3D, ScanNet의 표준 벤치마크에서 전용 3D 재구성 기준선보다 높은 성능을 기록했다고 전합니다.

이미지 분석

여러 대의 카메라와 스마트폰이 탁자 위 로봇과 물체를 서로 다른 위치에서 촬영하는 장면입니다.
Screenshot

이미지는 Atlas의 sparse real-world data capture 사례와 연결되며, 한 대의 촬영 장비가 아닌 소수의 소비자용 카메라로 로봇 조작 장면을 수집하는 구성을 나타냅니다. 탁자 위 물체와 로봇 주변에 배치된 카메라가 서로 다른 시점의 영상을 제공하고, 게시물의 3~5대 스마트폰 기반 3D 재구성 및 로봇 시뮬레이션 활용을 시각적으로 뒷받침합니다.

여러 대의 카메라와 스마트폰이 탁자 위 로봇과 물체를 서로 다른 위치에서 촬영하는 장면입니다.

용어 해설

옴니 월드 모델(Omni World Model)
텍스트, 이미지, 영상, 3D 기하 정보를 서로 분리된 입력으로 처리하지 않고 하나의 구조 안에서 함께 다루는 모델입니다. Atlas는 모든 입력을 공통 3D 공간 맥락에 배치해 장면의 형태와 시간적 변화를 연결하며, 생성뿐 아니라 물리적 상황의 시뮬레이션에도 활용합니다.
공간 지능(Spatial Intelligence)
AI가 이미지나 영상 속 사물의 위치, 깊이, 움직임, 공간 관계를 파악하고 새로운 시점이나 행동 결과를 추론하는 능력입니다. 이 글에서는 3D 기하와 시간 정보를 결합해 로봇 이동, 물체 조작, 카메라 경로를 가상 환경에서 재현하는 능력을 뜻합니다.
자기회귀 Diffusion Transformer(Autoregressive Diffusion Transformer)
이전 생성 결과를 바탕으로 다음 내용을 순차적으로 예측하는 자기회귀 방식과 노이즈를 점진적으로 제거하는 Diffusion 방식, Transformer 구조를 결합한 모델입니다. Atlas는 이 구조로 영상의 2D 픽셀만 생성하지 않고 공통 3D 공간 맥락에 맞는 시각·기하 정보를 생성합니다.
3D Gaussian Splats
3차원 공간을 수많은 Gaussian 요소로 표현해 새로운 시점의 장면을 빠르게 렌더링하는 표현 방식입니다. Atlas는 영상에서 얻은 새로운 시점의 화면뿐 아니라 point cloud와 3D Gaussian splats를 직접 출력해 장면의 기하 구조를 함께 다룹니다.
Metric Depth
카메라에서 장면 속 각 지점까지의 거리를 실제 공간 단위에 대응하도록 나타낸 깊이 정보입니다. Atlas는 로봇이 이동하는 경로를 따라 탑재 센서가 수집할 RGB 영상과 metric depth 스트림을 합성해 실제 환경을 시뮬레이션합니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.