본문으로 건너뛰기

World Labs가 공개한 Atlas의 공간·시간 시뮬레이션

Atlas가 휴대폰 영상에서 로봇 시뮬레이션용 공간과 시점 데이터를 생성합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

World Labs가 공개한 Atlas는 휴대폰 세 대에서 다섯 대의 일반 영상만으로 카메라를 자유롭게 이동한 다중 시점 장면을 생성하고, 로봇의 이동 경로에 맞춰 탑재 카메라가 볼 RGB와 depth 데이터를 만들어내는 omni world model입니다. 이 모델은 정적 3D 복원을 넘어 강체·관절형·변형 가능 객체의 움직임과 상호작용을 시뮬레이션하며 조명, 배경, 물체 위치를 바꿔 로봇 학습 데이터를 확장합니다. 내부 구조로는 multimodal autoregressive diffusion transformer를 사용하고, 카메라 이동을 텍스트가 아니라 정밀한 카메라 기하로 입력해 공통 공간 맥락에 맞추는 방식을 택합니다.

실용적 조언

  • 로봇 시뮬레이션 데이터 생성에 활용하려면 휴대폰 세 대에서 다섯 대로 촬영한 영상과 로봇의 이동 경로, 탑재 카메라 관측 조건을 함께 준비하는 구성이 게시물의 사용 방식에 부합합니다.
  • 생성 데이터의 활용 전에는 조명·배경·물체 위치를 바꾼 결과가 실제 환경의 움직임과 depth 관측을 얼마나 보존하는지 별도 검증해야 합니다.

섹션별 상세

01
게시물은 World Labs의 Atlas가 새로운 시점 합성과 로봇 학습용 공간·시간 시뮬레이션을 겨냥한다고 전합니다. 일반 휴대폰 세 대에서 다섯 대의 영상만 사용하며, 보정된 카메라 배열이나 그린스크린, 전문 촬영 스튜디오 없이 정지된 시간의 자유 카메라 다중 시점 영상을 만든다는 점이 핵심입니다. 적은 촬영 장비로 카메라 이동과 장면 재구성을 처리하려는 접근이어서 실제 환경을 시뮬레이션 데이터로 바꾸는 비용과 준비 절차를 줄이는 방향입니다.
02
Atlas의 Real-to-Sim 과정은 정적 3D 환경을 한 번 복원하는 데서 멈추지 않습니다. 시뮬레이션 안에서 로봇이 특정 경로로 이동하면 그 로봇에 장착된 카메라가 각 위치에서 관측할 RGB와 depth 데이터를 경로에 맞춰 생성합니다. 여기에 강체·관절형·변형 가능 객체의 움직임과 상호작용을 반영하고 조명, 배경, 물체 위치를 바꿀 수 있어 로봇 학습에 필요한 다양한 관측 조건을 만들 수 있다는 의미입니다.
03
Atlas의 내부 구조는 multimodal autoregressive diffusion transformer이며, 카메라 이동을 거친 텍스트 프롬프트로 지정하는 대신 정밀한 카메라 기하를 기본 입력으로 사용합니다. 카메라 기하를 공통 spatial context에 연결해 생성되는 장면과 시점의 관계를 맞추는 방식이 게시물의 기술적 차별점으로 제시됩니다. 다만 게시물에는 생성 품질의 정량 벤치마크, 지원하는 영상 해상도, 모델 규모, 실제 로봇 학습 성능 수치가 포함되지 않았습니다.

이미지 분석

야외 농구장에서 사람이 공을 던지는 장면과 주변 구조물이 함께 포착된 영상 프레임입니다.
Screenshot

이미지는 사람, 농구공, 골대, 기둥, 건물과 나무가 함께 있는 야외 장면을 보여주며, 서로 다른 깊이와 물체 위치를 포함합니다. 공이 이동 중인 순간과 넓은 카메라 시야가 보이므로 게시물이 말한 물체 상호작용과 자유 카메라 장면 생성의 사례와 연결됩니다.

야외 농구장에서 사람이 공을 던지는 장면과 주변 구조물이 함께 포착된 영상 프레임입니다.

용어 해설

새 시점 합성(Novel View Synthesis)
새 시점 합성은 여러 카메라나 영상에서 얻은 장면 정보를 바탕으로 관측하지 않은 카메라 위치의 영상을 생성하는 기술입니다. Atlas는 적은 수의 일반 휴대폰 영상에서 카메라를 자유롭게 이동한 다중 시점 장면을 만들려 합니다.
Real-to-Sim
Real-to-Sim은 현실에서 촬영한 환경과 물체의 움직임을 로봇 시뮬레이션으로 옮기는 과정입니다. Atlas는 정적 3D 복원에 그치지 않고 특정 로봇 경로에서 탑재 카메라가 볼 RGB와 depth 데이터를 생성하는 방식으로 이 과정을 수행합니다.
카메라 기하(Camera Geometry)
카메라 기하는 카메라의 위치와 방향, 시야 같은 공간적 관계를 수치로 나타내는 정보입니다. Atlas는 카메라 이동을 모호한 텍스트 지시로 처리하지 않고 정밀한 카메라 기하를 입력해 장면을 하나의 공간 맥락에 맞춥니다.
자기회귀 Diffusion Transformer(Autoregressive Diffusion Transformer)
자기회귀 Diffusion Transformer는 이전에 생성한 정보와 Diffusion 과정을 결합해 다음 장면 정보를 순차적으로 생성하는 구조입니다. 게시물은 Atlas가 multimodal 입력을 처리하는 이 구조를 사용한다고 설명하지만, 학습 방식이나 규모는 밝히지 않습니다.
강체·관절형·변형 가능 객체(Rigid, Articulated, and Deformable Objects)
강체 객체는 형태가 거의 변하지 않고, 관절형 객체는 연결부를 중심으로 움직이며, 변형 가능 객체는 외력에 따라 형태가 바뀝니다. Atlas는 현실 촬영에서 이 세 종류의 물체 상호작용을 반영한 시뮬레이션을 구성하려 합니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.