본문으로 건너뛰기

Vision Pro로 구축한 손동작 데이터셋 EgoDex

EgoDex는 Vision Pro와 ARKit으로 338k개의 손동작 episode를 수집한 데이터셋입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

물리 로봇을 사람이 teleoperate해야 한다는 데이터 수집 한계를 줄이기 위해 Apple은 Vision Pro와 ARKit으로 사람의 일상 손동작을 직접 기록한 egodex를 구축했습니다. ARKit은 68개 신체·손 관절을 30Hz로 기기에서 추적해 annotator와 사후 pose estimation 없이 338k episode, 194개 작업, 829시간의 데이터를 만들었습니다. 작성자는 이 중 3,243개 테스트 episode를 영상·3D skeleton·2D pose overlay가 동기화된 MCAP으로 변환하고 FiftyOne에서 필터링·재생할 수 있게 했습니다. 게시물은 Vision Pro를 대규모 손 추적 데이터 수집 장치로 활용하는 흐름과 함께, 해당 데이터셋을 직접 검사할 수 있는 데모와 데이터 카드를 연결합니다.

실용적 조언

  • EgoDex의 held-out test set은 Hugging Face Space에서 설치 없이 FiftyOne 브라우저 화면으로 탐색할 수 있습니다.
  • 작업 유형과 물체를 기준으로 필터링한 뒤 영상, 3D skeleton, 2D pose overlay가 동일한 30Hz 시간축에 맞는지 확인하면 멀티모달 조작 데이터의 구성을 빠르게 점검할 수 있습니다.

섹션별 상세

01
물리 로봇의 원격 조작만으로 손재주 학습 데이터를 모으는 방식은 수집 규모에 한계가 있다는 문제의식에서 출발했습니다. Apple은 로봇을 촬영 과정에서 제외하고 사람들이 Vision Pro를 착용한 채 세탁, 카드 사용, 신발끈 묶기 같은 일상 작업을 수행하도록 했습니다. 이 방식은 로봇 자체의 움직임 대신 사람이 실제로 수행한 손과 신체 동작을 데이터로 축적합니다.
02
ARKit은 기록하는 동안 68개의 신체·손 관절을 초당 30회 추적했고, 처리를 기기에서 수행했습니다. 따라서 별도의 annotator나 사후 pose estimation 없이 영상과 관절 정보를 동시에 얻는 구조입니다. 그 결과로 194개 작업, 338,000개 episode, 829시간 규모의 egodex 데이터셋이 구축됐으며, Apple은 이를 당시 가장 크고 다양한 dexterous manipulation dataset이라고 평가했습니다.
03
작성자는 전체 데이터셋이 아니라 111개 작업에 걸친 3,243개 held-out test episode를 추출해 fiftyone에서 열람할 수 있는 멀티모달 MCAP으로 구성했습니다. 각 episode에는 1인칭 영상, 3D 애니메이션 스켈레톤, 영상 프레임에 투영한 2D pose overlay가 포함되고 세 데이터가 초당 30회 동기화됩니다. 브라우저에서 작업, 작업 유형, 물체, 언어 설명으로 필터링하고 episode를 재생할 수 있어 손동작 데이터의 구조와 품질을 직접 확인할 수 있습니다.
04
이 사례는 Vision Pro가 단순한 가상·증강현실 장치가 아니라 손 추적 데이터를 대규모로 수집하는 기록 장치로 활용될 수 있음을 시사합니다. 로봇을 직접 teleoperate하는 대신 사람이 자연스러운 일상 행동을 수행하고, 기기가 관절 정보를 자동으로 기록하는 입력·처리·출력 경로를 만들었습니다. 다만 게시물에 제시된 수치는 데이터셋 규모와 구성에 관한 것이며, 이 데이터로 학습한 로봇 모델의 성능 결과는 포함하지 않습니다.

이미지 분석

FiftyOne 화면에서 EgoDex 샘플 영상과 Assemble·Disassemble 작업 라벨을 격자 형태로 확인할 수 있습니다.
Screenshot

왼쪽 필터에는 task와 duration 같은 필드가 있고, 중앙에는 손으로 의자를 조립하거나 분해하는 장면의 샘플이 배열되어 있습니다. 오른쪽 대시보드는 chair 분포와 assemble·disassemble 작업 수, duration 분포를 차트로 나타내어 데이터셋을 작업·시간 기준으로 탐색하는 게시물의 설명과 연결됩니다.

FiftyOne 화면에서 EgoDex 샘플 영상과 Assemble·Disassemble 작업 라벨을 격자 형태로 확인할 수 있습니다.

FiftyOne의 EgoDex 데이터셋 탐색 화면에 작업 샘플과 작업별 통계 차트가 함께 표시되어 있습니다.
Screenshot

중앙 샘플 격자는 영상 프레임과 Assemble 또는 Disassemble 라벨을 함께 제공하고, 왼쪽 패널은 language와 duration 같은 메타데이터 필터를 제공합니다. 오른쪽 차트는 chair 관련 샘플 수와 두 작업 유형의 분포, duration 히스토그램을 제공해 멀티모달 테스트 세트를 브라우저에서 세부적으로 검사하는 흐름을 나타냅니다.

FiftyOne의 EgoDex 데이터셋 탐색 화면에 작업 샘플과 작업별 통계 차트가 함께 표시되어 있습니다.

용어 해설

원격 조작(Teleoperation)
사람이 물리 로봇의 움직임을 직접 조종해 로봇 시연 데이터를 수집하는 방식입니다. 로봇의 동작과 작업 환경을 함께 기록할 수 있지만, 수집 과정에서 로봇과 조작자가 필요해 데이터 규모를 빠르게 키우기 어렵다는 한계가 있습니다.
1인칭 시점 영상(Egocentric Video)
착용자의 시점에서 촬영한 영상으로, 손과 물체의 상호작용을 작업 수행자의 관점에서 기록합니다. EgoDex에서는 Vision Pro 사용자가 일상 작업을 수행하는 동안 손 관절 좌표와 함께 저장되어 조작 행동 학습에 활용됩니다.
ARKit
Apple 기기의 카메라와 센서를 이용해 사람의 신체 및 손 관절 위치를 추적하는 소프트웨어 프레임워크입니다. 이 게시물에서는 68개의 신체·손 관절을 초당 30회 추적하고 기록 시점에 기기에서 처리하는 데 사용됐습니다.
MCAP
시간 순서에 따라 여러 종류의 센서·영상 데이터를 함께 저장하고 재생하는 기록 형식입니다. 작성자는 EgoDex의 1인칭 영상, 3D 애니메이션 스켈레톤, 프레임에 투영한 2D 자세 오버레이를 초당 30회 동기화된 멀티모달 데이터로 변환했습니다.
멀티모달 데이터셋(Multimodal Dataset)
영상, 관절 좌표, 자세 오버레이처럼 서로 다른 형태의 데이터를 동일한 시간축에 맞춰 묶은 학습·평가 데이터 모음입니다. EgoDex 테스트 세트는 작업 영상과 3D·2D 손동작 표현을 함께 탐색할 수 있도록 구성됐습니다.

언급된 도구

fiftyone추천

EgoDex test episode를 브라우저에서 필터링하고 영상과 관절 표현을 함께 탐색하는 데 사용됐습니다.

vision pro중립

사람이 일상 작업을 수행하는 동안 egocentric video와 신체·손 관절 정보를 기록하는 장치로 사용됐습니다.

arkit중립

68개의 신체·손 관절을 30Hz로 추적하고 기록 시점에 기기에서 처리했습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.