본문으로 건너뛰기

로보틱스 파운데이션 모델을 위한 피지컬 AI 데이터 수집 전쟁

로보틱스 파운데이션 모델의 핵심인 물리적 데이터를 확보하기 위해 무료 서비스와 보상형 앱을 활용하는 Physical AI 기업들의 수집 전략과 데이터 규모를 분석했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

로보틱스 파운데이션 모델의 성공을 위해 필수적인 물리적 데이터 부족 문제를 해결하려는 Physical AI 기업들의 혁신적인 수집 전략을 분석했다. OpenGraph Labs의 무료 노동 제공이나 microagi의 무료 청소 서비스, Figure AI의 대규모 참여형 앱 보상 체계 등 실생활 데이터를 확보하기 위한 다양한 비즈니스 모델이 경쟁하고 있다. 특히 LLM의 학습 규모를 로봇 동작 시간으로 환산했을 때 약 2,100만 시간의 데이터가 '지능의 창발'을 위한 임계점으로 제시되었으며, 이를 통해 단순 파인튜닝을 넘어선 범용적 프리트레이닝 모델로의 진화가 가속화되고 있다.

챕터별 상세

00:00

로봇 데이터 수집의 한계와 새로운 벤더의 등장

LLM은 인터넷상의 텍스트 데이터를 크롤링하여 학습할 수 있지만, 로보틱스 모델은 실제 물리적 상호작용 데이터가 절대적으로 부족한 상황이다. 이를 해결하기 위해 인간의 작업 데이터를 전문적으로 수집하여 판매하는 Physical AI 데이터 벤더들이 등장했다. OpenGraph Labs는 6~8명의 인력이 하루 8시간 동안 무료로 노동을 제공하는 대신, 작업자의 1인칭 시점 영상과 촉각 장갑 데이터를 수집하는 독특한 비즈니스 모델을 운영한다. 이는 고품질의 실제 작업 데이터를 확보하기 위해 기업이 직접 현장에 뛰어드는 전략적 선택이다.
02:59

무료 청소 서비스를 통한 데이터 확보 전략

독일 기업 microagi가 개발한 Shift 앱은 뉴욕과 샌프란시스코에서 일반 가정에 무료 청소 서비스를 제공하며 데이터를 수집한다. 청소부는 머리에 iPhone을 장착한 특수 장치를 쓰고 작업하며, 수집된 데이터는 AI 심사를 거쳐 품질이 보장된 경우에만 보상이 지급된다. microagi는 올해 안에 2,000만 시간의 데이터 확보를 목표로 하고 있으며, 이는 단순한 서비스업을 넘어 거대 로봇 모델 학습을 위한 인프라 구축의 성격을 띤다. 데이터 승인율은 평균 72% 수준이며, 양손이 모두 화면에 보이고 의미 있는 태스크를 수행해야 하는 엄격한 기준이 적용된다.

데이터 승인 기준 중 하나인 'Hand Visibility'는 로봇이 인간의 손동작을 정확히 매핑하기 위해 양손의 위치와 움직임이 끊김 없이 영상에 담겨야 함을 의미한다.

08:17

Figure AI의 참여형 데이터 생태계 규모

Figure AI는 Index라는 앱을 통해 전 세계 사용자들이 일상적인 가사 노동 데이터를 업로드하고 보상을 받는 플랫폼을 구축했다. 현재 주간 활성 사용자(WAU)는 약 44,000명에 달하며, 지금까지 크리에이터들에게 지급된 총보상액은 1,500만 달러(약 200억 원)를 넘어섰다. 수집된 영상은 1,600만 개 이상이며, 매일 약 4.9년 분량의 노동 데이터가 새롭게 추가되고 있다. 이는 특정 지역에 국한되지 않고 전 세계의 다양한 환경과 사물 조작 데이터를 대규모로 확보할 수 있는 확장성을 보여준다.
15:15

LLM 토큰과 로봇 데이터의 규모 비교 분석

GPT-3가 학습한 3,000억 개의 토큰을 인간의 독서 시간으로 환산하면 약 2,100만 시간에 해당한다. 로보틱스 분야에서 'GPT-3 모먼트'와 같은 지능의 창발을 일으키기 위해서는 최소 2,100만 시간 이상의 물리적 동작 데이터가 필요할 것으로 추정된다. 현재 Figure AI나 microagi가 목표로 하는 2,000만 시간 규모는 언어 모델의 초기 성공 지점에 근접한 수치이다. 하지만 로봇 동작은 언어보다 정보 밀도가 낮고 복잡도가 높기 때문에, 실제로는 60배에서 1,000배 이상의 더 많은 데이터가 필요할 것이라는 예측도 존재한다.

창발(Emergence)이란 단순한 구성 요소들이 모여 전체 시스템에서 개별 요소에는 없던 새로운 복잡한 지능이나 특성이 나타나는 현상을 말한다.

25:05

프리트레이닝을 통한 로봇 지능의 고도화

단순히 특정 환경에서만 잘 작동하게 만드는 파인튜닝 방식은 새로운 환경에 대응하기 어렵다는 한계가 있다. 대규모 사전 학습(Pre-training)을 거친 모델은 인컨텍스트 러닝 능력을 갖추게 되어, 처음 보는 작업도 인간의 시연 영상 한 번만으로 즉시 수행할 수 있다. 실제 사례로 Dyna-2 모델은 딘타이펑 매장에서 하루 3,000장 이상의 냅킨을 접는 작업을 성공적으로 수행하며 상용화 가능성을 입증했다. 더 나은 프리트레이닝 데이터와 인프라가 갖춰질수록 로봇의 범용성과 작업 성공률은 비약적으로 향상된다.

Dyna-2는 로보틱스 스타트업이 개발한 모델로, 실제 서비스 현장에 배치되어 반복적이고 정교한 조작이 필요한 가사/서비스 노동을 수행한다.

용어 해설

로보틱스 파운데이션 모델(Robotics Foundation Model)
다양한 로봇 하드웨어와 작업 환경에 범용적으로 적용될 수 있도록 대규모 멀티모달 데이터를 학습한 기초 모델이다. 특정 작업만 수행하는 기존 로봇 AI와 달리, 언어 명령을 이해하고 복잡한 물리적 조작을 스스로 계획하여 실행하는 능력을 갖춘다.
피지컬 AI(Physical AI)
디지털 환경을 넘어 실제 물리적 세계에서 물체를 조작하고 상호작용하는 인공지능 기술이다. 로봇의 시각 인지, 촉각 피드백, 정밀한 관절 제어 등을 통합하여 인간의 노동을 물리적으로 대체하거나 보조하는 것을 목표로 한다.
1인칭 시점 데이터(Egocentric View)
작업자가 머리에 카메라를 착용하고 자신의 손동작과 작업 대상을 바라보는 시점에서 촬영한 영상 데이터이다. 로봇이 인간의 시각적 주의 집중과 손의 움직임을 동일한 각도에서 학습하여 복잡한 조작 기술을 습득하는 데 핵심적인 역할을 한다.
인컨텍스트 러닝(In-context Learning)
모델이 명시적인 파인튜닝 없이 입력된 몇 가지 예시나 시연 데이터만으로 새로운 작업을 즉석에서 수행하는 능력이다. 로보틱스에서는 로봇이 처음 보는 환경에서 인간의 시연 영상을 한 번 보는 것만으로 해당 동작을 따라 하는 방식으로 구현된다.
사전 학습(Pre-training)
특정 작업에 특화되기 전 대규모의 일반적인 데이터를 통해 모델의 기초 지능을 형성하는 단계이다. 로보틱스에서는 수백만 시간의 인간 동작 데이터를 학습하여 물리적 세계의 법칙과 기본적인 조작 능력을 먼저 습득하게 함으로써 범용성을 확보한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.