본문으로 건너뛰기
TLDR AI Feed조회 1

범용 로봇의 병목은 모델보다 데이터

로봇 모델의 성능보다 실제 환경에서 수집할 조작 데이터와 물리적 신뢰성 확보가 범용화의 핵심 병목으로 떠올랐습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 시각과 언어 능력을 갖춘 모델을 로봇에 연결하면 지능이 곧바로 전달된다는 낙관론에 제동을 걸고, 로봇의 핵심 병목이 실제 환경에서 수집해야 하는 조작 데이터라고 봅니다. Vision-Language-Action Model은 로봇 내부에서 이미지와 텍스트 지시, 신체 상태를 처리할 만큼 발전했지만, Libero benchmark에서는 작은 장면 변화만으로 성공률이 95% 안팎에서 30% 아래로 떨어지고 다른 benchmark에서는 90% 이상에서 0으로 추락했습니다. 산업용 로봇 466만 대가 높은 반복 작업 신뢰성을 보이는 이유는 일반화가 아니라 고정된 부품·장치·작업 셀 바깥의 변수를 설계로 제거했기 때문이며, 범용 로봇의 사업성은 아직 투자 규모에 비해 실제 가동 시간이 부족합니다. 따라서 스타트업은 한 작업과 제한된 환경에 집중해 데이터를 축적하고, 기존 제조사는 설치된 로봇에서 물리적 상호작용 데이터를 수집하는 장치를 확보해야 하며, 범용 지능은 수년간의 좁고 계측된 배포 이후에야 현실화될 가능성이 큽니다.

섹션별 상세

01
로봇을 카메라와 이미 학습된 모델에 연결하면 지능이 자동으로 이전된다는 관점은 물리 시스템의 복잡성을 과소평가합니다. Vision-Language-Action Model은 텍스트 지시, 로봇 시점의 이미지, proprioceptive data를 입력받아 행동을 출력하며 Gemini Robotics On-Device 2처럼 네트워크 왕복 없이 로봇 내부에서 실행되는 사례도 나왔습니다. 그러나 실제 환경의 움직임을 안정적으로 만들려면 모델의 추론 능력뿐 아니라 기계·전자·소프트웨어가 결합된 전체 시스템과 현장 데이터가 필요합니다.
02
로봇 조작에는 언어 모델의 학습에 쓰인 웹 문서처럼 이미 존재하는 대규모 데이터 말뭉치가 없습니다. 낯선 물체를 낯선 자세에서 집는 한 번의 사례마다 실제 로봇과 운영자가 물리적 시간에 맞춰 궤적을 생성해야 하므로, 데이터는 비용을 지불한 뒤 한 에피소드씩 만들어집니다. 이 구조적 차이 때문에 단순히 장비와 자본을 늘리는 것만으로는 언어 모델과 같은 데이터 확장 효과를 기대하기 어렵습니다.
03
Vision-Language-Action 연구 1,228편을 바탕으로 한 최근 분석은 로봇의 분포 외 일반화가 취약하다는 수치를 제시합니다. Libero benchmark에서는 약 95%의 성공률이 장면에 작은 변화만 줘도 30% 아래로 떨어졌고, 다른 benchmark에서는 90%를 넘던 성능이 정확히 0으로 내려갔습니다. 조명이나 물체 회전처럼 실제 현장에서 흔한 변화에 대한 결과를 측정하지 않으면, 반복 시연 영상은 로봇의 일반적인 능력을 판단하는 근거가 되기 어렵습니다.
04
현재 산업용 로봇은 일반화에 성공해서가 아니라 작업 범위를 고정하고 그 바깥의 변수를 공학적으로 제거했기 때문에 높은 신뢰성을 냅니다. International Federation of Robotics에 따르면 2024년에 542,000대가 설치됐고 전 세계 가동 재고는 466만 대로 1년 사이 9% 늘었으며, 이 기계들은 용접·부품 배치·팔레타이징을 반복 수행합니다. 이는 전통적인 자동화의 성과이며, 여러 환경과 작업을 스스로 처리하는 체화된 지능의 증거와는 구분해야 합니다.
05
범용 로봇의 사업성은 투자 규모보다 실제 가동 시간에서 더 분명하게 드러납니다. BMW에 배치된 Figure 02가 11개월 동안 약 1,250시간을 운용해 달력 기준 하루 4시간에도 미치지 못했으며, 같은 시기에 robotics에는 2025년 407억 달러의 벤처 자본이 유입됐고 Bank of America는 2026년 약 90,000대의 humanoid 출하를 전망했습니다. 자본과 현장 운용 사이의 간극은 모델의 시연 성능보다 실패율을 감당할 만큼 충분한 실제 상호작용 시간이 부족하다는 문제를 드러냅니다.
06
스타트업이 확보해야 할 차별화 요소는 내려받을 수 있는 모델이나 구매 가능한 하드웨어보다 특정 물리 환경에서 데이터를 생산하는 장치입니다. 한 작업, 한 환경 유형, 한 gripper에 범위를 묶으면 실패가 집중되는 긴 꼬리 영역까지 궤적을 수집할 가능성이 커지고, Waymo의 특정 도시·구역 중심 자율주행이나 창고와 공장을 잇는 단일 구간 자율주행 트럭처럼 사업성이 유지되는 범위에서 일반화를 좁힐 수 있습니다. 반대로 모든 작업을 수행하겠다는 약속은 감당하기 어려운 데이터 수집 비용을 초기에 떠안게 만듭니다.
07
대형 제조사에는 이미 설치된 466만 대의 로봇이 장기간 실행·기록·보정한 물리적 상호작용 데이터라는 잠재 자산으로 남아 있습니다. 지금까지 이 기록 대부분은 학습 가능한 형태로 수집되지 않았지만, 설치 기반에 계측 장치를 추가해 산업 동작을 training data로 바꾸는 기업은 벤처 자금만으로 복제하기 어려운 우위를 얻을 수 있습니다. 반대로 지능을 외부 모델에 의존하는 로봇 제조사는 훌륭한 arm을 만들어도 actuation을 제공하는 상품 공급자로 밀려날 위험이 있습니다.
08
물리적 AI에서는 언어 모델의 95% 수준 정확도를 허용하는 관행이 통하지 않으며, 사람 곁에서 움직이는 humanoid는 99.9%를 훨씬 넘는 생산 수준이 필요합니다. 학습된 policy를 배포할 때는 기계가 해야 할 일뿐 아니라 절대 하지 말아야 할 일을 계약으로 규정하고, commissioning 시점의 일회성 검사가 아니라 지속적인 실행 증거로 계약 준수를 확인해야 합니다. 아직 조명 변화나 물체를 40도 회전한 상황에서 성능이 0으로 무너지는 benchmark를 넘어설 공학 관행이 충분히 정립되지 않았으므로, 좁고 계측된 배포를 수년간 누적하는 접근이 범용화보다 현실적인 경로입니다.

용어 해설

시각-언어-행동 모델(Vision-Language-Action Model)
Vision-Language-Action Model은 로봇의 시점에서 얻은 이미지와 텍스트 지시, 관절·자세 같은 proprioceptive data를 함께 받아 실제 행동으로 변환하는 모델입니다. 언어 모델처럼 지식만 생성하는 대신 인식과 판단, 물리적 움직임을 연결하며, 입력 분포를 벗어난 상황에서도 안정적으로 행동하는 일반화 능력이 핵심 과제입니다.
고유수용성 데이터(Proprioceptive Data)
고유수용성 데이터는 로봇 관절의 각도, 위치, 속도처럼 로봇 자신의 신체 상태를 나타내는 센서 정보입니다. Vision-Language-Action Model은 카메라 이미지와 이 내부 상태를 함께 처리해 현재 환경에서 어떤 움직임을 실행할지 결정합니다. 외부 장면만 보는 방식보다 로봇의 실제 자세와 동작 가능 범위를 판단하는 데 중요합니다.
분포 외 일반화(Out-of-Distribution Generalization)
분포 외 일반화는 학습 과정에서 보지 못한 물체 배치, 조명, 회전, 작업 조건에서도 모델이 성능을 유지하는 능력입니다. 로봇은 실제 환경의 작은 변화가 입력 분포를 바꾸므로, 반복 동작을 재현하는 것만으로는 충분하지 않습니다. 이 글에서는 Libero benchmark의 성공률이 작은 장면 변화만으로 95% 안팎에서 30% 아래로 떨어지는 사례가 문제의 심각성을 드러냅니다.
원격 조작(Teleoperation)
Teleoperation은 사람이 로봇을 직접 원격 조작해 특정 물체와 자세, 환경에서의 행동 궤적을 수집하는 방식입니다. 조작 로봇에는 언어 모델의 웹 문서처럼 이미 축적된 대규모 데이터가 없기 때문에, 사람이 실제 장비를 움직이는 시간이 학습 데이터 생성 속도를 결정합니다. 따라서 데이터 확보에는 장비 비용과 운영자 시간이 함께 필요합니다.
체화된 지능(Embodied Intelligence)
체화된 지능은 인공지능이 카메라와 로봇 관절 같은 물리적 신체를 통해 주변 환경을 인식하고 행동하는 능력입니다. 텍스트 생성처럼 오류를 사람이 읽고 넘길 수 있는 영역과 달리, 물리적 시스템에서는 잘못된 행동이 사람·제품·설비의 손상으로 이어질 수 있습니다. 따라서 일반화뿐 아니라 99.9%를 크게 넘는 신뢰성, 지속적인 검증, 행동 금지 조건까지 함께 다뤄야 합니다.
물리적 AI(Physical AI)
Physical AI는 확률적으로 행동하는 학습 정책을 질량과 운동량을 가진 기계에 적용하는 기술 영역입니다. 언어 모델의 오답은 대개 사용자가 읽고 지나가지만, 로봇의 오작동은 충돌과 제품 손상, 인프라 피해로 이어질 수 있어 허용 가능한 오류율이 훨씬 낮습니다. 이 차이 때문에 물리적 시스템에는 소프트웨어와 다른 수준의 강건성·안전성·신뢰성 공학이 요구됩니다.

기술

  • Vision-Language-Action Model
  • Gemini Robotics On-Device 2
  • Libero
  • Figure 02
  • Waymo

활용 사례

  • 산업용 용접과 부품 배치
  • 팔레타이징
  • 제조 현장의 특정 작업 자동화
  • 도시·구역 제한형 자율주행
  • 창고와 공장 사이의 물류 자율주행
  • 설치된 산업용 로봇의 동작 데이터 수집
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.