본문으로 건너뛰기

로봇 조작을 통합하는 Generalized Action Model

GAM은 다양한 로봇 말단장치의 조작 행동을 하나의 VLA 모델로 생성하고 1,000만 회 이상 작업에서 검증했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

GAM은 시각 관측과 언어 지시를 로봇 행동으로 바꾸는 VLA 기반 foundation model로, 흡착 잡기·집게 잡기·가두기·배치를 하나의 정책과 critic으로 처리합니다. 실제 관측에서 시뮬레이션 행동 후보와 품질 레이블을 생성하고 말단장치 인코딩을 적용해, 고품질 상호작용 데이터 수집 비용과 하드웨어별 재학습 부담을 줄이는 구조를 취합니다. 로봇 workcell fleet에서 1,000만 회가 넘는 pick-and-place cycle을 수행해 pick 성공률 95% 초과와 place 성공률 90% 초과를 기록했으며, 새로운 파지 방식을 가진 hybrid end-effector에서도 90% 초과 성공률을 냈습니다. 다만 제공된 본문만으로는 비교 모델과 세부 실험 조건까지 확인되지 않습니다.

빠른 이해

새로운 점

다양한 말단장치의 행동 표현과 데이터 수집 문제를 통합 정책·critic, 시뮬레이션 기반 오프라인 데이터, 말단장치 인코딩으로 함께 처리합니다.

핵심 메커니즘

시각 관측과 언어 조건을 VLA 파이프라인에 입력하고, 통합 정책이 여러 조작 행동 후보를 생성하면 critic이 후보 품질을 점수화합니다. 실제 관측에서 시뮬레이션 행동 후보와 레이블을 재생성하고, 말단장치 인코딩으로 학습하지 않은 하드웨어에도 정책을 전이합니다.

핵심 수치

  • Pick 성공률: 95% 초과- 1,000만 회가 넘는 pick-and-place cycle
  • Place 성공률: 90% 초과- 1,000만 회가 넘는 pick-and-place cycle
  • Hybrid end-effector 성공률: 90% 초과- 서로 다른 파지 모드를 가진 말단장치
  • 실행 규모: 1,000만 회 초과- 로봇 workcell fleet의 pick-and-place cycle

섹션별 상세

01

GAM의 통합 로봇 조작 구조

GAM은 서로 다른 작업과 로봇 형태에서 행동 생성을 통합하는 production-grade foundation model로 제시됐습니다. vision-language-action(VLA) 파이프라인을 통해 시각 관측과 언어 조건을 바탕으로 흡착 잡기, 집게 잡기, 물체 가두기, 배치 등 다양한 조작 행동을 하나의 모델에서 생성하며, 정책과 critic이 행동 후보를 만들고 품질을 평가합니다. 이 구조는 말단장치마다 달라지는 행동 표현과 대규모 고품질 상호작용 데이터 확보 비용이라는 두 가지 확장 장벽을 동시에 겨냥합니다.
02

시뮬레이션 기반 데이터와 하드웨어 전이

GAM은 실제 관측에서 얻은 정보를 바탕으로 시뮬레이션에서 밀도 높은 행동 후보와 품질 레이블을 다시 계산하는 오프라인 데이터 생성 파이프라인을 사용합니다. 로봇이 모든 후보 행동을 실제 환경에서 반복 실행하지 않아도 학습에 필요한 행동·평가 쌍을 확장할 수 있으며, 말단장치 인코딩은 모델이 접하지 않은 하드웨어로 zero-shot transfer를 가능하게 합니다. 서로 다른 파지 방식을 가진 hybrid end-effector에서도 90% 초과 성공률을 기록해, 통합 표현이 특정 그리퍼에만 묶이지 않음을 확인했습니다.
03

실제 작업 셀에서의 검증 결과

GAM은 로봇 workcell fleet에서 1,000만 회가 넘는 pick-and-place cycle을 수행하며 생산 환경을 겨냥한 규모로 검증됐습니다. 전체 결과에서 pick 성공률은 95% 초과, place 성공률은 90% 초과였고, 별도의 파지 모드를 가진 hybrid end-effector에서도 90% 초과 성공률을 유지했습니다. 실제 반복 작업 규모와 조작 방식별 일반화 결과는 단일 VLA 모델이 다양한 말단장치와 행동 유형을 처리할 가능성을 뒷받침하지만, 제공된 본문에는 세부 실험 조건이나 비교 기준이 포함되지 않았습니다.

용어 해설

비전-언어-행동(Vision-Language-Action)
카메라 이미지와 언어 지시를 함께 입력받아 로봇의 실제 행동을 출력하는 모델 구조입니다. 시각 정보에서 물체와 상황을 파악하고, 명령과 결합해 잡기·놓기 같은 조작 동작으로 변환하므로 여러 작업과 로봇 하드웨어를 하나의 정책으로 연결하는 데 중요합니다.
말단장치(End-Effector)
로봇 팔 끝에 장착되어 물체와 직접 상호작용하는 장치입니다. 흡착 그리퍼와 집게형 그리퍼처럼 형태와 작동 방식이 다르면 같은 작업도 필요한 행동 표현이 달라지므로, 다양한 하드웨어를 하나의 모델에서 다루려면 말단장치 정보를 별도로 인코딩해야 합니다.
오프라인 데이터 생성(Offline Data Generation)
로봇이 실제 환경에서 직접 시행착오를 반복하지 않고, 관측 데이터와 시뮬레이션을 이용해 학습용 행동 후보와 품질 레이블을 미리 만드는 방법입니다. 실제 상호작용 데이터 수집 비용을 줄이면서 대규모 정책 학습에 필요한 밀도 높은 감독 신호를 확보할 수 있습니다.
제로샷 전이(Zero-Shot Transfer)
새로운 하드웨어나 환경에 맞춘 추가 학습 없이 기존 모델의 지식을 바로 적용하는 방식입니다. GAM은 말단장치의 특성을 인코딩해 학습 때 보지 못한 하드웨어에도 행동 정책을 옮기도록 설계했으며, 로봇 종류가 늘어날 때 데이터 재수집 부담을 낮추는 역할을 합니다.
크리틱(Critic)
생성된 행동 후보가 작업에 적합한지 점수로 평가하는 모델 구성요소입니다. 정책이 흡착 잡기·집게 잡기·가두기·배치 같은 후보 행동을 만들면 크리틱이 품질을 평가해 선택 과정에 신호를 제공하므로, 하나의 모델이 다양한 조작 방식을 처리할 수 있습니다.

기술

  • Generalized Action Model (GAM)
  • vision-language-action (VLA)
  • Vision-language models (VLMs)
  • Robotic manipulation
  • Reinforcement learning
  • Transfer learning
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 18.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.