본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

openbmb/MiniCPM-RobotManip

임바디드 로봇 조작(vision-language-action) — 단일 가중치로 여러 다운스트림 태스크 처리1.5Bapache-2.0

OpenBMB의 1.5B 범용 로봇 조작 정책으로 스트리밍 컨텍스트를 통해 60프레임의 과거 관측을 유지하면서 π0.5·Qwen-VLA보다 나은 성능을 낸다.

학습 방식 · MiniCPM-V 4.6의 시각 토큰 압축을 물려받고 starVLA·LeRobot 코드베이스를 참고해 구현한 vision-language-action 정책으로, 카드에는 학습 데이터와 절차가 공개돼 있지 않다.

TL;DR

MiniCPM-RobotManip은 1.5B 규모의 단일 범용 정책으로 여러 조작 태스크를 하나의 가중치로 처리하면서 π0.5·Qwen-VLA 같은 더 큰 모델을 대표 평가에서 앞선다. 과거 관측을 스트리밍 방식으로 컨텍스트에 계속 누적해 60프레임(최대 1분)의 시각 기억을 유지하면서도 단계당 연산을 125TFLOPs에서 3.3TFLOPs로 줄여, 단일 프레임 반응형 행동 생성에서 장기적 시각 맥락 기반 의사결정으로 VLA를 확장했다. MiniCPM-V 4.6의 시각 토큰 압축을 이어받아 프레임당 토큰을 256에서 64로 4배 압축했고, H100·BF16·단일 프레임 입력 기준 결정 스텝당 forward 지연이 120ms로 π0.5의 234ms보다 짧다. 하나의 정책으로 여러 조작 과제를 다뤄야 하면서도 실시간 반응성이 중요한 로봇 매니퓰레이션 응용에 적합하다.

핵심 포인트

  • 단일 1.5B 가중치로 여러 다운스트림 조작 태스크를 처리하면서 π0.5·Qwen-VLA보다 나은 대표 평가 결과를 낸다.
  • 60프레임(최대 1분)의 시각 기억을 스트리밍 컨텍스트로 유지하면서도 단계당 연산을 125TFLOPs→3.3TFLOPs로 줄였다.
  • MiniCPM-V 4.6의 시각 토큰 압축(256→64, 4배)을 물려받아 H100 기준 forward 지연 120ms로 π0.5(234ms)보다 빠르다.

벤치마크

벤치마크지표비교
결정 스텝당 forward 지연ms (H100, BF16, 단일 프레임)120π0.5 234ms
단계당 연산TFLOPs3.3단일 프레임 반응형 기준 125TFLOPs

179

LIKES

698

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.