1.5B 경량 VLA로 실시간 조작에서 상위 모델을 능가하는 일반화 정책
MiniCPM-RobotManip은 1.5B 파라미터의 VLA 모델로 스트리밍 컨텍스트와 시각 토큰 압축을 결합해 per-step 연산을 125 TFLOPs에서 3.3 TFLOPs로 줄이면서 60프레임의 시각 메모리를 유지하고 경쟁 모델을 능가하는 벤치마크 점수를 기록했다.
TL;DR
MiniCPM-RobotManip은 1.5B 파라미터의 Vision-Language-Action 모델로 MiniCPM-V의 시각 토큰 압축을 계승하고 스트리밍 추론을 도입해 연속 관찰 60프레임을 유지하면서 per-step 연산을 125 TFLOPs에서 3.3 TFLOPs로 줄였다. 프레임당 토큰을 256에서 64로 압축해 추론 비용과 메모리를 절감했고 H100 BF16 환경에서 모델-포워드 지연을 120 ms로 측정해 기존 비교 대상보다 낮은 지연을 입증했다. 벤치마크 표에서는 LIBERO 97.5, RoboTwin2 easy 91.3/hard 91.6, RMBench 53.3 등의 점수를 보고해 동일 가중치로 다양한 조작 과제를 처리하는 generalist 정책의 실용성을 보여준다. 다만 README는 구현·학습 세부(예: 최종 학습 데이터 구성, 세부 훈련 절차)를 제한적으로 제시하므로 재현과 확장 적용을 위해 추가 문서 확인이 필요하다.
핵심 역량
- 다중 프레임 시각 메모리를 유지한 상태에서 연속적 행동 청크를 생성할 수 있다.
- 단일 가중치로 여러 조작 과제를 처리하는 일반화된 조작 정책을 실행할 수 있다.
- 프레임 압축과 스트리밍 추론을 결합해 낮은 지연으로 실시간 제어에 활용할 수 있다.
- PIL 기반 리사이즈와 동일한 전처리 파이프라인을 사용해 이미지 입력을 모델 입력으로 변환한다.
강점
- 동등 또는 더 큰 모델 대비 적은 연산으로 유사하거나 더 높은 벤치마크 성능을 기록한 점이 실사용 비용·지연 측면에서 유리하다.
- 프레임 압축과 스트리밍 컨텍스트로 실시간 추론 환경에서 낮은 메모리·지연을 달성한 점이 임베디드 로봇 적용에 적합하다.
- Apache-2.0 라이선스로 상용·연구 활용이 용이하다.
훈련 방식
MiniCPM-V를 기반으로 시각 토큰 압축과 스트리밍 추론을 결합해 단일 가중치로 다양한 조작 과제를 학습한 일반화 정책 접근을 사용했다.
알아두면 좋은 것
- 모델은 MiniCPM-V의 시각 토큰 압축을 계승해 프레임당 토큰을 256에서 64로 줄여 4배 압축을 달성했다.
- 스트리밍 추론으로 프레임 히스토리 60개를 유지하면서 per-step 연산을 125 TFLOPs에서 3.3 TFLOPs로 낮췄으며 최대 1분의 시각 메모리를 지원한다.
- H100 BF16 환경에서 단일 프레임 입력 기준 모델-포워드 지연이 120 ms로 보고되었으며 π0.5의 234 ms와 비교되었다.
- 라이선스는 Apache-2.0이며 transformers 라이브러리(권장 버전 5.7.0)를 통해 배포된다.
기술적 특징
- 스트리밍 컨텍스트는 과거 관찰을 연속적으로 모델 컨텍스트에 통합해 매스텝마다 전체 컨텍스트를 재계산하지 않도록 한다. 이 처리 방식으로 per-step 연산량을 크게 줄여 README에 명시된 대로 125 TFLOPs에서 3.3 TFLOPs로 감소시켰으며, 이로 인해 60 프레임의 히스토리를 유지하면서도 실시간 제어가 가능해졌다.
- 시각 토큰 압축은 각 프레임의 시각 표현을 256 토큰에서 64 토큰으로 축소해 입력 차원과 연산을 4배로 줄였다. 이 압축은 MiniCPM-V의 방식에 기반하며 압축된 토큰을 통해 모델 포워드때 필요한 메모리와 연산을 절감해 추론 지연을 줄인다.
- 추론 지연 개선은 하드웨어 환경과 데이터 형식(BF16, H100)에 최적화된 측정으로 뒷받침되어 단일 프레임 입력 기준 모델-포워드가 120 ms로 보고되었다. 이 수치는 동급 레퍼런스(π0.5의 234 ms) 대비 낮은 응답 지연을 의미하며 실시간 루프에 유리하다.
차별점
- 1.5B 단일 모델로 여러 조작 과제를 처리하는 generalist 정책을 제시한다.
- 스트리밍 컨텍스트로 60프레임을 유지하면서 per-step 연산을 125 TFLOPs에서 3.3 TFLOPs로 크게 낮춘다.
- 프레임당 시각 토큰을 256에서 64로 압축해 추론 비용과 메모리 요구를 4배 줄였다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| LIBERO | score | 97.5 | — |
| Calvin (ABC→D) | score | 4.1 | — |
| RoboTwin2 (clean+random) easy | score | 91.3 | — |
| RoboTwin2 (clean+random) hard | score | 91.6 | — |
| RMBench | score | 53.3 | — |
이미지 분석


179
Likes
698
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.