용어 해설
- World Action Models(World Action Models (WAMs))
- — World Action Models는 관측된 장면의 미래 시각 상태와 그 상태를 만들 행동을 함께 예측하는 로봇 모델입니다. 영상 토큰과 행동 토큰을 공동 생성해 물체 이동, 접촉, 실패 같은 물리적 변화와 제어 명령 사이의 인과 관계를 학습하며, 단순한 행동 모방보다 새로운 작업과 환경에 대한 일반화를 목표로 합니다.
- Flow Matching
- — Flow Matching은 노이즈가 섞인 데이터에서 원래 데이터로 이동하는 속도장을 학습하는 생성 모델 학습 방식입니다. ZimaBlue는 깨끗한 영상·행동과 Gaussian noise를 보간한 뒤 noise에서 데이터로 향하는 차이를 예측하고, 유효 토큰에 대한 제곱 오차를 줄여 미래 영상과 행동을 복원합니다.
- K/V 캐시(K/V Cache)
- — K/V Cache는 Attention에서 계산한 Key와 Value를 저장해 이후 토큰 처리에 재사용하는 메모리입니다. ZimaBlue의 Slow DiT는 영상 토큰에서 여러 층의 K/V를 추출하고 Fast DiT가 이를 참조하므로, 매 제어 단계마다 전체 미래 영상을 다시 생성하지 않고 최신 관측에 맞춰 행동을 갱신합니다.
- Diffusion Step Distillation(Diffusion-Step Distillation)
- — Diffusion Step Distillation은 여러 번의 denoising 과정을 소수의 단계로 압축하는 방법입니다. ZimaBlue는 Distribution Matching Distillation으로 8회 DiT 평가를 Slow와 Fast 각각 2회로 줄이며, teacher와 student가 추정한 깨끗한 샘플의 분포 차이를 학습 신호로 사용해 생성 품질과 제어 속도의 균형을 맞춥니다.
- Real-Time Chunking(Real-Time Chunking (RTC))
- — Real-Time Chunking은 이전 행동 청크에서 이미 실행하기로 한 prefix를 유지하고 나머지 suffix만 새 관측으로 다시 예측하는 비동기 제어 방식입니다. Fast branch는 실행 중간의 시간 오프셋과 최신 상태를 입력받아 suffix를 갱신하므로, 행동 연결성을 보존하면서 접촉 오류나 장면 변화에 대응합니다.
- Cross-Embodiment Learning
- — Cross-Embodiment Learning은 형태와 센서 구성이 다른 로봇의 데이터를 하나의 표현 공간에서 학습하는 방식입니다. ZimaBlue는 팔, 그리퍼, 몸통, 이동 베이스, 손 관절을 포함한 100차원 state-action 슬롯에 각 로봇의 유효 좌표만 채우고 mask를 적용해 서로 다른 제어 인터페이스의 행동 지식을 공유합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







