본문으로 건너뛰기

MMaDA-VLA: 통합 멀티모달 지시 및 생성을 지원하는 대규모 확산 시각-언어-행동 모델

이산 확산 공식을 활용해 시각, 언어, 로봇 행동을 단일 토큰 공간에서 통합 처리하여 장기 작업의 일관성을 획기적으로 개선한 MMaDA-VLA 모델이 제안됐다.

섹션별 상세

01
기존 VLA 모델의 계층적 및 자기회귀 패러다임은 아키텍처 오버헤드가 크고 장기 작업 시 오류가 누적되는 한계가 있었다. MMaDA-VLA는 별도의 외부 모듈 없이 환경 역학을 캡처할 수 있는 통합 프레임워크를 통해 이러한 구조적 병목을 해결한다. 단일 백본 내에서 멀티모달 이해와 생성을 통합하여 시스템의 효율성과 제어 안정성을 동시에 확보했다. 이는 복잡한 로봇 조작 작업에서 더 높은 신뢰성을 제공하는 기반이 된다.
02
언어, 이미지, 연속적인 로봇 제어 데이터를 단일 이산 토큰 공간으로 임베딩하는 네이티브 이산 확산 공식을 제안했다. 모든 모달리티를 동일한 형식의 토큰으로 변환하여 학습함으로써 데이터 간의 상관관계를 더욱 깊이 있게 파악한다. 마스크된 토큰의 노이즈를 제거하는 방식을 통해 모델이 누락된 정보를 추론하고 정교한 출력을 생성하도록 유도한다. 이 통합 토큰 공간은 멀티모달 데이터의 효율적인 융합을 가능하게 한다.
03
미래의 목표 관찰 이미지와 행동 덩어리(Action Chunk)를 병렬로 생성하는 구조를 채택하여 추론 속도와 정확도를 높였다. 반복적인 노이즈 제거(Iterative Denoising) 과정을 통해 전역적이고 순서에 구애받지 않는 데이터 정제를 수행하여 장기적인 일관성을 유지한다. 별도의 보조 월드 모델 없이도 예측된 미래 시각 결과에 행동을 접지(Grounding)함으로써 실행 오류를 최소화한다. 이러한 메커니즘은 로봇이 환경 변화에 유연하게 대응하며 목표를 달성하도록 돕는다.
04
시뮬레이션 벤치마크인 LIBERO와 CALVIN에서 기존 모델들을 압도하는 최첨단 성능(SOTA)을 달성했다. LIBERO에서는 평균 98.0%의 성공률을 기록했으며, CALVIN에서는 평균 길이 4.78을 달성하여 뛰어난 작업 수행 능력을 보여주었다. 실세계 작업에서도 높은 성능을 유지하며 실제 산업 현장이나 가정용 로봇에 적용될 수 있는 가능성을 확인했다. 이는 확산 모델 기반의 VLA 아키텍처가 차세대 로봇 지능의 핵심이 될 수 있음을 시사한다.

용어 해설

시각-언어-행동 모델(VLA)
시각적 관찰 정보와 자연어 지시를 결합하여 로봇의 구체적인 제어 동작(Action)을 생성하는 인공지능 모델이다. 로봇이 주변 환경을 이해하고 인간의 명령에 따라 적절한 물리적 작업을 수행하도록 만드는 핵심 기술이다.
이산 확산(Discrete Diffusion)
데이터를 불연속적인 토큰 형태로 변환한 뒤 노이즈를 섞고 이를 다시 복원하는 과정을 통해 새로운 데이터를 생성하는 기법이다. 연속적인 수치 대신 이산적인 값을 다루어 언어와 행동 데이터를 통합 학습하기에 용이하다.
행동 덩어리(Action Chunk)
로봇의 동작을 매 순간 개별적으로 결정하는 대신, 일련의 연속된 동작 묶음을 한 번에 생성하는 방식이다. 제어의 시간적 일관성을 유지하고 장기적인 작업 수행 시 발생하는 오류 누적을 줄이는 데 효과적이다.
노이즈 제거(Denoising)
확산 모델에서 무작위 노이즈가 포함된 입력값으로부터 원래의 깨끗한 데이터를 찾아가는 역과정이다. 반복적인 노이즈 제거를 통해 모델은 더 정교하고 일관성 있는 미래 상태나 행동을 예측할 수 있다.

기술

  • MMaDA-VLA
  • Discrete Diffusion
  • LIBERO
  • CALVIN

활용 사례

  • 정밀한 로봇 팔 조작
  • 자연어 지시 기반 가전 로봇 제어
  • 복잡한 환경에서의 장기 작업 수행 로봇
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 26.수집 2026. 04. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.