본문으로 건너뛰기

LaMem-VLA: 로봇 조작을 위한 Vision-Language-Action 모델의 이중 잠재 메모리

LaMem-VLA는 과거 경험을 고정 길이의 잠재 메모리 토큰으로 재구성해 VLA 모델 내부 임베딩과 직접 결합함으로써 SimplerEnv에서 73.9%와 LIBERO에서 97.6%의 성공률을 달성했다.

용어 해설

잠재 메모리 토큰(Latent Memory Token)
모델의 연속된 임베딩 공간에서 과거 경험을 압축해 고정 길이로 표현한 벡터 토큰이다. 검색된 역사적 증거를 소형의 학습 가능한 슬롯으로 재구성해 현재 관찰 및 명령과 함께 self-attention으로 처리한다. VLA 모델의 추론 시점에 메모리를 직접 결합해 시계열 의존성을 반영하는 데 핵심 역할을 한다.
메모리 볼트(Memory Vault)
역사적 경험을 저장하는 구조적 저장소로, 본 논문에서는 시각 중심의 short-term vault와 의미 중심의 long-term vault로 이원화되어 있다. short-term vault는 키-값 쌍으로 시각 증거를 보관하고 long-term vault는 행동 히든 상태를 연속적으로 보관한다. 검색 후 응축 과정을 거쳐 VLA 임베딩 공간의 토큰으로 재구성된다.
잠재 메모리 응축기(Latent Memory Condenser)
검색된 다수의 메모리 단위를 고정 길이의 학습 가능한 메모리 슬롯으로 요약하는 모듈이다. 컨텍스트 쿼리와 결합된 소형 transformer 블록을 사용해 중복을 제거하고 VLA 임베딩 차원으로 매핑한다. 이는 검색 크기와 무관한 입력 인터페이스를 제공해 추론 비용을 제어한다.
확산 기반 액션 전문가(Diffusion-based Action Expert)
잠재적 노이즈에서 연속적 액션 청크를 복원하는 조건부 확산 정책으로, 메모리로부터 생성된 액션 토큰을 조건으로 하여 반복적 denoising를 수행한다. 학습은 MSE 손실로 노이즈 예측을 최적화하는 방식으로 진행되며, 추론은 DDIM 샘플링으로 연속 제어 신호를 생성한다. 복잡한 연속 제어를 고품질 궤적으로 변환하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.