본문으로 건너뛰기

EventVLA: 장기 Vision-Language-Action 정책을 위한 이벤트 기반 시각 증거 메모리

로봇 조작 환경에서는 작업 중간에 잠깐 드러나는 시각 단서가 이후 행동 결정에 필수적일 때가 많다. EventVLA는 이러한 일시적 증거를 예측·선제 저장해 비마르코프성 과제에서 성공률을 크게 향상시킨다.

용어 해설

시각 앵커(Visual Anchors)
초기 프레임과 짧은 시간 창의 과거 프레임을 고정적으로 보관하는 규칙 기반 메커니즘이다. 이 구성은 장기 조작에서 전역 레이아웃(초기 프레임)과 최근 동작 단서(짧은 히스토리)를 유지하여 많은 구조적으로 단순한 메모리 요구 과제를 해결한다. 그러나 일시적 상호작용으로 발생하는 transient evidence는 포착하지 못한다.
키프레임 증거 메모리(Keyframe Evidence Memory)
VLA의 최종 레이어 잠재 임베딩 h_t를 입력으로 받아 향후 실행 구간 H에 대한 키프레임 확률 벡터 p̂_t를 예측하는 가벼운 병렬 헤드이다. p̂_t에서 특정 인덱스가 τ_commit을 넘으면 그 시점의 원시 이미지를 메모리에 동적 커밋한다. FIFO와 NMS로 버퍼를 관리해 중복을 줄인다.
비마르코프성(Non-Markovian)
현재 관찰만으로 올바른 행동 결정을 내리기 어려운 상황을 의미한다. 예컨대 작업 중간에 잠깐 드러난 정보가 이후에 결정적일 때 발생하며, 이러한 일시적 단서를 보존하지 않으면 표준 Markov 정책 π(o_t,l)로는 성공률 저하가 발생한다.
청크 단위 예측(Chunk-wise Prediction)
단일 미래 스텝 분류기가 놓칠 수 있는 중간 이벤트를 포착하기 위해 여러 미래 스텝(H)을 묶어 확률 벡터를 예측하는 접근이다. 입력은 h_t이고 KEM MLP를 거쳐 sigmoid로 H차원 확률 벡터를 얻는다. 이를 통해 메모리 쓰기 일정을 미리 계획한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.