본문으로 건너뛰기

InternVLA-A1.5: 이해·잠재 예측·행동을 통합한 조합적 일반화

InternVLA-A1.5는 VLM 백본을 유지하면서 학습 전용의 소수 포사이트 토큰을 WAN2.2로 감독하여 픽셀 생성 없이 세계 모델의 동적 사전지식을 정책에 전이해 시뮬레이션과 실환경에서 우수한 조합적 일반화와 장기 실행 성능을 달성했다.

용어 해설

잠재 예측(Latent Foresight)
미래 장면 정보를 픽셀 이미지 대신 작은 잠재 코드로 압축해 정책에 제공하는 방법으로, 현재 관찰과 언어 맥락을 통해 예측해야 할 미래 특징을 추출하고 이를 행동 생성에 조건으로 사용함으로써 픽셀 수준 생성 비용을 회피한다.
포사이트 토큰(Foresight Tokens)
모델 내부에 학습 가능한 소수의 슬롯 토큰으로 현재 멀티모달 컨텍스트를 조회하여 미래 관련 잠재 표현을 생성하며, 동결된 비디오 생성기의 조건 입력으로 사용되어 동역학적 사전지식을 정책으로 전이시키는 인터페이스 역할을 한다.
플로우 매칭(Flow Matching)
연속적 행동 덩어리의 확률분포를 직접 모델링하기 위해 노이즈에서 목표 행동으로의 속도장을 학습하는 방법으로, 학습 시 노이즈와 목표 행동의 보간을 사용해 예측해야 할 속도 벡터를 회귀함으로써 비자동회귀적 연속 제어 샘플링을 가능하게 한다.
변형기 혼합 구조(Mixture-of-Transformers)
사전학습된 VLM 백본과 별도이지만 아키텍처 패턴을 공유하는 경량 유니파이드 전문가를 함께 운용하는 설계로, 일부 풀 어텐션 계층은 공유하고 나머지 계층은 모듈별로 분리해 의미적 이해와 제어 신호를 병렬로 유지한다.
FAST 토크나이저(FAST tokenizer)
연속 행동을 고정 길이의 토큰 시퀀스로 변환하는 토크나이저로, 작업-지향적 행동 덩어리를 VLM 어휘에 추가해 다음 토큰 예측 손실로 행동과 서브태스크를 동시 감독할 수 있게 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 06.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.