본문으로 건너뛰기

GigaWorld-Policy-0.5: AutoResearch로 강화된 저지연 고성능 World Action Model

GigaWorld-Policy-0.5는 학습 시 미래 시각적 동역학을 사용하고 추론 시 액션 전용 디코딩을 적용해 RTX 4090에서 85ms 추론 지연과 실세계 평균 성공률 0.85를 달성했다.

용어 해설

전문가 혼합 Transformer(Mixture-of-Transformers)
서로 다른 전문화 블록을 병렬로 두고 입력을 전문가별로 처리한 뒤 통합하는 아키텍처로서, 시각적 동역학과 액션 생성처럼 상이한 모달리티를 연산적으로 분리해 추론 시 불필요한 연산을 건너뛰는 데 중요하다.
행동 조건 세계 모델(Action-Conditioned World Model)
로봇의 행동을 조건으로 미래 시각적 관측을 예측하는 모델이다. 액션 입력이 주어질 때 장면의 시간적 진화를 모델링하여 액션과 그 결과 간의 인과 관계를 학습하는 역할을 한다.
액션 중심 인과 마스킹(Action-Centered Causal Mask)
모델 내부 어텐션에서 미래 시각적 토큰이 액션 토큰을 참조하도록 허용하되 액션 토큰이 미래 시각적 토큰을 참조하지 못하게 차단하는 마스킹 규칙으로, 학습 시에는 시각적 동역학을 활용하면서 추론 시 액션 전용 디코딩을 가능하게 한다.
흐름 매칭(Flow Matching)
데이터와 노이즈 사이의 선형 보간 지점에서 속도(velocity) 필드를 회귀하여 생성 모델을 학습하는 프레임워크로서, 서로 다른 모달리티에 대해 시점 샘플링 전략을 달리 적용하여 안정적 다중모달 학습을 지원한다.
키-값 캐시(KV Cache)
오토리그레시브 디코딩 중 이미 계산한 어텐션 키와 값을 저장해 다음 토큰 예측에서 재사용하는 기법으로, 컨텍스트가 고정된 상황에서 반복 연산을 피해 추론 지연을 줄이는 데 효과적이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.