용어 해설
- 전문가 혼합 Transformer(Mixture-of-Transformers)
- — 서로 다른 전문화 블록을 병렬로 두고 입력을 전문가별로 처리한 뒤 통합하는 아키텍처로서, 시각적 동역학과 액션 생성처럼 상이한 모달리티를 연산적으로 분리해 추론 시 불필요한 연산을 건너뛰는 데 중요하다.
- 행동 조건 세계 모델(Action-Conditioned World Model)
- — 로봇의 행동을 조건으로 미래 시각적 관측을 예측하는 모델이다. 액션 입력이 주어질 때 장면의 시간적 진화를 모델링하여 액션과 그 결과 간의 인과 관계를 학습하는 역할을 한다.
- 액션 중심 인과 마스킹(Action-Centered Causal Mask)
- — 모델 내부 어텐션에서 미래 시각적 토큰이 액션 토큰을 참조하도록 허용하되 액션 토큰이 미래 시각적 토큰을 참조하지 못하게 차단하는 마스킹 규칙으로, 학습 시에는 시각적 동역학을 활용하면서 추론 시 액션 전용 디코딩을 가능하게 한다.
- 흐름 매칭(Flow Matching)
- — 데이터와 노이즈 사이의 선형 보간 지점에서 속도(velocity) 필드를 회귀하여 생성 모델을 학습하는 프레임워크로서, 서로 다른 모달리티에 대해 시점 샘플링 전략을 달리 적용하여 안정적 다중모달 학습을 지원한다.
- 키-값 캐시(KV Cache)
- — 오토리그레시브 디코딩 중 이미 계산한 어텐션 키와 값을 저장해 다음 토큰 예측에서 재사용하는 기법으로, 컨텍스트가 고정된 상황에서 반복 연산을 피해 추론 지연을 줄이는 데 효과적이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

