용어 해설
- 6자유도 궤적(6-DoF Trajectory)
- — 카메라의 3차원 이동과 3축 회전을 하나의 연속 궤적으로 표현하는 방식입니다. 위치 변화와 방향 변화를 함께 입력해 키보드 명령보다 풍부한 카메라 운동을 보존합니다. EchoWM은 이 표현을 1인칭과 3인칭 장면에 공통으로 사용합니다.
- 카메라 의도(Camera Intent)
- — 사용자가 어떤 방향과 속도로 장면을 관찰하고 이동하려는지 나타내는 상호작용 표현입니다. 1인칭에서는 관찰자의 이동을 직접 지정하고, 3인칭에서는 캐릭터와 카메라의 결합된 움직임을 데이터에서 학습하게 합니다. 특정 게임의 컨트롤러나 카메라 리그에 의존하지 않는 공통 인터페이스입니다.
- 통합 카메라 위치 인코딩(Unified Camera Positional Encoding)
- — 카메라 사이의 상대적인 광선 기하를 Attention 내부에 주입하는 위치 인코딩 방식입니다. 절대 월드 좌표 대신 토큰 간 상대 변환을 사용해 전역 좌표계가 바뀌어도 관계를 유지합니다. EchoWM은 별도 카메라 인코더 없이 이 경로를 비디오 Self-Attention과 병렬로 연결합니다.
- 점진적 학습(Progressive Training)
- — 서로 충돌하기 쉬운 오디오·비디오 생성과 궤적 제어를 여러 단계로 나누어 학습하는 전략입니다. AV-CPT로 생성 prior를 맞춘 뒤 Action-SFT에서 카메라 경로만 학습하고, Joint-FT에서 두 능력을 함께 조정합니다. 마지막으로 자기 생성 이력을 이용한 Autoregressive Post-Training을 적용해 긴 롤아웃을 준비합니다.
- Self-Gradient Forcing
- — 모델이 직접 생성한 이전 오디오·비디오 청크를 다음 예측의 문맥으로 사용하면서 학습하는 자기 생성 기반 훈련 방식입니다. 순차 샘플링 자체에는 gradient를 저장하지 않고, 생성된 문맥 표현을 병렬로 다시 계산해 이후 손실을 앞선 문맥 표현까지 전달합니다. 이 과정은 teacher forcing과 실제 autoregressive 추론 사이의 분포 차이를 줄입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






