용어 해설
- 플로우 매칭(Flow Matching)
- — 데이터 분포로부터 연속 경로를 학습하는 확률적 생성 기법으로, 시간 λ에 따른 속도장(velocity field)을 학습해 초기 Gaussian 샘플을 데이터 분포로 ODE 통합으로 전이시키는 방식이다. 본문에서는 k단계의 행동 시퀀스에 대해 속도장 vθ를 예측하고 그 값과 목표 속도(v⋆)의 제곱 오차를 최소화하는 손실을 사용했다. 이 방식은 고정된 토큰 코드북의 제약 없이 연속적·다중모드 행동을 생성하는 핵심 수단으로 활용된다.
- 역 Kullback–Leibler 발산(Reverse KL)
- — 생성 모델의 출력 분포를 데이터 분포에 맞추기 위해 사용하는 DKL(p_model || p_data) 형태의 목표로, 높은 밀도 모드에 확률을 집중시키는 경향이 있어 소수 모드가 무시될 수 있다. 본문에서는 이 모드 추적 성향을 완화하기 위해 엔트로피 정규화와 결합해 온도 β로 표적 분포를 완화했다. 그 결과 역-KL 단독 대비 희소 모드를 더 잘 보존하면서도 폐루프 롤아웃의 데이터 유사성을 개선하는 균형을 만든다.
- 공변량 편이(코비에이트 시프트)(Covariate Shift)
- — 교사 강요(teacher forcing)로 학습한 모델이 배치에서는 로그된 히스토리를 조건으로 하지만 배포 시 자체 생성한 상태를 조건으로 하여 누적 오차가 발생하는 현상이다. 본문에서는 폐루프 롤아웃 분포 pθ^CL과 데이터 분포 pdata의 불일치를 줄이는 것을 목표로 삼았다. ERD는 폐루프 롤아웃을 직접 미세조정해 이 편이를 실질적으로 완화했다.
- 비홀로노믹(자전거식) 운동학(Non-holonomic Kinematics)
- — 차량·자전거처럼 횡방향 독립 이동이 실행 입력에 없고 회전에 따른 박스 중심의 전진·스윙 변위를 모델링하는 운동학으로, 회전 각도와 no-slip 오프셋 r에 따라 박스 중심의 횡방향 변위가 발생한다. 본문은 이 모델을 행동 실행 단계에서 적용해 차량·자전거에 부적절한 횡슬립 같은 불합리한 상태를 방지했다. 이로 인해 연속 표현의 표현력은 유지되면서 유형별 현실성이 확보된다.
- 교차 쌍 다양도(CPD)(Cross-Pair Diversity (CPD))
- — 동일 시나리오에 대해 생성한 K개의 폐루프 롤아웃 쌍간 평균 거리로 정의되는 로그 비의존적 다양성 지표로, 에이전트 유형별 정규화와 시간·객체 평균을 포함한다. 본문에서는 RMM과 함께 사용해 사실성(realism)과 다양성(diversity) 사이의 균형을 평가했다. CPD 값이 클수록 동일 초기 조건에서 더 많은 서로 다른 미래를 생성하는 것으로 해석된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




