TL;DR
실시간 상호작용을 필요로 하는 애니메이션과 로보틱스에서는 텍스트 지시와 장기 공간 목표를 동시에 만족하면서도 낮은 지연으로 모션을 생성하는 것이 핵심이다. ARDY는 루트의 전역 제어성과 바디의 저차원 잠재 표현을 결합함으로써 정밀한 경로 추종과 효율적 생성 학습을 동시에 실현했다. 결과적으로 복잡한 문장 지시와 수초 단위의 장기 목표를 온라인 환경에서 반응적으로 처리할 수 있게 했다.
왜 중요한가
실시간 상호작용을 필요로 하는 애니메이션과 로보틱스에서는 텍스트 지시와 장기 공간 목표를 동시에 만족하면서도 낮은 지연으로 모션을 생성하는 것이 핵심이다. ARDY는 루트의 전역 제어성과 바디의 저차원 잠재 표현을 결합함으로써 정밀한 경로 추종과 효율적 생성 학습을 동시에 실현했다. 결과적으로 복잡한 문장 지시와 수초 단위의 장기 목표를 온라인 환경에서 반응적으로 처리할 수 있게 했다.
핵심 기여
루트는 명시적, 바디는 잠재로 분리한 하이브리드 표현 디자인
루트 위치와 헤딩은 전역 좌표의 명시적 피처로 유지하고 바디는 토크나이저로 압축한 잠재 임베딩으로 대체했다. 이 분리는 전역 경로 제어를 직접 덮어쓰기 방식으로 정확하게 수행할 수 있게 했고 바디 표현은 생성 학습에서 차원과 복잡도를 크게 낮추어 효율성을 개선했다. 실험에서 하이브리드 표현은 순수 명시적 표현보다 제약 정확도와 모션 품질 양쪽에서 우수했다.
루트와 바디를 교차 예측하는 인터리브드(two-stage) 자기회귀 확산 디노이저
생성 단계에서 먼저 클린 루트 토큰을 예측하고 이 결과를 고정하여 바디 잠재를 예측하는 두 단계 구조를 반복적으로 적용했다. 이 구조는 루트 제약 충족과 바디 재구성 품질 간의 상충을 완화했고 단일 단계 모델보다 제약 오차와 스케이팅이 감소했다. 또한 변동하는 히스토리 길이를 허용하는 트랜스포머 기반 설계로 긴 문맥 조건도 수용했다.
인터랙티브 데모와 대규모 데이터 기반 실험적 검증
Bones Rigplay라는 대규모 고품질 모션 데이터로 학습하고 HumanML3D에 대한 벤치마크 비교와 광범위한 소거 실험을 수행했다. 실시간 데모에서 4단계 모델 평균 33ms, 10단계 모델 63ms 지연을 보고했고 인간 평가에서도 기존 자기회귀 기법 대비 선호도를 확보했다. 이 결과는 실전 응용에서의 응답성, 제어성, 품질의 균형을 입증한다.
핵심 아이디어 이해하기
문제의 출발점은 실시간 상호작용 환경에서 텍스트 지시와 공간적 키네마틱 제약을 동시에 만족시켜야 한다는 점이다. 기존의 오프라인 확산 모델은 복잡한 제어를 제공하지만 반복적이고 많은 디노이징 단계 때문에 인터랙티브한 응답성을 얻기 어렵다. 반대로 기존의 자기회귀 온라인 방법은 속도는 확보하지만 길게 이어지는 텍스트 의미와 장기 목표를 처리할 충분한 컨텍스트를 유지하지 못해 제어성이나 의미적 일관성이 떨어진다.
방법론
ARDY는 두 가지 주요 구성으로 접근했다. 첫째는 바디 모션을 토크나이저로 패치화하여 저차원 잠재 임베딩으로 압축하고 루트는 전역 좌표의 명시적 피처로 유지하는 하이브리드 표현을 설계한 점이다. 이 설계는 루트 경로 같은 전역 제약을 직접 덮어쓰기로 강제할 수 있게 하며 바디는 저차원 토큰으로 효율적으로 생성 가능하게 한다.
관련 Figure

이 그림은 바디 모션이 패치화되어 잠재 토큰으로 인코딩되고 전역 루트 피처가 명시적으로 결합되는 하이브리드 표현의 데이터 흐름을 보여준다. 또한 인터리브드 디노이저의 루트 예측 단계와 바디 예측 단계가 반복적으로 작동하여 최종 하이브리드 출력을 복원하는 과정을 시각적으로 전달한다.
ARDY의 시스템 아키텍처 다이어그램으로 토크나이저와 두 단계 디노이저가 하이브리드 표현을 어떻게 처리하는지 도식화하고 있다.
주요 결과
정량 실험에서 ARDY는 HumanML3D 및 자체 처리된 데이터셋에서 텍스트 정합성(R-precision)과 분포적 유사도(FID) 측면에서 경쟁력 있는 결과를 보였고 풋 스케이팅 비율을 낮게 유지했다. 자가회귀 비교 대상인 DiP와의 비교에서는 장기(out-of-horizon) 제약 설정에서도 관절 오차가 크게 증가하지 않아 긴 문맥 처리 능력이 우수함이 확인됐다. 인간 주관평가에서는 모션 품질과 의미 일치성, 목표 정확도에서 참가자들이 ARDY를 일관되게 선호했다.
관련 Figure

여러 샘플을 통해 모델이 장기적인 경로 추종, 희소 웨이포인트 도달, 그리고 전체 바디 키프레임을 동시에 만족시키는 성능을 시각적으로 확인할 수 있다. 이 그림은 논문의 실험 결과와 제약 샘플링 절차가 실제 생동감 있는 동작을 생성하는 데 기여함을 보강한다.
다양한 제약 유형별 정성적 결과를 모아둔 그림으로 루트 궤적, 루트 웨이포인트, 전체 바디 키프레임, 관절 위치와 회전 예시를 포함한다.
기술 상세
전체 아키텍처는 하이브리드 토큰 시퀀스를 입력으로 받는 자기회귀 트랜스포머 기반 디노이저와 토크나이저 오토인코더로 구성된다. 토크나이저는 패치 크기 P=4 프레임을 사용하며 인코더와 디코더 모두 8층의 causal transformer 블록을 사용해 인코딩과 재구성을 수행한다. 디노이저는 루트용 트랜스포머와 바디용 트랜스포머로 분리된 두 분기로 구성되며 각 분기는 8개 레이어, 8개 헤드, 잠재 차원 1024를 사용한다.
한계점
논문에서 명시한 주요 한계로는 첫째, 현재 구현은 과거 모든 프레임을 히스토리로 입력하는 방식이라 매우 장기 과제를 처리할 때 비효율적이다. 둘째, 확산 기반 설계의 다중 디노이징 단계는 계산 비용을 증가시키며 더 많은 단계는 지연을 키운다. 셋째, 모델은 순수 키네마틱 모델로 물리적 동력학을 모형화하지 않아 때때로 풋 스케이팅이나 진동과 같은 물리적 비현실성이 관찰될 수 있다.
실무 활용
ARDY는 실시간 인터랙티브 환경에서 텍스트 지시와 다양한 스페이셜 제약을 결합한 모션 합성 파이프라인으로 사용 가능하다. 낮은 단계의 확산 설정(예를 들어 4단계)으로도 평균 33ms의 생성 지연을 달성하여 게임 엔진이나 인터랙티브 시뮬레이터에 통합하기 적합하다.
- 게임 및 실시간 애니메이션에서 플레이어 명령이나 스크립트 기반 텍스트로 캐릭터 행동을 즉시 생성하는 제어 인터페이스.
- 모바일 또는 데스크톱 기반의 애니메이션 툴에서 키프레임 일부만 지정하면 나머지 시퀀스를 빠르게 보간하고 제약을 충족하는 자동 애니메이션 생성.
- 로봇 제어 연구에서 사람이 지정한 목표 위치와 포즈를 텍스트와 결합해 시뮬레이션용 고품질 행동 시나리오를 빠르게 생성하는 데이터 생성 파이프라인.
코드 공개 여부: 미확인
관련 Figure

이 스크린샷은 사용자 입력이 어떻게 텍스트와 키프레임 또는 루트 웨이포인트로 타임라인에 추가되고 3D 씬에 제약이 시각적으로 표시되는지 보여주며 실시간 재계획과 버퍼 기반 지연 완화 전략을 지원하는 운영 방식의 직관을 제공한다. 또한 데모가 실제 GPU에서 낮은 지연으로 동작하도록 설계되었음을 보강한다.
실시간 데모 인터페이스 스크린샷으로 텍스트 프롬프트와 타임라인, 제약 시각화가 결합된 운영 화면을 보여준다.
키워드
용어 해설
- Hybrid Motion Representation
- — 루트 위치와 바디 모션을 분리하여 루트는 전역 좌표의 명시적 피처로 유지하고 몸동작은 토크나이저로 압축한 잠재 임베딩으로 표현하는 방식으로, 전역 경로 제어와 효율적 생성 학습을 동시에 가능하게 한다.
- Finite Scalar Quantization (FSQ)
- — 토크나이저 인코더 출력의 각 원소를 미리 정의한 이산 레벨 집합으로 양자화하여 잠재 공간을 구성하는 방식으로, 연속표현 대비 학습 안정성을 높이며 재구성 토큰을 생성한다.
- Autoregressive Diffusion
- — 짧은 윈도우를 연속적으로 생성하면서 각 단계에서 확산 기반의 반복적 노이즈 제거를 수행하는 생성 구조로, 온라인 인터랙션에 적합하도록 응답성을 유지하면서 품질을 제어한다.
- Motion Tokenizer
- — 연속 프레임을 패치 단위로 묶어 인코더로 압축하고 디코더로 재구성하는 비대칭 오토인코더로, 바디 모션을 저차원 토큰으로 변환해 생성 모델의 입력으로 사용한다.
- Root Constraint Overwriting
- — 모델 입력의 루트 관련 피처를 사용자 제공 목표값으로 직접 덮어써서 글로벌 경로 제어를 강제하는 기법으로, 전역 좌표 조건을 정확하게 만족시키는 데 핵심 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.