본문으로 건너뛰기

LoRA와 DoRA를 활용한 NVIDIA Cosmos Predict 2.5 로봇 비디오 생성 파인튜닝

NVIDIA Cosmos Predict 2.5 모델을 LoRA와 DoRA로 파인튜닝하여 로봇 조작 작업에 최적화된 고품질 합성 비디오 데이터를 생성하는 방법.

섹션별 상세

01
Cosmos Predict 2.5는 텍스트와 이미지를 입력받아 물리적으로 타당한 비디오를 생성하는 월드 모델이다.
02
LoRA와 DoRA 어댑터를 DiT의 어텐션 및 피드포워드 레이어에 주입하여 전체 파라미터 학습 없이 효율적으로 도메인 적응을 수행한다.
python
lora_config = LoraConfig(
    r=args.lora_rank,
    lora_alpha=args.lora_alpha,
    target_modules=['to_q', 'to_k', 'to_v', 'to_out.0', 'ff.net.0.proj', 'ff.net.2'],
    use_dora=args.use_dora, # set True to switch to DoRA
)
dit.add_adapter(lora_config)
cast_training_params(dit, dtype=torch.float32) # LoRA params in fp32

Cosmos Predict 2.5 모델에 LoRA 또는 DoRA 어댑터를 설정하고 주입하는 코드.

03
학습 루프는 Rectified Flow 공식을 사용하여 노이즈에서 데이터로의 속도를 예측하도록 최적화된다.
python
# Forward
pred_velocity = dit(
    hidden_states=xt,
    condition_mask=cond_mask,
    timestep=in_timestep,
    encoder_hidden_states=prompt_embeds,
    padding_mask=padding_mask,
    return_dict=False,
)[0]
# MSE loss is computed only on the non-conditioned frames
target_velocity = noise - clean_latent
pred_velocity = target_velocity * cond_mask + pred_velocity * (1 - cond_mask)
loss = F.mse_loss(pred_velocity.float(), target_velocity.float())

Rectified Flow 공식을 사용하여 학습 손실(MSE Loss)을 계산하는 핵심 루프.

04
Sampson Error를 통해 프레임 간 기하학적 일관성을 측정하고 LLM-as-a-Judge를 통해 물리적 타당성과 지시 이행 능력을 검증한다.
Temporal 및 Cross-View Sampson Error 비교 차트.
Chart파인튜닝 전후의 기하학적 오차를 비교한다. LoRA와 DoRA 적용 시 Sampson Error가 감소하여 프레임 간 및 뷰 간 일관성이 향상되었음을 보여준다.
물리적 타당성(Adherence to Physical Commonsense) 점수 비교 차트.
Chart파인튜닝된 모델이 기본 모델보다 물리적 상식을 더 잘 준수함을 보여준다. LoRA와 DoRA 모두 물리적 타당성 점수를 향상시킨다.
지시 이행(Adherence to Prompt) 점수 비교 차트.
Chart파인튜닝된 모델이 프롬프트 지시를 더 정확하게 수행함을 보여준다. 특히 rank 32 설정에서 더 높은 점수를 기록한다.
05
실험 결과, rank 32 설정이 지시 이행 능력을 높이며, DoRA와 LoRA는 유사한 성능을 보이나 DoRA는 학습 안정성에 기여할 수 있다.

용어 해설

Rectified Flow
노이즈 샘플을 데이터로 변환하는 경로를 직선화하여 학습하는 생성 모델링 방식. 모델은 노이즈와 데이터 사이의 속도를 예측하도록 학습되며, 샘플링 효율성과 품질을 높인다.
Sampson Error
매칭된 키포인트와 에피폴라 라인 사이의 거리를 측정하는 기하학적 오차 지표. 비디오 생성에서 프레임 간 혹은 뷰 간의 기하학적 일관성을 평가하는 데 사용된다.
월드 모델(World Model)
물리적 세계의 역학을 이해하고 미래 상태를 예측하는 AI 모델. 로봇 조작이나 자율 주행 등 물리적 상호작용이 필요한 작업에서 합성 데이터를 생성하는 데 활용된다.
파라미터 효율적 파인튜닝(PEFT)
대규모 모델의 전체 가중치를 학습하지 않고 일부 파라미터나 어댑터 모듈만 학습하여 메모리 사용량을 줄이는 기법. LoRA와 DoRA가 대표적이다.

기술

  • Cosmos Predict 2.5
  • LoRA
  • DoRA
  • PyTorch
  • Diffusers
  • Accelerate

활용 사례

  • 로봇 조작 작업 합성 데이터 생성
  • 특정 카메라 뷰포트 적응
  • 물리적 타당성 검증

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 19.수집 2026. 05. 19.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.