섹션별 상세
Cosmos Predict 2.5는 텍스트와 이미지를 입력받아 물리적으로 타당한 비디오를 생성하는 월드 모델이다.
LoRA와 DoRA 어댑터를 DiT의 어텐션 및 피드포워드 레이어에 주입하여 전체 파라미터 학습 없이 효율적으로 도메인 적응을 수행한다.
python
lora_config = LoraConfig(
r=args.lora_rank,
lora_alpha=args.lora_alpha,
target_modules=['to_q', 'to_k', 'to_v', 'to_out.0', 'ff.net.0.proj', 'ff.net.2'],
use_dora=args.use_dora, # set True to switch to DoRA
)
dit.add_adapter(lora_config)
cast_training_params(dit, dtype=torch.float32) # LoRA params in fp32Cosmos Predict 2.5 모델에 LoRA 또는 DoRA 어댑터를 설정하고 주입하는 코드.
학습 루프는 Rectified Flow 공식을 사용하여 노이즈에서 데이터로의 속도를 예측하도록 최적화된다.
python
# Forward
pred_velocity = dit(
hidden_states=xt,
condition_mask=cond_mask,
timestep=in_timestep,
encoder_hidden_states=prompt_embeds,
padding_mask=padding_mask,
return_dict=False,
)[0]
# MSE loss is computed only on the non-conditioned frames
target_velocity = noise - clean_latent
pred_velocity = target_velocity * cond_mask + pred_velocity * (1 - cond_mask)
loss = F.mse_loss(pred_velocity.float(), target_velocity.float())Rectified Flow 공식을 사용하여 학습 손실(MSE Loss)을 계산하는 핵심 루프.
Sampson Error를 통해 프레임 간 기하학적 일관성을 측정하고 LLM-as-a-Judge를 통해 물리적 타당성과 지시 이행 능력을 검증한다.



실험 결과, rank 32 설정이 지시 이행 능력을 높이며, DoRA와 LoRA는 유사한 성능을 보이나 DoRA는 학습 안정성에 기여할 수 있다.
용어 해설
- Rectified Flow
- — 노이즈 샘플을 데이터로 변환하는 경로를 직선화하여 학습하는 생성 모델링 방식. 모델은 노이즈와 데이터 사이의 속도를 예측하도록 학습되며, 샘플링 효율성과 품질을 높인다.
- Sampson Error
- — 매칭된 키포인트와 에피폴라 라인 사이의 거리를 측정하는 기하학적 오차 지표. 비디오 생성에서 프레임 간 혹은 뷰 간의 기하학적 일관성을 평가하는 데 사용된다.
- 월드 모델(World Model)
- — 물리적 세계의 역학을 이해하고 미래 상태를 예측하는 AI 모델. 로봇 조작이나 자율 주행 등 물리적 상호작용이 필요한 작업에서 합성 데이터를 생성하는 데 활용된다.
- 파라미터 효율적 파인튜닝(PEFT)
- — 대규모 모델의 전체 가중치를 학습하지 않고 일부 파라미터나 어댑터 모듈만 학습하여 메모리 사용량을 줄이는 기법. LoRA와 DoRA가 대표적이다.
기술
- Cosmos Predict 2.5
- LoRA
- DoRA
- PyTorch
- Diffusers
- Accelerate
활용 사례
- 로봇 조작 작업 합성 데이터 생성
- 특정 카메라 뷰포트 적응
- 물리적 타당성 검증
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 19.수집 2026. 05. 19.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.