verl-project/verl-omni
Python0 / 0
Diffusion·Omni 모델을 vLLM-Omni와 분산 RL 구조로 학습하는 verl 기반 framework
TL;DR
VeRL-Omni는 verl 생태계 위에서 Diffusion과 omni-modality 모델의 RL post-training을 수행하는 Python framework입니다. vLLM-Omni 기반 Rollout Engine, Visual·Audio Reward Engine, TransferQueue/RPC를 연결해 멀티모달 trajectory 생성과 비동기 보상 계산을 학습 업데이트와 분리합니다. FSDP2와 VeOmni backend, USP·TP·DP 병렬화, Hydra 설정을 지원하며 Qwen-Image·Wan2.2·Qwen3-Omni 등 여러 모델과 FlowGRPO·DPO·GSPO를 조합할 수 있습니다. Qwen-Image FlowGRPO 기준 diffusers 기반 flow_grpo보다 end-to-end throughput이 약 25% 높다는 README 수치가 있으므로, 단일 GPU용 간단한 Fine-tuning 도구보다 분산 멀티모달 RL 인프라가 필요한 경우에 적합합니다.
핵심 포인트
- VeRL 기반의 멀티모달 RL training framework입니다. Diffusion, unified multimodal, omni-modality 모델을 하나의 학습 구조에서 처리합니다. 이미지·비디오·오디오 생성 모델을 직접 후처닝하려는 팀에 적합합니다.
- vLLM-Omni가 rollout을 담당하고 Reward Engine이 Visual·Audio 보상을 계산합니다. TransferQueue와 RPC로 trajectory와 feedback을 전달하며 비동기 reward 처리를 겹칩니다. 생성과 학습 업데이트를 분리해 대규모 분산 학습에 대응합니다.
- FSDP2와 VeOmni backend에서 USP·TP·DP 병렬화를 조합합니다. Hydra 설정으로 actor update, rollout, reward 모듈을 교체할 수 있습니다. Qwen-Image 기준 diffusers 기반 flow_grpo보다 end-to-end throughput이 약 25% 높다고 README에 기재되어 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Qwen-Image FlowGRPO reference setup | end-to-end throughput | ~25% higher | diffusers 기반 flow_grpo 구현 대비 공개된 README 수치이며, 이 저장소의 모든 모델·설정에 일반화된 수치는 아닙니다. |
이미지 분석

812
Stars
144
Forks
+204
Trending
0
조회수
812 watchers92 open issuesApache License 2.0
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.