본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

verl-project/verl-omni

Python0 / 0

Diffusion·Omni 모델을 vLLM-Omni와 분산 RL 구조로 학습하는 verl 기반 framework

TL;DR

VeRL-Omni는 verl 생태계 위에서 Diffusion과 omni-modality 모델의 RL post-training을 수행하는 Python framework입니다. vLLM-Omni 기반 Rollout Engine, Visual·Audio Reward Engine, TransferQueue/RPC를 연결해 멀티모달 trajectory 생성과 비동기 보상 계산을 학습 업데이트와 분리합니다. FSDP2와 VeOmni backend, USP·TP·DP 병렬화, Hydra 설정을 지원하며 Qwen-Image·Wan2.2·Qwen3-Omni 등 여러 모델과 FlowGRPO·DPO·GSPO를 조합할 수 있습니다. Qwen-Image FlowGRPO 기준 diffusers 기반 flow_grpo보다 end-to-end throughput이 약 25% 높다는 README 수치가 있으므로, 단일 GPU용 간단한 Fine-tuning 도구보다 분산 멀티모달 RL 인프라가 필요한 경우에 적합합니다.

핵심 포인트

  • VeRL 기반의 멀티모달 RL training framework입니다. Diffusion, unified multimodal, omni-modality 모델을 하나의 학습 구조에서 처리합니다. 이미지·비디오·오디오 생성 모델을 직접 후처닝하려는 팀에 적합합니다.
  • vLLM-Omni가 rollout을 담당하고 Reward Engine이 Visual·Audio 보상을 계산합니다. TransferQueue와 RPC로 trajectory와 feedback을 전달하며 비동기 reward 처리를 겹칩니다. 생성과 학습 업데이트를 분리해 대규모 분산 학습에 대응합니다.
  • FSDP2와 VeOmni backend에서 USP·TP·DP 병렬화를 조합합니다. Hydra 설정으로 actor update, rollout, reward 모듈을 교체할 수 있습니다. Qwen-Image 기준 diffusers 기반 flow_grpo보다 end-to-end throughput이 약 25% 높다고 README에 기재되어 있습니다.

벤치마크

벤치마크지표비교
Qwen-Image FlowGRPO reference setupend-to-end throughput~25% higherdiffusers 기반 flow_grpo 구현 대비 공개된 README 수치이며, 이 저장소의 모든 모델·설정에 일반화된 수치는 아닙니다.

이미지 분석

VeRL-Omni의 Diffusion 및 Omni RL training architecture를 나타낸 다이어그램입니다.
상단의 FlowGRPO, Omni-PPO, DPO trainer가 중앙 Training System과 연결되고, Actor Engine은 DiffusersFSDP2와 VeOmni/Megatron을 사용합니다. 하단에서는 Rollout Engine의 LLM-Omni(vLLM)가 trajectory를 생성하고 Reward Engine이 Visual·Audio feedback을 계산한 뒤 TransferQueue/RPC를 거쳐 actor 학습으로 전달합니다.

812

Stars

144

Forks

+204

Trending

0

조회수

812 watchers92 open issuesApache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.