inclusionAI/LLaDA-Image
Text-to-image 생성, VQ 조건부 생성, 참조 이미지 기반 Instruction-guided Editing6Bapache-2.0
텍스트 생성과 참조 이미지 편집을 통합한 6B Diffusion 모델
학습 방식 · 6B 통합 Diffusion 모델을 Image-only Pre-training과 Mid-training으로 학습한 뒤 paired language supervision 및 생성·편집 공동 학습을 적용했으며, Turbo 변형에는 Twin-DMD Distillation을 사용했습니다.
TL;DR
LLaDA-Image는 6B 파라미터 규모의 오픈소스 통합 이미지 생성·편집 모델로, 텍스트 입력 생성과 참조 이미지 기반 편집을 하나의 Checkpoint에서 처리합니다. 기본 모델은 50단계 Diffusion으로 고품질 결과를 만들고, LLaDA-Image-Turbo는 Twin-DMD Distillation으로 4단계 추론을 수행합니다. Image-only Pre-training과 Mid-training으로 시각적 사전지식을 익힌 뒤 언어 감독 및 생성·편집 공동 학습을 적용했으며, Qwen-Image-Bench에서 영어 53.53, 중국어 53.38을 기록했습니다.
핵심 포인트
- 텍스트 생성과 참조 이미지 편집을 별도 Backbone 없이 하나의 Checkpoint에서 처리합니다.
- Image-only Pre-training 뒤 언어 감독과 생성·편집 공동 학습을 이어 시각적 사전지식을 구축합니다.
- 기본 모델은 50단계, Twin-DMD Distillation을 거친 Turbo는 4단계 추론을 사용합니다.
- Qwen-Image-Bench에서 영어 53.53, 중국어 53.38의 전체 점수를 기록했습니다.
제한사항
- 학습 코드는 아직 공개되지 않았고 Inference code와 Model weights만 제공됩니다.
- Text 및 VQ 생성은 높이와 너비가 16의 배수여야 하며, Image Editing은 두 치수가 32의 배수여야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Qwen-Image-Bench 영어 | overall score | 53.53 | README 기재 기준 전체 점수 SOTA |
| Qwen-Image-Bench 중국어 | overall score | 53.38 | README 기재 기준 전체 점수 SOTA |
이미지 분석




71
LIKES
635
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.