Boogu/Boogu-Image-0.1-Turbo
10B 규모 기반에서 Decoupled DMD 증류를 적용해 3~4 스텝으로 고품질 포토리얼리즘과 안정적 한·영 텍스트 렌더링을 제공하는 빠른 T2I 모델이다.
학습 방식 · 10B 기반을 공동 학습(Joint Training)으로 구축한 후, Turbo 변형은 Decoupled DMD 증류를 통해 3~4 스텝으로 빠른 추론을 달성하도록 추가로 학습/증류했다.
TL;DR
Boogu-Image-0.1-Turbo는 Boogu 프로젝트가 공개한 10B 규모의 이미지 생성·편집 모델 가족 중 증류형 변형으로, Apache-2.0 라이선스 하에 텍스트-투-이미지(및 계열의 편집) 기능을 제공한다. 프로젝트는 모델 아키텍처 자체보다 데이터 품질과 파이프라인 설계로 중·영 텍스트 렌더링과 이미지 이해-생성의 통합을 목표로 삼았다. Turbo는 Decoupled DMD 기반의 증류를 적용해 동일 파라미터 수에서 생성 스텝을 3~4로 줄였고, Base와 Edit 등 다른 변형은 공동 학습(Joint Training)을 통해 텍스트 렌더링·편집·생성 능력을 함께 키웠다. 실사용을 고려해 FP8 가중치 버전과 다양한 오프로딩 전략, flash-attn 설치 스크립트를 문서화했으며, 자체 Boogu Arena(1K+ 프롬프트)로 선호도 기반 비교를 수행해 시나리오별 평점을 공개했다. 이로 인해 Boogu는 포토리얼리즘과 안정적 텍스트 렌더링을 동시에 제공하는 점, 증류로 인한 낮은 레이턴시, 오픈소스·배포 유연성에서 실용적 가치를 제공한다. 반면 세계 지식·브랜드·복잡한 인컨텍스트 문맥 면에서는 폐쇄형 대형 시스템과 격차가 있고, 이미지 편집의 입력 보존성·작은 얼굴·복잡한 포즈의 신체 구조·초밀집 텍스트 처리에서는 아직 한계가 존재한다.
핵심 포인트
- Decoupled DMD 증류로 동일 파라미터에서 스텝을 크게 줄여 빠른 추론을 달성함
- 파이프라인 수준에서 외부/내부 프롬프트 리라이터를 제공해 프롬프트 품질과 메모리 관리를 동시에 설계함
- 중·영 이중 언어 텍스트 렌더링과 텍스트 편집을 핵심 목표로 삼아 포스터·문서형 레이아웃에서 강점을 보인다는 점
- fp8 가중치와 다양한 offload 전략을 문서화해 낮은 VRAM 환경에서의 실사용을 고려한 배포 옵션을 제공함
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Boogu Arena — Realistic Photography (Turbo) | rating | 4/5 stars | Z-Image-Turbo: parity or slightly better per README comparison table |
| Boogu Arena — Simple Text Rendering (Turbo) | rating | 4/5 stars | Qwen-Image-2512: comparable per README comparison table |
| Boogu Arena — Dense Text Rendering (Turbo) | rating | 3/5 stars | Boogu-Image-0.1-Base: Base rated higher (4/5) for dense text |
이미지 분석




50
LIKES
513
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.