10B 파라미터에서 3~4스텝으로 빠른 포토리얼리즘과 안정적 중·영 텍스트 렌더링
10B 규모 기반에서 Decoupled DMD 증류를 적용해 3~4 스텝으로 고품질 포토리얼리즘과 안정적 한·영 텍스트 렌더링을 제공하는 빠른 T2I 모델이다.
TL;DR
Boogu-Image-0.1-Turbo는 Boogu 프로젝트가 공개한 10B 규모의 이미지 생성·편집 모델 가족 중 증류형 변형으로, Apache-2.0 라이선스 하에 텍스트-투-이미지(및 계열의 편집) 기능을 제공한다. 프로젝트는 모델 아키텍처 자체보다 데이터 품질과 파이프라인 설계로 중·영 텍스트 렌더링과 이미지 이해-생성의 통합을 목표로 삼았다. Turbo는 Decoupled DMD 기반의 증류를 적용해 동일 파라미터 수에서 생성 스텝을 3~4로 줄였고, Base와 Edit 등 다른 변형은 공동 학습(Joint Training)을 통해 텍스트 렌더링·편집·생성 능력을 함께 키웠다. 실사용을 고려해 FP8 가중치 버전과 다양한 오프로딩 전략, flash-attn 설치 스크립트를 문서화했으며, 자체 Boogu Arena(1K+ 프롬프트)로 선호도 기반 비교를 수행해 시나리오별 평점을 공개했다. 이로 인해 Boogu는 포토리얼리즘과 안정적 텍스트 렌더링을 동시에 제공하는 점, 증류로 인한 낮은 레이턴시, 오픈소스·배포 유연성에서 실용적 가치를 제공한다. 반면 세계 지식·브랜드·복잡한 인컨텍스트 문맥 면에서는 폐쇄형 대형 시스템과 격차가 있고, 이미지 편집의 입력 보존성·작은 얼굴·복잡한 포즈의 신체 구조·초밀집 텍스트 처리에서는 아직 한계가 존재한다.
핵심 역량
- 고품질 포토리얼리즘 텍스트-투-이미지 생성(단계 수 3~4로 빠른 추론)
- 중국어·영어 병행 텍스트 렌더링(포스터·문서·브랜딩 레이아웃에서의 문장/문자 삽입·수정 가능)
- 다양한 스타일(3D 미니어처, 중국풍 금장, 판타지, 애니메 스타일 등)로의 프롬프트-인식 스타일화
- 이미지 편집: 객체 삽입·제거·교체, 속성·재질 변경, 배경·장면 대체 등(현재 단일 레퍼런스 이미지 지원)
- FP8 양자화 및 offload 전략을 통한 저메모리 실행 지원(12GB~환경에서 권장 설정 제공)
강점
- 포토리얼리즘과 텍스트 렌더링 간의 균형: Turbo는 현실적인 사진 품질을 유지하면서도 중·영 텍스트를 안정적으로 렌더링하는 점을 강조했다.
- 빠른 추론: 동일 파라미터(10B)에서 증류를 통해 3~4 스텝으로 결과를 생성해 지연과 비용 면에서 이점을 제공한다.
- 오픈 소스·유연한 배포: Apache-2.0 라이선스와 diffusers 파이프라인, FP8/offload 옵션으로 연구·실험 환경에서 사용하기 쉽다.
훈련 방식
10B 기반을 공동 학습(Joint Training)으로 구축한 후, Turbo 변형은 Decoupled DMD 증류를 통해 3~4 스텝으로 빠른 추론을 달성하도록 추가로 학습/증류했다.
알아두면 좋은 것
- Boogu-Image-0.1은 Base, Turbo, Edit와 fp8 양자화 변형을 포함한 10B 규모의 모델 가족으로 공개됐으며, 라이선스는 Apache-2.0이다.
- Turbo는 Decoupled DMD를 적용한 증류형 변형으로 동일 파라미터 수에서 3~4 스텝으로 빠른 생성을 목표로 하며, Base는 밀집 텍스트 렌더링에서 우수함을 보였다.
- Boogu Arena라는 자체 ELO 기반 선호도 평가(1K+ 프롬프트)를 구축해 내부 비교를 수행했으며, 결과는 README의 시나리오별 평점 및 리더보드로 제시됐다.
- 실행 가이드에서 flash-attn 설치 스크립트, fp8 가중치, 다양한 VRAM별 offload 권장 구성(12/16/24/32GB 등)을 제공해 실사용 환경 최적화를 지원한다.
기술적 특징
- 공동 학습 기반 10B 재현성: 가족 모델(Base/Edit/Turbo)은 10B 파라미터 설계로 공동 학습(Joint Training)을 통해 텍스트 렌더링·편집·생성 능력을 함께 키웠다. 이렇게 통합된 데이터·목표 설정은 레이아웃·텍스트 보존과 생성 품질 사이의 균형을 개선했다.
- Decoupled DMD 기반 증류로 추론 스텝 절감: Turbo 변형은 Decoupled DMD라는 증류 접근을 적용해 동일 파라미터에서 생성 스텝을 3~4로 줄였다. 이로 인해 실사용에서 낮은 레이턴시로도 포토리얼리즘을 유지할 수 있다.
- FP8 양자화·오프로딩 지원으로 저메모리 실행: fp8 가중치 버전과 여러 offload 플래그를 문서화해 12~24GB급 GPU 환경에서도 모델을 실행할 수 있도록 설계했다. README에 VRAM별 권장 설정이 명시되어 있어 실무 적용 시 메모리 조정을 용이하게 한다.
- 파이프라인 내외부 프롬프트 리라이터(Instruction Rewriter): 프롬프트 품질 향상을 위해 외부 LLM 기반 리라이터와 파이프라인 통합 리라이터를 모두 제공한다. 이는 복잡한 지시문을 구조화해 모델 입력을 개선하고, 메모리 사용과 실행 기기 분배를 제어할 수 있다.
- 텍스트 렌더링·편집에 대한 데이터 중심 접근: Boogu는 거대한 컴퓨팅 대신 데이터 품질·파이프라인 설계로 중·영 텍스트 렌더링과 인-이미지 텍스트 편집 성능을 높이는 전략을 선택했다. 이 접근은 포스터·브랜드 가이드처럼 레이아웃·문자 보존이 중요한 응용에서 효용을 가진다.
차별점
- Decoupled DMD 증류로 동일 파라미터에서 스텝을 크게 줄여 빠른 추론을 달성함
- 파이프라인 수준에서 외부/내부 프롬프트 리라이터를 제공해 프롬프트 품질과 메모리 관리를 동시에 설계함
- 중·영 이중 언어 텍스트 렌더링과 텍스트 편집을 핵심 목표로 삼아 포스터·문서형 레이아웃에서 강점을 보인다는 점
- fp8 가중치와 다양한 offload 전략을 문서화해 낮은 VRAM 환경에서의 실사용을 고려한 배포 옵션을 제공함
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Boogu Arena — Realistic Photography (Turbo) | rating | 4/5 stars | Z-Image-Turbo: parity or slightly better per README comparison table |
| Boogu Arena — Simple Text Rendering (Turbo) | rating | 4/5 stars | Qwen-Image-2512: comparable per README comparison table |
| Boogu Arena — Dense Text Rendering (Turbo) | rating | 3/5 stars | Boogu-Image-0.1-Base: Base rated higher (4/5) for dense text |
이미지 분석




50
Likes
513
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.