10B 파라미터로 텍스트·스타일·객체 편집을 지원하는 오픈소스 이미지 편집 패밀리
Boogu-Image-0.1-Edit는 Diffusers 파이프라인 기반 10B 모델로 중국어·영어 텍스트 편집과 고품질 이미지 스타일 변환을 지원하는 이미지-투-이미지 편집용 체크포인트이다.
TL;DR
Boogu-Image-0.1은 텍스트-투-이미지 생성과 이미지 편집을 하나의 패밀리로 묶은 오픈소스 프로젝트로, Base·Edit·Turbo 변형을 동일한 10B 파라미터 기반으로 제공한다. 모델은 중국어·영어의 밀집 텍스트 렌더링과 사진적 생성, 스타일 전환, 단일 참조 이미지 편집을 목표로 데이터·파이프라인을 조정했다. 학습과정은 멀티태스크 공동 학습(Joint Training)을 바탕으로 하며, Turbo는 Decoupled DMD 증류를 적용해 3~4 스텝의 저스텝 추론을 실현했다. FP8 양자화 체크포인트와 다양한 VRAM 오프로드 전략을 문서화해 저자원 환경 실행을 지원하며, 자체 평가(Boogu Arena)의 1K+ 프롬프트 ELO 리더보드를 통해 여러 시나리오에서 경쟁력을 보고했다. 그러나 한계도 분명하다. 이미지-투-이미지 일관성(정체성·레이아웃 보존), 장문·초밀도 텍스트의 완전한 정확성, 작은 얼굴·사지·미세 텍스트에서의 재구성 아티팩트(FLUX.1 VAE 관련 재구성 손실)가 존재하므로, 고정밀 보존이 필요한 생산 환경에서는 추가 검증과 후처리가 필요하다. 이 릴리스는 연구 목적의 공개본이며 Apache-2.0 라이선스로 배포된다.
핵심 역량
- 고품질의 사진풍 생성(Boogu-Image-0.1-Turbo는 3~4 스텝으로 빠른 생성 지원)
- 중국어·영어에 강한 텍스트 인이미지 렌더링 및 레이아웃 보존(포스터·브랜딩·문서형 레이아웃 대상)
- 단일 참조 이미지 기반의 스타일 전환·속성 변경·객체 삽입·제거 등 광범위한 편집 작업
- 다양한 예술적 스타일(애니메, 중국풍 금박, 판타지 등)로의 안정적 스타일 전환
- FP8 가중치와 오프로드 설정을 통한 저VRAM 환경 실행 지원
강점
- Apache-2.0 라이선스 하의 오픈소스 공개로 상업적 활용·포크가 용이하다.
- Base/Edit/Turbo 패밀리 구조로 연구·실험(밀도 높은 텍스트 편집)과 실무(빠른 Turbo 생성) 요구를 분리해 제공한다.
- FP8 양자화 옵션과 상세한 VRAM 오프로드 가이드로 저자원 환경에서도 실행 가능하다.
훈련 방식
10B 파라미터 규모로 멀티태스크·공동(joint) 학습을 수행했으며, Turbo 변형은 Decoupled DMD 증류로 3~4 스텝 추론을 달성하고 FP8 양자화 체크포인트와 오프로드 전략을 병행했다.
알아두면 좋은 것
- 모델 패밀리( Base / Edit / Turbo )가 모두 10B 파라미터로 제공되며, Turbo는 Decoupled DMD 증류로 3~4 스텝 추론을 목표로 설계되었다.
- Boogu Arena라는 자체 평가 파이프라인으로 1K+ 사용자 페르소나 프롬프트를 사용한 ELO 스타일 비교를 수행했고 결과를 리더보드 형태로 제공한다.
- 연구 목적의 공개 릴리스이며 라이선스는 Apache-2.0이다. FP8 체크포인트와 다양한 VRAM 오프로드 권장 설정을 문서로 제공한다.
- 책임성 고지에서 이미지 편집의 보존성(특히 identity/layout), 장문의 고밀도 텍스트, 작은 얼굴·사지 등에서 한계가 존재함을 명시한다(FLUX.1 VAE 관련 재구성 손실 언급).
기술적 특징
- Joint training: 여러 생성·편집 태스크를 하나의 학습 파이프라인에서 공동 학습해 모델 중복을 줄이고 다양한 제어 신호에 반응하도록 설계되었다. 이로 인해 동일한 10B 파라미터가 Base, Edit, Turbo 변형에 재사용된다.
- Decoupled DMD 증류(튜닝된 증류 전략): Turbo 변형에 증류를 적용해 추론 스텝을 3~4로 줄였고, 짧은 샘플링 루프에서 실사 품질과 텍스트 보존 간 균형을 맞추었다. 증류 과정은 생성 품질 유지와 속도 개선을 동시에 달성하는 목적이다.
- FP8 양자화 및 오프로드: 모델은 fp8 가중치 변형과 함께 제공되며, 문서에 VRAM별 권장 오프로드 플래그가 있어 12GB~32GB 등의 제한된 GPU 환경에서도 실행할 수 있도록 구성되었다. 이 접근은 대형 모델의 접근성을 높인다.
- 텍스트 렌더링 최적화: 중국어·영어 이중언어의 밀집 텍스트 레이아웃을 타깃으로 데이터·파이프라인을 조정해 문서·포스터·브랜딩 형식에서의 텍스트 가독성·배치 일관성을 강화했다. 다만 장문·초밀집 레이아웃에서는 오차가 남는다.
- 인프라·추론 최적화 도구와 가이드: Flash Attention 설치 스크립트와 Torch Compile 관련 주의사항, 다양한 오프로드/캐시 전략을 문서화해 실제 배포 환경에서 속도·메모리 조정을 지원한다.
차별점
- 동일한 10B 기반으로 Base/Edit/Turbo 세 가지 목적별 변형을 제공해 연구·실무 전환을 용이하게 한 제품군 구조
- 중국어·영어의 밀집 텍스트 렌더링을 중점으로 데이터·파이프라인을 조정한 점
- Decoupled DMD 기반의 증류로 Turbo에 3~4 스텝의 초저스텝 추론을 구현한 점
- FP8 체크포인트와 상세한 VRAM 오프로드 권장 설정을 함께 제공해 저자원 환경 지원이 용이한 점
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Realistic Photography (Boogu-Image-0.1-Turbo) | star-rating | 4/5 | Z-Image-Turbo: 4/5 |
| Simple Text Rendering (Boogu-Image-0.1-Base) | star-rating | 4/5 | Qwen-Image-2512: 4/5 |
| Dense Text Rendering (Boogu-Image-0.1-Base) | star-rating | 4/5 | Z-Image-Turbo: 2/5 |
이미지 분석




138
Likes
986
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.