Krea 2 Turbo FP8로 용량 절반화
Krea 2 Turbo의 FP8 weight-only 양자화 버전으로 모델 크기를 24.76 GiB에서 12.01 GiB로 줄여 16GB·24GB GPU에서 실행 가능하게 한다.
TL;DR
이 모델은 Krea 2 OSS Turbo의 BF16 가중치를 기반으로 선택적 weight-only FP8(float8_e4m3fn) 양자화를 적용해 모델 용량을 24.76 GiB에서 12.01 GiB로 줄인 배포판이다. 양자화는 2차원 가중치 행렬 중 크기 기준을 충족하는 텐서만 목표로 하며 바이어스·스케일·민감 투영 레이어는 고정밀로 보존해 수치 불안정과 품질 저하를 최소화하도록 설계되었다. 결과적으로 16GB·24GB GPU 환경에서의 로컬 실행 가능성이 높아지고 ComfyUI 워크플로우로 즉시 통합해 테스트할 수 있는 실용적 이점을 제공한다. 다만 README는 정성적 샘플과 텐서 수·용량 절감 수치를 제시할 뿐 정량적 화질 지표는 제공하지 않으므로 실제 화질 영향은 사용 환경에서 추가 검증이 필요하다.
핵심 역량
- 다양한 스타일의 이미지를 텍스트 프롬프트로 생성할 수 있으며, 리치한 디테일과 색감 표현을 유지한 샘플을 출력한다. README 샘플에는 3D, 애니메, 비치 등 서로 다른 스타일 결과물이 포함되어 있어 범용 이미지 생성 능력을 확인할 수 있다. ComfyUI 워크플로우로 즉시 연동해 파라미터를 조정하며 생성 파이프라인을 구성할 수 있다.
- 저용량화된 FP8 버전은 동일한 텍스트-투-이미지 파이프라인에서 더 작은 메모리 풋프린트를 요구하므로 16GB 또는 24GB GPU 환경에서도 모델을 로드하고 추론할 수 있다. 양자화 대상과 비대상을 선별해 수치 불안정을 최소화했기 때문에 출력 품질 저하가 제한적임이 README에서 보고되었다. 따라서 로컬 환경에서의 실험 빈도와 반복 생성 비용이 낮아진다.
- ComfyUI 통합을 통해 미리 정의된 워크플로우(JSON)를 불러와 즉시 샘플을 생산할 수 있으며, 기본 샘플링 설정(8 steps, CFG 1.0, er_sde, simple scheduler, 1280×720)이 제공되어 빠른 재현이 가능하다. 추가로 필요한 텍스트 인코더와 VAE 파일 위치가 명시되어 있어 관련 파일 배치만으로 전체 파이프라인을 완성할 수 있다. 이러한 구성은 비전문가도 기존 워크플로우에 모델을 손쉽게 적용하게 한다.
강점
- 모델 용량을 24.76 GiB에서 12.01 GiB로 줄여 약 51.5%의 디스크·VRAM 절감을 달성했다는 점이 가장 명확한 강점이다. 이 수치는 16GB 또는 24GB GPU 환경에서 직접 모델을 로드해 추론할 수 있게 만드는 실용적 이점을 제공한다. 용량 절감은 로컬 실험·프로토타이핑 비용을 크게 낮춘다.
- 양자화 대상과 비대상을 계층별로 명시하고 민감 레이어를 보존한 설계로 수치 안정성을 확보한 점이 기술적 강점이다. README에 따르면 266개 텐서를 FP8로 변환하고 166개 텐서는 native precision으로 유지함으로써 품질 저하와 NaN 발생 위험을 줄였다. 따라서 단순한 전 범위 양자화보다 실제 생성 품질 보존 측면에서 우위가 있다.
훈련 방식
기반 모델은 Krea 2 OSS Turbo의 BF16 가중치이며 본 배포판은 weight-only 방식으로 float8_e4m3fn 양자화를 적용해 최적화한 버전이다. 양자화 과정에서는 2차원 가중치 텐서 중 원소 수와 차원 기준을 충족하는 항목만 낮은 비트로 변환했고, 바이어스·정규화 파라미터와 민감한 투영·모듈레이션 레이어는 고정밀로 보존했다. 이 방식은 계산 프로모션 오류를 방지하고 출력 품질 손실을 최소화하면서 모델 크기를 절감하는 것을 목표로 했다.
알아두면 좋은 것
- 라이선스는 krea-2-license로 지정되어 있으며, README에 라이선스 링크가 포함되어 있다. 라이선스 조건은 모델 사용과 배포에 영향을 미치므로 상업적 활용 여부와 재배포 제한을 확인해야 한다. 구체적인 라이선스 텍스트는 제공된 링크에서 참조할 수 있다.
- 양자화는 선택적 weight-only 전략으로 구현되어 2차원 가중치 행렬만 float8_e4m3fn으로 변환했고, 바이어스·스케일·일차원 벡터 등 민감 파라미터는 고정밀로 남겨두었다. 이러한 설계는 수치적 프로모션 오류와 NaN 발생 리스크를 낮추면서 시각적 품질을 보존하는 데 목적을 두었다. README는 quantized/kept 텐서 수와 크기 절감 수치를 명시해 검증 근거를 제공한다.
- 배포 구성에서 ComfyUI(0.25.0+) 네이티브 지원이 강조되어 있어 표준 ComfyUI 워크플로우로의 통합이 매우 수월하다. 모델 파일은 safetensors 형식으로 제공되며, 함께 필요한 텍스트 인코더와 VAE 파일의 위치가 명시되어 있어 사용자가 파일만 배치하면 바로 실행할 수 있다. 이 점은 파이프라인 재현성과 사용자 편의성 측면에서 장점으로 작용한다.
- 샘플 이미지들이 다양한 스타일을 포괄하며 README 샘플 표에 3D·Anime·Beach 등 예시가 수록되어 있다. 이러한 예시는 FP8 변환에도 원본 BF16 기반 샘플과 유사한 품질을 유지한다는 주장의 근거 역할을 한다. 다만 README는 정량적 화질 평가(예: FID) 수치는 제공하지 않으므로 품질 보존 주장은 정성적 근거에 기반한다.
기술적 특징
- 선택적 weight-only 양자화 전략은 모든 파라미터를 일괄적으로 낮은 비트로 변환하는 대신, 2차원 가중치 행렬 중 element 수가 1024를 초과하고 ndim이 2 이상인 텐서만 float8_e4m3fn으로 변환했다. 이러한 필터링은 표현력 요구가 낮은 큰 행렬에서 공간을 절감하면서, 작은 벡터나 바이어스·정규화 파라미터의 정보 손실을 방지한다. 결과적으로 수치적 불안정성이나 프로모션 오류 발생 가능성을 줄이며 품질을 유지한다.
- 민감한 투영·모듈레이션 레이어(예: LastLayer.modulation.lin)와 같은 특정 파라미터는 고정밀(float32/bfloat16)로 완전히 보존했다. 이렇게 보존된 파라미터는 양자화로 인한 오차가 최종 출력에 증폭되는 시나리오를 차단하며, 연산 중 발생할 수 있는 BFloat16·Float8 프로모션 문제를 방지한다. 보존 전략은 모델 출력의 안정성 확보와 품질 유지에 직접 기여한다.
- 양자화 포맷으로 float8_e4m3fn을 사용해 2차원 텐서를 압축했으며, 그 결과 Tensor 수 기준으로 266개를 양자화하고 166개를 네이티브 정밀도로 유지했다. 이 분할적 접근은 총 모델 용량을 절반 수준으로 낮추는 효과를 냈으며 README에 구체적 용량 수치(24.76 GiB➔12.01 GiB)를 제시해 절감 효과를 정량화했다. 따라서 메모리 제약 환경에서의 실행 가능성이 크게 개선되었다.
- ComfyUI(0.25.0+) 네이티브 지원을 통해 워크플로우 파일을 캔버스에 드래그 앤 드롭하는 방식으로 즉시 통합할 수 있게 설계되었으며, 필요한 텍스트 인코더와 VAE 파일의 경로를 명시해 재현성을 높였다. 기본 샘플링 설정(8 steps, CFG 1.0, er_sde, simple scheduler, 1280×720)이 제공되어 초기 테스트와 재현이 용이하다. 이 통합성은 사용자가 별도 노드 추가 없이 표준 환경에서 모델을 시험해볼 수 있게 한다.
차별점
- 대다수의 범용 양자화 스크립트와 달리 텐서 선택 기준을 명확히 하여 2차원 대형 가중치만 FP8로 변환하고 민감 파라미터는 고정밀로 유지한 점이 차별화 요소이다. 이 방법은 품질 저하와 수치 에러를 피하면서도 용량 절감을 달성하도록 균형을 맞췄다. 결과적으로 로컬 GPU 환경에서의 사용성 개선에 초점을 맞춘 실전적 접근이 특징이다.
- 양자화 전후의 텐서 수(266 FP8, 166 native)를 공개해 어느 정도의 내부 구조가 양자화 대상인지 투명하게 보여준 점이 다른 배포판과 구별된다. 이 수치는 사용자가 실제로 어느 정도의 절감이 기대되는지 가늠하게 하며, 양자화의 범위와 한계를 명확히 한다. 투명성은 품질 검증과 문제 재현 시 유용한 근거를 제공한다.
- ComfyUI 네이티브 워크플로우를 제공하고 필요한 보조 파일 위치를 명시한 배포 방식은 실무 적용 편의성을 높인다. 사용자는 파일을 지정된 폴더에 배치하고 제공된 JSON을 불러오기만 하면 기본 설정으로 생성 테스트를 시작할 수 있다. 이러한 통합성은 실험 반복과 프로토타이핑 속도를 높이는 실용적 차별점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Model size reduction | model size | 24.76 GiB ➔ 12.01 GiB | ≈51.5% reduction |
이미지 분석




75
Likes
26.6k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.