AlperKTS/Krea2_FP8
Krea 2 Turbo의 FP8 weight-only 양자화 버전으로 모델 크기를 24.76 GiB에서 12.01 GiB로 줄여 16GB·24GB GPU에서 실행 가능하게 한다.
학습 방식 · 기반 모델은 Krea 2 OSS Turbo의 BF16 가중치이며 본 배포판은 weight-only 방식으로 float8_e4m3fn 양자화를 적용해 최적화한 버전이다. 양자화 과정에서는 2차원 가중치 텐서 중 원소 수와 차원 기준을 충족하는 항목만 낮은 비트로 변환했고, 바이어스·정규화 파라미터와 민감한 투영·모듈레이션 레이어는 고정밀로 보존했다. 이 방식은 계산 프로모션 오류를 방지하고 출력 품질 손실을 최소화하면서 모델 크기를 절감하는 것을 목표로 했다.
TL;DR
이 모델은 Krea 2 OSS Turbo의 BF16 가중치를 기반으로 선택적 weight-only FP8(float8_e4m3fn) 양자화를 적용해 모델 용량을 24.76 GiB에서 12.01 GiB로 줄인 배포판이다. 양자화는 2차원 가중치 행렬 중 크기 기준을 충족하는 텐서만 목표로 하며 바이어스·스케일·민감 투영 레이어는 고정밀로 보존해 수치 불안정과 품질 저하를 최소화하도록 설계되었다. 결과적으로 16GB·24GB GPU 환경에서의 로컬 실행 가능성이 높아지고 ComfyUI 워크플로우로 즉시 통합해 테스트할 수 있는 실용적 이점을 제공한다. 다만 README는 정성적 샘플과 텐서 수·용량 절감 수치를 제시할 뿐 정량적 화질 지표는 제공하지 않으므로 실제 화질 영향은 사용 환경에서 추가 검증이 필요하다.
핵심 포인트
- 대다수의 범용 양자화 스크립트와 달리 텐서 선택 기준을 명확히 하여 2차원 대형 가중치만 FP8로 변환하고 민감 파라미터는 고정밀로 유지한 점이 차별화 요소이다. 이 방법은 품질 저하와 수치 에러를 피하면서도 용량 절감을 달성하도록 균형을 맞췄다. 결과적으로 로컬 GPU 환경에서의 사용성 개선에 초점을 맞춘 실전적 접근이 특징이다.
- 양자화 전후의 텐서 수(266 FP8, 166 native)를 공개해 어느 정도의 내부 구조가 양자화 대상인지 투명하게 보여준 점이 다른 배포판과 구별된다. 이 수치는 사용자가 실제로 어느 정도의 절감이 기대되는지 가늠하게 하며, 양자화의 범위와 한계를 명확히 한다. 투명성은 품질 검증과 문제 재현 시 유용한 근거를 제공한다.
- ComfyUI 네이티브 워크플로우를 제공하고 필요한 보조 파일 위치를 명시한 배포 방식은 실무 적용 편의성을 높인다. 사용자는 파일을 지정된 폴더에 배치하고 제공된 JSON을 불러오기만 하면 기본 설정으로 생성 테스트를 시작할 수 있다. 이러한 통합성은 실험 반복과 프로토타이핑 속도를 높이는 실용적 차별점이다.
- 모델 용량을 24.76 GiB에서 12.01 GiB로 줄여 약 51.5%의 디스크·VRAM 절감을 달성했다는 점이 가장 명확한 강점이다. 이 수치는 16GB 또는 24GB GPU 환경에서 직접 모델을 로드해 추론할 수 있게 만드는 실용적 이점을 제공한다. 용량 절감은 로컬 실험·프로토타이핑 비용을 크게 낮춘다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Model size reduction | model size | 24.76 GiB ➔ 12.01 GiB | ≈51.5% reduction |
이미지 분석




75
LIKES
26.6k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.