empero-ai/Qwythos-9B-v2-GGUF
Qwythos-9B-v2-GGUF는 FTPO로 반복 루프를 제거하고 MTP를 복원한 양자화된 Qwythos 9B v2로서 GGUF 포맷으로 배포되어 llama.cpp 계열 런타임에서 멀티모달·장문 추론을 지원한다. 이 문장은 모델의 핵심 개선점과 배포 포맷을 간결하게 요약한다. 모델은 1,048,576 토큰의 YaRN rope-scaling을 통해 대용량 컨텍스트를 지원한다.
학습 방식 · 기반 모델은 empero-ai/Qwythos-9B-v2이며 v2 패치는 FTPO(Final-Token Preference Optimization)를 적용한 미세조정으로 반복 루프를 표적으로 제한해 교정했다. 비전 프로젝터는 Qwen3.5-9B에서 상속되어 동결된 상태로 유지되었으며 이미지 관련 파인튜닝은 이루어지지 않았다. 양자화와 GGUF 변환은 llama.cpp 도구(convert_hf_to_gguf.py 등)를 사용해 수행되었고 구조적 검증 및 스모크 테스트가 병행되었다.
TL;DR
Qwythos-9B-v2-GGUF는 Empero AI의 Qwythos 9B v2를 GGUF 양자화 아티팩트로 배포한 모델로서 FTPO(Final-Token Preference Optimization)를 통해 그리디 및 저온도 디코딩에서 발생하던 반복 루프를 제거하고 MTP 헤드를 복원해 speculative decoding을 지원한다. 하이브리드 아키텍처는 Gated-DeltaNet(SSM) 블록과 전체 어텐션 블록을 혼합하며 SSM 관련 텐서는 변환 시 더 높은 정밀도로 보존해 양자화로 인한 성능 저하를 줄인다. 비전 입력 처리는 Qwen3.5 기반의 BF16 mmproj를 별도 제공해 멀티모달 파이프라인을 구성하지만 비전 타워는 본 릴리스에서 미세조정되지 않았고 세부 평가는 베이스 모델 카드를 참조해야 한다. 최종적으로 이 패키지는 다양한 K-quant 옵션과 MTP 변형, 1,048,576 토큰의 장문 컨텍스트 지원을 통해 런타임 제약에 따른 품질·용량 선택지를 제공한다.
핵심 포인트
- FTPO로 특정 토큰 위치만 보정해 반복 문제를 제거하면서도 기존의 추론 성능을 유지했다.
- 하이브리드 SSM/어텐션 구조를 유지하면서 SSM 관련 텐서를 고정밀도로 보존하는 혼합 정밀도 양자화를 적용했다.
- MTP 헤드를 복원해 Qwen3.5 호환 speculative decoding 워크플로우를 지원하도록 패키징했다.
- Greedy 및 저온도 샘플링에서 루핑이 제거되어 결정론적 디코딩이 실용적으로 가능해졌고 이로 인해 기존에 필요하던 repeat-penalty 의존을 줄일 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| repetition-rate-greedy-lowtemp | 반복 발생률(그리디/저온도 디코딩) | 6.7% → 0% | — |
213
LIKES
295.3k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.