Qwythos 9B v2 GGUF, 1M 토큰 컨텍스트와 루핑 제거된 멀티모달 빌드
Qwythos-9B-v2-GGUF는 FTPO로 반복 루프를 제거하고 MTP를 복원한 양자화된 Qwythos 9B v2로서 GGUF 포맷으로 배포되어 llama.cpp 계열 런타임에서 멀티모달·장문 추론을 지원한다. 이 문장은 모델의 핵심 개선점과 배포 포맷을 간결하게 요약한다. 모델은 1,048,576 토큰의 YaRN rope-scaling을 통해 대용량 컨텍스트를 지원한다.
TL;DR
Qwythos-9B-v2-GGUF는 Empero AI의 Qwythos 9B v2를 GGUF 양자화 아티팩트로 배포한 모델로서 FTPO(Final-Token Preference Optimization)를 통해 그리디 및 저온도 디코딩에서 발생하던 반복 루프를 제거하고 MTP 헤드를 복원해 speculative decoding을 지원한다. 하이브리드 아키텍처는 Gated-DeltaNet(SSM) 블록과 전체 어텐션 블록을 혼합하며 SSM 관련 텐서는 변환 시 더 높은 정밀도로 보존해 양자화로 인한 성능 저하를 줄인다. 비전 입력 처리는 Qwen3.5 기반의 BF16 mmproj를 별도 제공해 멀티모달 파이프라인을 구성하지만 비전 타워는 본 릴리스에서 미세조정되지 않았고 세부 평가는 베이스 모델 카드를 참조해야 한다. 최종적으로 이 패키지는 다양한 K-quant 옵션과 MTP 변형, 1,048,576 토큰의 장문 컨텍스트 지원을 통해 런타임 제약에 따른 품질·용량 선택지를 제공한다.
핵심 역량
- 장문 컨텍스트(최대 1,048,576 토큰)를 포함한 복잡한 추론과 긴 대화 문맥을 처리할 수 있다.
- 이미지 입력을 텍스트 설명으로 변환하는 멀티모달 파이프라인을 mmproj 비전 프로젝터와 연계해 지원한다.
- Greedy 또는 저온도 샘플링에서도 반복 루프 없이 결정적 출력을 생성할 수 있으며 함수 호출 및 대화형 응답 포맷을 제공한다.
- 여러 양자화 옵션(Q4_K_M, Q5_K_M, Q6_K, Q8_0 등)으로 파일 크기와 품질 사이의 트레이드를 선택할 수 있다.
강점
- Greedy 및 저온도 샘플링에서 루핑이 제거되어 결정론적 디코딩이 실용적으로 가능해졌고 이로 인해 기존에 필요하던 repeat-penalty 의존을 줄일 수 있다.
- YaRN rope-scaling으로 1,048,576 토큰의 장문 컨텍스트를 지원해 긴 대화나 문서 단위의 추론 작업에서 유연성을 제공한다.
- 다양한 K-quant 옵션과 MTP-enabled 변형, 그리고 BF16 mmproj를 함께 제공해 사용자가 런타임·품질·기능 요구에 맞춰 조합할 수 있다.
훈련 방식
기반 모델은 empero-ai/Qwythos-9B-v2이며 v2 패치는 FTPO(Final-Token Preference Optimization)를 적용한 미세조정으로 반복 루프를 표적으로 제한해 교정했다. 비전 프로젝터는 Qwen3.5-9B에서 상속되어 동결된 상태로 유지되었으며 이미지 관련 파인튜닝은 이루어지지 않았다. 양자화와 GGUF 변환은 llama.cpp 도구(convert_hf_to_gguf.py 등)를 사용해 수행되었고 구조적 검증 및 스모크 테스트가 병행되었다.
알아두면 좋은 것
- 반복 루프 제거는 FTPO(Final-Token Preference Optimization)를 적용해 시작 토큰 위치의 분포만 조정함으로써 달성되었고 문서상 반복률이 6.7%에서 0%로 감소했다고 표기되어 있다.
- 모델은 하이브리드 구조로 Gated-DeltaNet(SSM) 블록과 전체 어텐션 블록을 3:1 비율로 섞어 사용하며 SSM 관련 텐서는 변환시 더 높은 정밀도로 보존된다.
- MTP-enabled 파일은 MTP 행렬을 Q8_0로 유지해 speculative decoding 초안 생성 기능을 복원했고 해당 기능은 최신 llama.cpp 빌드에서 활성화된다.
- 이미지 입력 처리를 위해 BF16 정밀도의 mmproj 파일이 별도로 제공되며 비전 타워는 Qwen3.5-9B에서 상속되어 본 릴리스에서는 파인튜닝되지 않았다.
기술적 특징
- FTPO는 반복을 유발하는 정확한 시작 토큰을 식별한 뒤 그 위치에서만 출력 분포를 재조정하도록 미세조정하는 기법이다. 이 방식은 전체 분포를 건드리지 않으므로 모델의 지식과 체인오브쏘트 능력은 보존되며, 문서상 반복률이 6.7%에서 0%로 감소한 근거가 제시되어 있다. 따라서 출력 일관성 향상과 추론 품질 보존을 동시에 달성하는 효과가 관찰된다.
- 하이브리드 아키텍처는 Gated-DeltaNet(SSM) 기반 선형 어텐션 블록을 전체 어텐션 블록과 3:1 비율로 혼합하여 사용한다. SSM 관련 상태 텐서들은 양자화에 민감하므로 변환 과정에서 일부 텐서를 Q8_0나 F32로 유지해 정밀도를 보존함으로써 선형 블록의 성능 저하를 최소화했다. 이 설계는 모델의 효율성과 긴 컨텍스트 처리 능력 사이의 균형을 맞추기 위한 의도적 선택이다.
- 양자화 전략은 블록별 혼합 정밀도를 적용하는 하이브리드-정밀도 접근을 채택했다. Q4_K_M 같은 저비트 옵션은 파일 크기를 크게 줄이되 SSM 핵심 텐서를 더 높은 비트로 유지해 정확도 손실을 보완했고, Q8_0와 BF16은 품질 우선 옵션으로 제공되어 사용자가 런타임 제약에 맞춰 선택할 수 있다. 변환 과정은 llama.cpp 도구와 스크립트를 통해 수행되었고 구조 검증 및 해시 검증으로 무결성이 확인되었다.
- MTP 복원은 Qwen3.5 호환 MTP 행렬을 포함한 `-MTP-` 변형 파일을 통해 speculative decoding 초안 생성을 가능하게 했다. MTP 관련 행렬들은 양자화 변형에서도 Q8_0로 고정되어 초안 품질을 유지하며, 이는 최신 llama.cpp 빌드에서 `--spec-type draft-mtp` 옵션으로 활성화된다. 이로써 추측형 디코딩 워크플로우에서 응답 속도와 초안 품질을 동시에 개선할 수 있다.
차별점
- FTPO로 특정 토큰 위치만 보정해 반복 문제를 제거하면서도 기존의 추론 성능을 유지했다.
- 하이브리드 SSM/어텐션 구조를 유지하면서 SSM 관련 텐서를 고정밀도로 보존하는 혼합 정밀도 양자화를 적용했다.
- MTP 헤드를 복원해 Qwen3.5 호환 speculative decoding 워크플로우를 지원하도록 패키징했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| repetition-rate-greedy-lowtemp | 반복 발생률(그리디/저온도 디코딩) | 6.7% → 0% | — |
213
Likes
295.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.