본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

empero-ai/Qwythos-9B-v2-GGUF

이미지-텍스트-투-텍스트 멀티모달 질의응답과 복합 추론을 수행하는 태스크에 최적화되어 있다. 본 모델은 텍스트 기반의 체인오브쏘트(reasoning) 출력을 유지하면서 이미지 입력을 처리하기 위해 Qwen3.5 계열의 비전 프로젝터를 함께 사용하도록 설계되었다. 또한 함수 호출 패턴과 긴 대화 히스토리를 요구하는 애플리케이션을 염두에 둔 대규모 컨텍스트 처리를 지원한다.9B1K 컨텍스트apache-2.0

Qwythos-9B-v2-GGUF는 FTPO로 반복 루프를 제거하고 MTP를 복원한 양자화된 Qwythos 9B v2로서 GGUF 포맷으로 배포되어 llama.cpp 계열 런타임에서 멀티모달·장문 추론을 지원한다. 이 문장은 모델의 핵심 개선점과 배포 포맷을 간결하게 요약한다. 모델은 1,048,576 토큰의 YaRN rope-scaling을 통해 대용량 컨텍스트를 지원한다.

학습 방식 · 기반 모델은 empero-ai/Qwythos-9B-v2이며 v2 패치는 FTPO(Final-Token Preference Optimization)를 적용한 미세조정으로 반복 루프를 표적으로 제한해 교정했다. 비전 프로젝터는 Qwen3.5-9B에서 상속되어 동결된 상태로 유지되었으며 이미지 관련 파인튜닝은 이루어지지 않았다. 양자화와 GGUF 변환은 llama.cpp 도구(convert_hf_to_gguf.py 등)를 사용해 수행되었고 구조적 검증 및 스모크 테스트가 병행되었다.

TL;DR

Qwythos-9B-v2-GGUF는 Empero AI의 Qwythos 9B v2를 GGUF 양자화 아티팩트로 배포한 모델로서 FTPO(Final-Token Preference Optimization)를 통해 그리디 및 저온도 디코딩에서 발생하던 반복 루프를 제거하고 MTP 헤드를 복원해 speculative decoding을 지원한다. 하이브리드 아키텍처는 Gated-DeltaNet(SSM) 블록과 전체 어텐션 블록을 혼합하며 SSM 관련 텐서는 변환 시 더 높은 정밀도로 보존해 양자화로 인한 성능 저하를 줄인다. 비전 입력 처리는 Qwen3.5 기반의 BF16 mmproj를 별도 제공해 멀티모달 파이프라인을 구성하지만 비전 타워는 본 릴리스에서 미세조정되지 않았고 세부 평가는 베이스 모델 카드를 참조해야 한다. 최종적으로 이 패키지는 다양한 K-quant 옵션과 MTP 변형, 1,048,576 토큰의 장문 컨텍스트 지원을 통해 런타임 제약에 따른 품질·용량 선택지를 제공한다.

핵심 포인트

  • FTPO로 특정 토큰 위치만 보정해 반복 문제를 제거하면서도 기존의 추론 성능을 유지했다.
  • 하이브리드 SSM/어텐션 구조를 유지하면서 SSM 관련 텐서를 고정밀도로 보존하는 혼합 정밀도 양자화를 적용했다.
  • MTP 헤드를 복원해 Qwen3.5 호환 speculative decoding 워크플로우를 지원하도록 패키징했다.
  • Greedy 및 저온도 샘플링에서 루핑이 제거되어 결정론적 디코딩이 실용적으로 가능해졌고 이로 인해 기존에 필요하던 repeat-penalty 의존을 줄일 수 있다.

벤치마크

벤치마크지표비교
repetition-rate-greedy-lowtemp반복 발생률(그리디/저온도 디코딩)6.7% → 0%

213

LIKES

295.3k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.