empero-ai/Qwythos-9B-v2
이 모델은 주로 text-generation, chain-of-thought 스타일의 추론 생성, 코드 생성 및 멀티모달 텍스트-이미지 질의응답에 사용되도록 설계되었다. 긴 문맥을 필요로 하는 수학·추론·코드 작업에서 긴 시퀀스 생성 능력을 발휘한다. 생성 샘플링 파라미터(temperature, top_p, top_k, repetition_penalty)를 통해 탐색성·결정성 균형을 조절할 수 있다.9B1K 컨텍스트apache-2.0
FTPO로 반복 생성 루프를 제거하고 1,048,576 토큰 컨텍스트와 추론 성능을 유지한 Qwythos-9B의 개선 파인튜닝 모델이다.
학습 방식 · 기반 모델 empero-ai/Qwythos-9B-Claude-Mythos-5-1M에 FTPO(Final-Token Preference Optimization)를 적용하여 루프 시작 토큰의 선택 선호도를 재학습했고, 약 2,000개의 자동 마이닝된 preference tuple과 LoRA(r=256, α=128)를 사용해 1 epoch로 경량 미세조정했다.
TL;DR
Qwythos-9B-v2는 Empero AI가 기반 모델 empero-ai/Qwythos-9B-Claude-Mythos-5-1M에 FTPO(Final-Token Preference Optimization)를 적용해 반복 생성 루프를 표적 제거한 경량 파인튜닝 모델이다. FTPO는 루프를 시작하는 특정 토큰의 선택 선호도를 재학습하여 그 위치에서 일관된 대체를 유도함으로써 그리디 디코딩에서의 루핑률을 6.7%에서 0.0%로 낮추었고, 이 과정에서 주요 추론 벤치마크 성능은 v1 수준으로 보존되었다. 또한 MTP 헤드를 복원해 speculative-decoding 호환성을 회복했고 YaRN 기반으로 1,048,576 토큰의 장문 컨텍스트를 공식 지원하여 긴 대화와 장문 생성 워크로드에 적합하다는 점이 특징이다.
핵심 포인트
- FTPO를 통해 반복 루프를 일으키는 정확한 토큰 위치만 표적으로 삼아 루핑을 제거하면서 전체 추론 능력을 유지한 점이 핵심 차별점이다.
- 네이티브 MTP 헤드를 복원하여 speculative decoding과 멀티토큰 예측 워크플로와의 호환성을 회복한 점이 다른 파인튜닝 모델과 구별된다.
- YaRN 기반으로 1,048,576 토큰의 장문 컨텍스트를 공식 지원하여 실무적 긴 문맥 요구를 처리할 수 있다는 점이 눈에 띈다.
- 루핑률을 6.7%에서 0.0%로 낮춘 점이 명확한 실무적 강점이며, 이 개선은 greedy나 저온 샘플링 상황에서 반복 문제를 제거하여 서빙 안정성을 높인다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU (CoT) | accuracy (CoT) | 83.8% | — |
| MMLU (5-shot loglik) | accuracy (5-shot loglik) | 69.6% | — |
| ARC-Challenge | accuracy | 96.4% | — |
| GPQA-diamond | accuracy | 49.0% | — |
| GSM8K | accuracy | 93.6% | — |
| HumanEval | pass@1 | 77.4% | — |
| Looping rate (greedy) | looping rate | 0.0% | — |
| Refusal rate | refusal rate | 0.0% | — |
142
LIKES
9.5k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.