루핑 0% 달성과 1M 토큰 추론 컨텍스트를 보존한 Qwythos-9B v2
이 모델은 주로 text-generation, chain-of-thought 스타일의 추론 생성, 코드 생성 및 멀티모달 텍스트-이미지 질의응답에 사용되도록 설계되었다. 긴 문맥을 필요로 하는 수학·추론·코드 작업에서 긴 시퀀스 생성 능력을 발휘한다. 생성 샘플링 파라미터(temperature, top_p, top_k, repetition_penalty)를 통해 탐색성·결정성 균형을 조절할 수 있다.9B1K 컨텍스트apache-2.0
FTPO로 반복 생성 루프를 제거하고 1,048,576 토큰 컨텍스트와 추론 성능을 유지한 Qwythos-9B의 개선 파인튜닝 모델이다.
TL;DR
Qwythos-9B-v2는 Empero AI가 기반 모델 empero-ai/Qwythos-9B-Claude-Mythos-5-1M에 FTPO(Final-Token Preference Optimization)를 적용해 반복 생성 루프를 표적 제거한 경량 파인튜닝 모델이다. FTPO는 루프를 시작하는 특정 토큰의 선택 선호도를 재학습하여 그 위치에서 일관된 대체를 유도함으로써 그리디 디코딩에서의 루핑률을 6.7%에서 0.0%로 낮추었고, 이 과정에서 주요 추론 벤치마크 성능은 v1 수준으로 보존되었다. 또한 MTP 헤드를 복원해 speculative-decoding 호환성을 회복했고 YaRN 기반으로 1,048,576 토큰의 장문 컨텍스트를 공식 지원하여 긴 대화와 장문 생성 워크로드에 적합하다는 점이 특징이다.
핵심 역량
- 장문 문맥 처리가 가능하며 1,048,576 토큰(YaRN)을 지원하므로 긴 문서·대화·분석을 한 번의 생성 세션에서 유지할 수 있다. 이 확장은 RoPE 스케일링을 통해 구현되며 짧은 컨텍스트에서의 소폭 트레이드오프를 수반한다. 사용자는 실제 길이에 맞춰 스케일 팩터를 조정할 수 있다.
- 추론 중심의 chain-of-thought 생성에서 높은 성능을 유지하며 MMLU·GSM8K·ARC 등에서 v1 수준의 점수를 보존한다. Greedy 또는 저온 샘플링에서도 루핑이 제거되어 반복 억제 매개변수(repetition_penalty)에 의존도가 크게 낮아졌다. 이는 수학·논리·코드 문제 해결 시 일관된 긴 추론을 가능하게 한다.
- 코드 생성에서 실용적인 솔루션을 제공하며 HumanEval pass@1 수치가 README에 명시되어 있어 코드 생성 품질을 정량적으로 평가할 수 있다. 예시로 longest_palindrome 구현이 포함되어 있어 알고리즘적 접근과 시간복잡도 설명까지 제공한다. 생성 설정에서 max_new_tokens를 크게 열어두면 더 긴 중간 추론을 허용할 수 있다.
- 멀티토큰 예측(MTP) 헤드가 복원되어 speculative decoding 및 병렬 생성 트릭과의 호환성이 개선되었다. MTP는 가중치와 구성의 일치가 중요하며 Qwythos-9B-v2에서는 해당 일관성이 복구되어 speculative-decoding 설정이 작동한다. 다만 MTP는 base에서 복원된 것이며 FTPO 과정에서 새로 공동 학습되지는 않았다.
강점
- 루핑률을 6.7%에서 0.0%로 낮춘 점이 명확한 실무적 강점이며, 이 개선은 greedy나 저온 샘플링 상황에서 반복 문제를 제거하여 서빙 안정성을 높인다.
- 장문 컨텍스트(1,048,576 토큰) 지원으로 긴 문서·대화·분석을 단일 세션에서 처리할 수 있으며 YaRN 기반 RoPE 스케일링으로 구현되어 있다.
- MTP 헤드 복원으로 speculative-decoding 및 멀티토큰 예측 워크플로와의 일관성이 확보되었고, FTPO가 모델의 핵심 추론 능력을 유지하면서 특정 문제만을 표적 수정한 점이 실용적 이점이다.
훈련 방식
기반 모델 empero-ai/Qwythos-9B-Claude-Mythos-5-1M에 FTPO(Final-Token Preference Optimization)를 적용하여 루프 시작 토큰의 선택 선호도를 재학습했고, 약 2,000개의 자동 마이닝된 preference tuple과 LoRA(r=256, α=128)를 사용해 1 epoch로 경량 미세조정했다.
알아두면 좋은 것
- 루핑률(그리디 기준)이 6.7%에서 0.0%로 개선되었고 이 개선은 FTPO로 특정 루프 시작 토큰의 선호도를 재학습하여 달성되었다. 이 조치는 모델의 나머지 분포와 추론 능력을 해치지 않도록 설계된 '가벼운' 수정이었다.
- 모델은 네이티브 멀티토큰 예측(MTP) 헤드를 원래대로 복원하여 설정과 가중치의 불일치를 해소했고, 그 결과 speculative-decoding 관련 워크플로와의 호환성이 향상되었다.
- 학습 데이터로는 낮은 온도에서 루프를 유도하여 추출한 약 2,000개의 preference tuple을 사용했고 LoRA(r=256, α=128)를 적용한 1 epoch의 경량 파인튜닝을 통해 과도한 재학습 없이 문제를 제거했다.
- 라이선스는 Apache-2.0이며 모델은 멀티모달 아키텍처 기반이지만 공개된 스택에서는 텍스트 중심으로 동작하도록 권장되며 vLLM과의 호환성이 명시되어 있다.
기술적 특징
- 아키텍처는 Qwen3.5-9B 하이브리드 구조를 채택하여 선형적 Gated-DeltaNet attention과 풀 attention을 3:1 비율로 혼합함으로써 연산 효율과 표현력을 조화시켰다. 이 혼합 구조는 긴 문맥에서 계산 비용을 낮추면서도 중요한 구간에서는 완전한 attention을 유지해 성능 저하를 방지한다. README는 이 구성으로 멀티모달 역량과 대규모 컨텍스트 처리를 동시에 지원한다고 명시했다.
- FTPO는 반복 루프를 시작하는 정확한 토큰을 찾아 그 위치에서 모델이 일관된 대체 토큰을 선호하도록 미세조정하는 방식으로 작동한다. 이 접근은 전체 확률 분포를 건드리지 않고 특정 위치의 결정만 바꾸기 때문에 지식·추론 성능의 보존이 가능했다. 실제로 FTPO 적용 후 주요 벤치마크의 성능은 v1 수준으로 유지되었다고 보고되었다.
- MTP 헤드가 weights와 config에서 불일치하던 문제를 해결하고 원래의 multi-token prediction 기능을 복원함으로써 speculative-decoding과 같은 병렬 생성 전략이 복원되었다. MTP는 한 번에 여러 토큰의 조건부 예측을 허용하여 speculative 기법의 수용도를 높인다. README는 MTP가 base에서 복원되었고 FTPO는 MTP를 건드리지 않았음을 명시했다.
- 장문 컨텍스트는 YaRN RoPE 스케일링으로 구현되어 262,144 토큰의 네 배인 1,048,576 토큰을 지원하며, 이 확장은 긴 대화·문서 분석에 유리하지만 짧은 컨텍스트에서 소폭의 성능 트레이드오프가 발생할 수 있다. README는 실제 사용 시 스케일 팩터를 조정하라고 권고했다.
- 파인튜닝은 LoRA 기법을 활용하여 전체 가중치 대신 저순위 보정 행렬을 학습하는 방식으로 수행되었고, 구체적으로 r=256, α=128, lr=1.5e-5, 1 epoch, early-stopping 기준 chosen_win ≥ 0.30을 적용하여 과도한 업데이트를 방지했다. 이 설정은 '가벼운 터치'로 루핑 문제만 표적화하는 목표에 맞춰진 하이퍼파라미터 선택이다.
차별점
- FTPO를 통해 반복 루프를 일으키는 정확한 토큰 위치만 표적으로 삼아 루핑을 제거하면서 전체 추론 능력을 유지한 점이 핵심 차별점이다.
- 네이티브 MTP 헤드를 복원하여 speculative decoding과 멀티토큰 예측 워크플로와의 호환성을 회복한 점이 다른 파인튜닝 모델과 구별된다.
- YaRN 기반으로 1,048,576 토큰의 장문 컨텍스트를 공식 지원하여 실무적 긴 문맥 요구를 처리할 수 있다는 점이 눈에 띈다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU (CoT) | accuracy (CoT) | 83.8% | — |
| MMLU (5-shot loglik) | accuracy (5-shot loglik) | 69.6% | — |
| ARC-Challenge | accuracy | 96.4% | — |
| GPQA-diamond | accuracy | 49.0% | — |
| GSM8K | accuracy | 93.6% | — |
| HumanEval | pass@1 | 77.4% | — |
| Looping rate (greedy) | looping rate | 0.0% | — |
| Refusal rate | refusal rate | 0.0% | — |
142
Likes
9.5k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.