logic65/Qwen3.8-Whittle-MoE-27B-A17.8B
Qwen3.8-27B를 사후 분할한 17.8B 활성 MoE로 router를 재학습해 반복 출력을 줄인 연구 프리뷰입니다.
학습 방식 · Qwen3.8-27B를 사후 분할한 post hoc MoE에 router distillation, router-only healing, multi-turn SFT, 완성 답변 증류를 적용했으며 ultrachat_200k, tulu-3-sft-mixture, CodeFeedback-Filtered-Instruction과 자체 corpus를 사용했습니다.
TL;DR
이 모델은 Qwen3.8-27B의 Attention 구조를 유지하고 17408 폭의 dense FFN을 64개 routed expert와 하나의 shared expert로 사후 분할한 post hoc MoE입니다. 각 토큰은 64개 중 16개 expert만 실행해 27B 전체에서 17.8B 파라미터를 활성화하며, 동결된 expert 대신 router를 먼저 학습해 지식 배터리를 4/39에서 27/39로 회복했습니다. 이후 multi-turn SFT와 완성 답변 증류로 반복 생성과 조기 종료를 줄였고, 권장 v2.1은 single-turn loop rate 8%, multi-turn 7%, 구조화 출력 loop rate 22%를 기록했습니다. Q4_K_M GGUF는 llama.cpp에서 실행되며 양자화 시 24GB VRAM 또는 12GB GPU 두 장으로 구동할 수 있지만, 구조화 출력과 산술 작업에는 여전히 한계가 있습니다.
핵심 포인트
- Qwen3.8-27B의 64개 층에서 Attention은 유지하고 FFN만 64개 routed expert와 shared expert로 분할했습니다.
- 각 토큰마다 64개 expert 중 16개만 선택해 총 27B 중 17.8B 파라미터를 활성화합니다.
- 전체 expert를 동결한 채 router만 학습해 지식 손실을 4/39에서 27/39로 회복했습니다.
- v2.1은 완성 답변 증류와 SFT를 거쳐 반복 생성과 조기 종료 문제를 크게 낮췄습니다.
제한사항
- SQL·HTML·Markdown 표 같은 구조화 출력에서 반복 생성 비율이 v2.1에도 22%입니다. 이는 이전 릴리스의 약 75%보다 낮지만, 구조화 결과를 안정적으로 보장하기에는 부족합니다. 다음 학습 라운드의 주요 개선 대상으로 남아 있습니다.
- MoE 압축에서 물려받은 token-level 불안정성 때문에 가끔 조어와 손상된 숫자가 출력됩니다. 지식 배터리는 28/39로 유지됐지만 이집트의 수도 회귀와 세 가지 사실 회복이 함께 관측됐습니다. 한 사람이 소규모 harness에서 측정했으므로 수치는 정식 benchmark가 아닌 작업실 측정값입니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| single turn loop rate | loop rate | 8% | 이전 릴리스 69%, v2 11%; 동일한 12개 프롬프트와 3개 seed 기준 |
| multi turn loop rate | loop rate | 7% | 이전 릴리스 64%; 2개 대화와 2개 seed의 모든 turn 기준 |
| late turn loop rate | loop rate | 8% | 이전 릴리스 56%, v2 17%; 5번째 turn 이후 기준 |
| structured output loop rate | loop rate | 22% | 이전 릴리스 약 75%, v2 39%; SQL·HTML·table 생성 기준 |
| median answer length | median answer length | 388 words | 이전 릴리스 268 words, v2 386 words |
| silent or truncated answers | count | 0 | v2와 v2.1에서 0; 이전 릴리스는 측정하지 않음 |
| knowledge battery | correct answers | 28/39 | 이전 릴리스 28/39, v2 27/39 |
85
LIKES
13.8k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.