Jackrong/Qwopus3.8-27B-Flash-GGUF
이미지와 텍스트를 함께 처리하는 멀티모달 생성, 추론, 코드 생성, Tool-use 및 Function-calling27Bapache-2.0
Qwen3.8-27B 기반 Fine-tuning 모델로 MTP 효율과 에이전트 완료 속도를 높입니다.
학습 방식 · Qwen3.8-27B에 약 150만 개 teacher-model SFT 예시 중 품질 상위 10%를 선별한 뒤, NVIDIA NeMo-RL + GSPO로 반복 샘플링과 보상 비교를 수행했습니다.
TL;DR
Qwopus3.8-27B-Flash-GGUF는 Qwen3.8-27B를 기반으로 SFT와 NeMo-RL + GSPO를 적용한 Fine-tuning 모델로, 긴 추론과 반복적인 에이전트 작업의 실행 비용을 줄이는 데 초점을 둡니다. 약 150만 개 teacher-model SFT 예시에서 품질이 높은 10%를 선별하고, 보상 기반 학습으로 유용한 추론 경로와 종료 행동을 강화합니다. Q5_K_M과 MTP 환경에서 생성 속도는 9.347 tok/s로 기반 비교 모델보다 12.8% 높고, 가중 MTP draft acceptance는 80.7%입니다. 대신 2,500문항 MMLU-Pro mixed set 정확도는 91.28%로 기반 비교 모델의 92.73%보다 낮아, 정확도 일부와 추론 효율 사이의 교환이 있습니다.
핵심 포인트
- Qwen3.8-27B에 고품질 SFT와 GSPO 기반 강화 학습을 결합해 불필요하게 길어지는 추론을 줄입니다.
- MTP draft acceptance 80.7%와 생성 속도 9.347 tok/s로 로컬 speculative decoding 효율을 높입니다.
- MMLU-Pro 정확도는 91.28%로 기반 비교 모델보다 1.45%포인트 낮아 성능 교환이 분명합니다.
- 14개 에이전트 소프트웨어 작업에서 13개를 통과했지만 단일 샘플 결과라 일반화에는 한계가 있습니다.
제한사항
- 보고된 2,500문항 MMLU-Pro mixed set 정확도가 Qwen3.8 기반 비교 모델보다 1.45%포인트 낮습니다.
- 에이전트 작업 품질과 완료 여부가 Prompt, Tool 환경, 오케스트레이션 및 피드백 루프에 좌우됩니다.
- 13/14 에이전트 작업 결과는 실패 작업만 재표본화한 단일 추출 결과이며, 광범위한 안전성 평가는 수행되지 않았습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro mixed-question accuracy | accuracy | 91.28% | Qwen3.8 base comparison: 92.73%, -1.45 pp |
| Decoder-only throughput across Math, Physics, and Chemistry | tok/s | 9.347 tok/s | Qwen3.8 base comparison: 8.284 tok/s, +12.8% |
| Weighted MTP draft acceptance | acceptance rate | 80.7% | Qwen3.8 base comparison: 66.1%, +14.6 pp |
| Aggregate raw_output characters across three subjects | characters | 7,949,546 | Qwen3.8 base comparison: 8,824,213, -9.9% |
| Agentic software-engineering battery, strict one-run result | passed tasks | 13 / 14 (93%) | 26.0 min on one RTX 5090; single-sample result |
이미지 분석



71
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.