AlexWortega/SIQ-1-35B
35B 총용량의 MoE를 증류해 토큰당 약 3B 활성화로 경제적 추론과 강한 reasoning·agent 능력을 함께 제공하는 파인튜닝 LLM이다.
학습 방식 · Qwen/Qwen3.6-35B-A3B 기반으로 MoE 구조를 유지한 채 distillation과 SFT/RFT/DPO/offline-GRPO 기반 후처리를 거쳤고, 판정자 상위 절반으로 선택된 데이터에 대해 PPO 실험을 수행했다.
TL;DR
SIQ-1-tiny-35b는 Qwen3.6-35B-A3B를 기반으로 MoE 구조를 유지한 채 증류한 모델로, 총 35B 파라미터이지만 토큰당 약 3B만 활성화되도록 설계되어 추론 비용을 낮췄다. SFT/RFT/DPO/offline-GRPO 계열의 후처리와 판정자 기반 PPO 실험을 결합해 에이전트형 작업, 코드 작성·디버깅, 고난도 추론에서 성능을 끌어올렸다. 동일한 로컬 하드웨어(단일 A6000)와 agent 루프 조건에서 autoresearch 테스트 val_bpb 1.767을 기록했고, GPQA-Diamond(Q4, greedy)에서는 정확도 70.2%와 평균 3158 토큰/질문으로 'Pareto-best' 위치에 올랐다. BullshitBench v2에서는 평균 1.047로 Nex-N2-Pro와 유사한 pushback 특성을 보였으며, <think> 태그와 Reasoning effort 토글을 통해 내부 사고 길이와 출력 형식을 제어할 수 있다. 결과적으로 SIQ는 실사용에서 토큰 비용 대비 정확도를 개선하려는 설계이며, MoE+distillation 조합과 후처리 정책으로 대형 베이스의 표현력을 유지하면서 실효 연산 비용을 낮인 점이 핵심이다. 한편 벤치마크는 동일한 로컬 조건에서의 비교 결과로, 공식 대형 클러스터 리더보드와는 직접 비교가 제한적이다.
핵심 포인트
- 토큰당 활성화 파라미터가 약 3B인 MoE 'tiny' 형태로, 전체 35B 용량을 유지하면서 추론 비용을 낮춘 구조
- 추론 중 <think>…</think> 내부 사고 블록과 Reasoning effort 제어로 하드한 추론·에이전트 계획을 모델 내부에서 관리하는 동작 제어 지원
- GPQA-Diamond에서 정확도와 토큰 비용 모두에서 Pareto 우위를 보고하며 실용적 비용-정확도 균형을 목표로 설계됨
- 로컬 배포 친화적 포맷(GGUF Q4_K_M 등)과 구체적인 llama.cpp/sglang 실행 플래그를 README에서 제공
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA-Diamond (Q4, co-measured) | accuracy % | 70.2 | — |
| GPQA-Diamond (tok/question mean) | tokens/question | 3158 | — |
| GPQA-Diamond (bf16, full eval) | accuracy % | 90.2 | — |
| Autoresearch duel (openai/parameter-golf) | val_bpb | 1.767 | vs base Qwen3.6-35B-A3B: 1.808; GLM-5.2: 2.078; Opus 4.8 ≈ 1.76 |
| IFEval (inst-loose) | accuracy % | 89.5 | vs Nex-N2-mini: 89.1 |
| vibetest (Claude-judge, /10) | score | 9.21 | vs Nex-N2-mini: 8.12 |
| BullshitBench v2 (avg /2) | avg /2 | 1.047 | vs Nex-N2-Pro: 1.040; Opus 4.8 (ref): 1.96; GPT-5.5 (ref): 0.92 |
이미지 분석



72
LIKES
3.4k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.