본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

AlexWortega/SIQ-1-35B

텍스트 생성(text-generation), 고난도 추론(reasoning), 자율적 연구 아이디어 생성(autoresearch), 에이전트형 도구사용 및 코드 작성·디버깅35B total (≈3B active per token)128K 컨텍스트apache-2.0

35B 총용량의 MoE를 증류해 토큰당 약 3B 활성화로 경제적 추론과 강한 reasoning·agent 능력을 함께 제공하는 파인튜닝 LLM이다.

학습 방식 · Qwen/Qwen3.6-35B-A3B 기반으로 MoE 구조를 유지한 채 distillation과 SFT/RFT/DPO/offline-GRPO 기반 후처리를 거쳤고, 판정자 상위 절반으로 선택된 데이터에 대해 PPO 실험을 수행했다.

TL;DR

SIQ-1-tiny-35b는 Qwen3.6-35B-A3B를 기반으로 MoE 구조를 유지한 채 증류한 모델로, 총 35B 파라미터이지만 토큰당 약 3B만 활성화되도록 설계되어 추론 비용을 낮췄다. SFT/RFT/DPO/offline-GRPO 계열의 후처리와 판정자 기반 PPO 실험을 결합해 에이전트형 작업, 코드 작성·디버깅, 고난도 추론에서 성능을 끌어올렸다. 동일한 로컬 하드웨어(단일 A6000)와 agent 루프 조건에서 autoresearch 테스트 val_bpb 1.767을 기록했고, GPQA-Diamond(Q4, greedy)에서는 정확도 70.2%와 평균 3158 토큰/질문으로 'Pareto-best' 위치에 올랐다. BullshitBench v2에서는 평균 1.047로 Nex-N2-Pro와 유사한 pushback 특성을 보였으며, <think> 태그와 Reasoning effort 토글을 통해 내부 사고 길이와 출력 형식을 제어할 수 있다. 결과적으로 SIQ는 실사용에서 토큰 비용 대비 정확도를 개선하려는 설계이며, MoE+distillation 조합과 후처리 정책으로 대형 베이스의 표현력을 유지하면서 실효 연산 비용을 낮인 점이 핵심이다. 한편 벤치마크는 동일한 로컬 조건에서의 비교 결과로, 공식 대형 클러스터 리더보드와는 직접 비교가 제한적이다.

핵심 포인트

  • 토큰당 활성화 파라미터가 약 3B인 MoE 'tiny' 형태로, 전체 35B 용량을 유지하면서 추론 비용을 낮춘 구조
  • 추론 중 <think>…</think> 내부 사고 블록과 Reasoning effort 제어로 하드한 추론·에이전트 계획을 모델 내부에서 관리하는 동작 제어 지원
  • GPQA-Diamond에서 정확도와 토큰 비용 모두에서 Pareto 우위를 보고하며 실용적 비용-정확도 균형을 목표로 설계됨
  • 로컬 배포 친화적 포맷(GGUF Q4_K_M 등)과 구체적인 llama.cpp/sglang 실행 플래그를 README에서 제공

벤치마크

벤치마크지표비교
GPQA-Diamond (Q4, co-measured)accuracy %70.2
GPQA-Diamond (tok/question mean)tokens/question3158
GPQA-Diamond (bf16, full eval)accuracy %90.2
Autoresearch duel (openai/parameter-golf)val_bpb1.767vs base Qwen3.6-35B-A3B: 1.808; GLM-5.2: 2.078; Opus 4.8 ≈ 1.76
IFEval (inst-loose)accuracy %89.5vs Nex-N2-mini: 89.1
vibetest (Claude-judge, /10)score9.21vs Nex-N2-mini: 8.12
BullshitBench v2 (avg /2)avg /21.047vs Nex-N2-Pro: 1.040; Opus 4.8 (ref): 1.96; GPT-5.5 (ref): 0.92

이미지 분석

Autoresearch duel 결과(실험별 val_bpb 추이). SIQ-1-tiny-35b가 최종 val_bpb 1.767을 기록하고, base Qwen3.6-35B-A3B는 1.808, GLM-5.2는 2.078로 표기되어 있다.
차트는 동일한 Pi-Agent 루프와 단일 A6000 환경에서의 실험별 val_bpb 변화를 보여준다. SIQ는 학습률 스케줄과 용량 편집을 통해 꾸준히 성능을 개선해 최종 1.767을 달성했고, 일부 경쟁 모델은 초기 개선 후 정체하거나 악화되어 목표 지표에서 뒤처졌다. 이 이미지는 README 문단의 '동일 조건 비교' 주장을 시각적으로 뒷받침하는 근거로 사용되었다.
GPQA-Diamond에서 정확도 대 토큰 비용의 Pareto 플롯으로, SIQ-1-tiny-35b(70.2%, 3158 tok/q)가 높은 정확도와 낮은 토큰 비용을 동시에 보이는 점으로 표시되어 있다.
플롯은 동일한 평가 하니스(Q4_K_M, greedy)에서 측정된 정확도와 평균 생성 토큰 수를 비교해 비용-정확도의 트레이드오프를 시각화한다. SIQ 포인트는 더 높은 정확도와 더 적은 토큰을 기록해 'Pareto-best' 위치에 놓였고, Qwen3.6-35B와 Nex-N2-mini는 더 많은 토큰으로 낮은 정확도를 보였다. 이 이미지는 README의 GPQA 수치(70.2%, 3158 tok/q)를 시각적 근거로 제공한다.
BullshitBench v2 결과의 막대 그래프로, SIQ-1-tiny-35b 평균 1.047을 기록해 Nex-N2-Pro(1.04)와 유사한 pushback 성향을 보였다.
그래프와 표는 모델의 'pushback vs. sycophancy' 성향을 요약하며 SIQ는 평균 1.047로 Nex-N2-Pro와 거의 동등한 수치를 나타낸다. README의 상세 표는 SIQ의 판정 분포(클리어 푸시백45, 파셜17, 수용38)를 함께 제시해 SIQ가 양극화된 반응 패턴을 보인다는 점을 보강한다. 이 이미지는 모델의 안전성·정렬 관련 행동 특성에 관한 정량적 근거를 제공한다.

72

LIKES

3.4k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.