unsloth/Ornith-1.0-35B-GGUF
단일 GPU 배포를 목표로 한 35B급 자기개선 에이전틱 코딩 MoE 모델(llama.cpp GGUF)35Bmit
자기개선 RL로 스캐폴드까지 최적화해 397B급 모델에 근접한 성능을 내는 35B 코딩 에이전트
학습 방식 · 자기개선(self-improving) RL 프레임워크로 솔루션 롤아웃뿐 아니라 그 롤아웃을 만드는 스캐폴드까지 함께 최적화해 더 나은 탐색 경로를 학습했다.
TL;DR
Ornith-1.0-35B는 강화학습으로 솔루션 롤아웃뿐 아니라 그 롤아웃을 만드는 스캐폴드까지 함께 최적화하는 자기개선 훈련 프레임워크로 만들어진 35B급 MoE 코딩 에이전트로, 9B-Dense부터 397B-MoE까지 이어지는 Ornith 패밀리 중 단일 GPU 배포를 노린 경량 멤버다. Terminal-Bench 2.1(Terminus-2)에서 64.2점을 기록해 같은 35B급 Qwen3.6-35B(52.5)를 크게 앞서고, SWE-bench Verified 75.6%·Multilingual 69.3%로는 훨씬 큰 397B급 Qwen3.5-397B와 비슷하거나 근접한 성적을 낸다. 이 저장소는 해당 모델을 llama.cpp에서 구동하기 위한 Unsloth Dynamic 2.0 GGUF 양자화 배포판이다. MIT 라이선스로 지역 제한 없이 자유롭게 쓸 수 있다.
핵심 포인트
- 롤아웃과 그 롤아웃을 만드는 스캐폴드를 함께 강화학습으로 최적화하는 자기개선 훈련 프레임워크를 쓴다.
- 35B MoE로 Qwen3.6-35B는 물론 훨씬 큰 Qwen3.5-397B에 근접하거나 앞서는 에이전틱 코딩 성적을 낸다.
- 단일 GPU 배포를 목표로 한 Ornith 패밀리(9B~397B) 중 경량 멤버다.
- MIT 라이선스로 지역 제한 없이 쓸 수 있고, 이 저장소는 Unsloth Dynamic 2.0 GGUF 변환판이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1(Terminus-2) | score | 64.2 | Qwen3.6-35B 52.5, Qwen3.5-397B 53.5 — 기반 모델 Ornith-1.0-35B의 공개 수치, GGUF 양자화 버전 측정치 아님 |
| SWE-bench Verified | pass@1 | 75.6 | Qwen3.6-35B 73.4, Qwen3.5-397B 76.4 — 기반 모델 Ornith-1.0-35B의 공개 수치, GGUF 양자화 버전 측정치 아님 |
| SWE-bench Pro | pass@1 | 50.4 | 기반 모델 Ornith-1.0-35B의 공개 수치, GGUF 양자화 버전 측정치 아님 |
| SWE-bench Multilingual | pass@1 | 69.3 | Qwen3.5-397B와 동률 69.3 — 기반 모델 Ornith-1.0-35B의 공개 수치, GGUF 양자화 버전 측정치 아님 |
114
LIKES
110.7k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.