ornith-ai/Ornith-1.5-35B-A3B-GGUF
35B MoE에서 3B만 활성화하며 코드·도구 사용·추론을 수행하는 GGUF 모델
학습 방식 · Ornith-1.0의 Qwen3.5·Gemma4 기반 continued pretraining, mid-training, post-training을 확장해 과제 생성·scaffold 구성·solution rollout을 함께 개선하는 reinforcement learning 기반 self-improvement loop를 적용했다.
TL;DR
Ornith-1.5-35B-A3B-GGUF는 Ornith-1.5-35B-A3B를 GGUF 형식으로 제공하는 양자화 배포본이며, 원본은 Qwen3.5와 Gemma4 계열에서 출발한 35B Mixture-of-Experts reasoning 모델이다. 토큰마다 약 3B 파라미터만 활성화하면서 <think> 추론 블록과 tool calling을 사용해 코드 수정, 검색, MCP 연동 같은 agent 작업을 처리한다. 과제 생성·scaffold 구성·solution rollout을 reinforcement learning으로 함께 최적화한 결과 원본 모델 기준 SWE-bench Verified 79, Terminal-Bench 2.1 68.5, GPQA Diamond 89.2를 기록했다. GGUF는 llama.cpp와 Ollama에서 로컬로 구동하기 좋지만, README에는 이 변환본의 quantization 수준과 독립 성능 측정값이 없다.
핵심 포인트
- 전체 35B 중 토큰마다 약 3B만 활성화하는 Mixture-of-Experts 구조로 추론 비용을 낮춘다.
- 고정된 사람이 만든 과제 대신 과제 생성과 scaffold 구성, solution rollout을 함께 최적화한다.
- <think> 블록과 reasoning_content를 분리하고 <tool_call>을 OpenAI 호환 tool_calls로 변환한다.
- 262,144토큰 컨텍스트와 YaRN 확장을 지원해 대규모 코드베이스와 장시간 agent 작업에 맞춘다.
제한사항
- GGUF 변환의 구체적인 quantization 수준과 이에 따른 품질·메모리 수치는 README에 명시되지 않았다.
- 원본 모델을 bf16으로 서비스하려면 약 70GB가 필요하고 256K 컨텍스트 여유를 위해 80GB GPU 2장이 권장된다.
- YaRN은 모든 요청에 같은 scaling factor를 정적으로 적용하므로 일반 길이 입력에서 품질이 약간 낮아질 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score | 67.8 | Ornith-1.0-35B-A3B 64.2, Qwen3.6-35B-A3B 52.5, Gemma-4-31B 42.1, Muse-Glimmer-30B 51.7, Qwen3.5-397B 53.5. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| Terminal-Bench 2.1 (Claude Code) | score | 68.5 | Ornith-1.0-35B-A3B 62.8, Qwen3.6-35B-A3B 49.2, Qwen3.5-397B 48.6. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| SWE-bench Verified | score | 79 | Ornith-1.0-35B-A3B 75.6, Qwen3.6-35B-A3B 73.4, Gemma-4-31B 52, Muse-Glimmer-30B 76, Qwen3.5-397B 76.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| SWE-bench Pro | score | 59.6 | Ornith-1.0-35B-A3B 50.4, Qwen3.6-35B-A3B 49.5, Gemma-4-31B 35.7, Muse-Glimmer-30B 51.2, Qwen3.5-397B 51.6. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| SWE-bench Multilingual | score | 71.4 | Ornith-1.0-35B-A3B 69.3, Qwen3.6-35B-A3B 67.2, Gemma-4-31B 51.7, Qwen3.5-397B 69.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| DeepSWE | score | 22 | Ornith-1.0-35B-A3B 0, Qwen3.6-35B-A3B 0, Qwen3.5-397B 1. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| Frontier-Bench v0.1 | score | 5.1 | Ornith-1.0-35B-A3B 1.4, Qwen3.6-35B-A3B 1.4, Qwen3.5-397B 1.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| NL2Repo | score | 46.2 | Ornith-1.0-35B-A3B 34.6, Qwen3.6-35B-A3B 29.4, Gemma-4-31B 15.5, Qwen3.5-397B 36.8. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| SWE Atlas - QnA | score | 39.8 | Ornith-1.0-35B-A3B 37.1, Qwen3.6-35B-A3B 15.5, Qwen3.5-397B 20.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| HLE (no tools) | score | 25.6 | Ornith-1.0-35B-A3B 20.8, Qwen3.6-35B-A3B 21.4, Gemma-4-31B 19.5, Muse-Glimmer-30B 22, Qwen3.5-397B 28.7. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| HLE (with tools) | score | 33.4 | Ornith-1.0-35B-A3B 30.1, Qwen3.6-35B-A3B 28.9, Gemma-4-31B 26.5, Qwen3.5-397B 48.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| GPQA Diamond | score | 89.2 | Ornith-1.0-35B-A3B 86.2, Qwen3.6-35B-A3B 86, Gemma-4-31B 84.3, Muse-Glimmer-30B 83.5, Qwen3.5-397B 88.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| MCP-Atlas | score | 70.2 | Ornith-1.0-35B-A3B 64.4, Qwen3.6-35B-A3B 62.8, Gemma-4-31B 55, Muse-Glimmer-30B 75.5, Qwen3.5-397B 72.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| Toolathlon-Verified | score | 48.7 | Ornith-1.0-35B-A3B 42.4, Qwen3.6-35B-A3B 41.7, Gemma-4-31B 40.8, Qwen3.5-397B 38.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| WideSearch | score | 67.8 | Ornith-1.0-35B-A3B 63.4, Qwen3.6-35B-A3B 60.1, Gemma-4-31B 54.2, Qwen3.5-397B 74. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| BrowseComp | score | 67.6 | Ornith-1.0-35B-A3B 63.5, Qwen3.6-35B-A3B 62, Qwen3.5-397B 78.6. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
| ClawEval | score | 72.5 | Ornith-1.0-35B-A3B 69.8, Qwen3.6-35B-A3B 68.7, Gemma-4-31B 48.5, Qwen3.5-397B 70.7. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다. |
이미지 분석

159
Likes
53.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.