ornith-ai/Ornith-1.5-9B-GGUF
자기개선형 reasoning과 tool calling에 맞춘 9B 코딩 에이전트 모델
학습 방식 · Ornith-1.0을 확장한 Ornith-1.5 계열로, Qwen3.5와 Gemma4 기반의 continued pretraining·mid-training·post-training 위에 task generation·scaffold construction·solution rollout 공동 최적화와 reinforcement learning을 적용했습니다.
TL;DR
Ornith-1.5-9B-GGUF는 Ornith-1.5-9B를 GGUF로 양자화한 파생 모델이며, 원본은 Qwen3.5와 Gemma4 기반 Ornith-1.0을 확장한 9B dense reasoning model입니다. 학습 중 모델이 새 과제와 scaffold, solution rollout을 생성하고 reinforcement learning으로 정책을 함께 개선해 코딩·도구 사용·에이전트 작업을 겨냥합니다. 원본 기준 SWE-bench Verified 70.6, GPQA Diamond 86.4, ClawEval 66.5를 기록했으며, 대부분 Ornith-1.0-9B와 Qwen3.5-9B보다 높지만 더 큰 Qwen3.6-35B-A3B에는 일부 항목에서 뒤처집니다. GGUF는 llama.cpp와 Ollama에서 OpenAI 호환 tool calling을 구성하기 좋고 262,144-token 컨텍스트를 지원하지만, 양자화 수준별 성능과 메모리 수치는 별도로 확인해야 합니다.
핵심 포인트
- Ornith-1.5-9B의 GGUF 양자화 배포본으로, 원본 9B dense 모델을 로컬 환경에서 실행하도록 구성했습니다. GGUF는 llama.cpp와 Ollama 같은 런타임에서 사용할 수 있어 단일 GPU나 로컬 에이전트 구축에 적합합니다. 이 저장소의 성능 수치는 양자화본이 아닌 기반 Ornith-1.5-9B의 공개 결과입니다.
- 고정된 사람이 만든 과제 대신 모델이 학습 과제와 해결 전략을 계속 생성하는 self-improvement loop를 사용했습니다. task generation, scaffold construction, solution rollout을 함께 최적화하고 reinforcement learning으로 policy를 갱신합니다. 이 방식이 코딩 과제와 도구 사용 과제를 겨냥한 차별점입니다.
- 모델은 응답 앞에 <think> … </think> 블록을 생성하는 reasoning model입니다. 최신 Transformers, vLLM 또는 SGLang의 reasoning parser가 reasoning_content와 최종 content를 분리하고 tool-call parser가 <tool_call>을 OpenAI 호환 tool_calls로 변환합니다. 따라서 일반 챗봇보다 코드 수정, 저장소 탐색, 외부 도구 연동을 포함한 agentic workflow에 맞습니다.
- 기본 컨텍스트 길이는 262,144 tokens이며 YaRN factor 4.0으로 약 1M tokens까지 확장하는 설정을 제공합니다. vLLM과 SGLang에서 rope_scaling을 정적으로 적용하므로 짧은 입력에서는 품질 저하가 생길 수 있습니다. 실제로 긴 코드베이스를 처리할 때만 요청 길이에 맞춰 확장하는 편이 권장됩니다.
제한사항
- GGUF 저장소는 양자화 형식과 로컬 실행을 제공하지만, README의 benchmark 수치는 Ornith-1.5-9B 원본 모델 기준입니다. 양자화 수준별 정확도나 속도 저하는 별도로 공개되지 않았습니다. 실제 배포에서는 선택한 GGUF 양자화 파일과 하드웨어 조합을 따로 검증해야 합니다.
- 원본 bf16 모델은 약 19GB이며 단일 80GB GPU 서빙을 기준으로 합니다. GGUF는 llama.cpp와 Ollama에서 실행할 수 있지만 README는 특정 양자화 레벨의 메모리 요구량을 제시하지 않습니다. 따라서 모바일이나 저메모리 환경에서의 실제 처리량은 저장소 정보만으로 판단하기 어렵습니다.
- reasoning 출력과 tool calling을 사용하려면 최신 런타임과 전용 parser 설정이 필요합니다. README는 Transformers 5.8.1 이상, vLLM 0.19.1 이상, SGLang 0.5.9 이상을 요구합니다. parser가 맞지 않으면 reasoning_content 분리나 OpenAI 호환 tool_calls 변환이 기대대로 동작하지 않을 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score | 46.2 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 43.1, Qwen3.5-9B 21.3, Qwen3.6-35B-A3B 52.5, Gemma-4-31B 42.1 |
| Terminal-Bench 2.1 (Claude Code) | score | 47 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 40.6, Qwen3.5-9B 18.9, Qwen3.6-35B-A3B 49.2 |
| SWE-bench Verified | score | 70.6 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 69.4, Qwen3.5-9B 53.2, Qwen3.6-35B-A3B 73.4, Gemma-4-31B 52 |
| SWE-bench Pro | score | 47.5 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 42.9, Qwen3.5-9B 31.3, Qwen3.6-35B-A3B 49.5, Gemma-4-31B 35.7 |
| SWE-bench Multilingual | score | 54.4 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 52, Qwen3.5-9B 39.7, Qwen3.6-35B-A3B 67.2, Gemma-4-31B 51.7 |
| NL2Repo | score | 32.4 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 27.2, Qwen3.5-9B 16.2, Qwen3.6-35B-A3B 29.4, Gemma-4-31B 15.5 |
| SWE Atlas - QnA | score | 20.6 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 17.9, Qwen3.5-9B 9.2, Qwen3.6-35B-A3B 15.5 |
| HLE (no tools) | score | 20.2 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 16.8, Qwen3.5-9B 14.7, Qwen3.6-35B-A3B 21.4, Gemma-4-31B 19.5 |
| HLE (with tools) | score | 30.5 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 26.4, Qwen3.5-9B 24.5, Qwen3.6-35B-A3B 28.9, Gemma-4-31B 26.5 |
| GPQA Diamond | score | 86.4 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 82.5, Qwen3.5-9B 81.7, Qwen3.6-35B-A3B 86, Gemma-4-31B 84.3 |
| MCP-Atlas | score | 54.2 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 49.4, Qwen3.5-9B 46.8, Qwen3.6-35B-A3B 62.8, Gemma-4-31B 55 |
| Toolathlon-Verified | score | 41.2 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 33.4, Qwen3.5-9B 29.6, Qwen3.6-35B-A3B 41.7, Gemma-4-31B 52.8 |
| WideSearch | score | 59.5 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 55.8, Qwen3.5-9B 53.6, Qwen3.6-35B-A3B 60.1, Gemma-4-31B 54.2 |
| BrowseComp | score | 56.4 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 44.8, Qwen3.5-9B 41.5, Qwen3.6-35B-A3B 62 |
| ClawEval | score | 66.5 | 기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 63.1, Qwen3.5-9B 53.2, Qwen3.6-35B-A3B 68.7, Gemma-4-31B 48.5 |
이미지 분석

109
Likes
54.9k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.