ornith-ai/Ornith-1.5-9B
새 태스크와 해결 전략을 스스로 생성하는 9B reasoning model
학습 방식 · Qwen3.5와 Gemma4를 기반으로 추가 continued pretraining, mid-training, post-training을 거친 Ornith-1.0을 확장하고, task generation·scaffold construction·solution rollout을 공동 최적화하는 reinforcement learning 기반 self-improvement loop를 적용했다.
TL;DR
Ornith-1.5-9B는 Qwen3.5와 Gemma4 기반의 Ornith-1.0을 확장한 9B dense reasoning model이다. 고정된 사람이 만든 태스크와 harness 대신 모델이 새 태스크를 생성하고, scaffold와 solution rollout 전략을 찾은 뒤 reinforcement learning으로 정책을 갱신하는 self-improvement loop를 사용한다. 기본적으로 <think> 추론 블록을 생성하며, tool call은 OpenAI 호환 tool_calls로 파싱할 수 있어 터미널 코딩 에이전트와 검색·도구 사용 작업에 적합하다. SWE-bench Verified 70.6, GPQA Diamond 86.4, ClawEval 66.5를 기록했으며, 대부분의 평가에서 Ornith-1.0-9B와 Qwen3.5-9B를 앞섰지만 일부 항목에서는 Qwen3.6-35B-A3B와 Gemma-4-31B가 더 높다.
핵심 포인트
- Ornith-1.5-9B는 Ornith-1.0을 확장한 9B dense reasoning model로, 고정된 사람 선별 태스크 대신 새 태스크와 해결 전략을 계속 생성하며 학습한다. Qwen3.5와 Gemma4를 기반으로 추가 학습한 Ornith-1.0에서 출발해 task generation, scaffold construction, solution rollout을 함께 최적화한다. 단일 GPU 환경에서 코딩 에이전트를 운영하려는 경우에 맞는 구조다.
- 모델은 기본 응답 앞에 <think> … </think> 블록을 생성하고, 최신 serving runtime이 이를 reasoning_content로 분리한다. <tool_call> 블록은 qwen3_xml 또는 qwen3_coder parser를 거쳐 OpenAI 호환 tool_calls 필드로 변환된다. 따라서 vLLM이나 SGLang 기반의 에이전트와 기존 OpenAI-compatible SDK를 연결하기 쉽다.
- 코딩 평가에서 SWE-bench Verified 70.6, SWE-bench Pro 47.5, SWE-bench Multilingual 54.4, NL2Repo 32.4를 기록했다. Ornith-1.0-9B와 비교하면 각각 69.4, 42.9, 52, 27.2보다 높고, Qwen3.5-9B의 53.2, 31.3, 39.7, 16.2도 웃돈다. 다만 Qwen3.6-35B-A3B는 같은 지표에서 73.4, 49.5, 67.2, 29.4로 더 높다.
- 에이전트 작업에서는 MCP-Atlas 54.2, Toolathlon-Verified 41.2, WideSearch 59.5, BrowseComp 56.4, ClawEval 66.5를 기록했다. Ornith-1.0-9B 대비 WideSearch는 55.8에서 59.5로, BrowseComp는 44.8에서 56.4로, Toolathlon-Verified는 33.4에서 41.2로 상승했다. 도구 사용과 검색형 작업을 결합한 coding CLI 및 agent framework에 우선 적합하다.
제한사항
- bf16 체크포인트는 약 19GB이므로 README 기준 단일 80GB GPU에서 serving하며, 효율적인 저사양 배포에는 별도 양자화 변형인 Ornith-1.5-9B-Mobile 또는 GGUF 빌드가 필요하다. 기본 체크포인트 자체가 모바일용 양자화 모델은 아니다. 따라서 일반적인 소비자용 GPU에서 바로 운영할 때는 메모리와 배포 형식을 먼저 확인해야 한다.
- Transformers ≥ 5.8.1, vLLM ≥ 0.19.1 또는 SGLang ≥ 0.5.9가 필요하며 reasoning parser와 tool-call parser 설정이 serving 과정에 포함된다. 런타임이 <think>와 <tool_call> 형식을 별도 필드로 처리하지 않으면 응답 파싱이 달라질 수 있다. README는 해당 버전 조건과 parser 구성을 명시한다.
- 기본 컨텍스트는 262,144 tokens이고 YaRN factor 4.0으로 대략 1M tokens까지 확장할 수 있지만, 공개 오픈소스 runtime은 모든 요청에 동일한 scaling factor를 정적으로 적용한다. README는 일반 길이 입력에서 품질이 소폭 저하될 수 있으므로 긴 입력이 실제로 필요한 경우에만 rope_scaling을 켜도록 안내한다. 또한 Qwen3.6-35B-A3B가 SWE-bench Multilingual 67.2와 BrowseComp 62로 더 높아 대형 모델 대비 모든 에이전트 평가에서 우세하지는 않다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score | 46.2 | Ornith-1.0-9B 43.1, Qwen3.5-9B 21.3, Qwen3.6-35B-A3B 52.5, Gemma-4-31B 42.1과 비교한 README 공개 수치 |
| Terminal-Bench 2.1 (Claude Code) | score | 47 | Ornith-1.0-9B 40.6, Qwen3.5-9B 18.9, Qwen3.6-35B-A3B 49.2와 비교한 README 공개 수치 |
| SWE-bench Verified | score | 70.6 | Ornith-1.0-9B 69.4, Qwen3.5-9B 53.2, Qwen3.6-35B-A3B 73.4, Gemma-4-31B 52와 비교한 README 공개 수치 |
| SWE-bench Pro | score | 47.5 | Ornith-1.0-9B 42.9, Qwen3.5-9B 31.3, Qwen3.6-35B-A3B 49.5, Gemma-4-31B 35.7과 비교한 README 공개 수치 |
| SWE-bench Multilingual | score | 54.4 | Ornith-1.0-9B 52, Qwen3.5-9B 39.7, Qwen3.6-35B-A3B 67.2, Gemma-4-31B 51.7과 비교한 README 공개 수치 |
| NL2Repo | score | 32.4 | Ornith-1.0-9B 27.2, Qwen3.5-9B 16.2, Qwen3.6-35B-A3B 29.4, Gemma-4-31B 15.5와 비교한 README 공개 수치 |
| SWE Atlas - QnA | score | 20.6 | Ornith-1.0-9B 17.9, Qwen3.5-9B 9.2, Qwen3.6-35B-A3B 15.5와 비교한 README 공개 수치 |
| HLE (no tools) | score | 20.2 | Ornith-1.0-9B 16.8, Qwen3.5-9B 14.7, Qwen3.6-35B-A3B 21.4, Gemma-4-31B 19.5와 비교한 README 공개 수치 |
| HLE (with tools) | score | 30.5 | Ornith-1.0-9B 26.4, Qwen3.5-9B 24.5, Qwen3.6-35B-A3B 28.9, Gemma-4-31B 26.5와 비교한 README 공개 수치 |
| GPQA Diamond | score | 86.4 | Ornith-1.0-9B 82.5, Qwen3.5-9B 81.7, Qwen3.6-35B-A3B 86, Gemma-4-31B 84.3와 비교한 README 공개 수치 |
| MCP-Atlas | score | 54.2 | Ornith-1.0-9B 49.4, Qwen3.5-9B 46.8, Qwen3.6-35B-A3B 62.8, Gemma-4-31B 55와 비교한 README 공개 수치 |
| Toolathlon-Verified | score | 41.2 | Ornith-1.0-9B 33.4, Qwen3.5-9B 29.6, Qwen3.6-35B-A3B 41.7, Gemma-4-31B 52.8과 비교한 README 공개 수치 |
| WideSearch | score | 59.5 | Ornith-1.0-9B 55.8, Qwen3.5-9B 53.6, Qwen3.6-35B-A3B 60.1, Gemma-4-31B 54.2와 비교한 README 공개 수치 |
| BrowseComp | score | 56.4 | Ornith-1.0-9B 44.8, Qwen3.5-9B 41.5, Qwen3.6-35B-A3B 62와 비교한 README 공개 수치 |
| ClawEval | score | 66.5 | Ornith-1.0-9B 63.1, Qwen3.5-9B 53.2, Qwen3.6-35B-A3B 68.7, Gemma-4-31B 48.5와 비교한 README 공개 수치 |
이미지 분석

124
Likes
1.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.