deepreinforce-ai/Ornith-1.0-9B-GGUF
Ornith-1.0-9B는 단일 80GB GPU에서 구동 가능한 9B dense 모델로 self-improving RL과 reasoning trace, OpenAI 호환 툴 호출을 통해 에이전틱 코드 자동화를 지원한다.
학습 방식 · Ornith-1.0 계열은 self-improving RL 프레임워크를 적용해 솔루션 롤아웃과 이를 생성하는 scaffold를 동시에 최적화하는 방식으로 학습했다. 이 접근은 탐색 경로(search trajectories)를 개선해 더 높은 품질의 코드 솔루션을 도출하도록 설계되었다. README에서는 상위 모델들이 Gemma4와 Qwen3.5를 기반으로 후처리되었다고 명시하여 일부 모델은 기존 대형 모델을 기반으로 추가 학습이 진행되었음을 시사한다.
TL;DR
Ornith-1.0-9B는 단일 80GB GPU에서 구동 가능한 9B dense LLM으로 에이전트형 코딩을 목표로 설계되었으며 MIT 라이선스로 배포된다. 모델은 self-improving RL을 통해 솔루션과 이를 생성하는 scaffold를 공동 최적화해 탐색 경로를 개선하고, <think> 태그 기반의 reasoning trace와 OpenAI 스타일의 tool_calls로 툴 호출을 분리해 제공한다. README는 Transformers·vLLM·SGLang 등에서의 서빙 예시와 GGUF 빌드를 함께 제공하여 다양한 런타임에서 즉시 사용 가능함을 명시했고, 벤치마크 표는 Terminal-Bench·SWE-bench·Claw-eval에서 Ornith이 동급 공개 모델 대비 우수한 점수를 기록했음을 보여준다. 다만 벤치마크는 구체적 실행 환경(컨텍스트 길이, 타임아웃, 샘플링 파라미터)에 의존하므로 동일 조건에서의 재현이 필요하다.
핵심 포인트
- Ornith은 솔루션 생성과 그 솔루션을 유도하는 scaffold를 동시에 학습하는 self-improving RL 프레임워크를 채택했다. 이로 인해 단일 생성 단계에서의 정답 최적화가 아니라 탐색 전략 자체를 개선해 반복 시도에서 더 안정적인 성공률을 얻도록 설계되었다. 동일 계열의 단순 SFT 모델 대비 에이전틱 작업에서 더 나은 탐색 품질을 보이는 것이 차별점이다.
- 추론 흔적을 명시적 블록(<think>)으로 출력하고 이를 reasoning_content로 분리해 제공하는 점이 운영·검증 측면에서 차별화된다. 이 출력 분리는 에이전트가 내린 결정을 외부에서 재현·검토하고 툴 호출 로직의 적절성을 검증하는 데 유용하다. 따라서 복잡한 자동화 파이프라인에서 원인 분석과 책임 추적을 용이하게 만든다.
- 단일 80GB GPU에서 구동 가능한 9B dense 설계로 경량 배포와 고성능 에이전틱 워크플로를 동시에 충족하도록 한 점이 실무적 차별점이다. GGUF 빌드와 Transformers/vLLM/SGLang 예시를 통해 다양한 런타임에 바로 적용할 수 있게 해 배포 유연성을 확보했다. 이로 인해 대형 모델 인프라 없이도 에이전틱 솔루션을 운영할 수 있다.
- 공개된 벤치마크에서 Ornith-1.0-9B는 Terminal-Bench 2.1(Terminus-2)에서 43.1을 기록해 같은 표에 있는 Qwen3.5-9B(21.3) 대비 높은 점수를 보였다. 이 수치는 에이전틱 터미널 작업에서의 실사용 성능 우위를 나타내며 동일 표에 있는 다른 모델들과의 직접 비교가 가능하다. 또한 Claw-eval 평균 63.1과 SWE-bench Verified 69.4 점수는 복합 코드 작업에 대한 강점을 뒷받침한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score | 43.1 | Qwen3.5-9B: 21.3, Qwen3.5-35B: 41.4, Gemma4-12B: 21, Gemma4-31B: 42.1 |
| Terminal-Bench 2.1 (Claude Code) | score | 40.6 | Qwen3.5-9B: 18.9, Qwen3.5-35B: 38.9 |
| SWE-bench Verified | score | 69.4 | Qwen3.5-9B: 53.2, Qwen3.5-35B: 70, Gemma4-12B: 44.2, Gemma4-31B: 52 |
| SWE-bench Pro | score | 42.9 | Qwen3.5-9B: 31.3, Qwen3.5-35B: 44.6, Gemma4-12B: 27.6, Gemma4-31B: 35.7 |
| SWE-bench Multilingual | score | 52 | Qwen3.5-9B: 39.7, Qwen3.5-35B: 60.3, Gemma4-12B: 32.5, Gemma4-31B: 51.7 |
| NL2Repo | score | 27.2 | Qwen3.5-9B: 16.2, Qwen3.5-35B: 20.5, Gemma4-12B: 10.3, Gemma4-31B: 15.5 |
| Claw-eval Avg | score | 63.1 | Qwen3.5-9B: 53.2, Qwen3.5-35B: 65.4, Gemma4-12B: 32.5, Gemma4-31B: 48.5 |
| SWE Atlas - QnA | score | 17.9 | Qwen3.5-9B: 9.2, Qwen3.5-35B: 13.2 |
| SWE Atlas - RF | score | 16.6 | Qwen3.5-9B: 4.3, Qwen3.5-35B: 10.2 |
| SWE Atlas - TW | score | 15.3 | Qwen3.5-9B: 4.4, Qwen3.5-35B: 9.8 |
이미지 분석

484
LIKES
1.2M
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.