9B 단일-GPU 에이전트 코딩 모델, Ornith 1.0
Ornith-1.0-9B는 단일 80GB GPU에서 구동 가능한 9B dense 모델로 self-improving RL과 reasoning trace, OpenAI 호환 툴 호출을 통해 에이전틱 코드 자동화를 지원한다.
TL;DR
Ornith-1.0-9B는 단일 80GB GPU에서 구동 가능한 9B dense LLM으로 에이전트형 코딩을 목표로 설계되었으며 MIT 라이선스로 배포된다. 모델은 self-improving RL을 통해 솔루션과 이를 생성하는 scaffold를 공동 최적화해 탐색 경로를 개선하고, <think> 태그 기반의 reasoning trace와 OpenAI 스타일의 tool_calls로 툴 호출을 분리해 제공한다. README는 Transformers·vLLM·SGLang 등에서의 서빙 예시와 GGUF 빌드를 함께 제공하여 다양한 런타임에서 즉시 사용 가능함을 명시했고, 벤치마크 표는 Terminal-Bench·SWE-bench·Claw-eval에서 Ornith이 동급 공개 모델 대비 우수한 점수를 기록했음을 보여준다. 다만 벤치마크는 구체적 실행 환경(컨텍스트 길이, 타임아웃, 샘플링 파라미터)에 의존하므로 동일 조건에서의 재현이 필요하다.
핵심 역량
- Ornith-1.0-9B는 복잡한 터미널 작업과 환경 상호작용을 포함하는 에이전틱 코딩 작업에서 툴 호출을 생성하고 실행 명령을 조합해 일련의 자동화된 작업을 수행할 수 있다. 모델은 툴 호출을 OpenAI 스타일의 표준 형식으로 반환하므로 에이전트 런타임이 이를 파싱해 실제 시스템 명령이나 API 콜로 연결할 수 있다. 이 동작은 반복적인 코드 작성·실행·검증 루프를 자동화하는 데 적합하다.
- Ornith-1.0-9B는 생성 과정에서 별도의 reasoning trace를 출력해 모델의 탐색 경로와 추론 단계를 기록할 수 있다. 이 추론 흔적은 </think> 마커로 분리되어 reasoning_content로 제공되므로 응답의 근거와 내부 결정을 후처리하거나 감사할 수 있다. 따라서 복잡한 의사결정이 요구되는 자동화 파이프라인에서 원인 분석과 정책 준수가 용이해진다.
- Ornith-1.0-9B는 다양한 배포 옵션을 지원해 Transformers, vLLM, SGLang 같은 런타임에서 OpenAI 호환 엔드포인트로 동작시킬 수 있다. GGUF 빌드가 제공되어 llama.cpp나 Ollama 같은 경량 런타임에도 적용 가능하다. 이로 인해 클라우드 기반 서비스와 로컬·엣지 환경 모두에서 추론 파이프라인을 구성할 수 있다.
강점
- 공개된 벤치마크에서 Ornith-1.0-9B는 Terminal-Bench 2.1(Terminus-2)에서 43.1을 기록해 같은 표에 있는 Qwen3.5-9B(21.3) 대비 높은 점수를 보였다. 이 수치는 에이전틱 터미널 작업에서의 실사용 성능 우위를 나타내며 동일 표에 있는 다른 모델들과의 직접 비교가 가능하다. 또한 Claw-eval 평균 63.1과 SWE-bench Verified 69.4 점수는 복합 코드 작업에 대한 강점을 뒷받침한다.
- Ornith-1.0-9B는 단일 80GB GPU에서 서빙 가능하도록 설계되어 실무 환경에서의 배포 장벽을 낮췄다. README에 따르면 bf16 기준으로 약 19GB 크기여서 대형 인프라 없이도 고성능 에이전트 워크플로를 운영할 수 있다. GGUF 빌드와 OpenAI 호환 엔드포인트를 함께 제공해 다양한 런타임으로 확장 가능하다.
훈련 방식
Ornith-1.0 계열은 self-improving RL 프레임워크를 적용해 솔루션 롤아웃과 이를 생성하는 scaffold를 동시에 최적화하는 방식으로 학습했다. 이 접근은 탐색 경로(search trajectories)를 개선해 더 높은 품질의 코드 솔루션을 도출하도록 설계되었다. README에서는 상위 모델들이 Gemma4와 Qwen3.5를 기반으로 후처리되었다고 명시하여 일부 모델은 기존 대형 모델을 기반으로 추가 학습이 진행되었음을 시사한다.
알아두면 좋은 것
- 라이선스는 MIT로 전 세계에서 접근 가능하며 지역 제한 없이 사용 가능하다. 이 점은 상업적·연구용 배포에서 제약이 적다는 의미이다. 모델 파일과 GGUF 빌드가 제공되어 다양한 런타임으로의 배포 경로가 열려 있다.
- Ornith 패밀리는 9B, 31B, 35B-MoE, 397B-MoE 구성으로 제공되며 대형 구성은 Gemma4와 Qwen3.5 기반으로 후처리(post-trained)되었다는 점이 명시되어 있다. README는 9B 모델을 경량 멤버로 규정하며 단일 GPU 배포를 목표로 한다. 큰 모델군은 에이전틱 코딩 벤치마크에서 상위 성능을 보였다고 표기되어 있다.
- Quickstart에서 권장하는 런타임 요구 사항은 Transformers ≥ 5.8.1, vLLM ≥ 0.19.1, SGLang ≥ 0.5.9로 명시되어 있다. 또한 샘플링 기본값(temperature=0.6, top_p=0.95, top_k=20)과 벤치마크 재현을 위한 temperature=1.0 설정을 제시하고 있다. 이 권장 설정은 재현성 확보와 추론 품질 튜닝에 직접적으로 연결된다.
- 벤치마크 평가 절차는 각 벤치마크별로 컨텍스트 길이와 실행 환경(예: CPU 코어, 메모리, 타임아웃)을 구체적으로 규정하고 있다. 예컨대 Terminal-Bench 2.1은 4시간 타임아웃, 32 CPU 코어, 48GB RAM으로 5번 반복 평균을 사용했다. 이러한 평가 조건은 비교 결과의 일관성과 신뢰성을 확보하기 위한 환경 통제이다.
기술적 특징
- 모델은 self-improving RL 루프를 도입해 단순한 정답 최적화가 아니라 ‘scaffold’와 최종 솔루션을 공동 최적화했다는 점이 핵심 기술이다. 이 방식은 모델이 더 나은 탐색 경로를 학습하게 하여 반복적 시도에서 더 높은 품질의 코드 출력을 획득하도록 했다. 결과적으로 에이전틱 환경에서의 성공률과 솔루션 완성도가 향상되었다.
- 추론 출력 구조에서 chain-of-thought를 <think> … </think> 블록으로 분리하여 reasoning_content 필드로 반환하는 디자인을 채택했다. 이 구조는 내부 추론을 기계적으로 추출해 검증·로깅·후처리에 활용할 수 있게 하며 툴 호출과 결합해 행동 근거를 추적할 수 있다. 별도의 파서를 통해 reasoning trace와 tool_call 블록을 OpenAI 호환 형식으로 노출하도록 구성되었다.
- 배포 관점에서 Ornith-1.0-9B는 dense 9B 모델로 약 19GB bf16 메모리 풋프린트를 가지며 단일 80GB GPU에서 서빙 가능하도록 최적화되었다. README는 vLLM과 SGLang, Transformers를 권장 런타임으로 제시하고 구체적인 서버 실행 예시를 제공해 운영 편의성을 높였다. 또한 GGUF 형식의 바이너리를 제공해 llama.cpp나 Ollama 같은 경량 런타임에서도 사용 가능하다.
- 에이전트 인터페이스는 OpenAI 호환 채팅 및 툴 호출 표준을 따르며, 자동 툴 선택과 tool-call-parser 옵션을 통해 툴 통합을 쉽게 구성하도록 설계되었다. 이 구성은 MCP, Hermes, OpenHands, OpenClaw 등 기존 에이전트 허브와의 즉시 연동을 가능하게 한다. 서버 설정에서 reasoning-parser와 tool-call-parser를 별도로 지정함으로써 파싱 정밀도와 툴 인터페이스의 유연성을 확보했다.
차별점
- Ornith은 솔루션 생성과 그 솔루션을 유도하는 scaffold를 동시에 학습하는 self-improving RL 프레임워크를 채택했다. 이로 인해 단일 생성 단계에서의 정답 최적화가 아니라 탐색 전략 자체를 개선해 반복 시도에서 더 안정적인 성공률을 얻도록 설계되었다. 동일 계열의 단순 SFT 모델 대비 에이전틱 작업에서 더 나은 탐색 품질을 보이는 것이 차별점이다.
- 추론 흔적을 명시적 블록(<think>)으로 출력하고 이를 reasoning_content로 분리해 제공하는 점이 운영·검증 측면에서 차별화된다. 이 출력 분리는 에이전트가 내린 결정을 외부에서 재현·검토하고 툴 호출 로직의 적절성을 검증하는 데 유용하다. 따라서 복잡한 자동화 파이프라인에서 원인 분석과 책임 추적을 용이하게 만든다.
- 단일 80GB GPU에서 구동 가능한 9B dense 설계로 경량 배포와 고성능 에이전틱 워크플로를 동시에 충족하도록 한 점이 실무적 차별점이다. GGUF 빌드와 Transformers/vLLM/SGLang 예시를 통해 다양한 런타임에 바로 적용할 수 있게 해 배포 유연성을 확보했다. 이로 인해 대형 모델 인프라 없이도 에이전틱 솔루션을 운영할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score | 43.1 | Qwen3.5-9B: 21.3, Qwen3.5-35B: 41.4, Gemma4-12B: 21, Gemma4-31B: 42.1 |
| Terminal-Bench 2.1 (Claude Code) | score | 40.6 | Qwen3.5-9B: 18.9, Qwen3.5-35B: 38.9 |
| SWE-bench Verified | score | 69.4 | Qwen3.5-9B: 53.2, Qwen3.5-35B: 70, Gemma4-12B: 44.2, Gemma4-31B: 52 |
| SWE-bench Pro | score | 42.9 | Qwen3.5-9B: 31.3, Qwen3.5-35B: 44.6, Gemma4-12B: 27.6, Gemma4-31B: 35.7 |
| SWE-bench Multilingual | score | 52 | Qwen3.5-9B: 39.7, Qwen3.5-35B: 60.3, Gemma4-12B: 32.5, Gemma4-31B: 51.7 |
| NL2Repo | score | 27.2 | Qwen3.5-9B: 16.2, Qwen3.5-35B: 20.5, Gemma4-12B: 10.3, Gemma4-31B: 15.5 |
| Claw-eval Avg | score | 63.1 | Qwen3.5-9B: 53.2, Qwen3.5-35B: 65.4, Gemma4-12B: 32.5, Gemma4-31B: 48.5 |
| SWE Atlas - QnA |
이미지 분석

484
Likes
1.2M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.