Ornith 9B 단일 GPU 배포 가능한 에이전트 코딩 모델
Ornith-1.0-9B는 dense 약 9B 파라미터로 설계된 MIT 라이선스의 에이전트 지향 텍스트 생성 모델로, <think> 추론 트레이스와 OpenAI 호환 툴 호출을 기본 지원하여 터미널 기반 코딩 벤치마크에서 비교 우위를 보였다.
TL;DR
Ornith-1.0-9B는 deepreinforce-ai가 공개한 MIT 라이선스의 dense 약 9B 텍스트 생성 모델로, 에이전트식 코드 생성과 툴 호출을 염두에 둔 설계로 단일 80GB GPU 환경에서 약 19GB bf16로 서빙 가능하도록 최적화되어 있다. 모델은 강화학습 기반의 self-improving 프레임워크를 사용하여 해답 롤아웃과 그 롤아웃을 유도하는 scaffold를 동시 최적화함으로써 탐색 경로를 개선하고 더 높은 품질의 코드 솔루션을 얻는 방식으로 학습되었다. README와 제공된 벤치마크 표는 Terminal-Bench 43.1, SWE-bench Verified 69.4, Claw-eval Avg 63.1 등 코드 중심 평가에서 Ornith-1.0-9B가 동일 테이블에 제시된 다른 오픈소스 계열 모델들보다 우수한 점수를 보였음을 나타낸다. 운영 측면에서는 transformers >= 5.8.1, vLLM >= 0.19.1, SGLang >= 0.5.9 같은 최신 런타임을 권장하고 기본적으로 <think> 추론 블록과 OpenAI 스타일의 tool_calls 출력을 제공하므로 에이전트 파이프라인에 바로 통합해 사용할 수 있다.
핵심 역량
- 툴 호출 형식의 함수 호출을 구조화하여 OpenAI 호환 agent 프레임워크에 바로 연동할 수 있다. 이 기능은 외부 도구를 자동으로 호출하고 반환값을 다음 행동의 입력으로 사용하도록 만든다.
- 응답 앞에 <think>...</think> 블록을 기본으로 생성하여 모델 내부 추론을 reasoning_content 필드로 분리해 제공한다. 이 구조는 디버깅과 중간결정 추적을 가능하게 하며 에이전트 행동의 투명도를 높인다.
- 터미널 기반 작업 자동화와 코드베이스 이해를 위한 텍스트 생성 능력을 갖추고 있어 터미널 명령 실행, 파일 나열, 간단한 리팩터링 지시 등 실무적 작업을 수행한다. 또한 OpenHands, Hermes, OpenClaw 같은 에이전트 허브와의 호환성이 명시되어 있다.
- 단일 80GB GPU 환경에서의 배포를 염두에 둔 경량화된 dense 9B 설계로, 로컬 프로토타이핑과 빠른 추론 파이프라인을 지원한다. 19GB 수준의 bf16 메모리 점유로 단일 GPU 상에서 서비스 가능한 사양이다.
강점
- 동급의 오픈소스 모델들과 비교한 벤치마크에서 코드 중심 과제에 대해 높은 점수를 보였으며, 예를 들어 Terminal-Bench 2.1에서 43.1, SWE-bench Verified에서 69.4, Claw-eval Avg에서 63.1의 수치를 기록하여 동일 표에 제시된 비교 모델들 대비 우위를 보였다.
- dense 9B 설계로 단일 80GB GPU에서 약 19GB bf16로 서빙이 가능하여 로컬 프로토타이핑과 비용 제약 있는 환경에서 실용성이 높다.
- OpenAI 호환 툴 호출과 reasoning_content 분리 같은 운영 편의성과 여러 런타임(vLLM, SGLang, transformers, GGUF 호환) 지원으로 에이전트 파이프라인에 바로 통합 가능한 점이 실무적 강점이다.
훈련 방식
Ornith-1.0 계열은 self-improving 학습 프레임워크를 사용하며 강화학습(RL)으로 솔루션 롤아웃과 그 롤아웃을 유도하는 scaffold를 공동 최적화했다. 이 접근은 스스로 더 나은 탐색 경로를 발견하게 하여 에이전트 행동의 품질을 높이는 방식으로 설계되어 있다. README에는 상위 사이즈가 Gemma4와 Qwen3.5 기반의 post-training을 거쳤다고 명시되어 있다.
알아두면 좋은 것
- Ornith-1.0-9B는 MIT 라이선스로 공개되어 상업적·비상업적 용도로 제약 없이 사용 가능하다.
- 서빙 요구사항으로 transformers >= 5.8.1, vLLM >= 0.19.1, SGLang >= 0.5.9를 권장하며 vLLM과 SGLang 예제 명령을 포함하여 OpenAI 호환 API로 배포하는 레시피를 제공한다.
- 기본 생성은 <think> 블록을 여는 reasoning-first 스타일이며, 서버 사이드 파서를 통해 reasoning_content와 tool_calls 필드를 분리해 반환하도록 설계되어 있다.
- 벤치마크는 Terminal-Bench, SWE-bench, NL2Repo, Claw-eval 등 코드·에이전트 중심의 평가에서 제시되며, 9B 모델은 단일 GPU 배포와 빠른 실험을 목표로 한다.
기술적 특징
- 자체 기술로서 Ornith은 RL 기반의 self-improving 프레임워크를 사용하여 해답 생성(rollout)뿐만 아니라 그 해답을 생성하게 하는 scaffold를 동시 학습했다. 이 동시 최적화는 탐색 경로를 개선하고 반복적 시도에서 더 높은 품질의 솔루션을 획득하도록 설계되어 있다.
- 기본 출력 형식은 <think>...</think> 블록을 포함하는 reasoning-first 스타일이며, 서버 측 파서를 통해 reasoning_content와 tool_calls를 분리하여 반환한다. 이 구조는 내부 추론을 보존하고 툴 연동 시 중간 결정을 명확하게 노출하는 데 유리하다.
- 서빙 레시피는 vLLM과 SGLang 등 최신 런타임을 권장하고 vLLM 예제에서 max-model-len=262144 같은 긴 컨텍스트 설정을 사용하는 것으로 나타나 긴 문맥 작업에 적합하도록 구성되어 있다. 또한 transformers >= 5.8.1 호환성을 명시해 표준 파이프라인에서 사용 가능하도록 했다.
- 9B 버전은 dense 구조로 설계되어 단일 GPU 배포를 목표로 메모리 점유를 약 19GB bf16로 유지하며, 상위 모델군에서는 35B-MoE나 397B-MoE 같은 Mixture-of-Experts 변형을 통해 더 큰 파라미터 예산을 효율적으로 활용하도록 분화되어 있다.
- 모델은 OpenAI 스타일의 tool_calls 출력을 잘 형성하도록 튜닝되어 있어 함수형 툴과의 자동 연동에서 오류가 적고, 서버 측에서 tool_call-parser 설정(qwen3_xml, qwen3_coder 등)을 통해 다양한 툴 표준을 바로 수용한다.
차별점
- 솔루션 생성과 그 솔루션을 유도하는 scaffold를 강화학습으로 동시에 최적화하는 self-improving 접근방식이 모델 설계의 핵심 차별점이다.
- 출력에 기본적으로 <think> 블록을 포함하고 이를 reasoning_content로 분리하는 프로덕션 친화적 설계로 추론 트레이스와 행동을 명확히 분리한다.
- 단일 80GB GPU에서 서빙 가능한 dense 9B로 경량화된 운영 편의성과, 동일 계열의 더 큰 MoE 변형을 함께 제공하는 제품 라인업으로 사용 사례에 맞춘 확장이 가능하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score | 43.1 | — |
| Terminal-Bench 2.1 (Claude Code) | score | 40.6 | — |
| SWE-bench Verified | score | 69.4 | — |
| SWE-bench Pro | score | 42.9 | — |
| SWE-bench Multilingual | score | 52 | — |
| NL2Repo | score | 27.2 | — |
| Claw-eval Avg | score | 63.1 | — |
| SWE Atlas - QnA | score | 17.9 | — |
| SWE Atlas - RF | score | 16.6 | — |
이미지 분석

419
Likes
376.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.