35B MoE 계열 에이전트 코딩 모델, 단일 GPU 서빙 최적화
Ornith-1.0-35B는 에이전트형 코딩과 도구 호출에 최적화된 35B 규모의 GGUF 모델로서 reasoning trace와 tool_call 파서를 통해 에이전트 워크플로를 지원한다.
TL;DR
Ornith-1.0-35B는 deepreinforce-ai가 공개한 GGUF 형식의 35B 규모 모델로 에이전트형 코딩과 tool-calling에 최적화되어 단일 노드 배포를 염두에 둔 서빙 레시피를 제공한다. 핵심적으로 README는 강화학습 기반의 self-improving 프레임워크를 통해 scaffold와 solution을 공동 최적화한다고 밝히며, 모델은 <think>…</think> reasoning 블록과 OpenAI 스타일의 tool_calls 출력을 지원하여 에이전트 워크플로와의 결합을 용이하게 만든다. 제공된 벤치마크 표와 시각화에서 Ornith-1.0-35B는 Terminal-Bench, SWE-Bench, Claw-eval 등 다수의 코드 중심 평가에서 경쟁 모델 대비 높은 점수를 기록했고 MIT 라이선스·GGUF 배포는 로컬 도입과 실무 서빙을 단순화한다. 다만 README에 제시된 성능은 특정 런타임 설정(vLLM/SGLang), 컨텍스트 창 크기, 온도 등 세부 실험 조건에 의존하므로 동일 조건으로의 재현이 필요하며 대형 MoE 변형과의 비용·성능 트레이드오프는 별도 검증이 요구된다.
핵심 역량
- Ornith-1.0-35B는 자연어로 된 코딩 요구를 받아 코드 스니펫을 생성하고 터미널 명령을 호출하는 에이전트 행동을 생성할 수 있다. README는 모델이 OpenAI 호환 tool_calls 필드를 출력하여 서버 쪽에서 함수 호출을 안전하게 중계하도록 설계되어 있음을 명시하고 있다. 이러한 기능은 자동화된 코드 작업 파이프라인과 도구 연동에서 즉시 활용 가능하다.
- 모델은 생성 과정에서 <think> … </think> 블록으로 추론 체인을 출력하여 중간 사고 과정을 별도 필드(reasoning_content)로 분리할 수 있다. 이 분리는 추론 과정을 로깅하거나 디버깅하는 데 유용하며 agentic search trajectory를 분석하는 데 기여한다. README는 reasoning_parser와 tool_call_parser 설정 예시를 통해 실무 적용 방법을 제시했다.
- Ornith-1.0-35B는 GGUF 형식으로 배포되어 llama.cpp, Ollama 같은 로컬 런타임이나 vLLM, SGLang을 통한 고성능 서빙 환경에서 동작한다. Serving 레시피는 tensor-parallel 설정과 최대 컨텍스트 길이(max-model-len) 조정을 포함하여 단일 노드 배포를 실현하는 구체적 매개변수를 제공한다. 또한 OpenAI 호환 인터페이스를 통해 기존 agent 프레임워크와 손쉽게 통합할 수 있다.
강점
- README는 Ornith-1.0-35B가 동급 오픈소스 모델 대비 코드 및 에이전트형 벤치마크에서 우수한 점수를 기록했음을 표로 제시한다. 제공된 표에서 Terminal-Bench 2.1에서 64.2, SWE-Bench Verified에서 75.6, Claw-eval Avg에서 69.8 등의 점수가 명시되어 있어 동일 조건 하 벤치마크 성능 근거가 존재한다. 또한 MIT 라이선스와 GGUF 배포로 실무 도입과 로컬 서빙이 용이하다는 운영적 강점이 있다.
훈련 방식
Ornith-1.0-35B는 Ornith 패밀리의 경량 구성원으로서 Gemma 4와 Qwen 3.5 등 대형 모델에서 추가적인 post-training 또는 RL 기반의 self-improving 훈련 프레임워크를 적용한 계열에 속하며 README는 특히 RL을 통해 scaffold와 solution을 공동 최적화하여 더 나은 탐색 궤적을 발견한다고 기술하고 있다.
알아두면 좋은 것
- Ornith-1.0-35B는 MIT 라이선스로 공개되어 상업적·비상업적 사용에 제약이 적고 글로벌 접근성이 보장된다. 공개 리포지토리에는 LICENSE 링크와 GGUF 빌드가 포함되어 있어 로컬 배포가 용이하다.
- 가족 모델군에는 9B, 31B-Dense, 35B-MoE, 397B-MoE 등 다양한 크기와 아키텍처가 포함되며 일부 대형 변형은 Gemma와 Qwen 기반의 post-training을 거쳤다고 명시되어 있다. README는 35B 모델을 단일 GPU 친화적으로 설계했다고 명시한다.
- 벤치마크 표는 Terminal-Bench 2.1, SWE-Bench, NL2Repo, ClawEval 등 여러 코드·터미널 기반 평가에서 Ornith-1.0-35B의 점수를 제시하며 구체적 실험 설정(temperature, parser, context window, timeout, CPU/RAM 등)을 각 항목 아래에 기재했다. 이미지와 표 모두 동일한 점수 표기를 포함하여 성능 비교 근거를 제공한다.
- 서빙을 위한 요구 런타임으로 Transformers ≥ 5.8.1, vLLM ≥ 0.19.1, SGLang ≥ 0.5.9를 권장하며 vLLM 예시는 8×80GB GPU 노드에서 tensor-parallel 8 설정을 사용한다. README는 또한 llama.cpp·Ollama 등 다양한 로컬 런타임과의 호환 사례를 포함하고 있다.
기술적 특징
- Ornith 계열은 일부 변형에서 Mixture of Experts(MoE)를 채택하여 동일한 파라미터 예산에서 더 큰 표현력을 확보하도록 설계되었다. README는 35B-MoE와 397B-MoE 구성의 존재를 밝히며 MoE는 입력별로 일부 전문가만 활성화해 연산 효율을 높이는 방식으로 대형 모델의 성능을 확장하는 데 기여한다고 명시했다. 이 설계는 대형 모델의 추론 비용과 성능 균형을 맞출 때 유리하다.
- 자체 개선(self-improving) 훈련 프레임워크는 강화학습을 통해 단순한 솔루션 롤아웃뿐 아니라 롤아웃을 유도하는 scaffold를 동시에 학습시킨다. 이 방식은 scaffold와 결과를 공동 최적화하면서 더 나은 검색 궤적과 높은 품질의 솔루션을 발견하게 하는 작동 원리를 갖는다. README는 이 접근이 에이전트 기반 코드 탐색 성능 향상에 기여한다고 기술했다.
- 서비스·호환성 측면에서 Ornith은 <think>…</think> 형태의 reasoning 출력을 기본으로 하여 reasoning_content 필드로 분리하고 도구 호출을 OpenAI 스타일 tool_calls로 노출하도록 파서를 제공한다. README의 serving 레시피는 reasoning_parser와 tool_call_parser를 설정하는 구체적 플래그를 포함하여 도구 연동 파이프라인에서의 투명성과 자동화를 지원한다.
- 배포 최적화는 GGUF 빌드와 vLLM·SGLang·Transformers 호환성을 통해 단일 노드 환경에서 대용량 컨텍스트를 운영할 수 있도록 설계되었다. README는 262k 컨텍스트 설정 예시와 tensor-parallel 매개변수를 제공하며 로컬 inference 도구(예: llama.cpp, Ollama)로의 연동 과정을 구체적으로 안내하고 있다.
차별점
- Ornith은 훈련 단계에서 scaffold 생성과 솔루션 롤아웃을 공동 최적화하는 self-improving RL 프레임워크를 채택하여 에이전트형 코드 탐색 성능을 끌어올린다고 명시되어 있다. 이 접근은 단순한 RL fine-tuning과 달리 탐색 전략 자체를 학습함으로써 더 효율적인 문제 해결 궤적을 유도하는 점에서 차별화된다.
- README는 모델을 GGUF 형식으로 공개하고 vLLM·SGLang·Transformers 등 다양한 런타임에 대한 구체적 서빙 레시피를 제공하여 로컬 단일 노드 배포와 OpenAI 호환 API 연동을 용이하게 만든다. 이러한 실무 지향적 배포 문서는 동일 계열 모델들 대비 즉시 현업에 적용 가능한 통합 경험을 제공한다.
- 패밀리 라인업에 MoE 기반 변형과 Dense 변형을 함께 제공하여 사용자가 성능과 비용에 따라 선택할 수 있게 설계되었다. 이로 인해 사용자 요구에 맞춘 유연한 선택지가 존재하며 벤치마크와 사용 사례에 따라 적절한 변형을 고를 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score (%) | 64.2 | vs Qwen3.5-35B: 41.4, vs Qwen3.6-35B: 52.5, vs Gemma4-31B: 42.1, vs Qwen3.5-397B: 53.5 |
| SWE-bench Verified | score (%) | 75.6 | vs Qwen3.5-35B: 70, vs Qwen3.6-35B: 73.4, vs Gemma4-31B: 52, vs Qwen3.5-397B: 76.4 |
| SWE-bench Pro | score (%) | 50.4 | vs Qwen3.5-35B: 44.6, vs Qwen3.6-35B: 49.5, vs Gemma4-31B: 35.7, vs Qwen3.5-397B: 51.6 |
| SWE-bench Multilingual | score (%) | 69.3 | vs Qwen3.5-35B: 60.3, vs Qwen3.6-35B: 67.2, vs Gemma4-31B: 51.7, vs Qwen3.5-397B: 69.3 |
| NL2Repo | score (%) | 34.6 | vs Qwen3.5-35B: 20.5, vs Qwen3.6-35B: 29.4, vs Gemma4-31B: 15.5, vs Qwen3.5-397B: 36.8 |
| Claw-eval Avg | score (%) | 69.8 | vs Qwen3.5-35B: 65.4, vs Qwen3.6-35B: 68.7, vs Gemma4-31B: 48.5, vs Qwen3.5-397B: 70.7 |
| SWE Atlas - QnA | score (%) | 37.1 | vs Qwen3.5-35B: 13.2, vs Qwen3.6-35B: 15.5, vs Qwen3.5-397B: 20.4 |
이미지 분석

926
Likes
1.9M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.