deepreinforce-ai/Ornith-1.0-35B-GGUF
Ornith-1.0-35B는 에이전트형 코딩과 도구 호출에 최적화된 35B 규모의 GGUF 모델로서 reasoning trace와 tool_call 파서를 통해 에이전트 워크플로를 지원한다.
학습 방식 · Ornith-1.0-35B는 Ornith 패밀리의 경량 구성원으로서 Gemma 4와 Qwen 3.5 등 대형 모델에서 추가적인 post-training 또는 RL 기반의 self-improving 훈련 프레임워크를 적용한 계열에 속하며 README는 특히 RL을 통해 scaffold와 solution을 공동 최적화하여 더 나은 탐색 궤적을 발견한다고 기술하고 있다.
TL;DR
Ornith-1.0-35B는 deepreinforce-ai가 공개한 GGUF 형식의 35B 규모 모델로 에이전트형 코딩과 tool-calling에 최적화되어 단일 노드 배포를 염두에 둔 서빙 레시피를 제공한다. 핵심적으로 README는 강화학습 기반의 self-improving 프레임워크를 통해 scaffold와 solution을 공동 최적화한다고 밝히며, 모델은 <think>…</think> reasoning 블록과 OpenAI 스타일의 tool_calls 출력을 지원하여 에이전트 워크플로와의 결합을 용이하게 만든다. 제공된 벤치마크 표와 시각화에서 Ornith-1.0-35B는 Terminal-Bench, SWE-Bench, Claw-eval 등 다수의 코드 중심 평가에서 경쟁 모델 대비 높은 점수를 기록했고 MIT 라이선스·GGUF 배포는 로컬 도입과 실무 서빙을 단순화한다. 다만 README에 제시된 성능은 특정 런타임 설정(vLLM/SGLang), 컨텍스트 창 크기, 온도 등 세부 실험 조건에 의존하므로 동일 조건으로의 재현이 필요하며 대형 MoE 변형과의 비용·성능 트레이드오프는 별도 검증이 요구된다.
핵심 포인트
- Ornith은 훈련 단계에서 scaffold 생성과 솔루션 롤아웃을 공동 최적화하는 self-improving RL 프레임워크를 채택하여 에이전트형 코드 탐색 성능을 끌어올린다고 명시되어 있다. 이 접근은 단순한 RL fine-tuning과 달리 탐색 전략 자체를 학습함으로써 더 효율적인 문제 해결 궤적을 유도하는 점에서 차별화된다.
- README는 모델을 GGUF 형식으로 공개하고 vLLM·SGLang·Transformers 등 다양한 런타임에 대한 구체적 서빙 레시피를 제공하여 로컬 단일 노드 배포와 OpenAI 호환 API 연동을 용이하게 만든다. 이러한 실무 지향적 배포 문서는 동일 계열 모델들 대비 즉시 현업에 적용 가능한 통합 경험을 제공한다.
- 패밀리 라인업에 MoE 기반 변형과 Dense 변형을 함께 제공하여 사용자가 성능과 비용에 따라 선택할 수 있게 설계되었다. 이로 인해 사용자 요구에 맞춘 유연한 선택지가 존재하며 벤치마크와 사용 사례에 따라 적절한 변형을 고를 수 있다.
- README는 Ornith-1.0-35B가 동급 오픈소스 모델 대비 코드 및 에이전트형 벤치마크에서 우수한 점수를 기록했음을 표로 제시한다. 제공된 표에서 Terminal-Bench 2.1에서 64.2, SWE-Bench Verified에서 75.6, Claw-eval Avg에서 69.8 등의 점수가 명시되어 있어 동일 조건 하 벤치마크 성능 근거가 존재한다. 또한 MIT 라이선스와 GGUF 배포로 실무 도입과 로컬 서빙이 용이하다는 운영적 강점이 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | score (%) | 64.2 | vs Qwen3.5-35B: 41.4, vs Qwen3.6-35B: 52.5, vs Gemma4-31B: 42.1, vs Qwen3.5-397B: 53.5 |
| SWE-bench Verified | score (%) | 75.6 | vs Qwen3.5-35B: 70, vs Qwen3.6-35B: 73.4, vs Gemma4-31B: 52, vs Qwen3.5-397B: 76.4 |
| SWE-bench Pro | score (%) | 50.4 | vs Qwen3.5-35B: 44.6, vs Qwen3.6-35B: 49.5, vs Gemma4-31B: 35.7, vs Qwen3.5-397B: 51.6 |
| SWE-bench Multilingual | score (%) | 69.3 | vs Qwen3.5-35B: 60.3, vs Qwen3.6-35B: 67.2, vs Gemma4-31B: 51.7, vs Qwen3.5-397B: 69.3 |
| NL2Repo | score (%) | 34.6 | vs Qwen3.5-35B: 20.5, vs Qwen3.6-35B: 29.4, vs Gemma4-31B: 15.5, vs Qwen3.5-397B: 36.8 |
| Claw-eval Avg | score (%) | 69.8 | vs Qwen3.5-35B: 65.4, vs Qwen3.6-35B: 68.7, vs Gemma4-31B: 48.5, vs Qwen3.5-397B: 70.7 |
| SWE Atlas - QnA | score (%) | 37.1 | vs Qwen3.5-35B: 13.2, vs Qwen3.6-35B: 15.5, vs Qwen3.5-397B: 20.4 |
| SWE Atlas - TW | score (%) | 27.8 | vs Qwen3.5-35B: 9.8, vs Qwen3.6-35B: 13.3, vs Qwen3.5-397B: 18.5 |
이미지 분석

926
LIKES
1.9M
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.