본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ornith-ai/Ornith-1.5-9B-GGUF

터미널 기반 코딩 에이전트, 도구 호출, 추론 및 일반 텍스트 생성9B262K 컨텍스트MIT

자기개선형 reasoning과 tool calling에 맞춘 9B 코딩 에이전트 모델

학습 방식 · Ornith-1.0을 확장한 Ornith-1.5 계열로, Qwen3.5와 Gemma4 기반의 continued pretraining·mid-training·post-training 위에 task generation·scaffold construction·solution rollout 공동 최적화와 reinforcement learning을 적용했습니다.

TL;DR

Ornith-1.5-9B-GGUF는 Ornith-1.5-9B를 GGUF로 양자화한 파생 모델이며, 원본은 Qwen3.5와 Gemma4 기반 Ornith-1.0을 확장한 9B dense reasoning model입니다. 학습 중 모델이 새 과제와 scaffold, solution rollout을 생성하고 reinforcement learning으로 정책을 함께 개선해 코딩·도구 사용·에이전트 작업을 겨냥합니다. 원본 기준 SWE-bench Verified 70.6, GPQA Diamond 86.4, ClawEval 66.5를 기록했으며, 대부분 Ornith-1.0-9B와 Qwen3.5-9B보다 높지만 더 큰 Qwen3.6-35B-A3B에는 일부 항목에서 뒤처집니다. GGUF는 llama.cpp와 Ollama에서 OpenAI 호환 tool calling을 구성하기 좋고 262,144-token 컨텍스트를 지원하지만, 양자화 수준별 성능과 메모리 수치는 별도로 확인해야 합니다.

핵심 포인트

  • Ornith-1.5-9B의 GGUF 양자화 배포본으로, 원본 9B dense 모델을 로컬 환경에서 실행하도록 구성했습니다. GGUF는 llama.cpp와 Ollama 같은 런타임에서 사용할 수 있어 단일 GPU나 로컬 에이전트 구축에 적합합니다. 이 저장소의 성능 수치는 양자화본이 아닌 기반 Ornith-1.5-9B의 공개 결과입니다.
  • 고정된 사람이 만든 과제 대신 모델이 학습 과제와 해결 전략을 계속 생성하는 self-improvement loop를 사용했습니다. task generation, scaffold construction, solution rollout을 함께 최적화하고 reinforcement learning으로 policy를 갱신합니다. 이 방식이 코딩 과제와 도구 사용 과제를 겨냥한 차별점입니다.
  • 모델은 응답 앞에 <think> … </think> 블록을 생성하는 reasoning model입니다. 최신 Transformers, vLLM 또는 SGLang의 reasoning parser가 reasoning_content와 최종 content를 분리하고 tool-call parser가 <tool_call>을 OpenAI 호환 tool_calls로 변환합니다. 따라서 일반 챗봇보다 코드 수정, 저장소 탐색, 외부 도구 연동을 포함한 agentic workflow에 맞습니다.
  • 기본 컨텍스트 길이는 262,144 tokens이며 YaRN factor 4.0으로 약 1M tokens까지 확장하는 설정을 제공합니다. vLLM과 SGLang에서 rope_scaling을 정적으로 적용하므로 짧은 입력에서는 품질 저하가 생길 수 있습니다. 실제로 긴 코드베이스를 처리할 때만 요청 길이에 맞춰 확장하는 편이 권장됩니다.

제한사항

  • GGUF 저장소는 양자화 형식과 로컬 실행을 제공하지만, README의 benchmark 수치는 Ornith-1.5-9B 원본 모델 기준입니다. 양자화 수준별 정확도나 속도 저하는 별도로 공개되지 않았습니다. 실제 배포에서는 선택한 GGUF 양자화 파일과 하드웨어 조합을 따로 검증해야 합니다.
  • 원본 bf16 모델은 약 19GB이며 단일 80GB GPU 서빙을 기준으로 합니다. GGUF는 llama.cpp와 Ollama에서 실행할 수 있지만 README는 특정 양자화 레벨의 메모리 요구량을 제시하지 않습니다. 따라서 모바일이나 저메모리 환경에서의 실제 처리량은 저장소 정보만으로 판단하기 어렵습니다.
  • reasoning 출력과 tool calling을 사용하려면 최신 런타임과 전용 parser 설정이 필요합니다. README는 Transformers 5.8.1 이상, vLLM 0.19.1 이상, SGLang 0.5.9 이상을 요구합니다. parser가 맞지 않으면 reasoning_content 분리나 OpenAI 호환 tool_calls 변환이 기대대로 동작하지 않을 수 있습니다.

벤치마크

벤치마크지표비교
Terminal-Bench 2.1 (Terminus-2)score46.2기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 43.1, Qwen3.5-9B 21.3, Qwen3.6-35B-A3B 52.5, Gemma-4-31B 42.1
Terminal-Bench 2.1 (Claude Code)score47기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 40.6, Qwen3.5-9B 18.9, Qwen3.6-35B-A3B 49.2
SWE-bench Verifiedscore70.6기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 69.4, Qwen3.5-9B 53.2, Qwen3.6-35B-A3B 73.4, Gemma-4-31B 52
SWE-bench Proscore47.5기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 42.9, Qwen3.5-9B 31.3, Qwen3.6-35B-A3B 49.5, Gemma-4-31B 35.7
SWE-bench Multilingualscore54.4기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 52, Qwen3.5-9B 39.7, Qwen3.6-35B-A3B 67.2, Gemma-4-31B 51.7
NL2Reposcore32.4기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 27.2, Qwen3.5-9B 16.2, Qwen3.6-35B-A3B 29.4, Gemma-4-31B 15.5
SWE Atlas - QnAscore20.6기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 17.9, Qwen3.5-9B 9.2, Qwen3.6-35B-A3B 15.5
HLE (no tools)score20.2기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 16.8, Qwen3.5-9B 14.7, Qwen3.6-35B-A3B 21.4, Gemma-4-31B 19.5
HLE (with tools)score30.5기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 26.4, Qwen3.5-9B 24.5, Qwen3.6-35B-A3B 28.9, Gemma-4-31B 26.5
GPQA Diamondscore86.4기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 82.5, Qwen3.5-9B 81.7, Qwen3.6-35B-A3B 86, Gemma-4-31B 84.3
MCP-Atlasscore54.2기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 49.4, Qwen3.5-9B 46.8, Qwen3.6-35B-A3B 62.8, Gemma-4-31B 55
Toolathlon-Verifiedscore41.2기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 33.4, Qwen3.5-9B 29.6, Qwen3.6-35B-A3B 41.7, Gemma-4-31B 52.8
WideSearchscore59.5기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 55.8, Qwen3.5-9B 53.6, Qwen3.6-35B-A3B 60.1, Gemma-4-31B 54.2
BrowseCompscore56.4기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 44.8, Qwen3.5-9B 41.5, Qwen3.6-35B-A3B 62
ClawEvalscore66.5기반 Ornith-1.5-9B의 공개 수치이며 Ornith-1.0-9B 63.1, Qwen3.5-9B 53.2, Qwen3.6-35B-A3B 68.7, Gemma-4-31B 48.5

이미지 분석

Ornith-1.5-9B와 Ornith-1.0-9B, Qwen3.5-9B, Qwen3.6-35B-A3B, Gemma-4-31B의 코딩·추론·에이전트 벤치마크 점수를 막대그래프로 비교한 이미지입니다.
이미지는 Ornith-1.5-9B가 대부분의 비교 항목에서 Ornith-1.0-9B와 Qwen3.5-9B보다 높은 점수를 기록하는 양상을 보여줍니다. 다만 Qwen3.6-35B-A3B는 Terminal-Bench 2.1, SWE-bench, MCP-Atlas, BrowseComp 등 일부 항목에서 더 높고, Toolathlon-Verified에서는 Gemma-4-31B가 앞서므로 9B 모델의 모든 작업 우위를 의미하지는 않습니다.

109

Likes

54.9k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.