본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ornith-ai/Ornith-1.5-35B-A3B-GGUF

추론 기반 텍스트 생성과 도구 호출, 터미널 중심의 agentic coding35B, 토큰당 약 3B 활성화262K 컨텍스트MIT

35B MoE에서 3B만 활성화하며 코드·도구 사용·추론을 수행하는 GGUF 모델

학습 방식 · Ornith-1.0의 Qwen3.5·Gemma4 기반 continued pretraining, mid-training, post-training을 확장해 과제 생성·scaffold 구성·solution rollout을 함께 개선하는 reinforcement learning 기반 self-improvement loop를 적용했다.

TL;DR

Ornith-1.5-35B-A3B-GGUF는 Ornith-1.5-35B-A3B를 GGUF 형식으로 제공하는 양자화 배포본이며, 원본은 Qwen3.5와 Gemma4 계열에서 출발한 35B Mixture-of-Experts reasoning 모델이다. 토큰마다 약 3B 파라미터만 활성화하면서 <think> 추론 블록과 tool calling을 사용해 코드 수정, 검색, MCP 연동 같은 agent 작업을 처리한다. 과제 생성·scaffold 구성·solution rollout을 reinforcement learning으로 함께 최적화한 결과 원본 모델 기준 SWE-bench Verified 79, Terminal-Bench 2.1 68.5, GPQA Diamond 89.2를 기록했다. GGUF는 llama.cpp와 Ollama에서 로컬로 구동하기 좋지만, README에는 이 변환본의 quantization 수준과 독립 성능 측정값이 없다.

핵심 포인트

  • 전체 35B 중 토큰마다 약 3B만 활성화하는 Mixture-of-Experts 구조로 추론 비용을 낮춘다.
  • 고정된 사람이 만든 과제 대신 과제 생성과 scaffold 구성, solution rollout을 함께 최적화한다.
  • <think> 블록과 reasoning_content를 분리하고 <tool_call>을 OpenAI 호환 tool_calls로 변환한다.
  • 262,144토큰 컨텍스트와 YaRN 확장을 지원해 대규모 코드베이스와 장시간 agent 작업에 맞춘다.

제한사항

  • GGUF 변환의 구체적인 quantization 수준과 이에 따른 품질·메모리 수치는 README에 명시되지 않았다.
  • 원본 모델을 bf16으로 서비스하려면 약 70GB가 필요하고 256K 컨텍스트 여유를 위해 80GB GPU 2장이 권장된다.
  • YaRN은 모든 요청에 같은 scaling factor를 정적으로 적용하므로 일반 길이 입력에서 품질이 약간 낮아질 수 있다.

벤치마크

벤치마크지표비교
Terminal-Bench 2.1 (Terminus-2)score67.8Ornith-1.0-35B-A3B 64.2, Qwen3.6-35B-A3B 52.5, Gemma-4-31B 42.1, Muse-Glimmer-30B 51.7, Qwen3.5-397B 53.5. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
Terminal-Bench 2.1 (Claude Code)score68.5Ornith-1.0-35B-A3B 62.8, Qwen3.6-35B-A3B 49.2, Qwen3.5-397B 48.6. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
SWE-bench Verifiedscore79Ornith-1.0-35B-A3B 75.6, Qwen3.6-35B-A3B 73.4, Gemma-4-31B 52, Muse-Glimmer-30B 76, Qwen3.5-397B 76.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
SWE-bench Proscore59.6Ornith-1.0-35B-A3B 50.4, Qwen3.6-35B-A3B 49.5, Gemma-4-31B 35.7, Muse-Glimmer-30B 51.2, Qwen3.5-397B 51.6. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
SWE-bench Multilingualscore71.4Ornith-1.0-35B-A3B 69.3, Qwen3.6-35B-A3B 67.2, Gemma-4-31B 51.7, Qwen3.5-397B 69.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
DeepSWEscore22Ornith-1.0-35B-A3B 0, Qwen3.6-35B-A3B 0, Qwen3.5-397B 1. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
Frontier-Bench v0.1score5.1Ornith-1.0-35B-A3B 1.4, Qwen3.6-35B-A3B 1.4, Qwen3.5-397B 1.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
NL2Reposcore46.2Ornith-1.0-35B-A3B 34.6, Qwen3.6-35B-A3B 29.4, Gemma-4-31B 15.5, Qwen3.5-397B 36.8. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
SWE Atlas - QnAscore39.8Ornith-1.0-35B-A3B 37.1, Qwen3.6-35B-A3B 15.5, Qwen3.5-397B 20.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
HLE (no tools)score25.6Ornith-1.0-35B-A3B 20.8, Qwen3.6-35B-A3B 21.4, Gemma-4-31B 19.5, Muse-Glimmer-30B 22, Qwen3.5-397B 28.7. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
HLE (with tools)score33.4Ornith-1.0-35B-A3B 30.1, Qwen3.6-35B-A3B 28.9, Gemma-4-31B 26.5, Qwen3.5-397B 48.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
GPQA Diamondscore89.2Ornith-1.0-35B-A3B 86.2, Qwen3.6-35B-A3B 86, Gemma-4-31B 84.3, Muse-Glimmer-30B 83.5, Qwen3.5-397B 88.4. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
MCP-Atlasscore70.2Ornith-1.0-35B-A3B 64.4, Qwen3.6-35B-A3B 62.8, Gemma-4-31B 55, Muse-Glimmer-30B 75.5, Qwen3.5-397B 72.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
Toolathlon-Verifiedscore48.7Ornith-1.0-35B-A3B 42.4, Qwen3.6-35B-A3B 41.7, Gemma-4-31B 40.8, Qwen3.5-397B 38.3. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
WideSearchscore67.8Ornith-1.0-35B-A3B 63.4, Qwen3.6-35B-A3B 60.1, Gemma-4-31B 54.2, Qwen3.5-397B 74. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
BrowseCompscore67.6Ornith-1.0-35B-A3B 63.5, Qwen3.6-35B-A3B 62, Qwen3.5-397B 78.6. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.
ClawEvalscore72.5Ornith-1.0-35B-A3B 69.8, Qwen3.6-35B-A3B 68.7, Gemma-4-31B 48.5, Qwen3.5-397B 70.7. README의 원본 Ornith-1.5-35B-A3B 공개 수치이며 GGUF 변환본 자체의 측정값은 아니다.

이미지 분석

Ornith-1.5-35B-A3B와 비교 모델의 코딩·추론·agentic benchmark 점수를 막대그래프로 비교한 이미지
이미지는 Ornith-1.5-35B-A3B가 Terminal-Bench 2.1에서 68.5, SWE-bench Verified에서 79, GPQA Diamond에서 89.2를 기록하고, MCP-Atlas에서 70.2, Toolathlon-Verified에서 48.7을 기록한 결과를 비교한다. 대부분의 코딩과 도구 사용 평가에서 Ornith-1.0-35B-A3B와 Qwen3.6-35B-A3B를 앞서지만, MCP-Atlas·WideSearch·BrowseComp에서는 Qwen3.5-397B 또는 Muse-Glimmer-30B가 더 높은 점수를 기록한다.

159

Likes

53.7k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.