본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ornith-ai/Ornith-1.5-35B-A3B

추론 기반 텍스트 생성, 도구 호출, 터미널 코딩 및 에이전트 작업약 35B 전체, 토큰당 약 3B 활성화262K 컨텍스트MIT

35B MoE 구조와 자기개선 RL로 코딩·도구 사용을 강화한 reasoning 모델

학습 방식 · Qwen3.5와 Gemma4를 기반으로 한 Ornith-1.0의 continued pretraining·mid-training·post-training을 확장해, 과제 생성·scaffold 구성·solution rollout을 함께 최적화하는 reinforcement learning 루프를 적용했습니다.

TL;DR

Ornith-1.5-35B-A3B는 Qwen3.5와 Gemma4 계열을 기반으로 추가 학습한 약 35B MoE 추론 모델이며, 토큰마다 약 3B 파라미터만 활성화합니다. 고정된 사람이 만든 데이터셋에만 의존하지 않고 새 과제를 생성한 뒤 scaffold와 해결 rollout을 함께 최적화하는 reinforcement learning 루프를 사용합니다. 기본적으로 <think> 블록을 생성하고 이를 reasoning_content로 분리하며, <tool_call>을 OpenAI 호환 tool_calls로 변환해 코딩 에이전트와 도구 사용에 연결합니다. SWE-bench Verified 79, Terminal-Bench 2.1 68.5, GPQA Diamond 89.2를 기록해 터미널 코딩과 도구 기반 작업에 적합하지만, 운영에는 약 70GB의 bf16 메모리와 최신 serving runtime이 필요합니다.

핵심 포인트

  • 35B MoE 구조에서 토큰마다 약 3B 파라미터만 활성화해 추론 계산량을 줄입니다.
  • 고정된 사람이 만든 과제 대신 과제 생성부터 전략과 rollout 보상까지 함께 최적화합니다.
  • <think> 블록과 reasoning_content를 분리하고 <tool_call>을 OpenAI 호환 tool_calls로 변환합니다.
  • SWE-bench Verified 79점과 GPQA Diamond 89.2점으로 코딩·추론 성능을 측정했습니다.

제한사항

  • 약 35B 파라미터를 저장하므로 bf16 기준 모델 메모리만 약 70GB가 필요합니다. README는 256K context 여유를 위해 2×80GB GPU 구성을 권장합니다. 따라서 토큰당 활성 파라미터가 약 3B여도 단일 일반 GPU 환경에서는 운영 구성이 제한됩니다.
  • 기본 출력은 최종 답변 전에 <think> … </think> 블록을 생성합니다. reasoning parser와 tool-call parser를 지원하는 최신 런타임이 필요하며, README는 Transformers ≥ 5.8.1, vLLM ≥ 0.19.1, SGLang ≥ 0.5.9를 요구합니다. 파서 설정이 맞지 않으면 reasoning_content와 tool_calls가 의도한 API 필드로 분리되지 않을 수 있습니다.
  • YaRN은 모든 요청에 같은 scaling factor를 정적으로 적용합니다. 일반 길이 입력에서도 품질이 조금 낮아질 수 있으므로 262,144 tokens를 실제로 넘는 작업에만 활성화해야 합니다. README는 factor 4.0에서 약 1M tokens를 목표로 하며, 약 524,288 tokens 작업에는 factor 2.0을 권장합니다.

벤치마크

벤치마크지표비교
Terminal-Bench 2.1 (Terminus-2)score67.8README 공개 비교 수치: Ornith-1.0-35B-A3B 64.2, Qwen3.6-35B-A3B 52.5
Terminal-Bench 2.1 (Claude Code)score68.5README 공개 비교 수치: Ornith-1.0-35B-A3B 62.8, Qwen3.6-35B-A3B 49.2
SWE-bench Verifiedscore79README 공개 비교 수치: Ornith-1.0-35B-A3B 75.6, Qwen3.6-35B-A3B 73.4, Qwen3.5-397B 76.4
SWE-bench Proscore59.6README 공개 비교 수치: Ornith-1.0-35B-A3B 50.4, Qwen3.6-35B-A3B 49.5, Qwen3.5-397B 51.6
SWE-bench Multilingualscore71.4README 공개 비교 수치: Ornith-1.0-35B-A3B 69.3, Qwen3.6-35B-A3B 67.2, Qwen3.5-397B 69.3
DeepSWEscore22README 공개 비교 수치: Ornith-1.0-35B-A3B 0, Qwen3.6-35B-A3B 0, Qwen3.5-397B 1
Frontier-Bench v0.1score5.1README 공개 비교 수치: Ornith-1.0-35B-A3B 1.4, Qwen3.6-35B-A3B 1.4, Qwen3.5-397B 1.4
NL2Reposcore46.2README 공개 비교 수치: Ornith-1.0-35B-A3B 34.6, Qwen3.6-35B-A3B 29.4, Qwen3.5-397B 36.8
SWE Atlas - QnAscore39.8README 공개 비교 수치: Ornith-1.0-35B-A3B 37.1, Qwen3.6-35B-A3B 15.5, Qwen3.5-397B 20.4
HLE (no tools)score25.6README 공개 비교 수치: Ornith-1.0-35B-A3B 20.8, Qwen3.6-35B-A3B 21.4, Qwen3.5-397B 28.7
HLE (with tools)score33.4README 공개 비교 수치: Ornith-1.0-35B-A3B 30.1, Qwen3.6-35B-A3B 28.9, Qwen3.5-397B 48.3
GPQA Diamondscore89.2README 공개 비교 수치: Ornith-1.0-35B-A3B 86.2, Qwen3.6-35B-A3B 86, Gemma-4-31B 84.3, Qwen3.5-397B 88.4
MCP-Atlasscore70.2README 공개 비교 수치: Ornith-1.0-35B-A3B 64.4, Qwen3.6-35B-A3B 62.8, Muse-Glimmer-30B 75.5, Qwen3.5-397B 72.3
Toolathlon-Verifiedscore48.7README 공개 비교 수치: Ornith-1.0-35B-A3B 42.4, Qwen3.6-35B-A3B 41.7, Gemma-4-31B 40.8, Qwen3.5-397B 38.3
WideSearchscore67.8README 공개 비교 수치: Ornith-1.0-35B-A3B 63.4, Qwen3.6-35B-A3B 60.1, Gemma-4-31B 54.2, Qwen3.5-397B 74
BrowseCompscore67.6README 공개 비교 수치: Ornith-1.0-35B-A3B 63.5, Qwen3.6-35B-A3B 62, Qwen3.5-397B 78.6
ClawEvalscore72.5README 공개 비교 수치: Ornith-1.0-35B-A3B 69.8, Qwen3.6-35B-A3B 68.7, Gemma-4-31B 48.5, Qwen3.5-397B 70.7

이미지 분석

Ornith-1.5-35B-A3B와 Ornith-1.0-35B-A3B, Qwen3.6-35B-A3B, Muse-Glimmer-30B, Gemma-4-31B, Qwen3.5-397B의 코딩·추론·에이전트 벤치마크 점수를 막대그래프로 비교한 이미지입니다.
이미지는 Terminal-Bench 2.1, SWE-bench Verified, DeepSWE, Frontier-Bench, NL2Repo, SWE Atlas - QnA, HLE, GPQA Diamond, MCP-Atlas, Toolathlon-Verified, WideSearch, BrowseComp의 점수를 비교합니다. Ornith-1.5-35B-A3B는 SWE-bench Verified 79, GPQA Diamond 89.2, MCP-Atlas 70.2 등에서 높은 점수를 기록하지만, MCP-Atlas 75.5와 BrowseComp 78.6에서는 Muse-Glimmer-30B 또는 Qwen3.5-397B가 더 높습니다.

212

Likes

1.7k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.