본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

deepreinforce-ai/Ornith-1.0-35B-FP8

터미널 기반 에이전트 코딩과 도구 호출을 포함한 텍스트 생성 및 코드 작성, 코드 기반 질의응답과 에이전트 워크플로 자동화35B256K 컨텍스트mit

Ornith-1.0-35B는 MoE 구조와 자기개선 강화학습을 적용해 에이전트형 코딩 벤치마크에서 높은 점수를 기록하고 단일 GPU 배포를 목표로 경량화된 구현을 제공한다.

학습 방식 · Ornith-1.0-35B는 Gemma4 및 Qwen3.5 기반 MoE 아키텍처 위에 포스트트레이닝된 계열 모델이며 자기개선형 강화학습을 사용해 생성한 솔루션과 그 솔루션을 생성한 스캐폴드를 동시에 최적화했다. 이 방식은 단일 출력의 품질뿐 아니라 탐색 경로 자체를 개선해 더 나은 롤아웃을 찾게 하는 것을 목표로 했다. 훈련에서 에이전트적 생성과 탐색 전략을 결합한 점이 핵심적 특징으로 기재되어 있다.

TL;DR

Ornith-1.0-35B는 MoE 아키텍처 기반의 35B 모델로 Gemma4와 Qwen3.5 계열에서 포스트트레이닝된 계열 모델이며 자기개선형 강화학습을 통해 생성 결과와 그 생성 경로(스캐폴드)를 동시에 최적화해 에이전트형 코딩 성능을 끌어올렸다. README에 수록된 벤치마크에서 Terminal-Bench 2.1 64.2와 SWE-bench Verified 75.6, Claw-eval 평균 69.8 등 코드 중심 평가에서 높은 점수를 기록했고 출력에 <think> 체인오브소트와 tool_call 블록을 포함해 reasoning_content와 structured tool_calls로 서버 측에서 분리·처리할 수 있도록 설계되었다. 배포 관점에서는 transformers·vLLM·SGLang 같은 최신 런타임과 GGUF/llama.cpp 경로를 통해 긴 컨텍스트(128K~262144)를 다루는 서빙 레시피를 제공하며 MIT 라이선스로 공개되어 상용 도입 제약이 낮다. 다만 벤치마크 점수는 각기 다른 하네스·템플릿·컨텍스트 설정에서 산출된 값이므로 동일 설정으로 재현해야 비교가 유효하고 긴 컨텍스트 운영은 메모리·병렬화 설정을 요구한다. 이 모델은 에이전트형 코드 자동화 파이프라인에서 도구 호출 표준화와 추론 로그 분리를 통해 통합 편의성을 제공하는 대신 MoE 특성상 특정 런타임과 병렬 환경을 맞추는 운영 부담이 존재한다.

핵심 포인트

  • Ornith은 MoE 기반 35B 모델을 Gemma4와 Qwen3.5 상단에서 포스트트레이닝한 계열 모델로서 공개 모델군에서 MoE 설계를 채택한 점이 차별화 요소이다. 이 설계는 동일한 파라미터 예산에서 더 높은 표현력을 확보하려는 목적을 가진다. README는 MoE가 계열 구성에서 주요 변형임을 명시하고 있다.
  • 훈련에서 자기개선형 RL로 스캐폴드와 솔루션을 함께 최적화하는 접근법을 사용해 단순한 SFT 대비 에이전트 탐색 성능을 개선하려는 점이 차별점이다. 이 접근은 에이전트형 코드 생성에서 더 나은 탐색 경로를 학습하는 데 초점을 맞춘다. README는 이 메커니즘을 모델의 핵심 설계로 제시하고 있다.
  • 기본 출력 포맷으로 <think> 체인오브소트를 포함하고 서버 파서를 통해 reasoning_content와 tool_calls를 구조화해 제공하는 점이 통합 관점에서 실무적 이점이다. 이 통합은 디버깅과 외부 도구 연동을 단순화해 에이전트 워크플로에서의 적용성을 높인다. 서빙 예제는 vLLM과 SGLang에서의 구체적 파서 설정을 포함한다.
  • 배포 측면에서 단일 GPU 환경을 목표로 한 경량화된 멤버로서 35B 모델을 제공하며 동시에 GGUF와 llama.cpp 등 경량 런타임 호환성을 제공해 다양한 배포 옵션을 지원한다. README에 로컬 테스트용 Transformers 예시와 GGUF 배포 예시가 병기되어 있어 배포 경로가 다변화되어 있다. 이 점이 오픈소스 실무 도입을 용이하게 만든다.

벤치마크

벤치마크지표비교
Terminal-Bench 2.1 (Terminus-2)score64.2
SWE-bench Verifiedscore75.6
Claw-eval Avgscore69.8
NL2Reposcore34.6
SWE Atlas - QnAscore37.1

이미지 분석

성능 비교 바차트 이미지로 Ornith-1.0-35B와 Qwen3.5-35B, Qwen3.6-35B, Gemma4-31B, Qwen3.5-397B의 벤치마크 점수를 나란히 표시하고 있다.
이미지는 여러 코드 중심 벤치마크(예: Terminal-Bench 2.1, SWE-bench, NL2Repo, Claw-eval)를 세로 막대 형태로 나열해 모델 간 점수 차이를 시각적으로 전달하고 있다. 차트 상에서 Ornith-1.0-35B의 막대는 다수 항목에서 표에 기재된 수치와 일치하게 더 높게 나타나며 이는 표에 기록된 64.2, 75.6, 69.8 같은 주요 점수와 시각적으로 대응된다. 하단 주석과 표의 설정 설명을 결합하면 이 시각화는 특정 런타임·템플릿·컨텍스트 길이 설정 하에서 얻은 비교 결과임이 확인된다.

55

LIKES

42.9k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.