본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ibm-granite/granite-4.2-30b

추론, 코드 생성, Tool Calling, Agentic Workflow와 다국어 대화를 위한 text-generation 모델입니다.30B128K 컨텍스트Apache 2.0

추론 모드와 Tool Calling을 결합한 IBM의 30B 다국어 Dense 모델

학습 방식 · Granite-4.1-30B-Base에서 post-training을 거쳐 reasoning, Tool Calling과 instruction following을 강화했습니다. SFT에는 공개 데이터, 합성 reasoning·Tool Calling 데이터, agentic trace와 선별한 human-authored data를 사용했고 30B 모델에는 agentic data를 늘린 두 번째 SFT 단계를 추가했습니다. 이후 GRPO 기반 다단계 강화학습과 RLHF로 수학, 코드, 과학, 도구 사용, 대화 품질과 안전성을 조정했습니다.

TL;DR

Granite-4.2-30B는 Granite-4.1-30B-Base에서 post-training한 30B Dense reasoning fine-tune 모델입니다. 기본 Thinking 모드는 `<think>...</think>` 안에서 단계별 추론을 수행하고, Non-thinking과 Low-effort 모드로 지연과 추론량을 조절합니다. GRPO와 RLHF를 거쳐 수학·코드·Tool Calling·Agentic Workflow를 겨냥했으며, GQA의 8개 KV heads와 128K 기본 컨텍스트를 사용합니다. README 수치에서 AIME25 89.17, SWE Bench Verified 57, RULER 128K 81.38을 기록했습니다.

핵심 포인트

  • Granite-4.1-30B-Base에서 post-training한 30B reasoning fine-tune 모델입니다. 기본적으로 `<think>...</think>` 안에서 단계별 추론을 수행합니다. 복잡한 수학, 코드, 다단계 작업에서 추론 깊이를 활용할 수 있습니다.
  • Thinking, Non-thinking, Low-effort 모드를 한 모델 안에서 전환할 수 있습니다. `enable_thinking`과 `low_effort` 설정으로 추론 토큰과 지연 시간을 조절합니다. 단순 질의에는 직접 응답을 선택하고 복잡한 작업에는 최대 8192 토큰을 사용할 수 있습니다.
  • Tool Calling 과정에서 사용할 도구와 호출 이유를 추론한 뒤 OpenAI function definition 형식으로 호출합니다. vLLM에서는 `granite_thinking_parser`와 `qwen3_coder` parser를 사용합니다. 이 구조는 다단계 Agentic Workflow와 코드 실행 도구를 연결하는 데 맞춰져 있습니다.
  • GQA에서 32개 attention heads와 8개 KV heads를 사용해 30B Dense Transformer를 구성합니다. SwiGLU MLP, RMSNorm, RoPE와 bfloat16 정밀도를 적용합니다. 128K 시퀀스를 기본 지원하고 README는 512K까지의 long-context 확장을 명시합니다.

제한사항

  • SFT 데이터가 영어 중심이고 일부 지원 언어의 비중이 다르므로 영어 외 언어에서는 성능 편차가 생길 수 있습니다. README는 다국어 성능 차이를 완화하기 위해 few-shot 예시를 활용할 수 있다고 안내합니다. 지원 언어에는 한국어, 일본어, 중국어, 독일어 등이 포함되지만 모든 언어를 동일하게 검증하지는 않았습니다.
  • 기본 Thinking 모드는 `<think>...</think>` 안에서 추가 토큰을 생성하므로 Non-thinking 모드보다 지연과 출력 길이가 커질 수 있습니다. 복잡한 추론에는 `max_new_tokens=8192`를 권장하고 단순 응답에는 2048을 사용합니다. 멀티턴 대화에서는 이전 Thinking 내용을 기본적으로 제거해 컨텍스트 사용량을 줄입니다.
  • 모델은 부정확하거나 편향되거나 안전하지 않은 응답을 낼 수 있습니다. `<think>...</think>` 안의 내용은 다듬어지지 않은 중간 추론일 수 있어 최종 결론과 동일하게 취급하면 안 됩니다. 배포 환경에서는 위험 탐지를 위해 Granite Guardian과 함께 사용할 것을 README가 권고합니다.

벤치마크

벤치마크지표비교
SWE Bench Multilingualscore41.89동일 README 표의 8B Dense는 30.78
SWE Bench Verifiedscore57동일 README 표의 8B Dense는 47.67
Terminal-Bench 2.1score29.24동일 README 표의 8B Dense는 20.56
BFCL (v4)score61.39동일 README 표의 8B Dense는 52.39
AIME25score89.17동일 README 표의 8B Dense는 86.67
LiveCodeBench v6score75.77동일 README 표의 8B Dense는 73.24
MMLU-Proscore77.60동일 README 표의 8B Dense는 74.04
RULER 128Kscore81.38동일 README 표의 8B Dense는 71.41

80

LIKES

1.8k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.