본문으로 건너뛰기

Granite 4.2 학습 데이터 공개 기록

Granite 4.2의 15조 토큰 사전 학습부터 CodeAlchemy 합성 코드와 공개되지 않은 데이터 공백까지 추적한 기록입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

IBM의 Granite 4.2는 3B·8B·30B 규모의 Dense decoder-only 언어 모델로, 다섯 단계에 걸쳐 약 15조 토큰을 사전 학습하고 Apache 2.0으로 공개됐습니다. 학습 기록에는 CodeAlchemy가 만든 약 1조 토큰의 synthetic code, 약 720만 개의 지도 미세 조정 샘플, 8단계 강화학습 순서가 포함됩니다. 다만 사전 학습 데이터셋의 구체적 목록, Phase 5 토큰 수, 필터링 기준과 제거량, 강화학습 단계별 데이터 규모는 공개되지 않았습니다. 따라서 이 글은 Granite 4.2의 학습 구성과 성능 수치를 모으면서도 각 수치의 출처와 공개 기록의 공백을 함께 구분합니다.

섹션별 상세

01
Granite 4.2는 2026년 8월 25일 공개된 3B·8B·30B 규모의 Dense decoder-only 언어 모델이며 세 모델 모두 Apache 2.0 라이선스를 따릅니다. 12개 언어, 131072 시퀀스 길이, 8개 KV head를 공통으로 사용하고 128K 문맥을 512K까지 확장하는 학습 단계가 포함됩니다. 가중치는 Hugging Face에서 받을 수 있지만, Granite Code의 20B·34B 모델은 Granite 4.2와 다른 이전 코드 모델 계열이므로 비교할 때 분리해야 합니다.
02
Granite 4.2 사전 학습은 약 15조 토큰을 다섯 단계로 나누어 진행됐고, 공개된 1~4단계 배분은 Granite 4.1 문서의 구성 수치를 참조합니다. 1단계 10조 토큰의 약 59%는 CommonCrawl, 약 20%는 코드이며, 2~4단계에서는 수학·코드·고품질 웹 데이터·합성 데이터의 비중을 바꾸면서 학습합니다. 5단계는 4K에서 32K·128K·512K로 문맥을 늘리는 과정이고, 512K 단계는 책 80%와 코드 저장소 20%를 사용하지만 전체 토큰 수는 공개되지 않았습니다.
03
IBM Research의 CodeAlchemy 파이프라인은 약 1조 토큰의 합성 소스 코드를 Granite 4.2 학습에 공급했습니다. CodeDev, CodeDialogue, CodeEnhance, CodeQA, CodeTrace의 다섯 생성 전략을 사용하고 GPT-OSS 모델, 15개 프로그래밍 언어, 5,000개가 넘는 라이브러리와 실행 추적을 결합합니다. 실행 기반 검증에서 CodeQA 샘플의 약 28%와 CodeTrace 샘플의 약 75%가 제거됐으며, 문서마다 합성 코드 규모를 1조, 거의 1조, 500B 이상 합성 토큰과 350B 추론 토큰, 약 976.6B 토큰으로 다르게 기록합니다.
04
지도 미세 조정은 약 720만 샘플과 약 1,000억 토큰을 사용하며 이 가운데 약 650억 토큰이 학습 가능 데이터로 집계됩니다. 전체 혼합물은 에이전트형 31.6%와 비에이전트형 68.4%로 나뉘고, 에이전트형 내부에서는 소프트웨어 엔지니어링이 69%, 도구 호출이 12.1%, 터미널 사용이 8.0%를 차지합니다. 데이터는 OpenAI Chat 형식으로 변환한 뒤 GPT-OSS-120B와 Gemma 4의 판정, 저품질·허위·잘못된 도구 상호작용 제거, tools·messages 필드의 SHA-256 중복 제거를 거치지만 임계값과 제거량은 공개되지 않았습니다.
05
8B와 30B는 비동기 GRPO와 leave-one-out advantage baseline을 사용해 8개 항목의 강화학습 순서를 통과합니다. RLVR을 세 차례 반복하며 수학·Lean 증명·경쟁 코딩·STEM 객관식·도구 호출·추론 퍼즐을 다루고, 이후 다중 턴 대화, 코드 보강, OpenHands 기반 SWE 단계, Terminal Harbor·Terminus-2 기반 터미널 사용, 웹 검색, RLHF를 이어갑니다. 3B는 에이전트형 블록을 건너뛰고 기초 강화학습과 정렬 중심의 짧은 경로를 사용하며, 각 단계의 실제 데이터 규모는 공개되지 않았습니다.
06
공식 벤치마크에서 30B는 MMLU-Pro 77.60, AIME25 89.17, GPQA 66.41, LiveCodeBench v6 75.77, SWE-Bench Verified 57.00, RULER 128K 81.38을 기록했습니다. 이 수치는 모두 IBM이 release post에 보고한 결과이며, 2026년 9월 9일 기준 Artificial Analysis의 30B Intelligence Index 15는 추정치로 표시됐고 공식 SWE-bench 리더보드에는 Granite 모델 항목이 없습니다. 따라서 모델 크기별 공식 수치와 독립 재현 결과를 같은 근거 수준으로 취급하기 어렵습니다.
07
공개 기록의 가장 큰 공백은 실제 데이터셋 이름과 학습 단계별 규모입니다. CommonCrawl·CommonCrawl-HQ·Code·Technical·Synthetic 같은 범주명은 있으나 전체 목록은 공개 예정 폴더로 연결되고, CommonCrawl의 라이선스·권리 근거·옵트아웃·robots.txt 처리도 명시되지 않았습니다. Phase 5 토큰 수, 언어별 토큰 배분, 필터링 임계값과 수율, 강화학습별 데이터량, 벤치마크 오염 제거 절차, Hirundo가 제거한 데이터와 검증 방식도 확인되지 않습니다.

용어 해설

밀집 디코더 전용 모델(Dense Decoder-only)
모든 입력 토큰이 전체 Transformer 가중치를 통과하는 언어 모델 구조입니다. Granite 4.2는 Mixture-of-Experts처럼 일부 전문가만 선택하지 않고 모든 파라미터를 사용해 다음 토큰을 생성하며, 3B·8B·30B 세 크기로 제공됩니다.
그룹화 쿼리 어텐션(Grouped-Query Attention)
여러 Query head가 더 적은 수의 Key·Value head를 공유하는 Attention 구조입니다. Granite 4.2는 세 모델 모두 8개의 KV head를 사용해 KV cache 메모리를 줄이고 128K 기본 문맥을 처리하도록 설계됐습니다.
지도 미세 조정(Supervised Fine-tuning)
사람이나 생성 파이프라인이 만든 입력·출력 예시로 사전 학습 모델의 응답 방식을 조정하는 단계입니다. Granite 4.2는 약 720만 샘플과 약 1,000억 토큰을 사용하고, 에이전트형 데이터와 비에이전트형 데이터를 별도 비율로 집계했습니다.
비동기 GRPO(Asynchronous GRPO)
여러 샘플의 보상을 서로 비교해 정책을 업데이트하는 Group Relative Policy Optimization을 비동기 방식으로 수행하는 강화학습 방법입니다. Granite 4.2는 leave-one-out advantage baseline과 검증 가능한 보상, 보상 모델 보상, 에이전트 작업 결과 보상을 결합했습니다.
검색 증강 생성(Retrieval-Augmented Generation)
질의 시점에 외부 문서를 검색하고 그 내용을 모델 입력에 넣어 답변을 생성하는 방식입니다. IBM은 Granite 계열의 기업 활용 사례로 문서 요약, 텍스트·표·이미지를 포함한 멀티모달 RAG, 검색 시스템을 제시했습니다.
머신 언러닝(Machine Unlearning)
학습된 모델에서 특정 데이터나 영향을 제거하고 그 결과를 확인하는 절차입니다. Granite 4.2 기록에는 Hirundo가 제공한 언러닝 단계가 사후 학습 과정에 적용됐다고 적혀 있지만, 무엇을 제거했는지와 검증 방법은 공개되지 않았습니다.

기술

  • Granite 4.2
  • Hugging Face
  • Apache 2.0
  • vLLM
  • SGLang
  • llama.cpp
  • CodeAlchemy
  • GPT-OSS
  • GPT-OSS-120B
  • Gemma 4
  • OpenHands
  • OpenCode
  • Terminus-2
  • SWE-agent
  • GRPO
  • RLVR
  • RLHF
  • Lean
  • SHA-256
  • SWE-bench

활용 사례

  • 문서 요약
  • 검색 증강 생성
  • 텍스트·표·이미지를 포함한 멀티모달 RAG
  • 도구 호출
  • 코드 생성
  • 소프트웨어 엔지니어링 작업
  • 터미널 기반 에이전트 작업
  • 웹 검색 에이전트
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 10.수집 2026. 09. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.