16B MoE 설계로 토큰당 2.8B 활성 파라미터와 32k 토큰 생성 지원을 결합한 AMD의 공개 연구체계
Instella-MoE는 16B 총 파라미터와 토큰당 2.8B 활성 파라미터를 가진 AMD의 공개 Mixture-of-Experts LLM로서 Gated MLA와 FarSkip-Collective를 통해 대규모 분산 학습과 장문 생성 성능을 겨냥해 설계되었다. 이 모델은 사전학습부터 SFT·DPO·RL까지 전체 파이프라인의 중간 및 최종 체크포인트를 공개해 연구 재현성을 확보했다. AMD ROCm과 Primus/Miles 스택에서 MI300 계열 GPU를 활용한 하드웨어-소프트웨어 공동 최적화가 성능 효율에 기여했다.
TL;DR
Instella-MoE는 AMD가 공개한 16B 파라미터 Mixture-of-Experts 언어모델로서 토큰당 2.8B 활성 파라미터, 64개 전문가와 토큰당 6개 활성화 구성을 통해 희소 활성화의 효율성을 실현했다. Gated MLA 어텐션과 FarSkip-Collective 통신 패턴을 도입해 어텐션의 선택적 연산과 통신-연산 오버랩을 구현했고 Primus/Miles와 ROCm 스택에서 MI300 계열 GPU에 맞춘 하드웨어-소프트웨어 최적화를 적용했다. 사전학습부터 SFT·DPO·RL에 이르는 단계적 파이프라인과 모든 중간 체크포인트를 공개했으며 표준 벤치마크에서 베이스 평균 76.7%를 기록하고 포스트트레인 Think 버전의 평균이 73.22%로 보고되어 공개 연구용 MoE 모델로서 성능과 재현성 측면에서 가시적 결과를 제공한다. 단, 라이선스는 연구용(researchrail)으로 상업적·안전 크리티컬 용도에는 제약이 있고 다국어 검증이 충분치 않으므로 활용 시 별도 안전·정확성 검증이 필요하다.
핵심 역량
- 지침 기반 대화 및 자유형 텍스트 생성이 가능하며 SFT와 RL을 거쳐 응답의 일관성과 지침 준수 성능이 향상되어 있다.
- 장문 문맥 처리가 가능하며 모델 파이프라인에서 long-context 확장 단계를 포함해 최대 32768토큰까지의 생성 실험을 지원했다.
- 희소 활성화 MoE 구조로 토큰당 활성 파라미터를 낮춰 동일 총 파라미터 대비 추론·메모리 효율을 개선하는 특성을 보인다.
- 선호 데이터 기반 DPO 및 RL 단계가 포함되어 응답 품질과 사용자 선호 정렬 성능을 높이도록 설계되었다.
강점
- 전체 공개 모델임에도 불구하고 공개된 표준 벤치마크에서 높은 평균 점수(Instella-MoE-Base 평균 76.7%)를 기록하여 연구용 오픈 모델 중 성능 우위를 보였다. 이 수치는 README의 표와 비교 차트에서 확인되는 수치로서 동급 공개 모델과의 비교에서 경쟁력이 있다.
- MoE 설계로 총 파라미터 대비 토큰당 활성 파라미터가 낮아 추론과 학습에서 자원 효율을 확보했으며 GPU별 최적화(Primus, FarSkip-Collective)가 통신 비용을 줄여 대규모 분산 학습이 실용 가능하다.
- 사전학습부터 RL까지의 전체 파이프라인과 중간체크포인트를 공개해 재현성 및 추가 연구 개발에 필요한 인프라와 데이터를 제공하는 점이 실용적 강점으로 작용한다.
훈련 방식
모델은 AMD Instinct MI300X/MI325X에서 Primus 프레임워크와 Miles RL을 사용해 스크래치(pre-train)로 시작하여 mid-train, long-context 확장, SFT, DPO, RL 순으로 단계별로 훈련을 진행했다. 각 단계에서는 데이터 혼합과 목표 손실이 달라지며 SFT 이후에는 선호 정렬을 위해 DPO가 적용되었다. 이 파이프라인 전체의 체크포인트와 레시피가 공개되어 훈련 재현과 추가 미세조정이 가능하다.
알아두면 좋은 것
- 모든 훈련 단계의 체크포인트와 훈련 레시피가 공개되어 재현성과 추가 연구를 위한 기반을 제공하며 데이터 혼합, 하이퍼파라미터 및 중간 체크포인트를 포함한다.
- 학습과 추론은 AMD ROCm 기반 Primus 트레이닝 프레임워크와 Miles RL 스택 위에서 이루어졌고 MI300X/MI325X GPU에 맞추어 통신·연산 최적화가 이루어졌다.
- 모델은 연구용 라이선스('researchrail')로 공개되어 상업적 사용을 제한하며 안전성·정확성 측면에서 연구 목적 외 적용을 권장하지 않는다.
- 장문 평가(HELMET, RULER)와 표준 벤치마크에서의 성능표를 제공해 MoE 설계의 효율성과 장문 성능을 수치로 확인할 수 있다.
기술적 특징
- Instella-MoE는 희소 활성화 MoE 구조로 설계되어 총 16B 파라미터를 유지하면서 토큰당 활성 파라미터를 2.8B로 제한해 연산·메모리 효율을 확보했다. 이 설계는 입력 토큰마다 일부 전문가만 활성화되도록 라우팅하여 동일 총 파라미터 대비 추론 비용을 낮추는 목적을 가지고 있다. 활성화 전문가 수와 공유 전문가 구성(총 64개 전문가, 토큰당 6개 활성화, 공유 전문가 2개)은 설계 목표에 맞게 명시되어 있다.
- Gated Multi-head Latent Attention(Gated MLA)를 도입해 어텐션 단계에서 헤드별·잠재 경로별로 게이팅을 적용함으로써 표현 전달을 선택적으로 제어했다. 이 방법은 중요 정보에 더 많은 연산을 집중시키고 비판요소의 잡음을 줄여 MoE의 희소성 효과와 결합되어 효율적인 표현 학습을 가능하게 했다.
- FarSkip-Collective 통신 패턴을 통해 분산학습에서 통신과 연산을 겹치게 스케줄링해 GPU 간 통신 대기 시간을 줄였다. 이 패턴은 특히 전문가 기반 라우팅에서 발생하는 대규모 텐서 교환에서 유효하며 MI300 계열 GPU의 메모리·대역폭 특성에 맞춰 최적화되었다.
- 학습 파이프라인은 단계적 접근을 취해 사전학습→미드트레인→장문(롱 컨텍스트) 확장→SFT→DPO→RL 순으로 진행되며 각 단계는 데이터 혼합과 목표가 달라 성능을 점진적으로 개선하는 구조였다. 이 구조로 인해 장문 처리 능력과 지침 준수 성능이 순차적으로 향상되었다.
- 하드웨어-소프트웨어 공동 최적화를 목표로 AMD ROCm 스택과 Primus 프레임워크에서 학습과 추론을 수행했고, 이 환경에서의 구현·튜닝(메모리 배치, 통신 스케줄링 등)이 대규모 MoE 학습의 실용성을 끌어올렸다.
차별점
- 사전학습부터 RL까지 전체 파이프라인의 모든 단계와 중간 체크포인트를 공개했기에 연구 재현성과 파생 연구에 필요한 데이터·하이퍼파라미터 접근성이 확보되어 있다. 이 공개 범위는 사용자가 같은 파이프라인을 따라 실험하거나 부분적으로 재현할 때 유용한 근거 자료를 제공한다. 공개된 레시피에는 데이터 혼합과 각 단계의 하이퍼파라미터가 포함되어 있다.
- 하드웨어-특화 최적화가 포함되어 있으며 MI300X/MI325X 기반의 Primus 및 FarSkip-Collective 통신 전략으로 AMD 인프라에서의 학습·추론 효율을 극대화했다. 이 접근은 일반적인 GPU 클러스터에 비해 통신·연산 오버헤드를 줄이는 방향으로 설계되었다. 결과적으로 분산 학습 시 MoE 특유의 통신 병목을 낮추는 효과가 기대된다.
- Gated MLA라는 어텐션 변형과 MoE 희소 활성화의 조합으로 토큰별 연산 집중도를 높였고 활성화 파라미터를 관리해 성능 대 비용 비율을 개선한 설계적 차별성이 있다. 게이팅은 중요 정보에 더 많은 표현 용량을 할당하도록 유도하고 이는 결과표에서의 장문·추론 성능 향상과 연결되었다. 이러한 구조는 동일 파라미터 대역에서 더 나은 효율을 목표로 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Instella-MoE-16B-A3B-Base | Avg (%) | 76.7 | — |
| Instella-MoE-16B-A3B-SFT | Avg (%) | 71.58 | — |
| Instella-MoE-16B-A3B-DPO | Avg (%) | 72.67 | — |
| Instella-MoE-16B-A3B-Think | Avg (%) | 73.22 | — |
| HELMET | Avg (HELMET, %) | 41.5 | — |
| RULER | RULER (%) | 79.4 | — |
이미지 분석




93
Likes
1.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.