amd/Instella-MoE-16B-A3B-Think
지침 응답과 사고형 추론을 위한 text generation (RL로 강화된 최종 Think 체크포인트)16B (활성 2.8B)researchrail
사전학습부터 RL까지 전 과정 체크포인트를 공개한 AMD의 16B MoE 언어모델.
학습 방식 · MI300X/MI325X에서 Primus 프레임워크와 Miles RL 스택으로 처음부터 학습, 사전학습→중간학습→장문 컨텍스트 확장→SFT→DPO→RL 순서로 단계별 파이프라인을 거쳤다.
TL;DR
Instella-MoE-16B-A3B-Think는 AMD가 Instinct MI300X/MI325X GPU에서 처음부터 학습한 16B 파라미터 Mixture-of-Experts 언어모델로, 토큰당 2.8B만 활성화하는 64개 전문가(공유 2개, 활성 6개) 구성과 Gated Multi-head Latent Attention, 통신-연산을 겹치는 FarSkip-Collective로 대규모 분산 학습 효율을 확보했다. 사전학습·중간학습·장문 컨텍스트 확장·SFT·DPO·RL 순으로 이어지는 파이프라인의 마지막 단계로, RL로 지침 추종과 응답 품질을 추가로 강화한 최종 체크포인트다. Base 체크포인트는 표준 벤치마크 평균 76.7%, 최종 Think 체크포인트는 OLMES 기반 후처리 평가 13개 과제 평균 73.22%를 기록했고, 전 단계 체크포인트와 학습 레시피를 함께 공개해 재현 가능한 오픈 MoE 연구에 적합하다. 다만 ResearchRAIL 라이선스로 연구 목적에 한정되고 다국어 성능은 검증되지 않았다.
핵심 포인트
- 총 16B 중 토큰당 2.8B만 활성화하는 64-전문가 MoE로 Gated MLA와 FarSkip-Collective를 결합했다.
- 사전학습부터 SFT·DPO·RL까지 전 단계 체크포인트와 학습 레시피를 모두 공개해 재현 가능한 오픈 MoE 연구를 지향한다.
- 장문 컨텍스트 확장 단계를 거쳐 HELMET·RULER를 8k부터 64k까지 평가한 결과를 함께 공개했다.
- SFT 이후 DPO와 RL을 순차 적용해 지침 추종과 응답 품질을 단계적으로 끌어올린 최종 Think 체크포인트다.
제한사항
- 연구 목적으로만 공개되어 고신뢰성이 요구되는 안전 크리티컬·의료 용도에는 적합하지 않다.
- 별도 안전 필터링 없이 체크포인트가 배포되므로 사용 전 자체적인 안전성·정확성 검증이 필요하다.
- 다국어 능력이 검증되지 않아 영어 이외 언어에서는 오류나 오해석 응답이 발생할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Instella-MoE-16B-A3B-Base | Avg (%) | 76.7 | — |
| Instella-MoE-16B-A3B-SFT | Avg (%) | 71.58 | — |
| Instella-MoE-16B-A3B-DPO | Avg (%) | 72.67 | — |
| Instella-MoE-16B-A3B-Think | Avg (%) | 73.22 | — |
| HELMET | Avg (HELMET, %) | 41.5 | — |
| RULER | RULER (%) | 79.4 | — |
155
LIKES
2.3k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.