MiniMaxAI/MiniMax-M3
MiniMax-M3는 약 428B 파라미터 규모의 네이티브 멀티모달 모델로 1M 토큰 컨텍스트를 지원하고 MiniMax Sparse Attention을 통해 긴 문맥 효율을 크게 개선한 모델이다.
학습 방식 · 모델은 학습 초기 단계부터 이미지·비디오·텍스트를 혼합해 학습하는 mixed-modality training을 적용했고 모델 규모 확장을 위해 MoE 계열의 활성화 전략을 사용해 입력당 약 23B 파라미터를 활성화하도록 설계되었다.
TL;DR
MiniMax-M3는 이미지·비디오·텍스트를 학습 초기부터 혼합해 처리하도록 설계된 네이티브 멀티모달 모델로서 약 428B 전체 파라미터와 약 23B 활성화 파라미터를 가진다. 모델은 1M 토큰 컨텍스트를 지원하도록 설계되었고 MiniMax Sparse Attention(MSA)을 통해 긴 문맥에서 어텐션 FLOPs와 레이턴시를 크게 낮추는 것을 목표로 삼았다. README에서 M3는 이전 세대(M2) 대비 1M 컨텍스트에서 prefill과 decode에서 수배~수십배의 속도 향상을 보고하고 있으며, 이미지 자료는 MSA가 GQA 대비 FLOPs 및 레이턴시에서 대폭 개선을 보였음을 정량적으로 제시한다. 이 설계는 긴 히스토리와 멀티모달 증거를 요구하는 코딩·에이전트형 장기 과제에서 실용적 이점을 제공하는 대신 전체 파라미터 규모와 특화된 서빙 스택으로 인한 인프라 요구사항이 존재함을 의미한다.
핵심 포인트
- 학습 초기부터 이미지·비디오·텍스트를 혼합해 훈련한 네이티브 멀티모달 설계로, 멀티모달 증거의 의미적 융합을 내부 표현 수준에서 확보한 점이 차별화된다.
- MiniMax Sparse Attention(MSA)를 핵심 연산자로 채택해 백만 토큰급 컨텍스트에서 어텐션 FLOPs와 레이턴시를 줄이도록 설계된 점이 경쟁 모델과의 주요 구분점이다.
- 모델 전체 파라미터는 매우 크지만 MoE 형태의 활성화 전략을 통해 입력당 활성화 파라미터를 수십억 단위로 제한하여 대규모 모델을 실무 환경에서 운영 가능한 방식으로 설계했다.
- 네이티브 멀티모달 학습으로 이미지·비디오와 텍스트 간의 의미 결합이 초기부터 학습되어 멀티모달 증거를 바로 활용하는 질적 장점이 있다.
이미지 분석


1.3k
LIKES
190.8k
DOWNLOADS
7 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.