본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

MiniMaxAI/MiniMax-M3

이미지·비디오·텍스트를 입력으로 받아 통합된 텍스트 출력을 생성하는 image-text-to-text 멀티모달 생성 및 장기 문맥 추론 태스크이다.~428B parameters, ~23B activated parameters1K 컨텍스트minimax-community

MiniMax-M3는 약 428B 파라미터 규모의 네이티브 멀티모달 모델로 1M 토큰 컨텍스트를 지원하고 MiniMax Sparse Attention을 통해 긴 문맥 효율을 크게 개선한 모델이다.

학습 방식 · 모델은 학습 초기 단계부터 이미지·비디오·텍스트를 혼합해 학습하는 mixed-modality training을 적용했고 모델 규모 확장을 위해 MoE 계열의 활성화 전략을 사용해 입력당 약 23B 파라미터를 활성화하도록 설계되었다.

TL;DR

MiniMax-M3는 이미지·비디오·텍스트를 학습 초기부터 혼합해 처리하도록 설계된 네이티브 멀티모달 모델로서 약 428B 전체 파라미터와 약 23B 활성화 파라미터를 가진다. 모델은 1M 토큰 컨텍스트를 지원하도록 설계되었고 MiniMax Sparse Attention(MSA)을 통해 긴 문맥에서 어텐션 FLOPs와 레이턴시를 크게 낮추는 것을 목표로 삼았다. README에서 M3는 이전 세대(M2) 대비 1M 컨텍스트에서 prefill과 decode에서 수배~수십배의 속도 향상을 보고하고 있으며, 이미지 자료는 MSA가 GQA 대비 FLOPs 및 레이턴시에서 대폭 개선을 보였음을 정량적으로 제시한다. 이 설계는 긴 히스토리와 멀티모달 증거를 요구하는 코딩·에이전트형 장기 과제에서 실용적 이점을 제공하는 대신 전체 파라미터 규모와 특화된 서빙 스택으로 인한 인프라 요구사항이 존재함을 의미한다.

핵심 포인트

  • 학습 초기부터 이미지·비디오·텍스트를 혼합해 훈련한 네이티브 멀티모달 설계로, 멀티모달 증거의 의미적 융합을 내부 표현 수준에서 확보한 점이 차별화된다.
  • MiniMax Sparse Attention(MSA)를 핵심 연산자로 채택해 백만 토큰급 컨텍스트에서 어텐션 FLOPs와 레이턴시를 줄이도록 설계된 점이 경쟁 모델과의 주요 구분점이다.
  • 모델 전체 파라미터는 매우 크지만 MoE 형태의 활성화 전략을 통해 입력당 활성화 파라미터를 수십억 단위로 제한하여 대규모 모델을 실무 환경에서 운영 가능한 방식으로 설계했다.
  • 네이티브 멀티모달 학습으로 이미지·비디오와 텍스트 간의 의미 결합이 초기부터 학습되어 멀티모달 증거를 바로 활용하는 질적 장점이 있다.

이미지 분석

대형 테이블 형태의 벤치마크 이미지로서 다양한 벤치마크 항목과 여러 모델의 성능 수치가 행렬 형태로 배치되어 있다. 표에는 코딩 성능, 에이전트형 장기 과제, 일반 언어·멀티모달 벤치마크 등이 포함되어 있고 모델별로 세부 항목 점수가 제시되어 있다. README 본문에서 '코딩 및 cowork 능력에서 최전선 수준(frontier-level) 성능'을 표가 뒷받침하는 근거로 제시하고 있으므로 벤치 표는 모델의 다양한 태스크 성능을 종합적으로 보여주는 자료로 활용된다.
이미지는 다수의 벤치 항목과 수치가 포함된 표 형식 자료로, 표 자체가 모델의 과제별 성능 분포와 상대 비교를 시각화하고 있다. 표의 구체적 숫자들은 이미지에 직접 포함되어 있어 시각적 근거로 사용 가능하지만 README 본문에는 일부 요약 수치만 기재되어 있으므로 정밀한 수치 해석은 원문 표의 데이터와 대조해야 한다. 벤치 항목 구성은 README의 '코딩·cowork' 성능 주장과 일치하며, 장기 컨텍스트·에이전트형 과제에 초점이 맞춰진 항목들이 눈에 띈다.
세 개의 선형 그래프를 통해 GQA 대비 MSA의 효율성을 비교하는 이미지로서, Per-Token FLOPs, Prefilling 레이턴시, Decoding 레이턴시의 시퀀스 길이(또는 KV 길이) 의존성을 시각화하고 있다. 그래프 상에 1M 토큰 지점에서의 상대 개선치를 크게 표시해 FLOPs 감소 및 레이턴시 속도 향상 수치를 직관적으로 보여준다. 이 이미지는 README의 MSA 효율 주장에 직접적인 정량적 근거를 제공하는 보조 자료로 기능한다.
왼쪽 그래프는 Per-Token Attention FLOPs를 시퀀스 길이 함수로 비교하며 이미지 내 표시는 1M 토큰에서 약 28.4배의 FLOPs 감소를 나타내고 있다. 중앙 그래프는 프리필(prefill) 단계 레이턴시를 비교하며 이미지 내 표시는 1M 토큰에서 약 14.2배의 속도 향상을, 오른쪽 그래프는 디코딩 단계의 토큰당 레이턴시를 비교하며 1M 토큰에서 약 7.6배의 속도 향상을 각각 표기하고 있다. 이 수치들은 이미지 기반 정량 결과로서 README 본문의 요약(예: 9×/15× 등 다른 기준의 비교)과 보완적으로 읽어야 하며, 이미지가 MSA의 스케일링 이점을 실험적으로 시각화하고 있음이 확인된다.

1.3k

LIKES

190.8k

DOWNLOADS

7 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.