본문으로 건너뛰기

JetBrains, 12B 파라미터 MoE 모델 Mellum2 공개

JetBrains가 텍스트와 코드 작업에 최적화된 12B 파라미터의 효율적인 Mixture-of-Experts 모델 Mellum2를 공개했다.

섹션별 상세

01
Mellum2는 MoE 아키텍처를 채택하여 총 12B 파라미터 중 토큰당 2.5B만 활성화한다. 이 구조는 모델의 전체 용량은 유지하면서 추론 시 연산량을 줄여 실시간 워크로드의 비용과 지연 시간을 낮춘다.
02
이 모델은 코드 생성, 추론, 과학, 수학 벤치마크에서 동급 모델과 경쟁력 있는 성능을 기록했다. 특히 2배 이상 빠른 추론 속도를 통해 고처리량 프로덕션 환경에 적합한 효율성을 확보했다.
Mellum2의 다양한 벤치마크 성능을 비교한 결과 차트.
ChartLiveCodeBench, BFCL, AIME 등 여러 벤치마크에서 Mellum2가 다른 모델들과 비교하여 어떤 성능을 보이는지 시각화했다. 이를 통해 모델의 코드 생성 및 추론 능력이 동급 모델 대비 경쟁력이 있음을 보여준다.
03
주요 활용 사례는 멀티 모델 시스템의 라우팅 및 오케스트레이션, RAG 파이프라인의 컨텍스트 처리, 에이전트의 서브 태스크 수행이다. 대형 모델을 호출하기 전 단계에서 효율적인 중간 연산을 처리하여 전체 시스템의 비용과 속도를 개선한다.
04
프라이빗 배포를 고려하여 설계되었으며, 내부 데이터나 보안이 중요한 환경에서 자체 호스팅이 가능하다. 텍스트와 코드 작업에 집중하여 범용 멀티모달 모델보다 가볍고 제어하기 쉬운 구조를 갖췄다.

용어 해설

전문가 혼합(MoE)
Mixture-of-Experts의 약자로, 모델의 전체 파라미터 중 특정 토큰 처리에 필요한 일부 전문가 네트워크만 활성화하는 아키텍처입니다. 전체 모델 용량은 크지만 추론 시 연산 비용을 획기적으로 줄여 효율성을 높입니다.
지연 시간(Latency)
입력 데이터가 모델에 전달된 후 결과가 출력되기까지 걸리는 시간입니다. 실시간 AI 서비스나 고처리량 시스템에서는 이 지연 시간을 최소화하는 것이 핵심 성능 지표입니다.
검색 증강 생성(RAG)
외부 지식 베이스에서 관련 정보를 검색하여 모델의 프롬프트에 주입하는 기술입니다. 모델이 학습하지 않은 최신 정보나 내부 데이터를 기반으로 답변을 생성하게 하여 환각 현상을 줄입니다.

기술

  • Mellum2
  • Mixture-of-Experts

활용 사례

  • 라우팅 및 오케스트레이션
  • RAG 파이프라인
  • 에이전트 서브 태스크
  • 프라이빗 배포
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 02.수집 2026. 06. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.