본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

upstage/Solar-Open2-250B

오피스 업무·문서 작업·코딩을 위한 250B-A15B 하이브리드 어텐션 에이전틱 MoE 언어모델250B-A15B1K 컨텍스트other

250B 중 15B만 활성화하며 1M 컨텍스트를 지원하는 영어·한국어·일본어 에이전틱 MoE 모델

학습 방식 · Solar Open 1(102B)에서 살아남는 2.3%의 가중치만 이전하고 나머지는 무작위 초기화한 뒤, softmax 1개·선형 어텐션 3개를 반복하는 하이브리드 구조를 약 12조 토큰으로 사전학습했다.

TL;DR

Solar Open 2는 250B 총 파라미터 중 15B만 활성화하는 하이브리드 어텐션 MoE로, 선형 어텐션 3개마다 소프트맥스 어텐션 1개를 배치하고 위치 인코딩을 완전히 없앤 NoPE 구조로 RoPE 외삽 한계 없이 1M 토큰 컨텍스트를 지원하며 48개 층 중 KV 캐시가 필요한 층은 12개뿐이다. Solar Open 1(102B)에서 구조 변경 후에도 살아남는 2.3%의 가중치만 이전하고 나머지는 무작위 초기화해 250B 규모에서도 초기 수렴을 앞당겼고, 약 12조 토큰으로 사전학습했다. 영어 벤치마크에서는 MMLU-Pro 86.2·LiveCodeBench(v6) 92.4로 비교 모델 중 최고점을 냈지만 GPQA-Diamond·HLE·SWE-Bench Verified에서는 DeepSeek-V4-Flash에 못 미쳤고, 한국어에서는 CLIcK 90.7·HAE-RAE 73.8 등 대부분 항목에서 앞섰다. 오피스 업무·문서 작업·코딩 같은 에이전틱 용도에 맞춰졌다. 다만 최소 H200 4장, 권장 8장이 필요해 개인이 단일 GPU로 돌리기는 어렵다.

핵심 포인트

  • 250B 중 15B만 활성화하는 하이브리드 어텐션 MoE로, 선형 어텐션 3개마다 소프트맥스 1개를 배치해 대형 모델 용량을 소형 모델 추론 비용으로 제공한다.
  • 위치 인코딩을 없앤 NoPE 구조로 RoPE의 외삽 한계 없이 1M 토큰 컨텍스트를 지원하며 KV 캐시가 필요한 층은 48개 중 12개뿐이다.
  • Solar Open 1의 가중치 중 구조 변경 후에도 남는 2.3%만 이전해 250B 규모에서도 초기 수렴을 앞당겼다.
  • 영어·한국어·일본어 3개 언어를 지원하며 한국어 벤치마크(CLIcK·HAE-RAE 등)에서 동급 모델 대비 우수하다.

제한사항

  • 최소 H200 4장, 권장 8장이 필요해 개인 사용자가 단일 GPU로 돌리기는 어렵다.

벤치마크

벤치마크지표비교
MMLU-Proaccuracy86.2Command A+ 79.0, DeepSeek-V4-Flash 85.9
LiveCodeBench(v6)pass@192.4DeepSeek-V4-Flash 92.3
KMMLU-Proaccuracy78.4DeepSeek-V4-Flash 78.9
SWE-Bench Verifiedpass@170.4MiMo-V2.5 73.0

739

LIKES

19k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.