upstage/Solar-Open2-250B
250B 중 15B만 활성화하며 1M 컨텍스트를 지원하는 영어·한국어·일본어 에이전틱 MoE 모델
학습 방식 · Solar Open 1(102B)에서 살아남는 2.3%의 가중치만 이전하고 나머지는 무작위 초기화한 뒤, softmax 1개·선형 어텐션 3개를 반복하는 하이브리드 구조를 약 12조 토큰으로 사전학습했다.
TL;DR
Solar Open 2는 250B 총 파라미터 중 15B만 활성화하는 하이브리드 어텐션 MoE로, 선형 어텐션 3개마다 소프트맥스 어텐션 1개를 배치하고 위치 인코딩을 완전히 없앤 NoPE 구조로 RoPE 외삽 한계 없이 1M 토큰 컨텍스트를 지원하며 48개 층 중 KV 캐시가 필요한 층은 12개뿐이다. Solar Open 1(102B)에서 구조 변경 후에도 살아남는 2.3%의 가중치만 이전하고 나머지는 무작위 초기화해 250B 규모에서도 초기 수렴을 앞당겼고, 약 12조 토큰으로 사전학습했다. 영어 벤치마크에서는 MMLU-Pro 86.2·LiveCodeBench(v6) 92.4로 비교 모델 중 최고점을 냈지만 GPQA-Diamond·HLE·SWE-Bench Verified에서는 DeepSeek-V4-Flash에 못 미쳤고, 한국어에서는 CLIcK 90.7·HAE-RAE 73.8 등 대부분 항목에서 앞섰다. 오피스 업무·문서 작업·코딩 같은 에이전틱 용도에 맞춰졌다. 다만 최소 H200 4장, 권장 8장이 필요해 개인이 단일 GPU로 돌리기는 어렵다.
핵심 포인트
- 250B 중 15B만 활성화하는 하이브리드 어텐션 MoE로, 선형 어텐션 3개마다 소프트맥스 1개를 배치해 대형 모델 용량을 소형 모델 추론 비용으로 제공한다.
- 위치 인코딩을 없앤 NoPE 구조로 RoPE의 외삽 한계 없이 1M 토큰 컨텍스트를 지원하며 KV 캐시가 필요한 층은 48개 중 12개뿐이다.
- Solar Open 1의 가중치 중 구조 변경 후에도 남는 2.3%만 이전해 250B 규모에서도 초기 수렴을 앞당겼다.
- 영어·한국어·일본어 3개 언어를 지원하며 한국어 벤치마크(CLIcK·HAE-RAE 등)에서 동급 모델 대비 우수하다.
제한사항
- 최소 H200 4장, 권장 8장이 필요해 개인 사용자가 단일 GPU로 돌리기는 어렵다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro | accuracy | 86.2 | Command A+ 79.0, DeepSeek-V4-Flash 85.9 |
| LiveCodeBench(v6) | pass@1 | 92.4 | DeepSeek-V4-Flash 92.3 |
| KMMLU-Pro | accuracy | 78.4 | DeepSeek-V4-Flash 78.9 |
| SWE-Bench Verified | pass@1 | 70.4 | MiMo-V2.5 73.0 |
739
LIKES
19k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.