TL;DR
Solar Open 2는 Upstage가 에이전트용 실무 작업을 목표로 개발한 250B 규모의 MoE 기반 모델로 토큰당 약 15B만 활성화해 추론 효율을 확보하고 최대 1M 토큰의 장문 컨텍스트를 처리하도록 설계되었다. 에이전트 시나리오를 반영한 합성·검증 파이프라인을 통해 도구 호출의 실행·검증 루프, 코드 테스트와 수정 루프, 사무 업무의 문서·스프레드시트 처리 등을 학습했으며 한국어 토크나이저는 동일 텍스트를 표현할 때 토큰 수를 크게 절감했다. Selective Weight Transfer를 통해 기존 모델의 일부 가중치를 초기화에 재사용함으로써 훈련 토큰을 약 58% 수준으로 줄였고 공식 벤치마크에서는 MMLU-Pro 86.2, LiveCodeBench 92.4 등 경쟁력 있는 성적을 보였다. 모델 가중치는 Hugging Face에 공개되어 상업적 사용과 파생 개발이 허용되며 vLLM과 Transformers 예시로 자체 인프라에 배포해 검증할 수 있다.
빠른 이해
새로운 점
에이전트 중심 데이터·검증 파이프라인과 250B MoE에서 토큰당 15B 활성화, 1M 토큰 컨텍스트를 결합해 오픈 웨이트로 배포한 점이 차별화 신호이다.
핵심 메커니즘
입력으로는 장문 컨텍스트와 에이전트 작업 지시가 들어오고, 처리 단계에서는 Hybrid Attention으로 1M 토큰을 관리하며 MoE의 전문가 라우팅으로 토큰당 필요한 8개 전문가를 활성화해 계산을 줄인 뒤 출력으로 연속된 도구 호출과 작업 완료 결과를 반환한다.
핵심 수치
- MMLU-Pro: 86.2- 지식 기반 평가 점수
- LiveCodeBench: 92.4- 코딩 성능 평가 점수
- 한국어 벤치마크 평균: 85.4- 비교 대상 모델 대비 우세
- Ko-GDPval: 86.8- 170개 실무 시나리오 기반 실무 수행 평가
- Active parameters per token: 15B / 250B- 토큰당 활성화되는 파라미터와 전체 파라미터
- 훈련 효율(토큰): 12B vs 22B- Selective Weight Transfer 적용 모델 vs 무작위 초기화 모델의 목표 손실 도달 토큰수 비교
섹션별 상세
요약 및 배포
아키텍처와 추론 효율성
- 모델은 MoE 아키텍처로 총 250B 파라미터 중 토큰당 15B만 활성화하도록 설계되었다. — Key highlights / Inference efficiency for repeated calls 섹션
장문 컨텍스트를 위한 Hybrid Attention
- 모델은 최대 1M 토큰 컨텍스트를 지원하기 위해 GQA와 선형 어텐션을 결합한 Hybrid Attention을 사용했다. — A 1M-token context for long tasks 섹션
에이전트 중심의 훈련 데이터와 검증 파이프라인
Selective Weight Transfer와 훈련 효율
- Selective Weight Transfer를 적용한 경우 목표 손실에 도달하는 데 약 12B 토큰이 필요했으며 무작위 초기화 모델은 약 22B 토큰을 필요로 했다. — Selective Weight Transfer for efficient training 섹션
벤치마크 성능과 실무 품질
- 주요 벤치마크 성적은 MMLU-Pro 86.2, LiveCodeBench 92.4, 한국어 평균 85.4 등이다. — Benchmarks 섹션 및 표의 점수 목록
배포·라이선스·운영 가이드
- 모델 가중치는 Hugging Face에 공개되며 Upstage Solar License 아래 상업적 이용과 파생 개발이 허용된다. — So anyone can verify it and build on it / Get started 섹션
용어 해설
- Mixture of Experts(MoE)
- — MoE는 다수의 전문가(encoder/FFN 블록)를 준비해 입력마다 일부 전문가만 활성화하여 연산량을 줄이는 구조로, 이 모델에서는 총 250B 파라미터 중 토큰당 약 15B만 활성화함으로써 대형 모델의 표현력을 유지하면서 추론 비용을 낮춘 점이 중요하다.
- 하이브리드 어텐션(Hybrid Attention)
- — Hybrid Attention은 일부 계층에서 GQA(softmax) attention을 사용하고 다른 계층에서 선형 attention을 적용하여 긴 입력을 처리할 때 KV 캐시의 선형 성장을 억제하면서도 전체적 문맥 이해 능력을 유지하는 방식으로, Solar Open 2는 48개 층에서 1 GQA층과 3개 선형층 블록을 반복했다.
- 선형 어텐션(Linear Attention)
- — Linear Attention은 입력 길이에 따라 메모리와 계산이 증가하지 않도록 고정 크기 상태로 시퀀스 정보를 요약해 다음 연산에 전달하는 방식으로, Solar Open 2에서는 전체 층의 75%에서 선형 어텐션을 적용해 1M 토큰 컨텍스트를 현실적으로 처리했다.
- No Positional Encoding(NoPE)
- — NoPE는 softmax attention 계층에서 positional encoding을 적용하지 않는 설계 선택으로, 훈련에서 주로 보지 못한 매우 긴 입력을 처리할 때 위치 기반 일반화(extrapolation)를 개선하는 목적을 가진 기법이다.
- 선택적 가중치 전이(Selective Weight Transfer)
- — Selective Weight Transfer는 이전 모델(Solar Open 100B)의 일부 가중치만을 선별해 새 아키텍처 초기화에 활용하는 방법으로, 무작위 초기화보다 훈련 토큰 수를 크게 줄여 동일 손실 수준에 더 빠르게 도달하게 만든 점이 핵심이다.
- 토크나이저 효율성(Tokenizer Efficiency)
- — 토크나이저 효율성은 동일 텍스트를 표현할 때 생성되는 토큰 수의 정도를 뜻하며, 한국어에서 토큰 수를 절감하면 추론 비용과 실효적 컨텍스트 길이를 모두 늘릴 수 있으므로 Solar Open 2의 한국어 최적화 토크나이저는 운영 비용에 직접적인 영향을 미친다.
기술
- vLLM
- Transformers
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.