118B MoE 구조와 1M 토큰 컨텍스트로 에이전트 코딩을 겨냥한 Laguna S 2.1
텍스트 생성 및 에이전트형 코딩 작업으로, 도구 호출과 사고 블록을 상호 배치하는 preserved thinking 기반의 장기 추론과 코드베이스 질의응답을 포함한다.118B total, ~8B activated per token1K 컨텍스트openmdw-1.1
Laguna S 2.1은 256 전문가 MoE와 1,048,576 토큰 컨텍스트, interleaved sliding-window 및 global attention을 결합해 에이전트형 코딩과 장기 작업을 겨냥한 118B 모델이다.
TL;DR
Laguna S 2.1은 Poolside가 공개한 118B 총 파라미터의 Mixture-of-Experts LLM으로 256개의 라우티드 전문가를 통해 토큰당 약 8B 활성 파라미터를 할당하여 에이전트형 코딩과 장기 컨텍스트 작업을 겨냥한다. 아키텍처는 48개 레이어를 12 global과 36 sliding-window로 배치하고 grouped-query attention과 per-head softplus 게이팅을 결합해 로컬·전역 참조를 동시에 처리하며 최대 1,048,576 토큰의 컨텍스트를 공식 지원한다. preserved thinking을 통한 내재적 추론과 도구 호출 사이의 사고 보존을 제공하며 DFlash 초안 모델을 이용한 speculative decoding과 FP8·NVFP4·INT4·GGUF 같은 양자화 변형으로 서빙 레이턴시와 메모리 요구를 조정할 수 있다. 공개된 벤치마크에서는 Terminal-Bench 2.1에서 70.2% 등의 수치를 기록하여 동급 대형 모델들과 경쟁하는 성능 프로파일을 보이고 상용·비상업적 이용을 허용하는 OpenMDW-1.1 라이선스를 따른다.
핵심 역량
- 에이전트형 코딩 작업에서 도구 호출 전후에 사고 블록을 보존하며 연속된 계획과 실행 흐름을 유지할 수 있다. enable_thinking 플래그로 요청 단위 제어가 가능하며 메시지 히스토리에 reasoning_content를 남기면 preserved thinking 동작이 유지된다. 이러한 동작은 도구 체인과 상호작용하는 복잡한 코딩 워크플로에서 중간 추론 상태를 보존하는 데 유용하다.
- 매우 긴 문맥을 처리할 수 있어 대규모 코드베이스나 장기 대화 로그를 포함하는 질의에 대응할 수 있다. 컨텍스트 최대 길이는 1,048,576 토큰으로 명시되어 있어 장기간의 문서 추적과 상태 보존이 가능하다. Sliding-window 레이어와 글로벌 레이어의 혼합으로 로컬 연산과 전역 참조를 병행하여 성능을 관리한다.
- 추론 지연을 줄이기 위해 speculative decoding을 도입할 수 있으며 DFlash 초안 모델과의 결합으로 낮은 레이턴시 제공이 가능하다. 모델과 함께 제공되는 DFlash 초안 모델을 서빙 구성에 포함하면 일부 토큰을 초안으로 생성하고 본 모델로 확정하는 방식으로 응답 시간을 단축할 수 있다. GGUF 및 다양한 양자화 변형을 통해 메모리 요구량을 줄이고 경량 서빙 옵션을 확보할 수 있다.
강점
- 토큰당 활성화되는 파라미터를 제한하는 MoE 설계로 동일한 총 파라미터 규모에서 연산 효율과 표현력을 균형 있게 확보한다.
- 1M 토큰의 초대형 컨텍스트를 공식 지원하여 장기 추론과 코드베이스 전반에 걸친 질의응답 같은 장기 작업에 적합하다.
- DFlash 초안 모델을 통한 speculative decoding과 여러 양자화 변형을 제공해 레이턴시와 메모리 트레이드오프를 실무 환경에서 조정할 수 있다.
알아두면 좋은 것
- Laguna S 2.1은 118B 총 파라미터에 토큰당 약 8B 활성 파라미터를 가지는 Mixture-of-Experts 설계를 채택했고 256개의 라우티드 전문가와 하나의 공유 전문가를 사용하여 토큰별로 일부 전문가만 활성화한다.
- 어텐션 구조는 48개 레이어 중 12개는 global attention, 36개는 sliding-window attention으로 구성되며 윈도우 크기는 512이고 레이어 타입별로 rotary scale과 softplus 기반 게이팅을 적용한다.
- 컨텍스트 최대 길이는 1,048,576 토큰으로 명시되어 있으며 preserved thinking을 통한 내재적 추론과 도구 호출 사이의 상호작용을 지원하도록 설계되었다.
- 공식적으로 FP8, NVFP4, INT4, GGUF와 같은 양자화 변형을 제공하며 OpenMDW-1.1 라이선스를 적용해 상업적·비상업적 이용 및 수정이 허용된다.
기술적 특징
- 256개의 라우티드 전문가와 top-10 토큰 라우팅은 입력 토큰마다 일부 전문가만 활성화해 연산량을 줄이는 반면, 토큰당 약 8B 활성 파라미터를 할당해 풍부한 표현력을 유지한다. 라우터는 softplus 게이팅을 사용해 전문가 선택의 출력을 안정화하고 음수 활성화를 제거한다. 이 구조는 대규모 모델이지만 실질적으로는 분기된 계산 경로를 통해 효율적인 서빙을 가능하게 한다.
- 어텐션 레이아웃은 48개 레이어를 1:3의 global-to-SWA 비율로 배치하여 전역 참조와 로컬 윈도우 기반 연산을 병행한다. Sliding-window 레이어는 윈도우 크기 512로 로컬 컨텍스트를 처리하고 글로벌 레이어는 긴거리 의존성을 캡처한다. 레이어 타입별 rotary scale과 per-head softplus 출력 게이팅이 추가되어 레이어마다 어텐션 스케일을 세밀하게 조정한다.
- Grouped-Query Attention은 KV 계산을 그룹화하여 메모리와 연산 부담을 줄이며 모델은 8개의 KV 헤드를 사용하고 head dim은 128로 설계되어 대규모 컨텍스트에서 효율적인 키/값 처리를 유지한다. 이 방식은 긴 컨텍스트를 처리할 때 KV 메모리 사용을 제한하는 데 기여한다. 결과적으로 대규모 토큰 윈도우에서도 실용적인 리소스 사용량을 유지할 수 있다.
- 내재적 추론을 위한 preserved thinking 메커니즘은 도구 호출 전후로 사고 블록을 유지하도록 설계되어 도구와의 상호작용이 포함된 에이전트형 워크플로에서 추론 상태를 보존한다. enable_thinking 플래그로 요청 단위 제어가 가능하며, 메시지 히스토리의 reasoning_content를 유지하면 후속 단계에서도 사고 상태가 이어진다. 이 설계는 복잡한 작업에서 중간 계산을 잃지 않고 연속된 계획을 수행할 수 있게 한다.
- 서빙 효율성을 높이기 위해 DFlash 기반의 speculative decoding 초안 모델을 별도 제공하며 본 모델과 결합해 낮은 레이턴시를 추구할 수 있다. 초안 모델로 다수의 토큰을 사전 생성한 뒤 본 모델로 확정하거나 보완하는 방식으로 응답 시간을 단축한다. 또한 FP8, NVFP4, INT4, GGUF 등의 양자화 변형을 통해 메모리 요구량을 크게 낮출 수 있도록 지원한다.
차별점
- 256개 라우티드 전문가와 top-10 라우팅을 채택한 MoE 설계로 토큰당 약 8B 활성 파라미터를 제공하는 점이 동급 모델과의 주요 설계 차별화 요소이다.
- 1,048,576 토큰이라는 초대형 컨텍스트를 공식 지원하여 장기 문맥 유지와 대규모 코드베이스 질의응답에 대응하는 점이 두드러진다.
- interleaved full 및 sliding-window attention의 혼합 배치와 per-layer rotary scale 및 softplus 게이팅을 통해 로컬 연산과 전역 참조를 동시에 조율하는 아키텍처적 선택을 택했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | accuracy | 70.2% | — |
| SWE-bench Multilingual | accuracy | 78.5% | — |
| SWE-Bench Pro (Public Dataset) | accuracy | 59.4% | — |
| DeepSWE | accuracy | 40.4% | — |
| SWE Atlas (Codebase QnA) | accuracy | 46.2% | — |
| Toolathlon Verified | accuracy | 49.7% | — |
이미지 분석
846
Likes
73.2k
Downloads
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.