Laguna S 2.1의 1M 토큰 문맥과 UD-Q4_K_XL GGUF 양자화 배포
대규모 문맥을 요구하는 텍스트 생성과 에이전트형 코딩 및 툴 호출이 포함된 장기 작업을 수행하는 텍스트-생성 태스크118B total, ~8B activated per token1K 컨텍스트openmdw-1.1
Laguna S 2.1의 GGUF 양자화 샤드(UD-Q4_K_XL)를 통해 llama.cpp·vLLM 등에서 1M 토큰 문맥과 MoE 기반 에이전트형 코딩 워크로드를 운용할 수 있다.
TL;DR
Laguna S 2.1의 GGUF 배포는 Unsloth가 제공한 UD-Q4_K_XL 양자화 샤드 형태로 약 40GB 규모로 분할되어 있으며 llama.cpp, vLLM 등 기존 엔진에서 적재·서빙할 수 있다. 모델은 118B 전체 파라미터와 토큰당 약 8B 활성화 파라미터를 갖는 Mixture-of-Experts 아키텍처로 256개의 routed 전문가와 1개의 공유 전문가를 사용하며 슬라이딩 윈도우(512)와 전역 어텐션을 1:3 비율로 섞어 1,048,576 토큰 문맥을 처리하도록 설계되었다. 응답 레이턴시 절감을 위해 DFlash 초안 모델을 이용한 speculative decoding 옵션을 제공하고 FP8/NVFP4/INT4/GGUF 등 여러 양자화 변형으로 메모리 요구를 낮출 수 있다. BF16 체크포인트는 다중 GPU(약 236GB 가중치)가 필요하며 OpenMDW-1.1 라이선스로 상업적·비상업적 활용이 허용되지만 Poolside의 사용정책과 안전 제약을 준수해야 한다.
핵심 역량
- 대규모(1,048,576 토큰) 문맥을 유지한 상태에서 길게 이어지는 생성과 코드·설계 문맥을 처리할 수 있다.
- 토큰별로 약 8B 활성화 파라미터를 동작시키는 MoE 구조로 복잡한 추론과 분기적 사고 흐름을 지원한다.
- 도구 호출(tool call) 사이에 사고 블록(thinking)을 삽입하고 보존된 reasoning_content를 통해 단계적 문제 해결을 처리할 수 있다.
- DFlash 초안 모델과의 speculative decoding을 결합해 응답 대기시간을 낮추고 실시간성 요구가 있는 서비스에 맞출 수 있다.
강점
- 1,048,576 토큰의 대규모 컨텍스트를 네이티브로 지원해 장기 문맥 작업에서 유리하다.
- MoE 아키텍처로 전체 파라미터는 크지만 토큰 처리 시 활성화되는 파라미터를 제한해 효율성을 확보했다.
- 공개 벤치마크에서 Terminal-Bench 2.1 70.2% 등 표기된 성과를 기록해 동급 작업에서 경쟁력을 갖췄다.
알아두면 좋은 것
- 모델은 118B 전체 파라미터이며 토큰당 약 8B만 활성화되는 Mixture-of-Experts 설계를 채택했고 전문가 수는 256(+1 공유)이다.
- 슬라이딩 윈도우(512)와 전역 어텐션을 1:3 비율로 혼합한 48개 레이어 배열과 per-layer rotary scale, softplus 게이팅을 통해 장기·단기 의존성을 조절한다.
- 양자화 옵션으로 FP8, NVFP4, INT4, GGUF 변형을 제공하며 Unsloth의 Dynamic 2.0 imatrix 보정 양자화(UD-Q4_K_XL)가 GGUF 배포 방식으로 포함되어 있다.
- OpenMDW-1.1 라이선스를 적용해 상업적·비상업적 사용과 수정이 허용되며 Poolside의 사용정책과 안전 제약 조건을 준수해야 한다.
기술적 특징
- 모델은 Mixture-of-Experts 구조를 사용해 총 118B 파라미터를 유지하면서 토큰당 약 8B만 활성화하도록 설계되었고, 이를 위해 256개의 routed 전문가와 1개의 공유 전문가를 배치하고 상위-10(top-10) 전문가 선택 정책을 사용한다. 이 설계는 모델 용량을 키우면서 실제 추론 시 연산·메모리 부담을 제한해 장기·복잡한 추론에 적합하다.
- 어텐션 레이아웃은 전역(global) 레이어 12개와 슬라이딩 윈도우(SWA) 레이어 36개를 1:3 비율로 혼합했고 윈도우 크기는 512이다. 이 혼합 구조는 지역적 컨텍스트의 세밀한 처리를 슬라이딩 윈도우로 수행하고 글로벌 의존성은 주기적 전역 레이어로 보완해 1M 토큰 문맥에서의 계산·성능 균형을 맞춘다.
- 어텐션은 grouped-query 구성과 8개의 KV 헤드, 헤드당 128 차원을 사용하고 출력단에 per-head softplus 게이팅을 적용해 헤드별 신호를 조절한다. 이 구성은 헤드 간 정보 흐름을 효율화하고 특정 토큰 패턴에 대한 선택적 강조를 가능하게 해 복잡한 코드·추론 패턴 처리에 유리하다.
- 응답 지연을 줄이기 위해 DFlash 기반의 초안( draft ) 모델을 이용한 speculative decoding을 제공하며 관련 서버·파라미터와 통합해 낮은 레이턴시 서빙을 지원한다. 또한 FP8, NVFP4, INT4, GGUF 등 여러 양자화 변형을 함께 제공해 메모리·추론 비용을 다양한 환경에서 절감할 수 있다.
차별점
- 네이티브로 1,048,576 토큰 문맥을 지원해 장기 문맥 처리 역량이 두드러진다.
- 256 routed 전문가와 top-10 선택 정책을 쓰는 MoE 설계로 전체 파라미터는 크지만 실제 토큰 처리 비용은 상대적으로 낮게 유지된다.
- 슬라이딩 윈도우와 전역 어텐션을 혼합한 레이어 레이아웃과 per-layer rotary scale이 장기·단기 의존성 균형을 맞춘다.
- DFlash 초안 모델과 speculative decoding을 조합해 실시간성 요구가 있는 에이전트 워크로드에서 레이턴시를 낮출 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | score | 70.2% | — |
| SWE-bench Multilingual | score | 78.5% | — |
| SWE-Bench Pro (Public Dataset) | score | 59.4% | — |
| DeepSWE | score | 40.4% | — |
| SWE Atlas (Codebase QnA) | score | 46.2% | — |
| Toolathlon Verified | score | 49.7% | — |
258
Likes
159.3k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.