117.6B MoE와 256K 컨텍스트를 로컬에서 지원하는 NVFP4 체크포인트
Laguna S 2.1-NVFP4는 117.6B MoE 아키텍처에 NVFP4 양자화를 적용해 256K 이상 장기 문맥과 에이전트형 코딩 워크플로를 로컬 환경에서 실행 가능하게 한 모델이다.
TL;DR
Laguna S 2.1-NVFP4는 117.6B 파라미터의 Mixture-of-Experts 아키텍처를 기반으로 토큰당 8.5B 활성화 파라미터와 Sliding Window Attention을 혼합해 설계된 모델로, NVFP4 양자화와 FP8 KV 캐시를 적용해 로컬 환경에서의 실행 가능성을 높였다. 모델은 기본 262,144 토큰 컨텍스트를 제공하며 훈련 시 1,048,576 토큰까지 확장된 상태에서 양자화 보정이 이뤄져 장기 문맥 작업을 지원하고 interleaved thinking을 통해 툴 호출 사이의 내부 추론을 유지할 수 있다. vLLM, Ollama, SGLang, Transformers, TRT-LLM 등 여러 런타임에서의 배포 경로와 speculative decoding(DFlash)과의 결합으로 실전 추론 처리량을 개선할 수 있으며, 공개 벤치마크에서는 Terminal-Bench 2.1 70.2%와 SWE-bench Multilingual 78.5% 같은 성능 수치가 보고되었다. 다만 고정밀 태그는 더 큰 메모리를 요구하고 1M 복원 구성은 품질 저하 가능성이 있으므로 권장 샘플링 설정과 런타임 권고사항을 따르는 것이 필요하다.
핵심 역량
- 장기 문맥을 활용한 텍스트 및 코드 생성 기능을 제공하며, Sliding Window Attention과 일부 전역 어텐션을 혼합해 수십만 토큰 단위의 컨텍스트를 처리할 수 있다. 모델은 툴 호출 사이에 내부 추론을 삽입하는 interleaved thinking을 지원해 복합 작업 흐름에서 중간 사고 상태를 보존한다. FP8로 양자화된 KV 캐시와 MoE 활성화 설계를 통해 로컬 단일 서버 환경에서 대형 파라미터 모델의 작동을 가능하게 한다.
- 에이전트형 코딩 워크플로에서 툴 사용과 코드 생성, 코드 베이스 질의 응답을 연속적으로 수행할 수 있으며, reasoning을 요청별로 비활성화해 응답 스타일을 제어할 수 있다. 모델은 recommended sampling 설정(temperature 0.7, top_p 0.95)을 권장하며, speculative decoding과 결합하면 추론 처리량을 높일 수 있다. 로컬 배포시 Ollama, vLLM, SGLang, Transformers, TRT-LLM 같은 런타임과 호환된다.
- 로컬 환경에서의 실용성 측면에서 NVFP4 체크포인트는 약 71GB 정도의 디스크/메모리 발자국을 가지며, Q4_K_M 및 BF16 등 다른 태그의 무게는 더 큰 메모리 요구를 수반한다. Ollama와 llama.cpp를 통해 Mac 및 일부 NVIDIA 환경에서 빠르게 실행 가능하며, DGX Spark나 Apple Silicon에서 서로 다른 성능 특성을 보였다. vLLM과 FlashInfer 등 최적화 스택과 함께 사용할 때 특화된 JIT/커널 경로를 통해 실전적 추론 성능을 확보할 수 있다.
강점
- 대규모 MoE 아키텍처(117.6B total, 8.5B activated)를 채택해 파라미터 규모는 크면서도 토큰당 활성화 파라미터를 제한해 로컬 환경에서 실용적인 실행 가능성을 확보한다. 이 구조는 전문가 수(256개 + 1 shared expert)를 통해 다양하고 풍부한 표현력을 유지하면서도 활성화 비용을 줄인다. NVFP4 양자화와 FP8 KV 캐시 조합은 대형 컨텍스트에서 메모리 발자국을 낮추는 실용적 이점을 제공한다.
- 긴 컨텍스트 지원은 기본 262,144 토큰으로 구성되어 있으며 훈련 시 1,048,576 토큰까지 확장된 이력이 있어 초대형 문맥 작업에서 경쟁력을 가진다. Sliding Window Attention을 다수 레이어에 적용하고 일부 레이어에 전역 어텐션을 배치해 로컬 처리와 전역 추론을 균형 있게 설계한 점이 장점이다. vLLM, Ollama, TRT-LLM 등 다양한 런타임 호환성을 확보해 실제 로컬 배포 선택지가 넓다.
- 벤치마크 표에는 Terminal-Bench 2.1 70.2%와 SWE-bench Multilingual 78.5% 같은 공개 수치가 포함되어 있어 동급 모델과 비교 가능한 성능 근거를 제공한다. README는 다양한 런타임별 성능(예: Spark 12.6 tok/s, Apple Silicon 17.6 tok/s)을 직접 제시해 실제 하드웨어에서의 처리율을 참고할 수 있게 했다. OpenMDW-1.1 라이선스는 상업적 사용과 수정에 관해 명확한 허용 범위를 제공한다.
훈련 방식
모델은 사전학습(pre-training), 후속(post-training) 및 강화학습 단계가 포함된 훈련 파이프라인으로 개발되었고 최종 단계에서는 reasoning 제어와 긴 컨텍스트 적응을 위해 추가적인 장기 문맥 확장 단계가 적용되었다. Optimizer로 Muon을 사용했고 훈련 과정에서 1M 토큰 수준의 컨텍스트 확장 및 그에 맞춘 양자화 보정이 수행되어 NVFP4 체크포인트의 양자화가 1M 환경 기준으로 캘리브레이션되었다. 이로 인해 기본 제공되는 256K 컨텍스트 설정 외에 config.json 수정으로 1,048,576 토큰 구성으로 복원할 수 있다.
알아두면 좋은 것
- 체크포인트는 NVFP4 양자화 버전으로 제공되며 NVFP4 무게는 대략 71 GB로 로컬 128 GB 머신에서 구동할 수 있도록 설계되었다. 모델은 Ollama와 llama.cpp에서 Q4_K_M 및 BF16 빌드로도 이용 가능하며 더 높은 정밀도 태그는 더 큰 메모리를 요구한다. OpenMDW-1.1 라이선스를 적용해 상업적·비상업적 용도로 수정 및 사용이 허용된다.
- 모델 구조는 총 117.6B 파라미터와 토큰당 8.5B 활성화 파라미터의 Mixture-of-Experts 아키텍처이며, 48개 레이어 중 36개 레이어에서 Sliding Window Attention을 사용하고 12개 레이어에서 전역 어텐션을 사용하도록 배치했다. SWA 레이어와 전역 어텐션의 비율은 3:1로 구성되어 있으며 per-head gating과 per-layer rotary scale을 사용해 혼합 어텐션 동작을 조절한다. 이 설계는 로컬 메모리 제약 아래서도 긴 문맥 성능을 유지하도록 고안되었다.
- 기본 구성은 262,144 토큰(256K) 컨텍스트로 제공되며, 본래 체크포인트는 최대 1,048,576 토큰으로 훈련된 상태여서 config.json을 복원하면 1M 설정을 사용 가능하다. 1M 구성은 품질 저하와 샘플링 제약을 수반할 수 있어 추천 샘플링(temperature <= 0.7, top_p <= 0.95) 사용이 권장된다. KV 캐시는 FP8로 양자화되어 있어 대규모 컨텍스트에서도 KV 메모리 발자국을 줄여준다.
- 성능 최적화를 위해 speculative decoding(DFlash)과 짝지어 사용하거나 FlashInfer/FlashInferCutlass 같은 네이티브 커널을 이용할 수 있으며, vLLM 0.25 이상과의 조합에서 자동으로 양자화 구성을 감지한다. DGX Spark 및 Apple Silicon에 대한 구체적 권장 사항과 초기 로드 시 시간·타임아웃 설정 조치가 README에 포함되어 있다. 시작 시 JIT와 그래프 캡처로 인한 초기 비용이 발생할 수 있으므로 환경 설정 가이드가 제공된다.
기술적 특징
- 모델은 Mixture-of-Experts 구조로 구현되어 총 117.6B 파라미터를 가지면서도 토큰당 활성화되는 파라미터를 8.5B로 제한해 단일 토큰 처리의 메모리·연산 비용을 줄였다. 전문가 수는 256개이며 1개의 공유 전문가를 포함해 토큰별 라우팅으로 일부 전문가만 활성화되는 방식이 적용되었다. 이 설계는 로컬 환경에서 대형 모델의 실행 가능성을 높이기 위해 선택되었다.
- 어텐션 설계는 Sliding Window Attention과 global attention을 3:1 비율로 혼합 배치하고 per-head gating과 per-layer rotary scale을 적용해 각 레이어의 지역 대 전역 처리 비중을 조절한다. Sliding Window은 창(window) 단위로 어텐션을 계산해 KV 캐시 요구량과 계산량을 줄이고, 일부 전역 레이어는 긴 거리 의존성을 포착해 전체 문맥 이해를 보완한다. 이러한 혼합 레이아웃은 매우 긴 컨텍스트 환경에서도 메모리 효율과 성능 균형을 제공한다.
- KV 캐시는 FP8로 양자화되어 컨텍스트당 저장되는 key/value의 메모리 비용을 낮추며, 모델은 이로써 256K 컨텍스트 구성에서 수십만 KV 토큰을 저장할 수 있는 발자국을 달성했다. 양자화는 NVFP4 체크포인트와 함께 제공되어 디스크 및 메모리 사용을 크게 절감한다. FP8 캐시는 긴 대화 유지와 반복 토큰 재사용 측면에서 현저한 메모리 절감을 가져온다.
- 추론 최적화 관점에서 speculative decoding(DFlash)과 결합할 때 처리량을 크게 향상시키도록 설계되어 있으며 vLLM과 FlashInfer 경로를 통해 네이티브 NVFP4 커널과 JIT 최적화를 활용할 수 있다. README에는 DFlash와의 결합 예시 및 vLLM 실행 시 권장 플래그와 주의사항이 포함되어 있어 실전 배포에서 성능 튜닝이 가능하다. 또한 여러 런타임에서 양자화 구성을 자동으로 감지하도록 해 배포 편의성을 높였다.
차별점
- Slidng Window Attention과 global attention을 레이어별로 혼합 배치하고 per-head gating과 per-layer rotary scale을 적용하여 긴 컨텍스트를 처리하면서도 KV 캐시 요구량을 낮춘 설계가 돋보인다. 이 배치는 로컬 메모리 제약 상황에서도 긴 문맥 유지와 전역 추론 성능을 동시에 확보하려는 목적에서 채택되었다. 소프트플러스 게이팅을 통해 각 레이어의 어텐션 모드를 동적으로 제어할 수 있다.
- 117.6B total 파라미터 규모의 MoE 설계로 모델 표현력을 확보하면서도 토큰당 활성화 파라미터를 8.5B로 제한해 실제 로컬 서버에서의 실행 가능성을 개선했다. 256개의 전문가와 1개의 공유 전문가 배열은 다양한 서브스페이스를 캡처하면서도 활성화 비용을 제어하도록 구성되었다. 이 접근은 대형 모델의 로컬 배포 제약을 완화하는 실무적 선택이다.
- KV 캐시의 FP8 양자화와 NVFP4 체크포인트 제공으로 디스크 및 메모리 사용량을 실질적으로 낮춰 약 71GB 규모의 로컬 배포를 가능하게 만든 점이 차별화 요소이다. 이와 함께 vLLM 및 FlashInfer 같은 최적화 스택과의 네이티브 연동을 통해 실전적 추론 성능을 확보했다. 결과적으로 고정밀 버전과의 트레이드오프를 명확히 제시하면서 다양한 하드웨어에서의 실행 옵션을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | accuracy | 70.2% | — |
| SWE-bench Multilingual | accuracy | 78.5% | — |
| SWE-Bench Pro (Public Dataset) | accuracy | 59.4% | — |
| DeepSWE | accuracy | 40.4% | — |
| SWE Atlas (Codebase QnA) | accuracy | 46.2% | — |
| Toolathlon Verified | accuracy | 49.7% | — |
이미지 분석
154
Likes
180.5k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.