poolside/Laguna-S-2.1-NVFP4
128GB급 단일 머신에서 118B MoE 코딩 에이전트를 돌리기 위한 NVFP4 양자화 체크포인트
학습 방식 · 사전학습→후처리(post-training)→강화학습(RL) 3단계 파이프라인에 Muon 옵티마이저를 사용해 학습했다.
TL;DR
Laguna S 2.1-NVFP4는 117.6B 총 파라미터 중 8.5B를 활성화하는 MoE 모델을 NVFP4로 양자화한 로컬 배포용 체크포인트로, 48개 층 중 36개에 헤드별 게이팅을 적용한 슬라이딩윈도우 어텐션을 3:1 비율로 섞고 KV 캐시를 FP8로 양자화해 메모리를 줄였다. vLLM·Transformers·TRT-LLM에서는 quantization_config만으로 자동 인식되어 별도 플래그 없이 서빙되며, DGX Spark나 Mac Studio 같은 128GB 통합 메모리 단일 머신 하나로도 118B급 코딩 에이전트를 돌릴 수 있다. 다만 SGLang에서는 NVFP4 fused-MoE 커널이 NaN을 내는 알려진 문제가 있어 FP8 체크포인트로 대신 서빙해야 하고, llama.cpp·Ollama 경로는 NVFP4 자체가 아니라 BF16이나 Q4_K_M GGUF로만 지원된다. DFlash NVFP4 드래프트와 결합하면 GB10에서 디코드가 13~14 tok/s에서 산문 15·코드 22~24 tok/s로 올라가, 개인 워크스테이션에서 대형 코딩 에이전트를 돌리려는 사용자에게 적합하다.
핵심 포인트
- vLLM·Transformers·TRT-LLM에서 별도 플래그 없이 quantization_config로 NVFP4를 자동 인식해 서빙한다.
- DGX Spark나 Mac Studio 같은 128GB 통합 메모리 단일 머신에서 118B급 MoE를 돌릴 수 있는 로컬 배포용 양자화판이다.
- DFlash NVFP4 드래프트를 붙이면 GB10 디코드가 13~14 tok/s에서 산문 15, 코드 22~24 tok/s로 올라간다.
- KV 캐시를 FP8로 양자화해 토큰당 메모리를 줄였고, 256K 설정에서 83만~87만 KV 토큰을 담을 수 있다.
제한사항
- SGLang에서는 NVFP4 W4A4 fused-MoE 커널이 NaN을 발생시켜 정상 동작하지 않으며, 이 경우 FP8 체크포인트를 대신 써야 한다.
- llama.cpp·Ollama에서는 NVFP4 자체가 아니라 BF16·Q4_K_M GGUF로만 지원된다.
- 이 체크포인트는 1M 컨텍스트로 배포되며 긴 컨텍스트에서 품질 저하가 있을 수 있어, 256K로 제한하려면 config.json을 직접 고쳐야 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | pass rate | 70.2% | Tencent Hy3(295B-A21B) 71.7% — 기반 모델 Laguna S 2.1(118B-A8B)의 공개 수치, NVFP4 양자화 버전 측정치 아님 |
| SWE-bench Multilingual | pass@1 | 78.5% | 기반 모델 Laguna S 2.1(118B-A8B)의 공개 수치, NVFP4 양자화 버전 측정치 아님 |
| SWE-Bench Pro | pass@1 | 59.4% | 기반 모델 Laguna S 2.1(118B-A8B)의 공개 수치, NVFP4 양자화 버전 측정치 아님 |
154
LIKES
180.5k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.