Laguna XS 2.1 33B MoE·262K 컨텍스트 기반 모델
Laguna XS 2.1은 33B 총파라미터와 토큰당 3B 활성화를 갖춘 Mixture-of-Experts 구조로 Sliding Window와 글로벌 어텐션을 혼합해 에이전트 코딩과 장기 문맥 처리에 최적화된 모델이다.
TL;DR
Laguna XS 2.1은 Poolside가 발표한 33B 총파라미터의 Mixture-of-Experts LLM으로 토큰당 활성화 3B와 262,144 토큰의 대형 컨텍스트를 처리하도록 설계되었다. 아키텍처는 40개 레이어에서 Sliding Window Attention과 글로벌 어텐션을 3:1 비율로 혼합하고 sigmoid gating과 per-layer rotary scales를 통해 전문가 라우팅을 제어하며, KV 캐시를 FP8로 양자화해 로컬 배포 시 메모리 부담을 줄였다. 벤치마크에서 SWE-bench Multilingual 63.1%로 이전 버전 대비 5.4%p 개선을 보고했고 도구 호출 전후의 사고 보존(preserved thinking)과 speculative decoding(DFlash) 같은 실무적 최적화로 에이전트형 코딩과 장기 히스토리 작업에 초점을 맞췄다. 다만 사고 블록 보존 실패 시 추론 연속성 손실 가능성과 로컬 환경에서의 정확한 성능·자원 요구는 실제 배포 환경에서 검증이 필요하다.
핵심 역량
- Laguna XS 2.1은 도구 호출 전후로 사고(reasoning)를 삽입하는 preserved thinking을 기본으로 지원해 도구 기반 워크플로에서 일관된 다단계 추론을 유지할 수 있다. 이 기능은 도구 호출 결과를 이어받아 추가 추론을 수행하거나 이후 요청에 사고 블록을 재활용할 때 유용하다. 사고 보존이 누락되면 추론이 중단될 수 있으므로 메시지 구성에서 사고 블록 유지가 중요하다.
- 모델은 Sliding Window Attention과 일부 글로벌 어텐션을 혼합한 하이브리드 어텐션 레이아웃으로 긴 컨텍스트를 메모리 효율적으로 처리한다. 40개 레이어 중 30개는 Sliding Window, 10개는 글로벌 어텐션으로 구성되어 로컬 문맥과 전역 의존성을 모두 다루도록 설계되었다. 이 접근은 컨텍스트 창을 크게 확장하면서도 전체 어텐션의 계산 복잡도를 제어한다.
- KV 캐시를 FP8 형식으로 양자화하여 토큰당 메모리 사용량을 줄였기 때문에 로컬 환경에서 보다 큰 컨텍스트를 유지할 수 있다. FP8 캐시는 메모리와 성능 사이의 균형을 제공하며 Laguna의 로컬 배포 가능성을 높였다. 이로 인해 Mac과 같은 제한된 메모리 환경에서 작동할 수 있는 기반이 마련되었다.
- 모델은 MoE 설계로 256개의 전문가와 1개의 공유 전문가를 사용하며 토큰당 활성화되는 파라미터를 3B 수준으로 제한해 계산 효율을 확보했다. 라우팅은 sigmoid gating과 per-layer rotary scales를 통해 이루어지며, 이는 특정 입력에 맞춰 필요한 전문가만 활성화하는 방식으로 동작한다. 이 구조는 대규모 파라미터를 유지하면서 추론 시 계산 비용을 상대적으로 낮추는 데 기여한다.
강점
- Laguna XS 2.1은 공식 벤치마크 표에서 SWE-bench Multilingual에서 이전 버전 대비 5.4%p 향상된 63.1%를 기록해 다국어 소프트웨어 문제 해결 능력이 개선되었음을 보여주었다. 이 수치는 README에 표로 명시되어 있으며 동일한 비교 모델인 Laguna XS.2의 57.7%에 비해 개선 폭이 확인된다. 벤치마크는 동일한 샘플링 파라미터와 도구 기반 하니스로 실행되었다고 밝혔다.
- 로컬 배포 친화성이 강점으로, KV 캐시 FP8 양자화와 다양한 저정밀 변형(FP8, NVFP4, INT4)이 제공되어 메모리 제약 환경에서도 운영할 수 있는 선택지를 제공한다. README는 Mac 36GB RAM 환경에서 동작 가능하다고 명시하여 실제 로컬 사용을 위한 구성과 실무적 제약 완화를 목표로 했음을 나타낸다. 또한 vLLM, TRT-LLM, llama.cpp 등 주요 서빙 도구와의 호환성이 확보되어 배포 유연성이 높다.
훈련 방식
훈련은 전형적인 사전학습(pre-training) 단계를 거친 뒤 post-training과 강화학습(async off-policy agent RL)을 포함하는 다단계 접근을 사용했다. 기술 보고서에서 데이터 오토믹싱(data automixing)과 비동기 오프폴리시(agent RL) 기법을 병용해 에이전트적 행동과 안정성을 향상시켰다고 명시되어 있다. 이러한 혼합 접근은 일반 생성 역량과 에이전트형 상호작용 능력을 모두 강화하는 목적이었다.
알아두면 좋은 것
- 모델은 OpenMDW-1.1 라이선스를 적용받아 상업적·비상업적 사용과 수정이 허용되는 자유로운 이용 조건을 제공한다.
- 로컬 사용을 염두에 둔 설계로 33B 총파라미터지만 토큰당 활성화 3B와 FP8 KV 캐시를 통해 Mac 36GB RAM 수준에서 실행 가능하다고 명시했다.
- 고품질 FP8, NVFP4, INT4 양자화 변형과 GGUF 변환이 제공되어 다양한 정밀도·성능 요구에 맞춘 배포 선택지가 준비되어 있다.
- 컨텍스트 윈도우는 262,144 토큰으로 설정되어 매우 긴 문맥을 필요로 하는 작업을 처리할 수 있도록 설계되었다.
기술적 특징
- 레이어별 sigmoid gating과 per-layer rotary scales를 도입해 Sliding Window Attention과 글로벌 어텐션을 혼합하는 아키텍처 배치를 구현했다. 이 구성은 40개 레이어 중 30개는 로컬 창 기반 어텐션을, 10개는 글로벌 어텐션을 적용하는 3:1 비율로 운용되어 장기 문맥과 전역 의존성을 동시에 처리하도록 설계되었다. 이러한 혼합은 전체 계산량을 절감하면서도 글로벌 정보 흐름을 유지하는 트레이드오프를 제공한다.
- MoE 구성은 256개의 전문가와 1개의 공유 전문가를 사용해 총 33B 파라미터를 유지하되 토큰당 활성화 파라미터를 3B로 제한해 계산 효율을 확보했다. 전문가 라우팅은 sigmoid gating을 통해 이루어지며, 입력별로 필요한 전문가만 활성화되므로 추론 시 불필요한 계산을 줄인다. 이 설계는 대형 모델의 표현력을 보존하면서 로컬 추론 비용을 제어하는 데 기여한다.
- KV 캐시를 FP8로 양자화해 토큰당 메모리 사용량을 줄였으며 이는 장기 컨텍스트 운영과 로컬 배포에 직접적인 이점을 제공한다. FP8 양자화는 메모리와 정밀도 사이의 균형을 조절하며 대규모 컨텍스트 길이(262,144 토큰)를 유지할 때 요구되는 메모리 부담을 낮춘다. README에서는 이 조합이 Mac 수준의 메모리 환경에서도 운용 가능하다고 명시했다.
- 보조 성능 최적화를 위해 DFlash speculative decoding을 옵션으로 제시해 지연시간 감소를 지원한다. DFlash는 5층의 소형 초안 모델을 사용해 최대 7토큰을 제안하고 약 70%의 자리별 수용률을 달성하며 주 모델은 이를 검증하는 방식으로 동작한다. 이 접근은 특히 코딩 작업에서 토큰 단위 레이턴시를 낮추는 실용적 이점을 제공한다.
- 추론 단계에서 사고(reasoning)를 도구 호출 전후로 삽입하는 preserved thinking을 네이티브로 지원해 에이전트형 상호작용의 일관성을 유지하도록 설계되었다. 모델은 생성 중 사고 블록을 스트리밍으로 분리하여 사고 내용과 일반 콘텐츠를 별도로 수집할 수 있게 하고, 이후 요청에서 사고 블록을 재투입하면 연속된 추론 흐름을 복원할 수 있다. 이 메커니즘은 도구 호출-응답 루프가 반복되는 자동화된 코딩 워크플로에서 유의미한 동작 안정성을 제공한다.
차별점
- Laguna XS 2.1은 40개 레이어 구성에서 Sliding Window Attention과 글로벌 어텐션을 3:1 비율로 명시적으로 혼합해 긴 컨텍스트 처리와 전역 정보 접근 간의 균형을 설계적으로 확보했다. 이러한 레이어 비율과 per-layer rotary scale 기반 gating은 입력 특성에 따라 로컬·글로벌 어텐션을 선택적으로 활용할 수 있게 한다. 이 점은 동일 규모의 단일 어텐션 레이아웃 모델과 차별화되는 구조적 선택이다.
- KV 캐시를 FP8로 양자화해 로컬 배포 환경에서의 메모리 요구사항을 낮춘 점은 모델의 실무적 접근성을 높였다. FP8 캐시와 함께 FP8/NVFP4/INT4 등 다양한 정밀도 변형을 공식적으로 제공해 배포 시 성능·정밀도 균형을 조정할 수 있도록 했다. 이는 동일 계열의 모델들에 비해 배포 옵션과 로컬 실행 가능성에서 차별점을 만든다.
- 네이티브로 preserved thinking과 도구 호출 간 인터리브(interleaved) 사고 흐름을 지원해 에이전트형 코딩과 터미널 스타일 작업에서의 연속성 및 상태 보존을 우선 설계했다. 생각 블록을 메시지 히스토리에 보존해야 일관된 추론이 이어지도록 명시해 도구 기반 자동화 워크플로에 적합한 운영 패턴을 제시했다. 이 점은 도구 호출이 빈번한 에이전트 환경에서의 실용적 이점을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | pass@1 (mean) | 70.9% | vs Laguna XS.2: +1.0 percentage points (69.9%) |
| SWE-bench Multilingual | pass@1 (mean) | 63.1% | vs Laguna XS.2: +5.4 percentage points (57.7%) |
| SWE-Bench Pro (Public Dataset) | pass@1 (mean) | 47.6% | vs Laguna XS.2: +1.3 percentage points (46.3%) |
| Terminal-Bench 2.0 | pass@1 (mean) | 37.5% | vs Laguna XS.2: +1.8 percentage points (35.7%) |
이미지 분석
192
Likes
25.6k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.