1M 토큰 네이티브 MoE 장기 컨텍스트 모델
69B 파라미터와 LongCat Sparse Attention으로 1M 토큰을 효율적으로 처리하는 MoE 기반 텍스트 생성 모델
TL;DR
LongCat-Flash-Lite-Sparse는 LongCat-Flash-Lite를 기반으로 한 69B non-thinking MoE 모델로 토큰당 약 3B 파라미터만 활성화하며 네이티브로 1M 토큰 컨텍스트를 지원합니다. 핵심 기술은 LongCat Sparse Attention으로, Streaming-Aware Indexing이 연속적 KV 접근을 유도하고 Cross-Layer Indexing이 인덱싱 결과를 여러 레이어에서 재사용하며 Hierarchical Indexing이 후보 수를 줄여 추론 오버헤드를 낮춥니다. 표준 및 장기 컨텍스트 벤치마크에서 에이전틱 성능(예: SWE-Bench Verified 68.20, τ²-Telecom 95.18)이 밀집 전신 대비 개선되는 반면 일반 지식·추론 지표는 대체로 동등한 수준을 유지하며, 단일 고메모리 GPU 노드에서의 배포 옵션을 README에 제공하고 있습니다.
핵심 역량
- 네이티브 1M 토큰 긴 컨텍스트 처리 능력과 이를 위한 progressive long-context extension 스케줄을 갖추고 있습니다.
- LongCat Sparse Attention(LSA)을 통해 스트리밍-친화적 인덱싱과 층 간 인덱싱 재사용으로 KV 접근을 연속적이고 효율적으로 만듭니다.
- Mixture-of-Experts 구조로 토큰당 활성 파라미터를 약 3B로 제한해 긴 컨텍스트를 처리하면서 계산 효율을 확보합니다.
강점
- 에이전틱 작업에서 개선된 성능을 보이며 SWE-Bench Verified에서 Lite-Sparse(w/o HI) 68.20을 기록해 Lite-Dense 54.40 대비 유의한 상승을 보였습니다. 이 점은 모델이 툴 사용, 검색, 코딩 같은 다단계 의사결정 흐름에서 더 나은 선택을 할 수 있음을 의미합니다. 동시에 MMLU 등 일반 도메인 벤치마크에서는 밀집 버전과 비슷한 수준의 성능을 유지해 전반적 역량 저하 없이 특정 작업에서 강점을 발휘합니다.
- 긴 컨텍스트 처리 효율이 핵심 강점이며 LSA의 세 가지 인덱싱 메커니즘이 실제 추론 대역폭과 메모리 접근 패턴을 개선합니다. README와 테이블은 여러 장기 벤치에서 개선 또는 유지되는 성능을 보고하고 있으며 특히 In-context Learning(HELMET-ICL Extend 91.63)과 Holistic Assessment(LongBench-v2 52.50→53.64 등)에서 경쟁력 있는 결과를 보입니다. 네이티브 1M 토큰 지원은 대화형 에이전트와 장기 메모리 애플리케이션에서 실질적 이점을 제공합니다.
- 배포 가능성이 높아 단일 고메모리 GPU 노드에서 서비스 가능한 점도 실전 적용 측면의 장점입니다. README에 제시된 sglang 런처 옵션은 긴 컨텍스트 프리필과 KV 캐시 최적화를 반영하고 있어 운영 환경에서 바로 적용할 수 있습니다. 다만 특정 언어·도메인에서 성능 변동이 존재할 수 있으므로 실제 서비스 전에 타겟 워크로드 기반 검증이 필요합니다.
훈련 방식
모델은 non-thinking Mixture-of-Experts 구조를 기반으로 하며 cross-layer distillation을 통해 층 간 인덱싱 재사용 능력을 학습했습니다. 긴 컨텍스트 확장을 위해 progressive schedule과 보강된 코퍼스를 사용해 1,024K 토큰까지 네이티브 지원을 목표로 했습니다. Hierarchical Indexing은 추론 시 활성화 가능하도록 설계되어 추가 학습 없이 후보 축소를 수행할 수 있습니다.
알아두면 좋은 것
- LongCat-Flash-Lite-Sparse는 69B 총 파라미터 규모의 non-thinking MoE 모델이며 토큰당 활성화되는 파라미터는 약 3B입니다. 이 모델은 LongCat-Flash-Lite를 기반으로 희소 어텐션 메커니즘인 LSA를 도입해 긴 컨텍스트 추론 효율을 개선합니다. 네이티브로 1,024K(1M) 토큰 컨텍스트를 지원하도록 장기 확장 스케줄과 보강된 코퍼스를 사용했습니다.
- LSA는 Streaming-Aware Indexing, Cross-Layer Indexing, Hierarchical Indexing의 세 가지 보완적 인덱싱 메커니즘을 결합합니다. Streaming-Aware Indexing은 토큰 선택 예산을 고정 싱크와 지역 윈도우로 분배해 연속적인 KV 접근을 유도하고 Cross-Layer Indexing은 인덱싱 결과를 인접 레이어에서 재사용하도록 학습시킵니다. Hierarchical Indexing은 조대 후보 탐색 후 세부 토큰 선택을 수행해 추론 시 인덱싱 오버헤드를 추가 학습 없이 줄일 수 있습니다.
- 표준 벤치마크에서 Lite-Sparse는 에이전틱 코딩과 툴 사용, 검색 관련 지표에서 Lite-Dense 대비 큰 개선을 보였습니다. 예컨대 SWE-Bench Verified는 Lite-Dense 54.40에서 Lite-Sparse(w/o HI) 68.20으로 상승했고 τ²-Telecom은 72.80에서 95.18로 증가했습니다. MMLU와 C-Eval 같은 일반 도메인 지표는 대체로 밀집 전신과 유사한 성능을 유지합니다.
- 배포 측면에서 SGLang의 기본 적응을 통해 단일 노드(예: 1xH20-141G)에서 서빙이 가능하도록 설계됐습니다. README에는 서버 런처 예시와 KV 캐시 dtype, 메모리 분할 같은 운영 파라미터가 포함되어 있어 실환경 테스트에 바로 활용할 수 있습니다. 다만 모든 다운스트림 응용에 대해 포괄적 검증을 수행하지 않았으므로 민감한 환경에서는 추가 평가가 필요합니다.
기술적 특징
- LongCat Sparse Attention은 Streaming-Aware Indexing으로 일부 토큰 선택을 고정 싱크와 지역 슬라이딩 윈도우에 할당해 프래그먼트화된 KV 접근을 예측 가능한 연속 읽기로 변환합니다. 이 처리 흐름은 메모리 접근 패턴을 개선해 HBM 대역폭 활용도를 올리는 것을 목표로 하며 긴 시퀀스에서 캐시·대역폭 병목을 완화합니다. 이러한 구조는 토큰별 후보 접근을 줄여 대규모 컨텍스트에서의 실시간 추론 효율을 높입니다.
- Cross-Layer Indexing은 인접 레이어들 사이의 어텐션 saliency 안정성을 활용해 한 번의 인덱싱 결과를 여러 레이어가 재사용하도록 만듭니다. 이를 위해 학습 단계에서 cross-layer distillation을 적용해 재사용 가능성을 학습시키며 추론 시 인덱싱 횟수를 줄여 지연을 감소시킵니다. 결과적으로 긴 회화나 누적 토큰이 많은 작업에서 전체 인덱싱 비용이 낮아집니다.
- Hierarchical Indexing은 조대 후보 블록을 먼저 회수하고 그 내부에서 세부 토큰을 선택하는 두 단계 스코어링을 적용합니다. 이 기법은 쿼리당 후보 공간을 대폭 축소해 인덱싱 오버헤드를 줄이며 추론 시 활성화 가능하다는 장점이 있어 학습 재실행 없이도 적용할 수 있습니다. 후보 축소는 특히 수백만 토큰 단위의 컨텍스트에서 유의미한 계산 절감으로 이어집니다.
차별점
- LSA의 세 가지 인덱싱 메커니즘(SI, CLI, HI)을 통합해 긴 컨텍스트에서의 메모리 접근 패턴과 인덱싱 오버헤드를 동시에 개선하는 점이 주요 차별화 포인트입니다. 단일 메커니즘이 아닌 계층적·층간·스트리밍 친화적 설계를 결합해 실하드웨어 접근 효율을 고려한 설계 결정을 내렸습니다. 이로 인해 긴 문맥 애플리케이션에서 효율성과 품질 균형을 확보하려는 요구에 부합합니다.
- 네이티브 1M 토큰 컨텍스트 지원을 목표로 progressive long-context extension을 도입한 점이 눈에 띕니다. 확장 스케줄과 보강 코퍼스를 통해 학습 단계에서 긴 컨텍스트 적응을 진행했으며 이로 인해 추론 시 대규모 컨텍스트를 직접 다루는 워크로드에서 추가적인 외부 처리 없이 동작할 수 있습니다. 많은 공개 모델들이 외부 플러그인이나 긴 컨텍스트 확장 기법을 필요로 하는 것과 대비됩니다.
- non-thinking MoE 아키텍처로 총 69B 파라미터를 유지하면서 토큰당 활성 파라미터를 약 3B로 제한해 계산 효율을 확보한 점도 차별점입니다. 이는 모델이 전체 파라미터 수에 비해 추론 비용을 줄이면서도 고용량 파라미터의 표현력을 활용할 수 있게 해 긴 문맥 작업에서 실질적인 효율 우위를 만듭니다. 또한 sglang 등 기존 서빙 도구와의 연동을 통해 단일 노드 배포가 가능하도록 설계되었습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-Bench Verified | acc | 68.20 | Lite-Dense: 54.40 |
| τ²-Telecom | avg@4 | 95.18 | Lite-Dense: 72.80 |
| MMLU | acc | 85.31 | Lite-Dense: 85.52 |
| HELMET-ICL Extend | acc | 91.63 | — |
| LongBench-v2 | score | 53.64 | Lite-Sparse (w/o HI): 52.50 |
| LOFT Retrieval Extend | acc | 44.38 | Lite-Sparse (w/o HI): 43.75 |
60
Likes
155
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.