deepseek-ai/DeepSeek-V4-Flash-DSpark
DeepSeek-V4-Flash-DSpark는 1M 토큰 장문 처리를 목표로 하는 MoE 기반 LLM으로 하이브리드 어텐션과 mixed-precision(FP4/FP8), speculative decoding 모듈을 결합해 장문 효율과 응답성 개선을 목표로 한다.
학습 방식 · 대규모 사전학습에 이어 SFT와 GRPO 기반의 독립 전문가 육성 후 on-policy distillation으로 통합하는 두 단계(post-training) 파이프라인을 적용했으며 사전학습 데이터는 32T 토큰 이상이라고 명시되어 있다.
TL;DR
DeepSeek-V4-Flash-DSpark는 DeepSeek-V4 체인의 Flash 계열 체크포인트에 speculative decoding 모듈을 추가한 릴리스로서 기본 모델 구조는 변경하지 않고 응답성 개선을 목표로 한다. 아키텍처 관점에서 MoE를 기반으로 Compressed Sparse Attention과 Heavily Compressed Attention을 결합한 하이브리드 어텐션을 도입해 1,000,000토큰 문맥에서 연산량과 KV 캐시 요구를 크게 줄이도록 설계되었다. 사전학습은 32T 토큰 이상의 대규모 코퍼스로 수행되었고 SFT와 GRPO로 전문가를 육성한 뒤 on-policy distillation으로 통합하는 두 단계의 후처리 파이프라인을 거쳤다. 결과적으로 README 표는 Flash와 Pro 버전이 코드·언어·장문 벤치마크에서 경쟁력 있는 수치를 보이며 FP4/FP8 혼합 정밀도와 Muon Optimizer, mHC 같은 구성 요소가 효율성과 안정성을 뒷받침한다고 보고하고 있다. 한계로는 이 릴리스가 별도 새로운 체크포인트가 아닌 동일 체크포인트에 speculative decoding 모듈을 덧붙인 형태임이 명시되어 있어 모델 내부 구조 변경에 따른 성능 개선 근거는 제한적이다.
핵심 포인트
- 1M 토큰을 공식 지원하는 하이브리드 어텐션 아키텍처를 채택해 장문 처리 효율성을 우선적으로 설계했다. 이 설계는 CSA와 HCA를 조합해 KV 캐시와 연산량을 크게 줄이는 것을 목표로 하며 README에 비교 수치가 제시되어 있다.
- MoE 구조에서 활성화 파라미터를 상대적으로 작게 유지하는 전략으로 실용적 추론 자원 소비를 낮추었다. Flash 계열은 284B 총 파라미터 중 13B만 활성화되도록 구성되어 특정 워크로드에서 비용 효율을 확보한다.
- MoE 전문가에 대한 FP4와 나머지 파라미터에 대한 FP8 혼합 정밀도 사용으로 메모리 효율과 대역폭 요구를 동시에 줄이는 방식을 택했다. README에서는 MoE 전문가가 FP4로 동작한다고 명시되어 혼합 정밀도의 구체적 적용 위치가 드러난다.
- 이번 릴리스는 동일 체크포인트에 speculative decoding 모듈을 추가한 형태로, 모델 변경 없이 응답성 개선을 도모하는 배포 전략을 취했다. DeepSeek-V4-Flash-DSpark는 이 점을 릴리스 노트에서 분명히 밝히고 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU | EM (5-shot) | DeepSeek-V4-Flash-Base 88.7, DeepSeek-V4-Pro-Base 90.1 | DeepSeek-V3.2-Base 87.8 |
| HumanEval | Pass@1 (0-shot) | DeepSeek-V4-Flash-Base 69.5, DeepSeek-V4-Pro-Base 76.8 | DeepSeek-V3.2-Base 62.8 |
| LongBench-V2 | EM (1-shot) | DeepSeek-V4-Flash-Base 44.7, DeepSeek-V4-Pro-Base 51.5 | DeepSeek-V3.2-Base 40.2 |
| LiveCodeBench | Pass@1 | DS-V4-Pro Max 93.5 | — |
| MRCR 1M | MMR | DS-V4-Pro Max 83.5 | Top reported 92.9 (other model in table) |
이미지 분석

182
LIKES
118.4k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.