1M 토큰 지원과 FP4/FP8 혼합 정밀도로 설계된 DeepSeek V4 Flash 계열
DeepSeek-V4-Flash-DSpark는 1M 토큰 장문 처리를 목표로 하는 MoE 기반 LLM으로 하이브리드 어텐션과 mixed-precision(FP4/FP8), speculative decoding 모듈을 결합해 장문 효율과 응답성 개선을 목표로 한다.
TL;DR
DeepSeek-V4-Flash-DSpark는 DeepSeek-V4 체인의 Flash 계열 체크포인트에 speculative decoding 모듈을 추가한 릴리스로서 기본 모델 구조는 변경하지 않고 응답성 개선을 목표로 한다. 아키텍처 관점에서 MoE를 기반으로 Compressed Sparse Attention과 Heavily Compressed Attention을 결합한 하이브리드 어텐션을 도입해 1,000,000토큰 문맥에서 연산량과 KV 캐시 요구를 크게 줄이도록 설계되었다. 사전학습은 32T 토큰 이상의 대규모 코퍼스로 수행되었고 SFT와 GRPO로 전문가를 육성한 뒤 on-policy distillation으로 통합하는 두 단계의 후처리 파이프라인을 거쳤다. 결과적으로 README 표는 Flash와 Pro 버전이 코드·언어·장문 벤치마크에서 경쟁력 있는 수치를 보이며 FP4/FP8 혼합 정밀도와 Muon Optimizer, mHC 같은 구성 요소가 효율성과 안정성을 뒷받침한다고 보고하고 있다. 한계로는 이 릴리스가 별도 새로운 체크포인트가 아닌 동일 체크포인트에 speculative decoding 모듈을 덧붙인 형태임이 명시되어 있어 모델 내부 구조 변경에 따른 성능 개선 근거는 제한적이다.
핵심 역량
- 장문 컨텍스트를 1,000,000토큰까지 처리할 수 있으며 하이브리드 어텐션 설계로 긴 문서에서의 연산량과 메모리 요구를 크게 줄인다. 모델은 장문 질의응답과 문서 내 장기 의존성 해소에 적합하며 검색 기반 복합 응답 생성에서 컨텍스트를 광범위하게 유지한다. README에서는 1M 토큰 규격을 명시하고 장문 전용 벤치마크 결과를 함께 제공한다.
- 다양한 추론 모드를 제공해 추론 비용과 정확도 간의 트레이드오프를 조절할 수 있다. Non-think, Think High, Think Max의 세 모드로 응답 속도와 사고 예산을 달리 설정하며 Think Max 모드는 시스템 프롬프트와 결합해 최대 추론 노력을 투입한다. 이 모드 전환은 복잡한 문제 해결이나 고정밀 추론에서 활용되도록 설계되었다.
- 코드·수학·언어 추론 등 복합 태스크에서 강력한 성능을 목표로 설계되었으며 표준 벤치마크에서 높은 점수를 보고했다. HumanEval, LiveCodeBench, MMLU 등 다양한 분류·코드·추론 지표를 README 표로 제공해 능력을 수치로 확인할 수 있다. 모델은 MoE 활성화 파라미터 설계로 특정 워크로드에서 효율적 자원 사용을 보장한다.
강점
- 1M 토큰 문맥을 목표로 한 아키텍처 개선으로 장문 효율성이 강조되어 있다. README에서는 하이브리드 어텐션 적용으로 DeepSeek-V4-Pro가 동일 조건에서 DeepSeek-V3.2 대비 단일 토큰 추론 FLOPs의 27% 수준과 KV cache의 10% 수준을 달성했다고 표기되어 있다. 이와 함께 대규모(32T 토큰) 사전학습과 MoE 설계로 장문·추론 워크로드에서 경쟁력 있는 성능을 확보했다.
훈련 방식
대규모 사전학습에 이어 SFT와 GRPO 기반의 독립 전문가 육성 후 on-policy distillation으로 통합하는 두 단계(post-training) 파이프라인을 적용했으며 사전학습 데이터는 32T 토큰 이상이라고 명시되어 있다.
알아두면 좋은 것
- DeepSeek-V4 시리즈는 MoE 아키텍처와 하이브리드 어텐션(CSA+HCA)을 결합해 1M 토큰 문맥을 목표로 설계되었으며 README에 32T 이상의 프리트레이닝 코퍼스가 명시되어 있다.
- 모델 배포에는 FP4와 FP8 혼합 정밀도 전략이 적용되며 MoE 전문가 파라미터는 FP4로, 기타 파라미터는 FP8로 운영되는 혼합 정밀도 표기가 README에 명시되어 있다.
- DeepSeek-V4-Flash-DSpark는 새로운 체크포인트가 아닌 동일 체크포인트에 speculative decoding 모듈을 덧붙인 릴리스로서 추론 응답성 개선을 목적으로 한다는 점이 명확하게 표기되어 있다.
- 사후 훈련 파이프라인은 SFT와 GRPO 기반의 전문가 육성 후 on-policy distillation을 통해 도메인별 능력을 통합하는 두 단계 접근법을 사용한다고 명시되어 있다.
기술적 특징
- 하이브리드 어텐션은 Compressed Sparse Attention과 Heavily Compressed Attention을 결합해 긴 문맥에서 연산량과 KV 캐시 요구를 줄인다. 이 설계는 모든 토큰 간 완전한 어텐션을 피하면서도 핵심 의존성을 보존하도록 희소화와 압축 전략을 조합해 구현된다. README는 이 조합이 1M 토큰 환경에서 FLOPs 및 메모리 이점을 제공한다고 명시했다.
- Mixture-of-Experts 아키텍처는 전체 파라미터 규모를 크게 유지하면서 활성화 파라미터만을 동적으로 선택해 추론 비용을 낮춘다. DeepSeek-V4-Flash는 284B 총 파라미터 중 13B만 활성화되는 구조를 채택해 계산 효율과 표현력을 동시에 확보한다. 이 구조는 다양한 도메인 전문성을 독립 전문가로 키운 뒤 통합하는 사후 훈련 파이프라인과 함께 동작한다.
- Manifold-Constrained Hyper-Connections(mHC)는 잔차 연결을 보강해 레이어 간 신호 전달 안정성을 높이면서 모델 표현력을 유지하도록 설계되었다. mHC는 깊은 네트워크에서 정보 소실과 기울기 문제를 완화하는 구조적 보완을 제공하며 복잡한 추론 시 안정적 동작을 돕는다. README는 mHC를 표준 잔차 연결의 보강 장치로 설명하고 있다.
- 혼합 정밀도 전략과 Muon Optimizer의 결합으로 학습 안정성과 효율을 확보했다. MoE 전문가 파라미터는 FP4로, 그 외 파라미터는 FP8로 운영해 메모리와 대역폭을 절감하며 Muon Optimizer는 수렴 속도와 안정성을 개선하는 역할을 담당한다. README는 FP4+FP8 혼합이 MoE 적용과 함께 사용된다고 명시했다.
차별점
- 1M 토큰을 공식 지원하는 하이브리드 어텐션 아키텍처를 채택해 장문 처리 효율성을 우선적으로 설계했다. 이 설계는 CSA와 HCA를 조합해 KV 캐시와 연산량을 크게 줄이는 것을 목표로 하며 README에 비교 수치가 제시되어 있다.
- MoE 구조에서 활성화 파라미터를 상대적으로 작게 유지하는 전략으로 실용적 추론 자원 소비를 낮추었다. Flash 계열은 284B 총 파라미터 중 13B만 활성화되도록 구성되어 특정 워크로드에서 비용 효율을 확보한다.
- MoE 전문가에 대한 FP4와 나머지 파라미터에 대한 FP8 혼합 정밀도 사용으로 메모리 효율과 대역폭 요구를 동시에 줄이는 방식을 택했다. README에서는 MoE 전문가가 FP4로 동작한다고 명시되어 혼합 정밀도의 구체적 적용 위치가 드러난다.
- 이번 릴리스는 동일 체크포인트에 speculative decoding 모듈을 추가한 형태로, 모델 변경 없이 응답성 개선을 도모하는 배포 전략을 취했다. DeepSeek-V4-Flash-DSpark는 이 점을 릴리스 노트에서 분명히 밝히고 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU | EM (5-shot) | DeepSeek-V4-Flash-Base 88.7, DeepSeek-V4-Pro-Base 90.1 | DeepSeek-V3.2-Base 87.8 |
| HumanEval | Pass@1 (0-shot) | DeepSeek-V4-Flash-Base 69.5, DeepSeek-V4-Pro-Base 76.8 | DeepSeek-V3.2-Base 62.8 |
| LongBench-V2 | EM (1-shot) | DeepSeek-V4-Flash-Base 44.7, DeepSeek-V4-Pro-Base 51.5 | DeepSeek-V3.2-Base 40.2 |
| LiveCodeBench | Pass@1 | DS-V4-Pro Max 93.5 | — |
| MRCR 1M | MMR | DS-V4-Pro Max 83.5 | Top reported 92.9 (other model in table) |
이미지 분석

182
Likes
118.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.