deepseek-ai/DeepSeek-V4.1-Flash
CED·CSA2·FP4 KV 캐싱으로 토큰당 KV cache를 890 bytes까지 줄인 1M 컨텍스트 multimodal MoE 모델
학습 방식 · 552B MoE backbone을 처음부터 45T multimodal tokens로 사전 학습한 뒤 SFT → RL → on-policy distillation(OPD)을 적용하고, 자동 합성 agent task·환경·rollout 데이터와 reasoning effort 1–100 제어를 결합했습니다.
TL;DR
DeepSeek-V4.1-Flash는 552B backbone을 사용하는 multimodal Mixture-of-Experts(MoE) base 모델로, 이미지와 텍스트를 함께 입력받아 autoregressive 방식으로 텍스트를 생성합니다. Causal Encoder-Decoder 구조와 Compressed Sparse Attention 2(CSA2), FP4 KV 캐싱을 결합해 토큰당 global KV cache를 890 bytes로 줄이고, prefill에는 8B, decode에는 16B 파라미터만 활성화합니다. 최대 1M 토큰 컨텍스트와 reasoning effort 1–100 조절을 지원하며, README 기준 DeepSWE v1.1에서 74.2, Terminal-Bench 2.1에서 90.6을 기록했습니다. 이미지 이해, 코드 에이전트, 긴 문맥 처리처럼 입력과 상호작용이 많은 작업에서 메모리 사용량과 추론 비용을 낮추는 데 초점이 맞춰져 있습니다.
핵심 포인트
- CED가 encoder hidden states에서 decoder global KV cache를 투영해 prefill 8B·decode 16B만 활성화합니다.
- CSA2의 Full·Reindex·Reuse 모드와 계층형 sparse indexer가 긴 문맥의 attention 비용 증가를 제한합니다.
- FP4 main KV caching을 적용해 global KV cache를 토큰당 890 bytes로 줄이고 V4-Flash 대비 약 4배 절감합니다.
- SFT·RL·on-policy distillation과 자동화된 agent task 데이터로 코드·보안·멀티모달 작업을 학습합니다.
제한사항
- README에 Jinja 형식의 chat template가 포함되지 않아 제공된 encoding 구현이나 deepseek-recipe 사용이 필요합니다.
- 로컬 추론에는 weight conversion과 별도 inference 절차가 필요하며, 모델 추론·도구 실행·HTTP 전송은 호출자가 구성해야 합니다.
- 에이전트 벤치마크 수치는 harness, context window, temperature, 샘플 수 등 평가 설정에 따라 산출되었습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro | EM | 74.1 | DeepSeek-V4-Flash-Base 68.3, DeepSeek-V4-Pro-Base 73.5 대비 동일 표에서 가장 높은 점수 |
| HumanEval | Pass@1 | 79.4 | DeepSeek-V4-Flash-Base 69.5, DeepSeek-V4-Pro-Base 76.8 대비 높은 점수 |
| GSM8K | EM | 93.0 | DeepSeek-V4-Flash-Base 90.8, DeepSeek-V4-Pro-Base 92.6 대비 높은 점수 |
| MMMU-Pro | EM | 56.5 | DeepSeek-V4.1-Flash-Base의 4-shot multimodal 평가 수치 |
| DocVQA | LLM-Judge | 95.6 | DeepSeek-V4.1-Flash-Base의 4-shot 문서 시각 질의응답 평가 수치 |
| Terminal-Bench 2.1 | Pass@1 | 90.6 | 비교 표에서 Opus-5.0 89.1, GPT-5.6 Sol 88.8, K3 88.3보다 높은 점수 |
| DeepSWE v1.1 | Resolved | 74.2 | 비교 표에서 Opus-5.0 74.0, GPT-5.6 Sol 73.0보다 높은 해결 수치 |
| CyberGym | Pass@1 | 88.1 | 비교 표에서 GPT-5.6 Sol 84.5, K3 80.0, GLM-5.3 84.5보다 높은 점수 |
| AutomationBench | Pass@1 | 54.8 | 비교 표에서 Opus-5.0 50.3, GPT-5.6 Sol 45.8보다 높은 점수 |
| Codeforces | Rating | 3471 | DeepSeek-V4-Pro 3348, DeepSeek-V4-Flash 3289 대비 높은 rating |
이미지 분석


1.3k
LIKES
6
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.