본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

deepseek-ai/DeepSeek-V4.1-Flash

이미지와 텍스트를 함께 입력받는 텍스트 생성 및 에이전트 추론552B backbone parameters; 8B / 16B activated parameters최대 1M tokens 컨텍스트MIT

CED·CSA2·FP4 KV 캐싱으로 토큰당 KV cache를 890 bytes까지 줄인 1M 컨텍스트 multimodal MoE 모델

학습 방식 · 552B MoE backbone을 처음부터 45T multimodal tokens로 사전 학습한 뒤 SFT → RL → on-policy distillation(OPD)을 적용하고, 자동 합성 agent task·환경·rollout 데이터와 reasoning effort 1–100 제어를 결합했습니다.

TL;DR

DeepSeek-V4.1-Flash는 552B backbone을 사용하는 multimodal Mixture-of-Experts(MoE) base 모델로, 이미지와 텍스트를 함께 입력받아 autoregressive 방식으로 텍스트를 생성합니다. Causal Encoder-Decoder 구조와 Compressed Sparse Attention 2(CSA2), FP4 KV 캐싱을 결합해 토큰당 global KV cache를 890 bytes로 줄이고, prefill에는 8B, decode에는 16B 파라미터만 활성화합니다. 최대 1M 토큰 컨텍스트와 reasoning effort 1–100 조절을 지원하며, README 기준 DeepSWE v1.1에서 74.2, Terminal-Bench 2.1에서 90.6을 기록했습니다. 이미지 이해, 코드 에이전트, 긴 문맥 처리처럼 입력과 상호작용이 많은 작업에서 메모리 사용량과 추론 비용을 낮추는 데 초점이 맞춰져 있습니다.

핵심 포인트

  • CED가 encoder hidden states에서 decoder global KV cache를 투영해 prefill 8B·decode 16B만 활성화합니다.
  • CSA2의 Full·Reindex·Reuse 모드와 계층형 sparse indexer가 긴 문맥의 attention 비용 증가를 제한합니다.
  • FP4 main KV caching을 적용해 global KV cache를 토큰당 890 bytes로 줄이고 V4-Flash 대비 약 4배 절감합니다.
  • SFT·RL·on-policy distillation과 자동화된 agent task 데이터로 코드·보안·멀티모달 작업을 학습합니다.

제한사항

  • README에 Jinja 형식의 chat template가 포함되지 않아 제공된 encoding 구현이나 deepseek-recipe 사용이 필요합니다.
  • 로컬 추론에는 weight conversion과 별도 inference 절차가 필요하며, 모델 추론·도구 실행·HTTP 전송은 호출자가 구성해야 합니다.
  • 에이전트 벤치마크 수치는 harness, context window, temperature, 샘플 수 등 평가 설정에 따라 산출되었습니다.

벤치마크

벤치마크지표비교
MMLU-ProEM74.1DeepSeek-V4-Flash-Base 68.3, DeepSeek-V4-Pro-Base 73.5 대비 동일 표에서 가장 높은 점수
HumanEvalPass@179.4DeepSeek-V4-Flash-Base 69.5, DeepSeek-V4-Pro-Base 76.8 대비 높은 점수
GSM8KEM93.0DeepSeek-V4-Flash-Base 90.8, DeepSeek-V4-Pro-Base 92.6 대비 높은 점수
MMMU-ProEM56.5DeepSeek-V4.1-Flash-Base의 4-shot multimodal 평가 수치
DocVQALLM-Judge95.6DeepSeek-V4.1-Flash-Base의 4-shot 문서 시각 질의응답 평가 수치
Terminal-Bench 2.1Pass@190.6비교 표에서 Opus-5.0 89.1, GPT-5.6 Sol 88.8, K3 88.3보다 높은 점수
DeepSWE v1.1Resolved74.2비교 표에서 Opus-5.0 74.0, GPT-5.6 Sol 73.0보다 높은 해결 수치
CyberGymPass@188.1비교 표에서 GPT-5.6 Sol 84.5, K3 80.0, GLM-5.3 84.5보다 높은 점수
AutomationBenchPass@154.8비교 표에서 Opus-5.0 50.3, GPT-5.6 Sol 45.8보다 높은 점수
CodeforcesRating3471DeepSeek-V4-Pro 3348, DeepSeek-V4-Flash 3289 대비 높은 rating

이미지 분석

DeepSeek-V4.1-Flash와 Kimi-K3, GLM-5.3, Opus5, GPT5.6-Sol의 에이전트 벤치마크 점수를 Terminal-Bench 3.0, DeepSWE v1.1, CyberGym, Automation-Bench별로 비교한 막대그래프입니다.
DeepSeek-V4.1-Flash는 Terminal-Bench 3.0에서 30.0, DeepSWE v1.1에서 74.2, CyberGym에서 88.1, Automation-Bench에서 54.8을 기록합니다. DeepSWE v1.1·CyberGym·Automation-Bench에서는 비교 대상 중 가장 높고, Terminal-Bench 3.0에서는 Opus5의 43.3보다 낮지만 Kimi-K3 17.7과 GLM-5.3 28.3보다 높습니다. 코드 수정, 보안 테스트, 자동화처럼 여러 단계의 도구 사용이 필요한 작업에서 성능 차이를 읽을 수 있습니다.
DeepSeek 계열 모델의 토큰당 global KV cache 크기를 DeepSeek-V1 389,120 bytes, DeepSeek-V3.2 48,068 bytes, DeepSeek-V4-Flash 3,514 bytes, DeepSeek-V4.1-Flash 890 bytes로 비교한 그래프입니다.
DeepSeek-V4.1-Flash의 토큰당 KV cache는 890 bytes로, DeepSeek-V4-Flash의 3,514 bytes에서 약 3.9배, DeepSeek-V3.2의 48,068 bytes에서 약 54배, DeepSeek-V1의 389,120 bytes에서 약 437배 작습니다. 그래프는 CED, CSA2, FP4 main KV caching, SWA Bounded Replay가 누적되어 긴 컨텍스트에서 저장해야 할 상태를 줄이는 방향을 나타냅니다. 1M 토큰 문맥을 유지하는 에이전트 추론에서 KV cache 메모리 부담을 낮추는 설계상의 차이를 수치로 확인할 수 있습니다.

1.3k

LIKES

6

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.