deepseek-ai/DeepSeek-V4-Pro-0813
에이전트형 텍스트 생성과 코드 실행, 도구 사용, 자동화 작업MIT
DSpark와 에이전트 최적화로 코드·도구 작업 성능을 높인 DeepSeek-V4-Pro 공식 후속 모델
TL;DR
DeepSeek-V4-Pro-0813은 DeepSeek-V4-Pro (Preview) 구조를 기반으로 DSpark speculative decoding module을 결합한 공식 후속 release이며, quantized나 LoRA 변형으로 명시된 모델은 아닙니다. 메시지는 Jinja chat template이 아니라 전용 encoding 코드로 변환하고, vLLM과 SGLang에서는 동일 체크포인트의 draft 경로를 활용해 speculative decoding을 켭니다. Terminal Bench 2.1에서 87.9점, DeepSWE에서 62.7점, Cybergym에서 83.3점을 기록해 코드 에이전트와 도구 사용 작업에 초점을 맞춥니다. 다만 README의 실행 예시는 4×GB300 또는 TP 4 환경을 전제로 하며, 로컬 사용자는 encoding과 inference 절차를 별도로 적용해야 합니다.
핵심 포인트
- DeepSeek-V4-Pro (Preview) 구조에 DSpark speculative decoding module을 결합한 공식 후속 release입니다. 동일 체크포인트에서 target과 draft 가중치를 함께 사용해 별도 draft model 없이 추론을 가속합니다. vLLM에서는 dspark 방식과 7개의 speculative tokens 설정으로 활성화합니다.
- 에이전트 작업 성능을 높이도록 설계되어 코드 작성과 터미널 조작에서 Preview보다 큰 폭의 점수 상승을 기록했습니다. Terminal Bench 2.1에서 87.9점, DeepSWE에서 62.7점을 기록해 실제 개발 작업에 가까운 평가에서 강점을 보였습니다. reasoning_effort는 low, high, max 세 단계로 제공되어 답변 전 숙고량을 조절합니다.
- Jinja 형식의 chat template 대신 OpenAI 호환 메시지를 입력 문자열로 변환하고 출력 텍스트를 다시 파싱하는 전용 encoding 코드를 사용합니다. encoding_dsv4의 encode_messages와 parse_message_from_completion_text를 통해 대화 형식과 reasoning_content를 처리합니다. 따라서 일반적인 AutoTokenizer 호출만으로 대화 프롬프트를 완성하기보다 저장소의 encoding 폴더 구현을 함께 적용해야 합니다.
- 대규모 배포를 위해 vLLM과 SGLang에서 Expert Parallelism, MoE backend, FP8 KV cache 같은 실행 경로를 제공합니다. vLLM은 --speculative-config에 dspark를 지정하고 SGLang은 --speculative-algorithm DSPARK를 지정하는 방식입니다. README의 예시는 4×GB300 노드와 TP 4 실행을 기준으로 하며 로컬 추론에는 별도 inference 문서가 필요합니다.
제한사항
- Jinja 형식의 chat template이 포함되지 않아 기본 Transformers 대화 호출만으로는 입력 형식을 구성하기 어렵습니다. OpenAI 호환 messages를 encoding_dsv4로 문자열화하고 모델 출력도 전용 parser로 처리해야 합니다. 이 절차를 생략하면 일반적인 chat template 기반 코드와 입력 및 출력 형식이 맞지 않을 수 있습니다.
- README의 공식 실행 예시는 vLLM에서 4×GB300 노드, SGLang에서 TP 4 구성을 사용하므로 소규모 로컬 환경에 그대로 적용하기 어렵습니다. 로컬 실행은 weight conversion과 interactive chat demo를 포함한 별도 inference 문서를 따라야 합니다. high와 max reasoning effort에서는 최대 출력 길이 384K tokens가 권장됩니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HLE | 점수 (도구 없음 / 도구 사용) | 42.7 / 60.0 | README 공개 비교표 기준으로 GLM-5.2는 40.5 / 54.7, Opus-4.8은 49.8 / 57.9, Fable-5 (w/ fallback)는 53.3 / 63.0 |
| Terminal Bench 2.1 | 점수 | 87.9 | README 공개 비교표 기준으로 DeepSeek-V4-Pro (Preview)는 72.1, Opus-4.8은 85.0, Fable-5 (w/ fallback)는 88.0 |
| NL2Repo | 점수 | 61.5 | README 공개 비교표 기준으로 DeepSeek-V4-Pro (Preview)는 38.5, GLM-5.2는 48.9, Opus-4.8은 69.7 |
| Cybergym | 점수 | 83.3 | README 공개 비교표 기준으로 DeepSeek-V4-Pro (Preview)는 52.7, Kimi K3는 80.0, Fable-5 (w/ fallback)는 83.1 |
| DeepSWE | 점수 | 62.7 | README 공개 비교표 기준으로 DeepSeek-V4-Pro (Preview)는 12.8, GLM-5.2는 46.2, Kimi K3는 67.5 |
| Toolathlon-Verified | 점수 | 74.1 | README 공개 비교표 기준으로 DeepSeek-V4-Pro (Preview)는 55.9, Kimi K3는 76.5, Opus-4.8은 76.2 |
| Agents' Last Exam | 점수 | 25.7 | README 공개 비교표 기준으로 DeepSeek-V4-Pro (Preview)는 16.5, GLM-5.2는 23.8, Kimi K3는 27.6 |
| AutomationBench (Public) | 점수 | 31.8 | README 공개 비교표 기준으로 DeepSeek-V4-Pro (Preview)는 12.8, GLM-5.2는 12.9, Kimi K3는 30.8 |
| DSBench-FullStack | 점수 | 71.1 | README에 내부 full-stack development test set으로 명시됐으며, DeepSeek-V4-Pro (Preview)는 41.8, Opus-4.8은 71.6, Fable-5 (w/ fallback)는 77.2 |
| DSBench-Hard | 점수 | 67.2 | README에 내부의 어려운 coding-agent 문제 테스트 세트로 명시됐으며, DeepSeek-V4-Pro (Preview)는 31.1, Opus-4.8은 71.7, Fable-5 (w/ fallback)는 68.3 |
267
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.