unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF
이미지와 텍스트를 함께 처리하는 멀티모달 에이전트 추론MIT
DeepSeek-V4-Flash 기반 Vision 실험 모델로 이미지 에이전트 성능을 확장
학습 방식 · DeepSeek-V4-Flash 아키텍처에 visual module을 결합한 뒤 continued training으로 시각 이해와 멀티모달 에이전트 기능을 학습했습니다.
TL;DR
이 모델은 DeepSeek-V4-Flash를 기반으로 visual module을 결합하고 continued training을 거친 GGUF 양자화 모델입니다. 이미지 입력은 llama.cpp b10766 이상에서 처리하며, OpenAI-style JSON 또는 <image>path</image> TXT 입력을 encoding 모듈이 prompt와 token ID로 변환한 뒤 vision encoder·aligner, DFlash attention, MoE, Hyper-Connections, DSpark 경로를 거칩니다. 기반 모델 기준 ApexBench Pass@1은 36.5, ZeroBench Pass@5는 35.0으로 멀티모달 에이전트 성능을 높였고, 텍스트 에이전트 작업에서는 DeepSeek-V4-Flash-0731과 비슷한 수준을 유지합니다. Q8 UD-Q8_K_XL은 162GB로 무손실에 가까운 실행 구성을 제공하지만 큰 메모리 용량이 필요합니다.
핵심 포인트
- DeepSeek-V4-Flash 아키텍처에 visual module을 추가하고 continued training으로 시각 이해 경로를 확장했습니다.
- ApexBench Pass@1 36.5로 기존 0731의 26.2†보다 높고, ZeroBench Pass@5는 35.0입니다.
- 텍스트 에이전트에서는 Terminal Bench 2.1 83.9로 0731의 82.7과 비슷한 성능 축을 유지합니다.
- 이미지는 llama.cpp b10766 이상이 필요하며, Q8 UD-Q8_K_XL 파일 크기는 162GB입니다.
제한사항
- 실험용 Vision 모델이므로 이미지 입력 처리는 llama.cpp b10766 이상 환경에 의존합니다.
- Q8 UD-Q8_K_XL 구성은 162GB이며 Q4보다 7GB만 커서, 양자화 수준에 따라 큰 저장 공간이 필요합니다.
- README의 벤치마크 수치는 기반 모델 DeepSeek-V4-Flash-Vision-Exp에 대한 공개 결과이며 이 GGUF 파일의 별도 측정치는 아닙니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal Bench 2.1 | score | 83.9 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 82.7, Opus-4.8 85.0 |
| NL2Repo | score | 57.7 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 54.2, Opus-4.8 69.7 |
| Cybergym | score | 75.3 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 76.7, Opus-4.8 78.3 |
| DeepSWE | score | 59.3 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 54.4, Opus-4.8 58.0 |
| Toolathlon-Verified | score | 75.9 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 70.3, Opus-4.8 76.2 |
| DSBench-Hard | score | 63.6 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 59.6, Opus-4.8 71.7 |
| AutomationBench (Public) | score | 25.7 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 25.1, Opus-4.8 27.2 |
| ApexBench | Pass@1 | 36.5 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 26.2†, Opus-4.8 39.4 |
| Agents' Last Exam | score | 27.3 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 25.2†, Opus-4.8 25.7 |
| Chartography | score | 64.3 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 수치 없음, Opus-4.8 65.0 |
| ZeroBench | Pass@5 | 35.0 | 기반 모델 공개 수치; DeepSeek-V4-Flash-0731 수치 없음, Opus-4.8 34.0 |
이미지 분석

70
LIKES
15.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.