본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF

이미지와 텍스트를 함께 처리하는 멀티모달 에이전트 추론MIT

DeepSeek-V4-Flash 기반 Vision 실험 모델로 이미지 에이전트 성능을 확장

학습 방식 · DeepSeek-V4-Flash 아키텍처에 visual module을 결합한 뒤 continued training으로 시각 이해와 멀티모달 에이전트 기능을 학습했습니다.

TL;DR

이 모델은 DeepSeek-V4-Flash를 기반으로 visual module을 결합하고 continued training을 거친 GGUF 양자화 모델입니다. 이미지 입력은 llama.cpp b10766 이상에서 처리하며, OpenAI-style JSON 또는 <image>path</image> TXT 입력을 encoding 모듈이 prompt와 token ID로 변환한 뒤 vision encoder·aligner, DFlash attention, MoE, Hyper-Connections, DSpark 경로를 거칩니다. 기반 모델 기준 ApexBench Pass@1은 36.5, ZeroBench Pass@5는 35.0으로 멀티모달 에이전트 성능을 높였고, 텍스트 에이전트 작업에서는 DeepSeek-V4-Flash-0731과 비슷한 수준을 유지합니다. Q8 UD-Q8_K_XL은 162GB로 무손실에 가까운 실행 구성을 제공하지만 큰 메모리 용량이 필요합니다.

핵심 포인트

  • DeepSeek-V4-Flash 아키텍처에 visual module을 추가하고 continued training으로 시각 이해 경로를 확장했습니다.
  • ApexBench Pass@1 36.5로 기존 0731의 26.2†보다 높고, ZeroBench Pass@5는 35.0입니다.
  • 텍스트 에이전트에서는 Terminal Bench 2.1 83.9로 0731의 82.7과 비슷한 성능 축을 유지합니다.
  • 이미지는 llama.cpp b10766 이상이 필요하며, Q8 UD-Q8_K_XL 파일 크기는 162GB입니다.

제한사항

  • 실험용 Vision 모델이므로 이미지 입력 처리는 llama.cpp b10766 이상 환경에 의존합니다.
  • Q8 UD-Q8_K_XL 구성은 162GB이며 Q4보다 7GB만 커서, 양자화 수준에 따라 큰 저장 공간이 필요합니다.
  • README의 벤치마크 수치는 기반 모델 DeepSeek-V4-Flash-Vision-Exp에 대한 공개 결과이며 이 GGUF 파일의 별도 측정치는 아닙니다.

벤치마크

벤치마크지표비교
Terminal Bench 2.1score83.9기반 모델 공개 수치; DeepSeek-V4-Flash-0731 82.7, Opus-4.8 85.0
NL2Reposcore57.7기반 모델 공개 수치; DeepSeek-V4-Flash-0731 54.2, Opus-4.8 69.7
Cybergymscore75.3기반 모델 공개 수치; DeepSeek-V4-Flash-0731 76.7, Opus-4.8 78.3
DeepSWEscore59.3기반 모델 공개 수치; DeepSeek-V4-Flash-0731 54.4, Opus-4.8 58.0
Toolathlon-Verifiedscore75.9기반 모델 공개 수치; DeepSeek-V4-Flash-0731 70.3, Opus-4.8 76.2
DSBench-Hardscore63.6기반 모델 공개 수치; DeepSeek-V4-Flash-0731 59.6, Opus-4.8 71.7
AutomationBench (Public)score25.7기반 모델 공개 수치; DeepSeek-V4-Flash-0731 25.1, Opus-4.8 27.2
ApexBenchPass@136.5기반 모델 공개 수치; DeepSeek-V4-Flash-0731 26.2†, Opus-4.8 39.4
Agents' Last Examscore27.3기반 모델 공개 수치; DeepSeek-V4-Flash-0731 25.2†, Opus-4.8 25.7
Chartographyscore64.3기반 모델 공개 수치; DeepSeek-V4-Flash-0731 수치 없음, Opus-4.8 65.0
ZeroBenchPass@535.0기반 모델 공개 수치; DeepSeek-V4-Flash-0731 수치 없음, Opus-4.8 34.0

이미지 분석

Unsloth Studio에서 DeepSeek-V4 계열 모델을 선택하고 대화형 입력과 High·Max thinking 설정을 조작하는 화면입니다.
이미지는 Unsloth Studio의 모델 실행 화면으로, 상단에 DeepSeek-V4 계열 모델과 GGUF 양자화 형식이 표시되고 중앙에는 대화 입력 영역이 배치되어 있습니다. README에서 안내한 High·Max thinking 토글과 실행 환경을 시각적으로 확인할 수 있어, 이 GGUF 모델이 Studio 기반 대화형 추론에 연결되는 방식을 보완합니다.

70

LIKES

15.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.