ysr666/dsh-vision-router
JavaScript0 / 0
DeepSeek Harness에서 원본 픽셀 기반 Vision 도구와 자동 fallback을 연결한다
TL;DR
dsh-vision-router는 DeepSeek Harness Web에 원본 이미지 기반 Vision 기능을 추가하는 JavaScript plugin-extension-skill이다. DeepSeek는 추론을 맡고 vision model과 14개 도구가 이미지 처리, 좌표 grounding, OCR, crop, screenshot, SVG 변환과 pixel diff를 맡아 여러 단계의 작업을 이어간다. `npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router` 한 명령으로 설치하며 Node.js 22 이상과 Python 없는 실행 환경을 요구한다. 사용자 모델이나 local Ollama·LM Studio를 우선 사용하고 익명 OVHcloud fallback으로 동작하지만 기본 fallback은 모델별 분당 2회 제한이 있어 반복 작업에는 별도 provider 또는 로컬 backend 구성이 유리하다.
핵심 포인트
- 이 레포는 DeepSeek Harness Web용 plugin-extension-skill이다. text-only DeepSeek agent에 Vision Router를 붙여 이미지 입력을 일반적인 tool-calling turn으로 처리한다. DSH 생태계에서 한 줄 설치와 composer의 Vision 토글을 제공한다.
- 이미지 전체를 단순한 텍스트 설명으로 바꾸지 않고 vision model과 DeepSeek를 눈과 두뇌로 분리한다. vision_ground와 vision_crop이 원본 픽셀 좌표를 다루고 DeepSeek가 질문과 도구 결과를 이어서 추론한다. 따라서 이미지 기반 UI 수정처럼 여러 번 확인해야 하는 작업에 적합하다.
- 기본값은 Python 없이 Node.js에서 동작하며 sharp, potrace, tesseract, system Chrome을 조합한다. vision_describe, OCR, 색상 추출, SVG trace, foreground cutout, HTML screenshot, pixel diff 등 14개 deep tool을 제공한다. Node.js 22 이상과 DeepSeek Harness Web profile이 필요하다.
- 사용자 모델, Ollama, LM Studio, custom HTTP endpoint, 익명 OVHcloud fallback을 순서대로 시도한다. 기본 익명 경로는 모델별 IP당 분당 2회 제한이라 이론상 다섯 모델을 합쳐 약 10 RPM이며, 안정적인 운영에는 별도 provider key나 local backend가 더 적합하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 픽셀 UI 재구성 | final diff | 2.54% (32,939 / 1,296,000 differing pixels, threshold 16/channel) | — |
이미지 분석




997
STARS
44
FORKS
+204
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.