본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ysr666/dsh-vision-router

JavaScript0 / 0

DeepSeek Harness에서 원본 픽셀 기반 Vision 도구와 자동 fallback을 연결한다

TL;DR

dsh-vision-router는 DeepSeek Harness Web에 원본 이미지 기반 Vision 기능을 추가하는 JavaScript plugin-extension-skill이다. DeepSeek는 추론을 맡고 vision model과 14개 도구가 이미지 처리, 좌표 grounding, OCR, crop, screenshot, SVG 변환과 pixel diff를 맡아 여러 단계의 작업을 이어간다. `npx @deepseek-ai/dsh plugin --profile web add dsh-vision-router` 한 명령으로 설치하며 Node.js 22 이상과 Python 없는 실행 환경을 요구한다. 사용자 모델이나 local Ollama·LM Studio를 우선 사용하고 익명 OVHcloud fallback으로 동작하지만 기본 fallback은 모델별 분당 2회 제한이 있어 반복 작업에는 별도 provider 또는 로컬 backend 구성이 유리하다.

핵심 포인트

  • 이 레포는 DeepSeek Harness Web용 plugin-extension-skill이다. text-only DeepSeek agent에 Vision Router를 붙여 이미지 입력을 일반적인 tool-calling turn으로 처리한다. DSH 생태계에서 한 줄 설치와 composer의 Vision 토글을 제공한다.
  • 이미지 전체를 단순한 텍스트 설명으로 바꾸지 않고 vision model과 DeepSeek를 눈과 두뇌로 분리한다. vision_ground와 vision_crop이 원본 픽셀 좌표를 다루고 DeepSeek가 질문과 도구 결과를 이어서 추론한다. 따라서 이미지 기반 UI 수정처럼 여러 번 확인해야 하는 작업에 적합하다.
  • 기본값은 Python 없이 Node.js에서 동작하며 sharp, potrace, tesseract, system Chrome을 조합한다. vision_describe, OCR, 색상 추출, SVG trace, foreground cutout, HTML screenshot, pixel diff 등 14개 deep tool을 제공한다. Node.js 22 이상과 DeepSeek Harness Web profile이 필요하다.
  • 사용자 모델, Ollama, LM Studio, custom HTTP endpoint, 익명 OVHcloud fallback을 순서대로 시도한다. 기본 익명 경로는 모델별 IP당 분당 2회 제한이라 이론상 다섯 모델을 합쳐 약 10 RPM이며, 안정적인 운영에는 별도 provider key나 local backend가 더 적합하다.

벤치마크

벤치마크지표비교
픽셀 UI 재구성final diff2.54% (32,939 / 1,296,000 differing pixels, threshold 16/channel)

이미지 분석

Reference 화면과 agent가 재구성한 Final Rebuild 화면을 나란히 놓고 픽셀 차이를 측정한 결과를 보여주는 비교 이미지이다.
이미지는 vision_html_screenshot으로 재구성한 UI를 vision_pixel_diff로 반복 검증하는 흐름을 시각화한다. 최종 차이가 2.54%이고 서로 다른 픽셀이 32,939개라는 수치가 표시되어, UI 복원을 눈대중이 아니라 heatmap과 정량 지표로 확인한다는 README의 핵심 사용 사례와 연결된다.
DeepSeek Harness 대화 화면에서 이미지 속 Send 버튼을 찾는 vision 도구 호출 과정을 보여주는 데모 GIF이다.
화면에는 이미지가 포함된 대화와 vision_ground, vision_crop, vision_pixel_diff를 거쳐 좌표를 찾는 작업 흐름이 나타난다. 이미지 입력을 별도 일회성 설명으로 끝내지 않고 일반적인 tool-calling turn으로 이어가며, 위치 확인과 픽셀 검증을 여러 단계로 수행하는 구조를 확인할 수 있다.
DeepSeek Harness Web에서 사용자가 이미지를 첨부하고 vision_describe 호출이 진행되는 대화 화면이다.
브라우저 기반 DSH 화면에 업로드된 이미지와 이미지 질의가 표시되고, 하단에는 vision-tools skill과 vision_describe tool call이 나타난다. Vision Router가 이미지 turn을 세션 UI 안에서 유지하면서 vision backend를 호출하는 실제 사용 경로를 보여준다.
DeepSeek Harness가 첨부 이미지의 인물, 버튼, 문구와 시각적 특징을 구조적으로 답한 결과 화면이다.
결과 화면은 이미지의 주제와 구성 요소를 제목, 인물, 빨간 버튼, 하단 문구, 색상과 스타일로 나누어 답한다. 이는 vision_describe가 단순 캡션뿐 아니라 이미지 질문에 맞춘 구조화된 evidence를 반환하고 DeepSeek가 이를 자연어 응답으로 조합하는 과정을 보여준다.

997

STARS

44

FORKS

+204

TRENDING

0

조회수

watchers 997open issues 2MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.