TL;DR
작성자는 screenshot을 browser action으로 바꾸는 QA harness에서 DeepSeek V4 Flash Vision Exp와 GLM 5.3 Flash를 같은 화면 세트에 적용해 비용과 실제 작업 성능을 비교했습니다. 두 모델 모두 테스트를 완료했고 DeepSeek도 페이지를 무난하게 읽었지만, 작성자의 전체적인 결과에서는 GLM 5.3 Flash가 더 나았습니다. 공개 점수는 Chartography에서 DeepSeek 64.3, GLM 78.0, Agents Last Exam에서 DeepSeek 27.3, GLM 26.3으로 엇갈렸으며 평가 harness가 달라 결정적인 근거가 되지는 않았습니다. 작성자는 기존 Flash 모델에 visual module을 추가한 실험적 DeepSeek보다 30T token multimodal pretraining corpus를 사용한 GLM의 구조가 이 browser QA workload에 더 잘 맞았다고 판단했습니다.
실용적 조언
- 브라우저 screenshot 기반 QA에서 두 vision model을 비교할 때는 공개 benchmark 점수만 고르지 말고 동일한 screenshot 세트와 동일한 실행 경로를 사용해 action 완료율과 페이지 이해 결과를 함께 측정하는 편이 적합합니다.
- 접근 비용을 비교할 때는 hosted provider의 이용 가능성, image request 형식, vLLM 실행에 필요한 GPU 구성까지 확인해야 하며 모델의 공개 점수와 실제 harness 결과를 분리해 기록하는 것이 좋습니다.
섹션별 상세
용어 해설
- 브라우저 QA 하네스(Browser QA Harness)
- — 브라우저 화면의 screenshot을 vision model에 입력하고, 모델이 읽은 페이지 구조와 판단을 실제 browser action으로 연결해 자동으로 검증하는 테스트 실행 환경입니다. 화면 이해 성능과 action 생성 정확도를 함께 평가할 수 있습니다.
- Chartography
- — 차트나 그래프처럼 시각적 구조를 가진 자료를 모델이 얼마나 잘 읽고 해석하는지 측정하는 평가 항목입니다. 이 글에서는 DeepSeek V4 Flash Vision Exp가 64.3, GLM 5.3 Flash가 Tools 포함 조건에서 78.0을 기록했습니다.
- Agents Last Exam
- — 에이전트형 작업 수행 능력을 평가하는 공개 benchmark입니다. 글에 인용된 점수는 DeepSeek V4 Flash Vision Exp가 27.3, GLM 5.3 Flash가 26.3이지만 두 모델의 평가 harness가 달라 직접 비교에는 한계가 있습니다.
- 멀티모달 사전학습 코퍼스(Multimodal Pretraining Corpus)
- — 텍스트와 이미지처럼 여러 양식의 데이터를 함께 사용해 모델의 시각·언어 처리 능력을 학습시키는 대규모 사전학습 데이터 모음입니다. GLM 5.3 Flash는 30T token 규모의 multimodal pretraining corpus를 사용했다고 밝힙니다.
- MIT 라이선스(MIT License)
- — 소프트웨어와 모델 가중치를 비교적 자유롭게 사용·수정·배포할 수 있도록 허용하는 permissive open-source license입니다. 글에서는 DeepSeek V4 Flash Vision Exp와 GLM 5.3 Flash의 두 release 가중치가 MIT License를 따른다고 설명합니다.
언급된 도구
각 모델을 고정해 동일한 browser screenshot 세트를 실행하는 inference 경로로 사용했습니다.
DeepSeek V4 Flash Vision Exp를 실행하기 위한 검증된 recipe가 언급됐으며 GB200 NVL4 tray 한 대에 GPU 네 개를 사용합니다.
Hugging Face에 등록된 DeepSeek V4 Flash Vision Exp의 inference provider입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
