본문으로 건너뛰기

DeepSeek V4와 GLM 5.3 Flash의 브라우저 QA 비교

같은 browser screenshot 세트에서 GLM 5.3 Flash가 DeepSeek V4 Flash Vision Exp보다 나은 결과를 냈습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 screenshot을 browser action으로 바꾸는 QA harness에서 DeepSeek V4 Flash Vision Exp와 GLM 5.3 Flash를 같은 화면 세트에 적용해 비용과 실제 작업 성능을 비교했습니다. 두 모델 모두 테스트를 완료했고 DeepSeek도 페이지를 무난하게 읽었지만, 작성자의 전체적인 결과에서는 GLM 5.3 Flash가 더 나았습니다. 공개 점수는 Chartography에서 DeepSeek 64.3, GLM 78.0, Agents Last Exam에서 DeepSeek 27.3, GLM 26.3으로 엇갈렸으며 평가 harness가 달라 결정적인 근거가 되지는 않았습니다. 작성자는 기존 Flash 모델에 visual module을 추가한 실험적 DeepSeek보다 30T token multimodal pretraining corpus를 사용한 GLM의 구조가 이 browser QA workload에 더 잘 맞았다고 판단했습니다.

실용적 조언

  • 브라우저 screenshot 기반 QA에서 두 vision model을 비교할 때는 공개 benchmark 점수만 고르지 말고 동일한 screenshot 세트와 동일한 실행 경로를 사용해 action 완료율과 페이지 이해 결과를 함께 측정하는 편이 적합합니다.
  • 접근 비용을 비교할 때는 hosted provider의 이용 가능성, image request 형식, vLLM 실행에 필요한 GPU 구성까지 확인해야 하며 모델의 공개 점수와 실제 harness 결과를 분리해 기록하는 것이 좋습니다.

섹션별 상세

01
작성자는 고해상도 screenshot을 입력으로 받아 browser action을 생성하는 QA harness의 비용 부담을 줄이기 위해 DeepSeek V4 Flash Vision Exp와 GLM 5.3 Flash를 같은 테스트 세트에서 비교했습니다. 두 모델을 ZenMux에서 각각 고정해 동일한 browser screenshot을 처리하게 했고, 두 모델 모두 전체 세트를 완료했습니다. DeepSeek는 페이지를 합리적으로 읽었지만 작성자의 전체 결과에서는 GLM이 더 나은 선택으로 남았습니다.
02
공개 benchmark 수치는 두 모델의 우열을 단독으로 확정하지 못했습니다. DeepSeek는 Chartography 64.3과 Agents Last Exam 27.3을, GLM은 Tools 포함 Chartography 78.0과 Agents Last Exam 26.3을 보고했지만 두 평가 harness가 서로 달랐습니다. 따라서 작성자는 공개 점수보다 동일한 browser QA workload에서 직접 얻은 결과를 GLM 선택의 근거로 삼았습니다.
03
두 release의 가중치는 MIT License를 사용하며, 접근성 측면에서는 초기 기록과 달리 DeepSeek의 격차가 줄었습니다. Hugging Face에는 DeepSeek의 inference provider로 Novita가 등록되어 있고, 검증된 vLLM recipe는 한 GB200 NVL4 tray에서 GPU 네 개를 사용합니다. GLM은 여러 hosted provider와 완전한 image request를 제공해 테스트에 투입하는 작업이 더 적었다고 평가됐습니다.
04
작성자는 두 모델의 architecture notes에서 성능 차이의 한 가지 가능성을 찾았습니다. DeepSeek V4 Flash Vision Exp는 기존 Flash model에 visual module을 추가했고 해당 checkpoint를 experimental로 표시한 반면, GLM 5.3 Flash는 30T token multimodal pretraining corpus로 새 base를 학습했다고 밝힙니다. 이 차이가 해당 browser QA workload에서 GLM의 우세와 연결될 가능성을 제시하지만, 글 자체는 인과관계를 확정하지 않습니다.

용어 해설

브라우저 QA 하네스(Browser QA Harness)
브라우저 화면의 screenshot을 vision model에 입력하고, 모델이 읽은 페이지 구조와 판단을 실제 browser action으로 연결해 자동으로 검증하는 테스트 실행 환경입니다. 화면 이해 성능과 action 생성 정확도를 함께 평가할 수 있습니다.
Chartography
차트나 그래프처럼 시각적 구조를 가진 자료를 모델이 얼마나 잘 읽고 해석하는지 측정하는 평가 항목입니다. 이 글에서는 DeepSeek V4 Flash Vision Exp가 64.3, GLM 5.3 Flash가 Tools 포함 조건에서 78.0을 기록했습니다.
Agents Last Exam
에이전트형 작업 수행 능력을 평가하는 공개 benchmark입니다. 글에 인용된 점수는 DeepSeek V4 Flash Vision Exp가 27.3, GLM 5.3 Flash가 26.3이지만 두 모델의 평가 harness가 달라 직접 비교에는 한계가 있습니다.
멀티모달 사전학습 코퍼스(Multimodal Pretraining Corpus)
텍스트와 이미지처럼 여러 양식의 데이터를 함께 사용해 모델의 시각·언어 처리 능력을 학습시키는 대규모 사전학습 데이터 모음입니다. GLM 5.3 Flash는 30T token 규모의 multimodal pretraining corpus를 사용했다고 밝힙니다.
MIT 라이선스(MIT License)
소프트웨어와 모델 가중치를 비교적 자유롭게 사용·수정·배포할 수 있도록 허용하는 permissive open-source license입니다. 글에서는 DeepSeek V4 Flash Vision Exp와 GLM 5.3 Flash의 두 release 가중치가 MIT License를 따른다고 설명합니다.

언급된 도구

ZenMux추천

각 모델을 고정해 동일한 browser screenshot 세트를 실행하는 inference 경로로 사용했습니다.

vLLM중립

DeepSeek V4 Flash Vision Exp를 실행하기 위한 검증된 recipe가 언급됐으며 GB200 NVL4 tray 한 대에 GPU 네 개를 사용합니다.

Novita중립

Hugging Face에 등록된 DeepSeek V4 Flash Vision Exp의 inference provider입니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 04.수집 2026. 09. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.