본문으로 건너뛰기
Roboflow Blog조회 2

Qwen3.8-Max의 비전 성능과 실사용 평가

Qwen3.8-Max는 2.4T MoE VLM으로 객체 검출에서 최고 성능을 보였고 8월 12일 가중치 공개가 예정돼 있다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Qwen3.8-Max은 2.4조 파라미터의 Mixture-of-Experts VLM으로 쿼리당 약 950억 파라미터를 활성화하며 Roboflow 벤치마크에서 객체 검출 최상위 성능을 기록했다. 텍스트 기반 JSON 출력과 이미지에 직접 그린 박스 두 가지 프롬프트 방식이 있으며, 박스 프롬프트는 약 80.8% mAP 근처의 우수한 결과를 냈다. 카운팅과 시각 추론에서도 상위권 성과를 보였으나, 데이터 추출과 실시간 지연(latency)은 약점으로 남아 있어 로컬 배포와 응답시간 요구조건에 따라 활용 전략을 달리해야 한다.

섹션별 상세

Qwen3.8-Max은 2.4조 파라미터 규모의 Mixture-of-Experts 기반 멀티모달 모델로, 텍스트·이미지·비디오를 입력받아 텍스트를 출력한다. 모델은 쿼리당 약 950억 파라미터를 활성화하는 구조를 채택해 연산을 부분적으로 줄이면서 고용량 모델의 표현력을 유지한다. Alibaba Cloud API를 통해 사용 가능한 상태이며, 2026년 8월 12일에 가중치와 함께 Qwen3.8-27B(27B, dense)도 공개될 예정이다.
객체 검출 평가에서 Qwen3.8-Max는 Roboflow의 VLM 벤치마크 최상위 성능을 기록했고, mAP@50 기준 리더보드 최상단에 위치했다. 다양한 도메인(위성·적외선·문서·기술 도면·혼잡 장면·작은 객체)에 대해 별도 태스크 학습 없이 강한 성능을 보였으며, 공개 차트에서는 최상위 mAP 수치가 확인된다. 이 결과는 실제 생산 환경에서 문서 스캔·위성 영상·산업 검사 같은 비표준 입력을 처리하는 데 유리하다는 의미를 가진다.
객체 검출 mAP@50 리더보드 차트
Chart이 차트는 Roboflow 벤치마크의 mAP@50 순위를 막대그래프로 보여주며 Qwen3.8-Max가 최상단에 위치해 있음을 시각적으로 확인할 수 있다. 각 모델의 상대적 성능과 수치(예: Qwen3.8-Max의 상위 mAP 값)를 한눈에 파악할 수 있어 비교 근거로 사용된다. 벤치마크 비교 결과를 문장으로만 읽는 것보다 성능 차이를 직관적으로 파악하는 데 유용하다.
태양광 패널 적외선/열 이미지와 예측 박스, 우측 mAP 85.6%
Photo해당 이미지는 태양광 패널과 hot spot을 검출한 예시를 보여주며 Qwen3.8-Max의 도메인 일반화 능력을 보여준다. 우측에 표시된 mAP 85.6% 값은 이 특정 케이스에서 높은 검출 정확도를 시사하며, 위성·항공·적외선 데이터에서의 적용 가능성을 뒷받침한다. 이미지 상의 라벨링과 예측 비교는 실제 산업 검사 시 유용한 평가 자료가 된다.
기술 도면(technical drawing) 예측 결과과 mAP 95.0%
Diagram기술 도면에서의 예측과 정답 비교 이미지로, Qwen3.8-Max가 도면상의 주석·치수 표기 같은 요소를 높은 정확도로 찾아낸 사례를 보여준다. 우측의 mAP 95.0% 값은 구조화된 도면 환경에서 모델이 매우 견고하게 동작함을 시사한다. 이런 성능은 생산·설계 검수 워크플로우에서 라벨 위치 확인이나 부품 존재 여부 판별에 직접 활용될 수 있다.
혼잡한 장면(당근)에서의 바운딩박스 예시와 mAP 95.0%
Photo이 사진은 다수의 당근이 놓인 장면에 대해 모델이 개별 객체를 어떻게 탐지했는지 보여주며, 시각적으로 복잡한 집합체에서도 높은 mAP를 기록한 사례를 보여준다. 밀집된 객체들 사이의 분리와 박스 배치가 실제 생산 라인의 품질 검사에서 의미 있는 성능임을 나타낸다. 다만 본문에서는 밀집·겹침 시 오차가 발생할 수 있다고도 언급했다.
작물(나무) 항공 이미지 예시와 mAP 95.5%
Photo항공 이미지를 대상으로 한 예측과 정답 비교로, Qwen3.8-Max가 농업용 항공 영상에서도 높은 mAP(95.5%)를 기록한 사례가 보인다. 행렬식 배치의 식물 개체를 안정적으로 탐지한 결과는 농작물 모니터링·수확 예측과 같은 실무 적용에 직접적인 가치를 제공한다. 본문은 이런 도메인 일반화 능력이 태스크별 추가 학습 없이도 유의미하다고 평가했다.
근거
  • Qwen3.8-Max이 Roboflow VLM 객체 검출 벤치마크에서 최상위 성능을 기록했다 (mAP@50 최고 점수). detection_map50_low.png 차트의 최상단 막대와 수치(예: 77.1%)를 근거로 함; 블로그 본문과 리더보드 이미지 참조. 출처
Qwen3.8-Max의 객체 검출 워크플로는 VLM 특성상 텍스트 출력 포맷을 정해 파싱하는 방식과, 이미지에 예시 박스를 그려 같은 클래스의 모든 인스턴스를 찾게 하는 박스 프롬프트 방식 두 가지로 나뉜다. 텍스트 포맷에서는 JSON 리스트에 레이블과 네 개의 좌표를 요구하며, Roboflow에서는 XYXY 좌표를 0에서 1000으로 정규화한 형식이 가장 안정적이었다. 박스 프롬프트가 약간 더 우수한 결과를 내었고, 직접 그린 박스 방식은 80.8% mAP 근처의 성과를 냈다.
박스 프롬프트 예시(알약)과 목표 대비 예측, mAP 99.4%
Photo프롬프트로 하나의 긍정 박스를 제공하고 모델이 나머지 동일한 객체를 찾아내는 사례를 보여주며, 이 케이스의 mAP 99.4%는 박스 프롬프트가 매우 정밀한 결과를 낼 수 있음을 시사한다. 긍정·부정 박스를 조합하면 복잡한 클래스 정의를 명시적으로 전달할 수 있어, 모양·손상·방향성과 같이 문자로 정의하기 힘든 조건을 처리하는 데 유리하다. 본문은 박스 프롬프트가 텍스트 좌표 방식보다 약간 우수하다고 보고했다.
박스 프롬프트를 통한 칩(토큰) 예측 데모와 100% mAP 예시
Photo이 예시는 복수의 박스 프롬프트와 목표 박스 간의 정합도를 시각화하며, 특정 예제에서 mAP가 100%로 기록된 점을 보여준다. 완전 일치 사례는 특정 조건(단일 클래스, 명확한 외형, 낮은 겹침)에서 모델이 매우 정확할 수 있음을 나타낸다. 다만 이런 완전 일치는 모든 도메인에 일반화되지는 않으며 본문에서는 영역·형태별로 성능 차이를 경고하고 있다.
근거
  • 이미지에 직접 그린 박스(박스 프롬프트)를 사용한 경우 mAP가 개선되어 약 80.8%에 도달했다. 본문의 'Prompt with boxes' 설명과 Playground 예제 이미지들; 블로그 설명에서 박스 방식이 텍스트 좌표 방식보다 약간 우수하다고 명시. 출처
객체 개수 세기(counting)에서는 Qwen3.8-Max가 Gemini 3.6 Flash와 공동 1위를 기록했고, 복잡한 시각적 질문이나 이상치 카운트 같은 작업을 수행할 수 있었다. 예컨대 크기가 다른 캔디에서 이상한 크기를 찾아 정수로 카운트하는 작업을 수행했으며, 다만 겹침·밀집·조명 변화가 심한 장면에서는 오차가 발생했다. 이러한 한계는 중첩된 객체나 유사한 외형을 가진 항목을 분리할 때 발생하는 전형적 오류와 일치한다.
객체 카운팅 벤치마크 차트
Chart이 차트는 카운팅 태스크에서 모델별 정확도를 비교하며 Qwen3.8-Max가 상위권에 있음을 보여준다. 상단의 수치(예: 82.4%)와 타 모델 간 수치 비교를 통해 카운팅 성능의 상대적 우위를 파악할 수 있다. 카운팅에서의 강점과 동시에 밀집된 장면에서의 오류 가능성도 본문에서 함께 언급되고 있다.
근거
  • 객체 개수 세기 평가에서 Qwen3.8-Max는 Gemini 3.6 Flash와 공동 1위를 기록했다. counting_accuracy_low.png의 상단 점수(예: 82.4%)와 본문에서의 공동 1위 언급을 근거로 함. 출처
시각 추론(visual reasoning)에서는 Qwen3.8-Max가 Gemini 3.5 Flash에 이어 상위권을 유지했으나, 정밀한 데이터 추출(data extraction)은 약점으로 나타났다. Roboflow 테스트에서 데이터 추출 리더보드 기준 Qwen3.8-Max는 10위권에 머물렀고, 손글씨 날짜나 포장재의 만료일처럼 지정된 영역에서 정확한 문자열을 반환해야 하는 과제에서 오독이나 허구값을 출력하는 사례가 보고됐다. 위치가 명확하더라도 문자 인식·정확한 문자열 재현에서 다른 최신 모델 대비 격차가 존재했다.
근거
  • 데이터 추출(task-specific strict formatting) 성능은 약점으로, 리더보드에서 10위권에 속하며 상위 모델과는 약 10%p 차이가 났다. 본문의 데이터 추출 등급 및 상위 모델(Gemini 3.5 Flash, Claude Sonnet, Muse Spark 1.2)과의 격차 언급. 출처
배포 관점에서는 MoE 구조가 쿼리당 연산을 줄여도 전체 모델의 크기 때문에 데이터센터급 인프라가 필요하다. 대부분 사용자는 API를 통해 접근할 것이고, 로컬 추론은 Qwen3.8-27B 같은 밀집형 소형 체크포인트가 현실적이다. 비용은 Muse Spark 1.2·Claude Sonnet·Gemini 3.5 Flash 등과 유사 범위였고, 지연시간은 상대적으로 길어 GPT-5.6이나 Claude Fable보다 응답이 느린 편이라 실시간 시스템에는 추가 파이프라인 설계가 필요하다.

용어 해설

Mixture-of-Experts
Mixture-of-Experts는 전체 파라미터 중 일부 전문가(expert)만 활성화해 쿼리별로 연산을 줄이는 구조이다. Qwen3.8-Max는 총 2.4조 파라미터를 가진 모델이며 쿼리당 약 950억 파라미터를 활성화해 처리 효율을 높인다.
mAP@50
mAP@50은 객체 검출에서 IoU 임계값 0.5를 기준으로 평균 정밀도를 계산한 지표로, 모델이 예측한 바운딩박스와 정답의 겹침을 기준으로 성능을 수치화한다. Roboflow 벤치마크에서는 VLM 간 객체 검출 성능 비교에 이 수치를 사용했다.
VLM
VLM(vision-language model)은 이미지·비디오와 텍스트를 입력으로 받아 텍스트를 출력하는 멀티모달 언어모델 계열을 일컫는다. Qwen3.8-Max는 이미지와 비디오를 받아 텍스트 형태의 예측(JSON 등)을 반환하는 VLM이다.
XYXY 정규화 좌표(XYXY normalized coordinates)
XYXY 정규화 좌표는 바운딩박스 네 좌표를 왼쪽상단(x1,y1)과 오른쪽하단(x2,y2) 순으로 표기하고, 값을 0에서 1000 범위로 정규화해 모델에 전달하는 형식이다. Roboflow 테스트에서 Qwen 계열은 이 형식에서 가장 안정적 성능을 보였다.
박스 프롬프트(Box prompting)
박스 프롬프트는 이미지에 예시 바운딩박스를 그려 모델에 같은 클래스의 다른 인스턴스를 찾도록 하는 입력 방식이다. Qwen3.8-Max는 이미지를 직접 표시한 박스 프롬프트에서 더 높은 mAP(약 80.8%)를 달성하는 경향을 보였다.

기술

  • Qwen3.8-Max
  • Qwen3.8-27B
  • Roboflow Playground
  • Alibaba Cloud API
  • Mixture-of-Experts
  • mAP@50
  • XYXY coordinates
  • Box prompting

활용 사례

  • 위성·항공 이미지에서 소형 객체 탐지
  • 산업용 적외선·검사 이미지의 고장·이상 탐지
  • 스캔 문서와 기술 도면에서의 객체 위치 파악
  • 제품 포장·블리스터의 날짜·라벨 추출(단, 정확도 한계 존재)
  • 카운팅 및 출고 검수 자동화

언급된 리소스

API DocsAlibaba Cloud API (Qwen3.8-Max 접근)
문서Qwen3.8-Max / Qwen3.8-27B 가중치 공개 일정 (2026-08-12)
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 07.수집 2026. 08. 07.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.