본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Qwen/Qwen3.8-27B-FP8

이미지와 동영상을 이해하면서 코딩, 문서 처리, 연구, 장기 에이전트 작업을 수행하는 Vision-Language 모델입니다.27B262K 컨텍스트apache-2.0

이미지·영상 이해와 장기 에이전트 작업에 맞춘 Qwen3.8-27B FP8 양자화 모델

학습 방식 · Qwen3.5 아키텍처 기반의 Qwen3.8-27B post-trained 모델에 block size 128의 fine-grained FP8 양자화를 적용한 Transformers 형식 가중치입니다.

TL;DR

Qwen3.8-27B-FP8는 Qwen3.8-27B를 기반으로 block size 128의 fine-grained FP8 양자화를 적용한 27B Vision-Language 모델입니다. 이미지와 동영상을 이해하고 기본 사고 모드, reasoning_effort, preserve_thinking을 통해 추론 깊이와 대화형 사고 맥락을 조절하며, 코딩·문서·브라우저·컴퓨터 사용 같은 장기 에이전트 작업을 처리합니다. README 기준 OSWorld-Verified 84.3, SWE-bench Pro 61.7, LiveCodeBench v6 90.3, Vision2Web 62.9를 기록했고, Transformers·vLLM·SGLang·TokenSpeed에서 구동할 수 있습니다.

핵심 포인트

  • Qwen3.8-27B를 기반으로 한 FP8 양자화 모델이라 원본의 27B 규모 기능을 유지하면서 배포 부담을 낮추는 구성을 갖췄습니다. Fine-grained FP8 양자화를 block size 128로 적용했으며, README는 원본과 성능 지표가 거의 동일하다고 설명합니다. Transformers, vLLM, SGLang, TokenSpeed 환경에서 사용할 수 있습니다.
  • 이미지와 동영상을 입력으로 받아 STEM 도식, 문서, 장시간 영상의 시각 정보를 텍스트 추론과 연결합니다. Vision Encoder와 Causal Language Model을 결합한 구조이며, 기본 사고 모드와 요청별 사고 비활성화, reasoning_effort 조절, preserve_thinking 설정을 제공합니다. OSWorld-Verified 84.3, WebArena-Verified 64.8, SWE-MM 38.6으로 멀티모달 에이전트 작업 성능을 측정했습니다.
  • 코딩과 장기 작업에서는 환경 피드백을 반영해 계획을 이어 가는 에이전트 실행 능력을 핵심 차별점으로 둡니다. Terminal Bench 2.1 73.0, SWE-bench Pro 61.7, QwenSWEBench 79.0, CoWorkBench 70.7을 기록했습니다. 27B dense 모델로 기존 개발 도구와 에이전트 하네스에 연결하기 쉬운 배포형 선택지입니다.

제한사항

  • 이 저장소는 FP8 양자화 가중치와 설정 파일을 제공하므로 원본 Qwen3.8-27B와 동일한 정밀도 구성이 아닙니다. README는 성능 지표가 원본과 거의 동일하다고 밝히지만, 이 저장소 자체의 독립적인 원본 대조 측정 절차는 제공하지 않습니다. 실제 배포에서는 사용하는 추론 엔진과 하드웨어에 따른 FP8 지원 상태를 확인해야 합니다.
  • 모델의 기본 컨텍스트 길이는 262,144 토큰이며 1,000,000 토큰은 확장 가능한 상한으로 기재되어 있습니다. 1M 컨텍스트와 공식 내장 도구는 별도 Qwen Cloud 호스팅 버전의 기능으로 안내됩니다. 따라서 자체 인프라에서 바로 1M 컨텍스트와 해당 도구 구성을 사용할 수 있다고 보기는 어렵습니다.

벤치마크

벤치마크지표비교
Terminal Bench 2.1 (Terminus)score73.0README 공개 비교 수치로 Qwen3.6-27B 63.4, Qwen3.7-Plus 64.0, Muse Glimmer-30B 51.7보다 높고 Opus4.6 Max 78.2보다 낮음
SWE-bench Proscore61.7README 공개 비교 수치로 Qwen3.6-27B 53.5, Qwen3.7-Plus 57.6, Muse Glimmer-30B 51.2, Opus4.6 Max 53.4보다 높음
QwenSWEBenchavg@379.0README 공개 비교 수치로 Qwen3.6-27B 49.3, Qwen3.7-Plus 59.2, Opus4.6 Max 63.8보다 높음
CoWorkBenchscore70.7README 공개 비교 수치로 Qwen3.6-27B 61.0, Qwen3.7-Plus 65.1, Muse Glimmer-30B 측정값 없음, Opus4.6 Max 68.2보다 높음
IFBenchscore79.5README 공개 비교 수치로 Qwen3.6-27B 69.1, Qwen3.7-Plus 79.1, Muse Glimmer-30B 77.0, Opus4.6 Max 62.5보다 높음
LiveCodeBench v6score90.3README 공개 비교 수치로 Qwen3.6-27B 83.9, Qwen3.7-Plus 89.6, Opus4.6 Max 88.8보다 높음
OSWorld-Verifiedscore84.3README 공개 비교 수치로 Qwen3.6-27B 63.9, Qwen3.7-Plus 73.3, Muse Glimmer-30B 65.9, Opus4.6 Max 72.7보다 높음
WebArena-Verifiedscore64.8README 공개 비교 수치로 Qwen3.6-27B 48.8, Qwen3.7-Plus 55.3보다 높음
SWE-MMscore38.6README 공개 비교 수치로 Qwen3.6-27B 25.7, Qwen3.7-Plus 30.0, Opus4.6 Max 27.1보다 높음
Vision2Webscore62.9README 공개 비교 수치로 Qwen3.6-27B 45.0, Qwen3.7-Plus 42.1보다 높음
MathVisionscore with CI94.6README 공개 비교 수치로 Qwen3.7-Plus 90.3보다 높으며, Qwen3.8-27B의 Without CI 수치는 90.0임
BabyVisionscore with CI85.6README 공개 비교 수치로 Qwen3.7-Plus With CI 70.4보다 높으며, Qwen3.8-27B의 Without CI 수치는 65.7임
CharXiv (RQ)score with CI90.2README 공개 비교 수치로 Qwen3.7-Plus With CI 85.9보다 높으며, Qwen3.8-27B의 Without CI 수치는 83.7임
OmniDocBench 1.5score91.1README 공개 비교 수치로 Qwen3.6-27B 89.4, Muse Glimmer-30B 75.8, Opus4.6 Max 86.6보다 높고 Qwen3.7-Plus 91.4보다 낮음

288

Likes

0

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.