본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Qwen/Qwen3.8-27B

이미지와 동영상을 이해하면서 텍스트 생성, 코딩, 문서 처리, 장기 에이전트 작업을 수행하는 멀티모달 대화 모델27B262K 컨텍스트Apache-2.0

이미지·동영상 이해와 장기 에이전트 작업에 특화된 27B 멀티모달 모델

학습 방식 · Qwen3.5 아키텍처를 기반으로 사전 학습과 Post-training을 수행한 dense 멀티모달 모델이며, 이미지·동영상 이해와 코딩·전문 업무·연구·장기 에이전트 작업에 특화된 데이터와 학습 단계를 적용했습니다.

TL;DR

Qwen3.8-27B는 Qwen3.5 아키텍처를 기반으로 사전 학습과 Post-training을 거친 27B dense 멀티모달 모델이다. Causal Language Model에 Vision Encoder를 결합해 이미지·동영상과 텍스트를 함께 처리하고, Gated DeltaNet과 Gated Attention을 섞어 262,144토큰의 native context를 지원한다. Thinking mode를 요청별로 끄거나 `reasoning_effort`로 조절할 수 있어 짧은 응답부터 장기 에이전트 작업까지 추론 비용을 조정할 수 있다. OSWorld-Verified 84.3, QwenSWEBench 79.0, LiveCodeBench v6 90.3, MathVision 94.6으로 코딩·컴퓨터 사용·시각 추론 성능을 입증했으며 Transformers, vLLM, SGLang, TokenSpeed 환경에 통합할 수 있다.

핵심 포인트

  • Qwen3.8-27B는 Qwen3.5의 아키텍처 기반으로 사전 학습과 Post-training을 거친 27B dense 모델이며, Causal Language Model과 Vision Encoder를 결합해 이미지·동영상 입력을 텍스트 응답으로 처리합니다. 이미지 문서, STEM 다이어그램, 차트뿐 아니라 장시간 동영상까지 동일한 모델 흐름에서 다룰 수 있습니다. Transformers 형식의 가중치와 설정 파일을 제공하며 vLLM, SGLang, TokenSpeed와도 호환됩니다.
  • Thinking mode는 기본 활성화 상태에서 요청별로 끌 수 있고, `reasoning_effort`로 추론 깊이를 조절하며 `preserve_thinking`으로 이전 메시지의 추론 문맥을 유지합니다. 입력된 요청은 추론 모드와 깊이 설정에 따라 처리된 뒤 텍스트 응답이나 도구 실행 단계로 이어집니다. 이 제어 방식은 짧은 응답과 복잡한 다단계 작업 사이에서 추론 비용과 작업 완결성을 조정할 때 의미가 있습니다.
  • 64개 레이어는 16개 블록마다 3개의 Gated DeltaNet·FFN 경로와 1개의 Gated Attention·FFN 경로를 배치한 구조입니다. Gated DeltaNet은 V 48개와 QK 16개의 Linear Attention Head를 사용하고, Gated Attention은 Q 24개와 KV 4개를 사용해 장문 처리와 전통적 Attention을 함께 구성합니다. 262,144토큰의 native context를 지원하고 최대 1,000,000토큰까지 확장할 수 있어 긴 문서, 장기 작업 기록, 시간 단위 동영상 처리에 맞습니다.
  • 텍스트와 멀티모달 에이전트 작업에서 모두 높은 점수를 기록했으며, 특히 OSWorld-Verified 84.3, AndroidWorld 81.9, SWE-MM 38.6, Vision2Web 62.9를 기록했습니다. 코딩 영역에서는 QwenSWEBench 79.0, SWE-bench Pro 61.7, LiveCodeBench v6 90.3을 기록했고, 이미지 기반 수학은 추론 보조 설정에서 MathVision 94.6을 기록했습니다. 다만 일부 비교 표에서 Qwen3.7-Plus나 Opus4.6 Max가 더 높은 점수를 낸 항목도 있어 모든 작업에서 최상위라고 일반화할 수는 없습니다.

제한사항

  • README는 로컬 추론에 필요한 구체적인 GPU 메모리, 양자화 설정, 배치 크기와 처리량 수치를 제공하지 않습니다. 따라서 27B 모델을 자체 인프라에 배포할 때 필요한 하드웨어 규모와 실제 지연 시간은 이 자료만으로 산정하기 어렵습니다. 프레임워크별 추론 효율과 처리량이 크게 달라질 수 있다고 명시되어 있어 배포 환경별 별도 측정이 필요합니다.
  • 262,144토큰은 native context이며 1,000,000토큰 처리는 확장 설정이 필요합니다. README는 이 확장에 필요한 구체적인 설정과 성능 저하 여부를 밝히지 않습니다. 1M context나 공식 내장 도구가 필요한 경우에는 아직 출시 예정인 Qwen Cloud 호스팅 버전의 제공 범위를 별도로 확인해야 합니다.

벤치마크

벤치마크지표비교
QwenSWEBenchscore79.0README 비교표 기준 Qwen3.6-27B 49.3, Qwen3.7-Plus 59.2, Opus4.6 Max 63.8
SWE-bench Proscore61.7README 비교표 기준 Qwen3.6-27B 53.5, Qwen3.7-Plus 57.6, Opus4.6 Max 53.4; Opus4.6 Max는 공식 보고 수치이고 나머지는 Claude Code harness 재평가 수치
OSWorld-Verifiedscore84.3README 비교표 기준 Qwen3.6-27B 63.9, Qwen3.7-Plus 73.3, Muse Glimmer-30B 65.9, Opus4.6 Max 72.7
WebArena-Verifiedscore64.8README 비교표 기준 Qwen3.6-27B 48.8, Qwen3.7-Plus 55.3
LiveCodeBench v6score90.3README 비교표 기준 Qwen3.6-27B 83.9, Qwen3.7-Plus 89.6, Opus4.6 Max 88.8
MathVisionscore with CI94.6README 비교표 기준 Qwen3.8-27B의 Without CI 점수는 90.0이며, CI 설정을 적용한 점수는 94.6; Qwen3.6-27B Without CI 85.1, Qwen3.7-Plus Without CI 90.3
SWE-MMscore38.6README 비교표 기준 Qwen3.6-27B 25.7, Qwen3.7-Plus 30.0, Opus4.6 Max 27.1
Vision2Webscore62.9README 비교표 기준 Qwen3.6-27B 45.0, Qwen3.7-Plus 42.1

8.9k

Likes

2

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.