Qwen/Qwen3.8-27B
이미지와 동영상을 이해하면서 텍스트 생성, 코딩, 문서 처리, 장기 에이전트 작업을 수행하는 멀티모달 대화 모델27B262K 컨텍스트Apache-2.0
이미지·동영상 이해와 장기 에이전트 작업에 특화된 27B 멀티모달 모델
학습 방식 · Qwen3.5 아키텍처를 기반으로 사전 학습과 Post-training을 수행한 dense 멀티모달 모델이며, 이미지·동영상 이해와 코딩·전문 업무·연구·장기 에이전트 작업에 특화된 데이터와 학습 단계를 적용했습니다.
TL;DR
Qwen3.8-27B는 Qwen3.5 아키텍처를 기반으로 사전 학습과 Post-training을 거친 27B dense 멀티모달 모델이다. Causal Language Model에 Vision Encoder를 결합해 이미지·동영상과 텍스트를 함께 처리하고, Gated DeltaNet과 Gated Attention을 섞어 262,144토큰의 native context를 지원한다. Thinking mode를 요청별로 끄거나 `reasoning_effort`로 조절할 수 있어 짧은 응답부터 장기 에이전트 작업까지 추론 비용을 조정할 수 있다. OSWorld-Verified 84.3, QwenSWEBench 79.0, LiveCodeBench v6 90.3, MathVision 94.6으로 코딩·컴퓨터 사용·시각 추론 성능을 입증했으며 Transformers, vLLM, SGLang, TokenSpeed 환경에 통합할 수 있다.
핵심 포인트
- Qwen3.8-27B는 Qwen3.5의 아키텍처 기반으로 사전 학습과 Post-training을 거친 27B dense 모델이며, Causal Language Model과 Vision Encoder를 결합해 이미지·동영상 입력을 텍스트 응답으로 처리합니다. 이미지 문서, STEM 다이어그램, 차트뿐 아니라 장시간 동영상까지 동일한 모델 흐름에서 다룰 수 있습니다. Transformers 형식의 가중치와 설정 파일을 제공하며 vLLM, SGLang, TokenSpeed와도 호환됩니다.
- Thinking mode는 기본 활성화 상태에서 요청별로 끌 수 있고, `reasoning_effort`로 추론 깊이를 조절하며 `preserve_thinking`으로 이전 메시지의 추론 문맥을 유지합니다. 입력된 요청은 추론 모드와 깊이 설정에 따라 처리된 뒤 텍스트 응답이나 도구 실행 단계로 이어집니다. 이 제어 방식은 짧은 응답과 복잡한 다단계 작업 사이에서 추론 비용과 작업 완결성을 조정할 때 의미가 있습니다.
- 64개 레이어는 16개 블록마다 3개의 Gated DeltaNet·FFN 경로와 1개의 Gated Attention·FFN 경로를 배치한 구조입니다. Gated DeltaNet은 V 48개와 QK 16개의 Linear Attention Head를 사용하고, Gated Attention은 Q 24개와 KV 4개를 사용해 장문 처리와 전통적 Attention을 함께 구성합니다. 262,144토큰의 native context를 지원하고 최대 1,000,000토큰까지 확장할 수 있어 긴 문서, 장기 작업 기록, 시간 단위 동영상 처리에 맞습니다.
- 텍스트와 멀티모달 에이전트 작업에서 모두 높은 점수를 기록했으며, 특히 OSWorld-Verified 84.3, AndroidWorld 81.9, SWE-MM 38.6, Vision2Web 62.9를 기록했습니다. 코딩 영역에서는 QwenSWEBench 79.0, SWE-bench Pro 61.7, LiveCodeBench v6 90.3을 기록했고, 이미지 기반 수학은 추론 보조 설정에서 MathVision 94.6을 기록했습니다. 다만 일부 비교 표에서 Qwen3.7-Plus나 Opus4.6 Max가 더 높은 점수를 낸 항목도 있어 모든 작업에서 최상위라고 일반화할 수는 없습니다.
제한사항
- README는 로컬 추론에 필요한 구체적인 GPU 메모리, 양자화 설정, 배치 크기와 처리량 수치를 제공하지 않습니다. 따라서 27B 모델을 자체 인프라에 배포할 때 필요한 하드웨어 규모와 실제 지연 시간은 이 자료만으로 산정하기 어렵습니다. 프레임워크별 추론 효율과 처리량이 크게 달라질 수 있다고 명시되어 있어 배포 환경별 별도 측정이 필요합니다.
- 262,144토큰은 native context이며 1,000,000토큰 처리는 확장 설정이 필요합니다. README는 이 확장에 필요한 구체적인 설정과 성능 저하 여부를 밝히지 않습니다. 1M context나 공식 내장 도구가 필요한 경우에는 아직 출시 예정인 Qwen Cloud 호스팅 버전의 제공 범위를 별도로 확인해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| QwenSWEBench | score | 79.0 | README 비교표 기준 Qwen3.6-27B 49.3, Qwen3.7-Plus 59.2, Opus4.6 Max 63.8 |
| SWE-bench Pro | score | 61.7 | README 비교표 기준 Qwen3.6-27B 53.5, Qwen3.7-Plus 57.6, Opus4.6 Max 53.4; Opus4.6 Max는 공식 보고 수치이고 나머지는 Claude Code harness 재평가 수치 |
| OSWorld-Verified | score | 84.3 | README 비교표 기준 Qwen3.6-27B 63.9, Qwen3.7-Plus 73.3, Muse Glimmer-30B 65.9, Opus4.6 Max 72.7 |
| WebArena-Verified | score | 64.8 | README 비교표 기준 Qwen3.6-27B 48.8, Qwen3.7-Plus 55.3 |
| LiveCodeBench v6 | score | 90.3 | README 비교표 기준 Qwen3.6-27B 83.9, Qwen3.7-Plus 89.6, Opus4.6 Max 88.8 |
| MathVision | score with CI | 94.6 | README 비교표 기준 Qwen3.8-27B의 Without CI 점수는 90.0이며, CI 설정을 적용한 점수는 94.6; Qwen3.6-27B Without CI 85.1, Qwen3.7-Plus Without CI 90.3 |
| SWE-MM | score | 38.6 | README 비교표 기준 Qwen3.6-27B 25.7, Qwen3.7-Plus 30.0, Opus4.6 Max 27.1 |
| Vision2Web | score | 62.9 | README 비교표 기준 Qwen3.6-27B 45.0, Qwen3.7-Plus 42.1 |
8.9k
Likes
2
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.