27B 멀티모달 모델 Qwen3.6의 공개 가중치와 262K 토큰 기본 컨텍스트
Qwen3.6-27B는 27B 파라미터의 Causal Language Model에 Vision Encoder를 더해 262,144 토큰의 네이티브 컨텍스트와 멀티모달 대화·코딩 에이전시 성능을 제공하는 공개 가중치 모델이다.
TL;DR
Qwen3.6-27B는 사전훈련과 포스트트레이닝을 거친 27B 파라미터의 Causal Language Model에 Vision Encoder를 결합한 공개 가중치 멀티모달 모델로서 Apache-2.0 라이선스로 배포되었다. 모델은 16×(3×(Gated DeltaNet → FFN) → 1×(Gated Attention → FFN)) 형태의 내부 레이아웃과 각기 다른 헤드 구성, 64차원 rotary position embedding을 채택해 표현력과 긴 컨텍스트 처리에 초점을 맞추었다. 네이티브로 262,144 토큰을 지원하며 설정을 통해 최대 1,010,000 토큰까지 확장 가능하고 Multi-Token Prediction 기반의 추론 전략과 speculative 옵션을 통해 처리량 최적화가 가능하다. README의 벤치마크 표는 SWE-bench Verified 77.2, RealWorldQA 84.1 등 코딩 및 멀티모달 평가에서의 경쟁력을 제시하며 SGLang·vLLM·KTransformers 등 여러 서빙 엔진과의 호환성을 통해 실제 배포 시 다양한 추론 환경에 적용할 수 있음을 보여준다.
핵심 역량
- 텍스트와 이미지를 입력으로 받아 통합된 응답을 생성하는 멀티모달 채팅 기능을 제공한다. README에 image-text-to-text 파이프라인 태그가 명시되어 있어 이미지 포함 질의응답과 문제 풀이에 활용 가능하다. Vision Encoder와 결합된 구조로 이미지 관련 문맥을 텍스트 추론과 연결한다.
- 매우 긴 문맥을 처리하는 능력을 갖추어 네이티브로 262,144 토큰을 지원하고 확장 설정으로 1,010,000 토큰까지 확장 가능한 입력을 처리한다. 이 특성은 문서 일괄 처리, 긴 코드베이스 분석, 반복적 대화의 역사 보존에 실용적이다. README는 긴 컨텍스트를 유지하면서도 메모리 관리 권고를 함께 제시한다.
- 에이전트형 코딩 워크플로를 지원하여 저장소 수준의 추론과 프런트엔드 워크플로 자동화를 수행한다. README는 Agentic Coding 성능 향상을 하이라이트로 제시하며 도구 호출과 툴 파서 옵션을 서빙 프레임워크에서 설정하는 예시를 제공한다. 툴 사용을 위한 자동화된 파서 옵션과 통합하면 코드 생성 후 도구 연계 플로우를 구축할 수 있다.
- 추론 단계에서 thinking 모드를 기본 동작으로 사용하며 내부 사고(think 태그)와 최종 응답을 분리하는 기능을 제공한다. 사용자는 비사고(instruct) 모드로 전환해 직접적인 응답만 얻도록 설정할 수 있으며 README가 관련 샘플 파라미터를 제시한다. 이 동작은 반복적 개발 과정에서 내부 추론 상태를 보존하거나 숨기는 운영적 선택을 가능하게 한다.
강점
- 공개 가중치로 제공되는 Qwen3.6-27B는 Apache-2.0 라이선스를 통해 사용성과 배포의 법적 불확실성을 줄였다. README가 모델의 공개 가중치 제공 사실을 명시하여 연구·응용에서 직접 모델을 로드해 실험할 수 있게 했다. 또한 Transformers 포맷 호환성으로 다양한 추론 엔진과 연동 가능하다.
- 네이티브 262K 토큰과 1,010K 토큰 확장 지원은 문서 기반 응용과 장문 코드 이해에서 실용적 이점을 제공한다. README는 긴 컨텍스트를 유지하는 것이 'thinking' 동작 보존에 중요한 요소라고 명시하여 긴 대화·코드 리뷰 워크플로에서의 이점을 근거로 제시했다. 이 점은 저장소 단위의 추론과 반복적 대화 기록 유지에 직접적으로 기여한다.
- 다양한 공개·내부 벤치마크에서 멀티모달 및 코딩 관련 성능이 상위권에 위치한다는 수치가 README의 표에 포함되어 있다. 예를 들어 SWE-bench Verified 77.2와 RealWorldQA 84.1 등 구체적 점수가 기재되어 있어 멀티모달 VQA 및 코딩 에이전시 성능을 정량적으로 확인할 수 있다.
훈련 방식
모델은 Causal Language Model에 Vision Encoder를 결합한 구조로 사전훈련과 후속 포스트트레이닝을 거쳐 개발되었으며 Multi-Token Prediction(MTP) 방식으로 학습되어 추론 시 speculative 전략과 결합할 수 있도록 설계되었다.
알아두면 좋은 것
- 이 저장소는 Transformers 포맷의 모델 가중치와 설정 파일을 포함하며 Transformers, vLLM, SGLang, KTransformers 등과 호환된다. README는 각 프레임워크별 권장 버전과 서빙 명령 예시를 제공하여 실제 배포 시 선택 가능한 엔진을 명시했다. 또한 Apache-2.0 라이선스를 적용해 상업적·비상업적 활용에서 법적 사용 범위를 명확히 했다.
- 모델 아키텍처는 27B 파라미터, 64개 레이어, 특별한 Hidden Layout(반복적 Gated DeltaNet 및 Gated Attention 블록)을 사용하도록 설계되었다. Gated DeltaNet과 Gated Attention의 헤드 구성과 차원 수가 README에 구체적으로 기재되어 있어 내부 연산 구조를 추적 가능하다. 이 설계는 멀티헤드 구성과 FFN 차원 배분을 통해 표현력과 계산 특성을 조절한다.
- 컨텍스트 길이는 네이티브로 262,144 토큰을 지원하며 확장 설정으로 1,010,000 토큰까지 확장 가능하다고 명시되어 있다. README는 긴 컨텍스트 사용 시 메모리 관련 권고를 제공하고 최소 권장 컨텍스트 길이(예: 128K)를 안내하여 운영 중 OOM 위험을 관리하도록 했다. 또한 MTP(Multi-Token Prediction) 관련 학습과 추론 옵션을 강조해 긴 시퀀스 효율화 전략을 제시했다.
- 기본 생성 모드가 thinking 모드이며 내부 사고 형식(<think> ... </think>)을 먼저 출력한 뒤 최종 답변을 제공하는 동작을 가진다고 명시되어 있다. README는 이 동작을 비활성화하는 인스트럭트 모드 설정 예시와 샘플 생성 파라미터를 함께 제시한다. 추론 성능과 처리량을 높이기 위한 speculative/MTP 설정 예시도 포함되어 있다.
기술적 특징
- 모델은 16×(3×(Gated DeltaNet → FFN) → 1×(Gated Attention → FFN)) 형태의 반복적 Hidden Layout을 채택하여 각 블록 내에서 Gated DeltaNet과 Gated Attention을 교차 배치한다. 이 구성은 서로 다른 어텐션·피드포워드 경로를 결합해 표현 학습의 다양성을 확보하도록 설계되었다. README는 이 레이아웃의 헤드 구성과 차원 수를 구체적으로 기재하여 내부 구조의 세부를 문서화했다.
- Gated DeltaNet은 V와 QK에 대해 서로 다른 선형 어텐션 헤드 수(예: V:48, QK:16)를 사용하고 각 헤드 차원을 분리하여 연산 비용과 표현 용량의 균형을 맞춘다. 이러한 분리된 헤드 설정은 입력 정보의 서로 다른 측면을 병렬로 포착하고 긴 컨텍스트에서 효율적으로 스케일하도록 설계되었다. README에 명시된 헤드 수와 차원은 모델의 계산 특성과 메모리 요구를 예측하는 데 도움이 된다.
- 로터리 위치 임베딩을 64차원으로 적용하여 어텐션 레이어에 위치 정보를 주입하고 긴 시퀀스에서 위치 관련 패턴을 유지한다. 이 선택은 긴 컨텍스트 처리 시 상대적 위치의 연속성 보존에 유리하며, 문서·코드 내 구조적 패턴 인식을 돕는다. README는 이 파라미터를 명시하여 위치 인코딩 구성의 근거를 제공했다.
- Multi-Token Prediction(MTP)으로 훈련되어 추론시 speculative 알고리즘과 결합해 처리량을 높일 수 있도록 설계되었다. README는 MTP와 연계된 speculative 설정(NEXTN, qwen3_next_mtp 등) 예시를 제공하며 서빙 엔진별 추천 파라미터도 함께 안내했다. 이 접근은 고용량 컨텍스트와 도구 호출이 빈번한 에이전트 작업에서 응답 지연과 비용을 줄이는 데 목적이 있다.
차별점
- 네이티브로 262,144 토큰을 처리하고 수동 설정으로 1,010,000 토큰까지 확장할 수 있는 컨텍스트 지원을 제공한다.
- Gated DeltaNet과 Gated Attention의 혼합 블록 구조를 채택하여 헤드 구성과 FFN 차원 분배를 통해 표현력과 연산 효율의 트레이드오프를 조정한다.
- 기본 동작이 내부 사고를 포함하는 thinking 모드이며 사용자가 이를 비활성화해 직접적인 응답 모드로 전환할 수 있는 운영 옵션을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 77.2 | — |
| QwenWebBench (Elo) | Elo | 1487 | — |
| RealWorldQA | score | 84.1 | — |
| MMLU-Pro | score | 86.2 | — |
| Claw-Eval (Avg) | score | 72.4 | — |
이미지 분석

2.1k
Likes
6.5M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.