본문으로 건너뛰기

알리바바, 성능과 효율성 극대화한 Qwen3.5 소형 모델 시리즈 공개

알리바바가 하이브리드 아키텍처와 네이티브 멀티모달 기능을 갖춘 Qwen3.5 소형 모델 시리즈(0.8B~9B)를 Apache 2.0 라이선스로 공개하며 온디바이스 AI 시장의 새로운 기준을 제시했다.

섹션별 상세

01
Qwen3.5 소형 시리즈는 0.8B, 2B, 4B, 9B의 네 가지 크기로 구성된다. 0.8B와 2B는 배터리 수명이 중요한 에지 기기 최적화 모델이며, 4B는 262,144 토큰의 컨텍스트 윈도우를 지원하는 경량 에이전트용이다. 9B 모델은 추론 능력이 강화되어 다국어 지식 및 대학원 수준의 추론 벤치마크에서 거대 모델들을 상회하는 성과를 낸다.
02
표준 Transformer 구조에서 벗어나 Gated Delta Networks와 희소 Mixture-of-Experts(MoE)를 결합한 효율적 하이브리드 아키텍처를 채택했다. 이 방식은 소형 모델의 고질적 문제인 메모리 벽을 해결하여 추론 시 더 높은 처리량과 낮은 지연 시간을 실현한다. 선형 어텐션의 변형 기술을 통해 연산 효율성을 극대화한 것이 특징이다.
03
기존의 시각 인코더를 덧붙이는 방식이 아닌 초기 융합(early fusion) 방식을 통해 멀티모달 토큰으로 직접 학습되었다. 이를 통해 4B 및 9B 모델은 UI 요소 읽기나 비디오 내 객체 계산 등 기존에는 10배 더 큰 모델에서나 가능했던 수준의 시각적 이해력을 보여준다. 별도의 인코더 없이도 네이티브하게 시각 정보를 처리한다.
04
벤치마크 결과 Qwen3.5-9B는 MMMU-Pro 시각 추론에서 70.1점을 기록해 Gemini 2.5 Flash-Lite(59.7)를 앞섰다. GPQA Diamond 벤치마크에서도 81.7점을 획득하여 파라미터 수가 13배 더 많은 gpt-oss-120B(80.1)를 추월하는 등 체급을 뛰어넘는 성능을 입증했다. 수학 및 비디오 이해도 지표에서도 경쟁 모델 대비 압도적인 우위를 점했다.
Qwen3.5 소형 모델 시리즈의 주요 벤치마크 성능 비교표.
Chart0.8B에서 9B 모델이 MMMU-Pro, GPQA, Video-MME 등 다양한 지표에서 경쟁 모델(Gemini 2.5 Flash-Lite 등)과 비교해 우수한 성적을 거두고 있음을 시각적으로 보여준다. 특히 9B 모델이 거대 모델인 gpt-oss-120B를 상회하는 지표들을 확인할 수 있다.
05
모든 모델 가중치와 설정 파일은 Apache 2.0 라이선스로 공개되어 상업적 이용, 수정 및 배포가 자유롭다. 특히 Instruct 버전뿐만 아니라 Base 모델도 함께 출시되어 기업이나 연구팀이 특정 작업에 맞춰 자체적으로 미세 조정하기에 용이한 환경을 제공한다. 이는 개발자들이 벤더 종속성 없이 로컬 환경에서 AI를 구축할 수 있게 돕는다.

용어 해설

게이트 델타 네트워크(Gated Delta Networks)
선형 어텐션 메커니즘의 일종으로, 표준 Transformer보다 메모리 효율이 높으면서도 긴 문맥을 효과적으로 처리할 수 있게 하는 아키텍처 기술이다. 소형 모델에서 높은 처리량과 낮은 지연 시간을 구현하는 데 핵심적인 역할을 한다.
전문가 혼합(Mixture-of-Experts)
모델의 전체 파라미터 중 특정 입력에 필요한 일부 전문가 신경망만 활성화하여 연산 효율을 높이는 구조이다. 이를 통해 적은 계산 자원으로도 거대 모델 수준의 성능을 낼 수 있다.
초기 융합(Early Fusion)
텍스트와 이미지 등 서로 다른 형태의 데이터를 학습 초기 단계부터 하나의 토큰 스트림으로 결합하여 학습하는 방식이다. 별도의 시각 인코더를 연결하는 방식보다 더 깊은 수준의 멀티모달 이해를 가능하게 한다.
픽셀 수준 그라운딩(Pixel-level Grounding)
텍스트 명령어를 이미지 내의 구체적인 픽셀 좌표나 객체 위치와 정확히 연결하는 기술이다. AI 에이전트가 화면상의 UI 요소를 인식하고 조작하는 데 필수적이다.
아파치 2.0 라이선스(Apache 2.0 License)
누구나 자유롭게 소프트웨어를 사용, 수정, 배포할 수 있도록 허용하며 상업적 이용에 제약이 적은 관대한 오픈소스 라이선스이다. 기업이 기술적 종속 없이 모델을 커스터마이징하기에 유리하다.

기술

  • Qwen3.5
  • Gated Delta Networks
  • Mixture-of-Experts
  • Apache 2.0
  • Hugging Face

활용 사례

  • 모바일 UI 자동화
  • 오프라인 비디오 요약
  • 로컬 코드 리팩터링
  • 복잡한 시각 문서 데이터 추출
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 03.수집 2026. 03. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.