본문으로 건너뛰기
Cerebras조회 1

Qwen 모델의 데이터, 크기 및 컨텍스트 확장 전략: 지능을 향한 여정

알리바바 Qwen 팀의 Junyang Lin이 데이터 규모, MoE 아키텍처, 컨텍스트 길이 확장을 통해 모델 지능을 극대화하는 실전 전략과 Qwen3의 기술적 세부 사항을 공유합니다.

챕터별 상세

01:00

데이터 확장의 중요성과 다단계 학습 전략

Qwen 시리즈는 초기 2조 토큰에서 시작하여 Qwen3에서는 36조 토큰까지 데이터 규모를 확장했다. 단순히 양을 늘리는 것이 아니라 다단계 사전 학습(Multi-stage Pre-training)을 적용했다. 1단계에서는 31조 토큰으로 일반적인 지식을 학습하고, 2단계에서는 코딩과 수학 등 고품질 데이터를 5조 토큰 추가하여 특정 능력을 강화했다. 중간 단계에서는 데이터의 밀도를 높이고 컨텍스트 길이를 4K에서 32K로 점진적으로 확장하는 방식을 사용했다.

데이터 확장은 모델의 기본 지식 베이스를 결정하며, 학습 단계별 데이터 믹스(Data Mix) 최적화가 성능에 큰 영향을 미친다.

06:30

모델 크기 확장과 MoE 아키텍처의 도입

Qwen 팀은 Dense 모델과 MoE(Mixture of Experts) 모델을 병행하여 개발했다. Dense 모델은 0.5B부터 32B까지 다양한 크기를 제공하여 모바일 배포 등 다양한 사용 사례에 대응했다. 하지만 모델이 커질수록 학습 효율이 떨어지는 문제를 해결하기 위해 MoE를 적극 도입했다. Qwen3-Max는 총 파라미터 수가 1조 개(1T)를 넘는 초대형 MoE 모델로 설계되었으며, 전문가 네트워크의 희소성(Sparsity)을 높여 연산 효율을 확보했다.

MoE는 전체 파라미터 중 일부만 연산에 참여시켜 초대형 모델의 학습 및 추론 비용을 획기적으로 줄여준다.

11:09

컨텍스트 길이 확장 및 외삽 기법

컨텍스트 길이를 사전 학습 단계에서 4K에서 256K까지 확장했다. 긴 컨텍스트 데이터를 확보하는 것이 어렵기 때문에 다단계 확장을 적용했다. 추론 시에는 Dynamic YaRN이나 Dual Chunk Attention 기법을 사용하여 학습된 길이보다 긴 100만(1M) 토큰까지 외삽(Extrapolation)이 가능하도록 구현했다. 이는 모델이 긴 문서를 이해하고 장기적인 추론(Long-horizon reasoning)을 수행하는 데 필수적인 요소이다.

외삽 기법은 모델이 학습하지 않은 길이의 텍스트를 처리할 수 있게 해주는 위치 인코딩 기술이다.

12:39

Qwen3-Next의 하이브리드 아키텍처 설계

Qwen3-Next에서는 기존의 Full Attention 구조의 한계를 극복하기 위해 하이브리드 아키텍처를 도입했다. 4개 레이어마다 하단 3개 레이어는 Gated Delta Net(선형 어텐션의 일종)을 사용하고, 상단 1개 레이어는 Full Attention을 사용하는 구조이다. Full Attention만 사용할 경우 발생하는 성능 저하를 막으면서도 연산 효율을 높였다. 또한 게이팅 메커니즘(Gating Mechanism)을 통합하여 모델의 표현력을 강화했다.

선형 어텐션은 컨텍스트 길이에 따른 연산 복잡도를 획기적으로 줄여주지만, 성능 유지를 위해 Full Attention과의 적절한 조합이 필요하다.

15:54

긴 컨텍스트 추론 최적화 기술: Minference 및 FP4

100만 토큰 이상의 긴 컨텍스트 추론 시 발생하는 병목 현상을 해결하기 위해 최적화 기술을 적용했다. Prefill 단계에서는 Minference와 동적 예산(Dynamic budget) 기법을 사용하여 희소 어텐션(Sparse Attention)을 구현했다. Decode 단계에서는 FP4 KV Cache 관리를 통해 메모리 점유율을 낮추고 속도를 높였다. 결과적으로 TTFT(첫 토큰 생성 시간)는 약 5배, 디코딩 속도는 약 3배 향상되는 결과를 얻었다.

Minference는 학습 없이도 어텐션 연산의 희소성을 활용하여 긴 문맥 추론 속도를 높이는 기술이다.

용어 해설

전문가 혼합 모델(MoE)
모델의 전체 파라미터 중 입력 토큰에 따라 필요한 일부 전문가(Expert) 네트워크만 활성화하여 연산 효율성을 극대화하는 아키텍처이다. 대규모 파라미터를 유지하면서도 추론 비용을 낮출 수 있어 초대형 언어 모델 확장에 핵심적인 역할을 한다.
확장 법칙(Scaling Laws)
언어 모델의 성능이 컴퓨팅 자원, 모델 파라미터 수, 학습 데이터 양의 증가에 따라 예측 가능한 지수 함수 형태로 향상된다는 법칙이다. 모델 설계 시 자원 배분의 최적점을 찾고 미래 성능을 예측하는 지표로 활용된다.
키-값 캐시(KV Cache)
Transformer 추론 과정에서 이전 토큰들의 Key와 Value 행렬을 메모리에 저장하여 재계산을 방지하는 기술이다. 긴 컨텍스트 처리 시 연산 속도를 높이는 데 필수적이지만, 메모리 점유율이 높아 최적화가 중요하다.
YaRN
RoPE(Rotary Positional Embeddings)를 확장하여 모델이 학습 시보다 훨씬 긴 컨텍스트를 이해할 수 있도록 하는 위치 인코딩 외삽 기법이다. 미세 조정 없이도 긴 문맥 정보를 효과적으로 보존할 수 있게 돕는다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 01. 13.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.