TL;DR
Ling-3.0은 post-training 이전의 Pre-trained, Mid-trained, WSM-merged 체크포인트를 제공해 continued pre-training과 fine-tuning 연구의 출발점을 넓힌 모델군이다. WSM은 기존 learning-rate decay 단계를 가중 체크포인트 병합으로 대체하며, 학습을 다시 수행하지 않고도 여러 decay 전략을 오프라인에서 비교하게 한다. Ling-3.0-tiny-base는 총 7.9B 중 1.3B가 활성화되고, Ling-3.0-flash-base는 총 124B 중 5.1B가 활성화된다. tiny-base에서 training recipe를 검증한 뒤 flash-base로 확장할 수 있으며, 두 모델 모두 coding과 추가 도메인 학습을 위한 연구용 체크포인트로 제시됐다.
섹션별 상세
이미지 분석

표는 두 모델 계열에서 pre-training 이후, mid-training 이후, WSM 병합 이후의 체크포인트가 각각 어떤 이름으로 제공되는지 보여준다. 아래 설명은 WSM-merged 체크포인트가 Mid-trained 체크포인트에 WSM을 적용한 결과이며, 모든 체크포인트가 post-training 이전 상태임을 뒷받침한다.
Ling-3.0-tiny와 Ling-3.0-flash의 Pre-trained, Mid-trained, WSM-merged 체크포인트 구성을 비교한 표와 각 저장 시점을 설명한 글머리표가 담겼다.

이미지는 Pre-trained와 Mid-trained 체크포인트가 WSM 병합 전에 저장되고, WSM-merged 체크포인트가 그 다음 단계에서 생성되는 순서를 나타낸다. 따라서 연구자가 post-training 전 상태에서 continued pre-training이나 별도 학습 실험을 시작할 수 있다는 게시물의 핵심 설명과 직접 연결된다.
Ling-3.0-tiny와 Ling-3.0-flash의 학습 단계별 체크포인트 이름과 WSM 적용 순서를 정리한 도식이다.
용어 해설
- 가중 체크포인트 병합(WSM)
- — WSM은 학습률 감쇠 단계 대신 여러 학습 체크포인트를 가중치로 결합하는 방식이다. Ling-3.0에서는 Mid-trained 체크포인트에 WSM을 적용해 최종 모델을 만들며, 다양한 학습률 감쇠 전략을 오프라인에서 비교할 수 있게 한다.
- 학습률 감쇠(LR decay)
- — LR decay는 학습이 진행될수록 optimizer의 learning rate를 일정한 규칙에 따라 낮추는 과정이다. 이 글에서는 해당 단계를 직접 수행하는 대신 WSM 기반 체크포인트 병합으로 대체해 continual pre-training 실험의 유연성을 높인다.
- 지속적 사전 학습(Continual Pre-training)
- — Continual Pre-training은 이미 사전 학습된 모델을 새로운 데이터나 도메인에 이어서 학습하는 방식이다. post-training을 거치지 않은 체크포인트를 출발점으로 제공하면 coding, 금융, 의료 같은 분야에 맞춘 추가 학습을 수행할 수 있다.
- 전문가 혼합 모델(Mixture of Experts)
- — Mixture of Experts는 여러 Expert 중 일부만 입력 처리에 참여시키는 구조다. Ling-3.0-tiny-base는 총 7.9B 파라미터 중 1.3B만 활성화하고, Ling-3.0-flash-base는 124B 중 5.1B를 활성화해 총 규모와 실제 계산량을 분리한다.
- 활성 파라미터(Active Parameters)
- — Active Parameters는 한 입력을 처리할 때 실제로 계산에 참여하는 파라미터 수다. Mixture of Experts 모델에서는 총 파라미터보다 활성 파라미터가 추론과 학습의 실제 계산량을 가늠하는 기준으로 쓰인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.