본문으로 건너뛰기

Ling-3.0 연구용 체크포인트 공개

Ling-3.0이 WSM 병합 기반의 post-training 전 체크포인트와 7.9B·124B 모델 구성을 공개했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Ling-3.0은 post-training 이전의 Pre-trained, Mid-trained, WSM-merged 체크포인트를 제공해 continued pre-training과 fine-tuning 연구의 출발점을 넓힌 모델군이다. WSM은 기존 learning-rate decay 단계를 가중 체크포인트 병합으로 대체하며, 학습을 다시 수행하지 않고도 여러 decay 전략을 오프라인에서 비교하게 한다. Ling-3.0-tiny-base는 총 7.9B 중 1.3B가 활성화되고, Ling-3.0-flash-base는 총 124B 중 5.1B가 활성화된다. tiny-base에서 training recipe를 검증한 뒤 flash-base로 확장할 수 있으며, 두 모델 모두 coding과 추가 도메인 학습을 위한 연구용 체크포인트로 제시됐다.

섹션별 상세

Ling-3.0의 체크포인트는 post-training 이전 상태로 공개되어 continued pre-training, fine-tuning, 추가 연구의 출발점으로 활용할 수 있다. Pre-trained 체크포인트는 대규모 pre-training 뒤와 mid-training 또는 WSM 병합 전에 저장되고, Mid-trained 체크포인트는 mid-training 뒤와 WSM 병합 전에 저장된다. WSM-merged 체크포인트는 Mid-trained 체크포인트에 WSM을 적용해 기존 learning-rate decay 단계를 대신한 결과이며, 세 체크포인트 모두 post-training은 거치지 않았다.
WSM은 기존의 learning-rate decay를 가중 체크포인트 병합으로 바꿔 학습 과정과 실험 방식을 분리한다. 연구자는 학습을 다시 실행하지 않고도 체크포인트를 조합해 서로 다른 learning-rate decay 전략을 오프라인에서 탐색할 수 있다. 같은 training recipe를 tiny-base에서 먼저 검증한 뒤 flash-base로 확장하는 흐름도 제공되어, 작은 모델에서 확인한 전략을 더 큰 모델에 적용하는 비교가 가능하다.
Ling-3.0-tiny-base는 총 7.9B 파라미터와 1.3B 활성 파라미터를 사용하며, Ling-2.5-mini-base의 절반 수준인 총 파라미터로 대부분의 benchmark에서 비슷하거나 더 높은 성능을 기록했다고 소개됐다. 특히 coding 성능이 강점으로 제시됐고, code pre-training과 SFT, RL post-training, model behavior 및 MoE 연구가 주요 활용 분야로 거론됐다. Ling-3.0-flash-base는 총 124B와 활성 5.1B 파라미터로 구성되며, coding, reasoning, long-context 평가에서 자신보다 2~3배 큰 모델과 비교해도 강한 성능을 보였다는 설명이다.

이미지 분석

Ling-3.0-tiny와 Ling-3.0-flash의 Pre-trained, Mid-trained, WSM-merged 체크포인트 구성을 비교한 표와 각 저장 시점을 설명한 글머리표가 담겼다.
Diagram

표는 두 모델 계열에서 pre-training 이후, mid-training 이후, WSM 병합 이후의 체크포인트가 각각 어떤 이름으로 제공되는지 보여준다. 아래 설명은 WSM-merged 체크포인트가 Mid-trained 체크포인트에 WSM을 적용한 결과이며, 모든 체크포인트가 post-training 이전 상태임을 뒷받침한다.

Ling-3.0-tiny와 Ling-3.0-flash의 Pre-trained, Mid-trained, WSM-merged 체크포인트 구성을 비교한 표와 각 저장 시점을 설명한 글머리표가 담겼다.

Ling-3.0-tiny와 Ling-3.0-flash의 학습 단계별 체크포인트 이름과 WSM 적용 순서를 정리한 도식이다.
Diagram

이미지는 Pre-trained와 Mid-trained 체크포인트가 WSM 병합 전에 저장되고, WSM-merged 체크포인트가 그 다음 단계에서 생성되는 순서를 나타낸다. 따라서 연구자가 post-training 전 상태에서 continued pre-training이나 별도 학습 실험을 시작할 수 있다는 게시물의 핵심 설명과 직접 연결된다.

Ling-3.0-tiny와 Ling-3.0-flash의 학습 단계별 체크포인트 이름과 WSM 적용 순서를 정리한 도식이다.

용어 해설

가중 체크포인트 병합(WSM)
WSM은 학습률 감쇠 단계 대신 여러 학습 체크포인트를 가중치로 결합하는 방식이다. Ling-3.0에서는 Mid-trained 체크포인트에 WSM을 적용해 최종 모델을 만들며, 다양한 학습률 감쇠 전략을 오프라인에서 비교할 수 있게 한다.
학습률 감쇠(LR decay)
LR decay는 학습이 진행될수록 optimizer의 learning rate를 일정한 규칙에 따라 낮추는 과정이다. 이 글에서는 해당 단계를 직접 수행하는 대신 WSM 기반 체크포인트 병합으로 대체해 continual pre-training 실험의 유연성을 높인다.
지속적 사전 학습(Continual Pre-training)
Continual Pre-training은 이미 사전 학습된 모델을 새로운 데이터나 도메인에 이어서 학습하는 방식이다. post-training을 거치지 않은 체크포인트를 출발점으로 제공하면 coding, 금융, 의료 같은 분야에 맞춘 추가 학습을 수행할 수 있다.
전문가 혼합 모델(Mixture of Experts)
Mixture of Experts는 여러 Expert 중 일부만 입력 처리에 참여시키는 구조다. Ling-3.0-tiny-base는 총 7.9B 파라미터 중 1.3B만 활성화하고, Ling-3.0-flash-base는 124B 중 5.1B를 활성화해 총 규모와 실제 계산량을 분리한다.
활성 파라미터(Active Parameters)
Active Parameters는 한 입력을 처리할 때 실제로 계산에 참여하는 파라미터 수다. Mixture of Experts 모델에서는 총 파라미터보다 활성 파라미터가 추론과 학습의 실제 계산량을 가늠하는 기준으로 쓰인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.