inclusionAI/Ling-3.0-flash
긴 컨텍스트와 에이전트 워크플로우에 최적화된 네이티브 대형 모델
학습 방식 · 사전학습 단계부터 하이브리드 선형 어텐션과 MoE를 혼용한 구조로 학습했으며, 학습 목표는 Next-Token Prediction과 Multi-Token Prediction(MTP)을 병행하는 형태입니다. KDA/MLA 블록을 교차 배치하고 게이팅과 희소 MoE(1/64 sparse MoE) 설계를 적용해 토큰당 활성 파라미터를 제한하면서도 표현력을 유지하는 방식으로 구현되었습니다. 또한 10,000+ 상호작용 환경을 통한 에이전트형 학습과 계층형 캐시를 결합해 실제 에이전시 워크플로우에 맞춘 종단간 반응성 확보를 목표로 삼았습니다.
TL;DR
Ling-3.0-flash는 네이티브 하이브리드 선형 MoE 아키텍처를 채용한 자체 대형 언어모델로, 전체 124B 파라미터 중 토큰당 5.1B만 활성화하는 설계로 비용 대비 긴 문맥·추론 성능을 최적화했습니다. Kimi Delta Attention과 Gated MLA를 교차 배치하고 희소 MoE와 MTP 학습 목표를 결합해 긴 컨텍스트(최대 256K)와 에이전트형 워크플로우에서 좋은 성능을 보이며, README의 표와 그래프에서 SWE-Bench·SysBench·MRCR 등 주요 벤치에서 경쟁력 있는 점수를 보입니다. 배포용으로 SGLang·vLLM 런처와 MTP/speculative 설정 예제를 제공하고 캐시 계층(SGLang HiCache + Mooncake)으로 TTFT를 크게 줄이는 실전 최적화까지 포함합니다.
핵심 포인트
- Ling-3.0-flash는 사양상 네이티브 하이브리드 선형(Hybrid-linear MoE) 아키텍처를 채택하고 있으며, Kimi Delta Attention(KDA)와 Gated MLA를 5:1 비율로 교차 쌓아 긴 문맥 처리 효율을 확보합니다. 모델 전체 파라미터는 124B이고 토큰당 활성화되는 파라미터는 5.1B로 설계되어 계산 비용을 낮추면서도 대규모 플래그십 대비 유사하거나 상회하는 성능을 목표로 합니다. 라우팅 전문가 수(512), 활성화 전문가 수(8) 등 MoE 구성과 KDA의 대각선 게이팅 같은 세부 설계가 장기 문맥과 추론 비용 절감에 기여합니다.
- 훈련 목표와 컨텍스트 정책은 Next-Token 예측에 더해 Multi-Token Prediction(MTP)을 포함하며, 컨텍스트 길이 학습 스케줄은 8K에서 32K를 거쳐 최대 256K까지 확장되었습니다. 이 조합은 긴 대화·문서·코드 세션에서의 일관성 유지와 대량 토큰 생성 시 레이턴시 최적화로 연결됩니다. README와 표에서 제시된 벤치 결과들이 긴 컨텍스트 작업과 추론 품질 측면에서의 강점을 뒷받침합니다.
- 제품화 관점의 엔지니어링 요소를 보유하여 대규모 에이전트 워크플로우를 겨냥한 10,000개 이상 상호작용 환경으로 파인튜닝·인터랙티브 학습을 수행했고, SGLang HiCache와 Mooncake 계층형 캐시(듀얼 물리 풀과 클러스터 공유 L3)를 네이티브로 통합해 반복적 재계산을 줄입니다. 해당 캐시 설계는 긴 입력 시 Time to First Token(TTFT)을 60%에서 80% 이상까지 단축시킨다고 명시되어 있어 실시간성·비용 측면의 이점을 제공합니다. 또한 Thinking 모드 기본 활성화와 권장 샘플링(temperature=0.6, top_p=0.95, top_k=20) 같은 실전 설정을 배포 흐름에 포함하고 있습니다.
- 배포 지원으로 SGLang과 vLLM용 런처 및 예제가 제공되며, MTP/speculative 실행을 권장해 추론 레이턴시를 낮추도록 설계되었습니다. 멀티-GPU 서버 실행 예시와 vLLM 설정이 README에 포함되어 있어 실제 운영 환경으로의 이식성이 고려되어 있습니다. 안정성·성능 균형을 맞추기 위해 prefix caching, mamba cache 모드 등 런타임 최적화 옵션 사용을 권장합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-Bench Pro | score | 56.6 | — |
| SWE-Bench Multilingual | score | 72.4 | — |
| Terminal-Bench 2.1 | score | 57.0 | — |
| MCP-Atlas | score | 65.5 | — |
| SkillsBench | score | 44.8 | — |
| SysBench | score | 93.6 | — |
| MRCR-256k | score | 81.1 | — |
| Multi-IF | score | 87.7 | — |
이미지 분석


83
Likes
25
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.