본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

inclusionAI/Ling-3.0-tiny

경량 추론·에이전트 작업을 위한 hybrid linear MoE 언어 모델7.9B 전체, 토큰당 1.3B 활성화최대 1M tokens 지원, SGLang 예시는 256K context 컨텍스트MIT

KDA·MLA hybrid와 sparse MoE로 로컬 추론 효율을 높인 7.9B reasoning 모델

TL;DR

Ling-3.0-tiny는 별도 Fine-tuning·양자화 파생 모델이 아니라 Ling-3.0 계열의 경량 hybrid reasoning MoE 모델로, 7.9B 전체 파라미터 중 토큰당 1.3B만 활성화한다. KDA 3개와 MLA 1개를 교차 배치하고 128개 routed expert 중 8개와 shared expert 1개를 선택해 긴 문맥 처리와 계산량 절감을 함께 구현한다. enable_thinking으로 일반 응답과 다단계 추론을 요청별로 전환하며, BF16·FP8·INT4 가중치를 제공해 로컬 및 자원 제약 환경을 겨냥한다. README 기준 DGX Spark에서 FP8 약 100–105 tokens/s, M4 Pro MacBook에서 86–90 tokens/s를 기록했고 8K context에서 peak memory usage는 약 8.34 GiB이다.

핵심 포인트

  • 7.9B 전체 파라미터 중 토큰마다 1.3B만 활성화해 추론 비용을 낮춘다.
  • KDA 3개와 MLA 1개를 교차 배치해 긴 문맥 처리 효율을 높인다.
  • 128개 routed expert 중 8개와 shared expert 1개만 선택하는 sparse MoE 구조다.
  • 요청별 enable_thinking 설정으로 빠른 응답과 다단계 추론을 전환한다.

제한사항

  • Ollama 실행은 현재 Apple Silicon의 MLX 경로와 소스 빌드에 한정된다.
  • thinking mode가 기본 활성화되므로 일반 질의에서도 추론 토큰과 지연이 발생할 수 있다.
  • custom code와 trust-remote-code 설정이 필요한 실행 경로가 있다.

벤치마크

벤치마크지표비교
Artificial Analysis Intelligence Index v4.1.1score25
Artificial Analysis Agentic Indexscore16
GDPval v2-AAscore772.00동일 표의 Qwen3.5-9B 644.00, Gemma-4-12B-it 645.00
Terminal-Bench 2.1score27.70동일 표의 Qwen3.5-4B 25.80, Qwen3.5-9B 29.20
SciCodescore24.20동일 표의 Qwen3.5-4B 16.10, Qwen3.5-9B 27.50
AA-LCRscore58.70동일 표의 Qwen3.5-4B 61.00, Qwen3.5-9B 65.30
GPQA Diamondscore73.40동일 표의 Qwen3.5-4B 77.10, Qwen3.5-9B 80.60
HMMT-Feb26score70.31동일 표의 Qwen3.5-4B 72.87, Qwen3.5-9B 71.21
IMO-AnswerBenchscore71.03동일 표의 Qwen3.5-4B 63.69, Qwen3.5-9B 70.00
Multi-IFscore83.15동일 표의 Qwen3.5-4B 79.84, Qwen3.5-9B 83.03

이미지 분석

Ling-3.0-tiny의 KDA·MLA hybrid 구조와 sparse MoE 경로를 나타낸 아키텍처 도식이다.
도식은 4개 레이어 블록마다 KDA 3개와 Gated MLA 1개를 배치하고, 각 attention 뒤에 MoE FFN을 연결하는 구성을 담고 있다. 상단에는 128개 routed expert와 1개 shared expert 중 토큰당 8개 routed expert를 선택하는 흐름이 표시되어 있으며, vocabulary size 157k와 embedding dimension 1,536도 확인된다. KDA의 linear time complexity와 1M tokens content length 표기는 긴 문맥 처리와 낮은 활성 파라미터 수를 함께 겨냥한 설계임을 뒷받침한다.
Ling-3.0-tiny와 Qwen3.5·Gemma 계열 모델의 에이전트·코딩·추론·지시 수행 점수를 비교한 표다.
표는 GDPval v2-AA, Terminal-Bench 2.1, SciCode, AA-LCR, GPQA Diamond, HMMT-Feb26, IMO-AnswerBench, IFBench, LIFEbench, Multi-IF 등 여러 영역의 점수를 나란히 제시한다. Ling-3.0-tiny는 GDPval v2-AA 772.00, GPQA Diamond 73.40, Multi-IF 83.15를 기록했으며, 표에 포함된 비교 모델별 점수도 함께 확인할 수 있다. 이 자료는 단일 과제가 아니라 agentic task, coding, long-context, knowledge, reasoning, instruction following을 아우르는 성능 범위를 보여준다.

150

Likes

0

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.