inclusionAI/Ling-3.0-tiny
경량 추론·에이전트 작업을 위한 hybrid linear MoE 언어 모델7.9B 전체, 토큰당 1.3B 활성화최대 1M tokens 지원, SGLang 예시는 256K context 컨텍스트MIT
KDA·MLA hybrid와 sparse MoE로 로컬 추론 효율을 높인 7.9B reasoning 모델
TL;DR
Ling-3.0-tiny는 별도 Fine-tuning·양자화 파생 모델이 아니라 Ling-3.0 계열의 경량 hybrid reasoning MoE 모델로, 7.9B 전체 파라미터 중 토큰당 1.3B만 활성화한다. KDA 3개와 MLA 1개를 교차 배치하고 128개 routed expert 중 8개와 shared expert 1개를 선택해 긴 문맥 처리와 계산량 절감을 함께 구현한다. enable_thinking으로 일반 응답과 다단계 추론을 요청별로 전환하며, BF16·FP8·INT4 가중치를 제공해 로컬 및 자원 제약 환경을 겨냥한다. README 기준 DGX Spark에서 FP8 약 100–105 tokens/s, M4 Pro MacBook에서 86–90 tokens/s를 기록했고 8K context에서 peak memory usage는 약 8.34 GiB이다.
핵심 포인트
- 7.9B 전체 파라미터 중 토큰마다 1.3B만 활성화해 추론 비용을 낮춘다.
- KDA 3개와 MLA 1개를 교차 배치해 긴 문맥 처리 효율을 높인다.
- 128개 routed expert 중 8개와 shared expert 1개만 선택하는 sparse MoE 구조다.
- 요청별 enable_thinking 설정으로 빠른 응답과 다단계 추론을 전환한다.
제한사항
- Ollama 실행은 현재 Apple Silicon의 MLX 경로와 소스 빌드에 한정된다.
- thinking mode가 기본 활성화되므로 일반 질의에서도 추론 토큰과 지연이 발생할 수 있다.
- custom code와 trust-remote-code 설정이 필요한 실행 경로가 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Artificial Analysis Intelligence Index v4.1.1 | score | 25 | — |
| Artificial Analysis Agentic Index | score | 16 | — |
| GDPval v2-AA | score | 772.00 | 동일 표의 Qwen3.5-9B 644.00, Gemma-4-12B-it 645.00 |
| Terminal-Bench 2.1 | score | 27.70 | 동일 표의 Qwen3.5-4B 25.80, Qwen3.5-9B 29.20 |
| SciCode | score | 24.20 | 동일 표의 Qwen3.5-4B 16.10, Qwen3.5-9B 27.50 |
| AA-LCR | score | 58.70 | 동일 표의 Qwen3.5-4B 61.00, Qwen3.5-9B 65.30 |
| GPQA Diamond | score | 73.40 | 동일 표의 Qwen3.5-4B 77.10, Qwen3.5-9B 80.60 |
| HMMT-Feb26 | score | 70.31 | 동일 표의 Qwen3.5-4B 72.87, Qwen3.5-9B 71.21 |
| IMO-AnswerBench | score | 71.03 | 동일 표의 Qwen3.5-4B 63.69, Qwen3.5-9B 70.00 |
| Multi-IF | score | 83.15 | 동일 표의 Qwen3.5-4B 79.84, Qwen3.5-9B 83.03 |
이미지 분석


150
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.