inclusionAI/Ling-3.0-flash-VL
이미지·비디오 이해, 시각 기반 추론, 문서·차트 해석, 웹·소프트웨어 인터페이스 작업124B 전체, 토큰당 5.5B 활성화최대 256K 토큰 컨텍스트MIT
이미지·비디오 이해와 장문맥 추론을 결합한 124B native multimodal 모델
학습 방식 · Ling-3.0-flash 기반 native multimodal 확장으로, ViT encoder·2-layer MLP projector·VideoRoPE·sparse MoE를 결합합니다.
TL;DR
Ling-3.0-flash를 기반으로 이미지와 비디오를 이해·추론·행동·검증 과정에 통합한 native multimodal 모델입니다. ViT encoder와 2-layer MLP projector가 시각 특징을 텍스트 표현에 맞추고, VideoRoPE가 공간 위치와 시간 순서를 함께 인코딩합니다. 124B 전체 파라미터 중 토큰당 5.5B만 활성화하며, KDA와 Gated MLA를 5:1로 배치한 42-layer hybrid backbone으로 최대 256K 토큰 문맥을 처리합니다. Artificial Analysis Intelligence Index v4.1.1에서 42점을 기록해 Ling-3.0-flash의 38점보다 4점 높았고, 이미지·비디오 기반 문서 이해와 웹·소프트웨어 인터페이스 작업에 적합합니다.
핵심 포인트
- ViT encoder가 이미지·비디오 특징을 추출하고 2-layer MLP projector가 텍스트 표현과 정렬합니다.
- VideoRoPE가 공간 위치와 시간 순서를 함께 인코딩해 사건 위치와 장시간 비디오 질의를 처리합니다.
- 124B 중 토큰당 5.5B만 활성화하는 sparse MoE로 모델 용량과 추론 효율을 함께 확보합니다.
- KDA와 Gated MLA를 5:1로 교차 배치한 42-layer backbone이 최대 256K 토큰 문맥을 처리합니다.
제한사항
- 256K 토큰 실행 레시피는 141GB급 GPU 4장 또는 80GB GPU 8장 구성을 권장합니다.
- Thinking mode가 기본 활성화되며, 요청별로 비활성화하려면 chat_template_kwargs 설정이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Artificial Analysis Intelligence Index v4.1.1 | score | 42 | Ling-3.0-flash의 공개 점수 38보다 4점 높음 |
| CountBench | score | 97.33 | Qwen3.8-27B 96.70, Gemini 3.5 Flash-Lite 97.10, Kimi-K2.6 95.70 |
| WorldVQA | score | 45.67 | Kimi-K2.6 50.63, Qwen3.8-27B 22.87, Gemini 3.5 Flash-Lite 42.83 |
| MMMU-Pro | score | 79.00 | Qwen3.8-27B 76.00, Gemini 3.5 Flash-Lite 79.00, Kimi-K2.6 79.40 |
| MathVision | score | 84.87 | Qwen3.8-27B 87.40, Gemini 3.5 Flash-Lite 79.24, Kimi-K2.6 87.40 |
| Humanity's Last Exam-MM | score | 19.88 | Qwen3.8-27B 21.90, Gemini 3.5 Flash-Lite 20.12, Kimi-K2.6 23.39 |
| OmniDocBench1.5 | score | 91.35 | Qwen3.8-27B 91.10, Gemini 3.5 Flash-Lite 89.25, Kimi-K2.6 90.67 |
| CharXiv_RQ | score | 81.30 | Qwen3.8-27B 83.70, Gemini 3.5 Flash-Lite 71.40, Kimi-K2.6 80.40 |
| MMSearch | score | 79.00 | Qwen3.8-27B 79.70, Gemini 3.5 Flash-Lite 78.67, Kimi-K2.6 80.00 |
| ClawEval-MM | score | 59.9 | Qwen3.8-27B 56.90, Gemini 3.5 Flash-Lite 54.52, Kimi-K2.6 49.60 |
| WebVoyager | score | 90.83 | Qwen3.8-27B 90.80, Gemini 3.5 Flash-Lite 90.10, Kimi-K2.6 85.43 |
| Vision2Web | score | 57.69 | Qwen3.8-27B 62.90, Gemini 3.5 Flash-Lite 54.85, Kimi-K2.6 55.42 |
| AntBench-Medical | score | 0.96 / 0.93 | Qwen3.8-27B 0.88 / 0.36, Gemini 3.5 Flash-Lite 0.87 / 0.74, Kimi-K2.6 0.95 / 0.91 |
이미지 분석



69
LIKES
1.9k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.