본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

inclusionAI/Ling-3.0-flash-VL

이미지·비디오 이해, 시각 기반 추론, 문서·차트 해석, 웹·소프트웨어 인터페이스 작업124B 전체, 토큰당 5.5B 활성화최대 256K 토큰 컨텍스트MIT

이미지·비디오 이해와 장문맥 추론을 결합한 124B native multimodal 모델

학습 방식 · Ling-3.0-flash 기반 native multimodal 확장으로, ViT encoder·2-layer MLP projector·VideoRoPE·sparse MoE를 결합합니다.

TL;DR

Ling-3.0-flash를 기반으로 이미지와 비디오를 이해·추론·행동·검증 과정에 통합한 native multimodal 모델입니다. ViT encoder와 2-layer MLP projector가 시각 특징을 텍스트 표현에 맞추고, VideoRoPE가 공간 위치와 시간 순서를 함께 인코딩합니다. 124B 전체 파라미터 중 토큰당 5.5B만 활성화하며, KDA와 Gated MLA를 5:1로 배치한 42-layer hybrid backbone으로 최대 256K 토큰 문맥을 처리합니다. Artificial Analysis Intelligence Index v4.1.1에서 42점을 기록해 Ling-3.0-flash의 38점보다 4점 높았고, 이미지·비디오 기반 문서 이해와 웹·소프트웨어 인터페이스 작업에 적합합니다.

핵심 포인트

  • ViT encoder가 이미지·비디오 특징을 추출하고 2-layer MLP projector가 텍스트 표현과 정렬합니다.
  • VideoRoPE가 공간 위치와 시간 순서를 함께 인코딩해 사건 위치와 장시간 비디오 질의를 처리합니다.
  • 124B 중 토큰당 5.5B만 활성화하는 sparse MoE로 모델 용량과 추론 효율을 함께 확보합니다.
  • KDA와 Gated MLA를 5:1로 교차 배치한 42-layer backbone이 최대 256K 토큰 문맥을 처리합니다.

제한사항

  • 256K 토큰 실행 레시피는 141GB급 GPU 4장 또는 80GB GPU 8장 구성을 권장합니다.
  • Thinking mode가 기본 활성화되며, 요청별로 비활성화하려면 chat_template_kwargs 설정이 필요합니다.

벤치마크

벤치마크지표비교
Artificial Analysis Intelligence Index v4.1.1score42Ling-3.0-flash의 공개 점수 38보다 4점 높음
CountBenchscore97.33Qwen3.8-27B 96.70, Gemini 3.5 Flash-Lite 97.10, Kimi-K2.6 95.70
WorldVQAscore45.67Kimi-K2.6 50.63, Qwen3.8-27B 22.87, Gemini 3.5 Flash-Lite 42.83
MMMU-Proscore79.00Qwen3.8-27B 76.00, Gemini 3.5 Flash-Lite 79.00, Kimi-K2.6 79.40
MathVisionscore84.87Qwen3.8-27B 87.40, Gemini 3.5 Flash-Lite 79.24, Kimi-K2.6 87.40
Humanity's Last Exam-MMscore19.88Qwen3.8-27B 21.90, Gemini 3.5 Flash-Lite 20.12, Kimi-K2.6 23.39
OmniDocBench1.5score91.35Qwen3.8-27B 91.10, Gemini 3.5 Flash-Lite 89.25, Kimi-K2.6 90.67
CharXiv_RQscore81.30Qwen3.8-27B 83.70, Gemini 3.5 Flash-Lite 71.40, Kimi-K2.6 80.40
MMSearchscore79.00Qwen3.8-27B 79.70, Gemini 3.5 Flash-Lite 78.67, Kimi-K2.6 80.00
ClawEval-MMscore59.9Qwen3.8-27B 56.90, Gemini 3.5 Flash-Lite 54.52, Kimi-K2.6 49.60
WebVoyagerscore90.83Qwen3.8-27B 90.80, Gemini 3.5 Flash-Lite 90.10, Kimi-K2.6 85.43
Vision2Webscore57.69Qwen3.8-27B 62.90, Gemini 3.5 Flash-Lite 54.85, Kimi-K2.6 55.42
AntBench-Medicalscore0.96 / 0.93Qwen3.8-27B 0.88 / 0.36, Gemini 3.5 Flash-Lite 0.87 / 0.74, Kimi-K2.6 0.95 / 0.91

이미지 분석

Ling-3.0-flash-VL의 ViT 입력부, MLP projector, 7개 그룹의 hybrid backbone, sparse MoE와 KDA·Gated MLA attention 구조를 나타낸 아키텍처 도식입니다.
도식은 이미지·비디오 입력이 ViT Encoder와 MLP Projector를 거쳐 텍스트 Embedding으로 합쳐지는 흐름을 담고 있습니다. 본체는 KDA 5개와 Gated MLA 1개를 포함하는 7개 그룹으로 구성되며, 124B 전체 파라미터 중 추론 단계마다 5.5B만 활성화하는 구조와 157K vocabulary size, 2,560 embedding dimension이 함께 표시되어 있습니다.
Artificial Analysis Intelligence Index v4.1.1의 모델별 점수 막대그래프에서 Ling-3.0-flash-VL이 42점을 기록한 위치를 나타낸 이미지입니다.
막대그래프에서 Ling-3.0-flash-VL은 42점으로 표시되며, Ling-3.0-flash의 38점보다 높은 위치에 놓여 있습니다. 그래프는 여러 multimodal 및 일반 모델의 점수를 한 축에서 비교해 Ling-3.0-flash-VL의 전체 지능 지수 성능을 맥락화합니다.
Ling-3.0-flash-VL과 Qwen3.8-27B, Gemini 3.5 Flash-Lite, Kimi-K2.6의 multimodal benchmark 점수를 비교한 표입니다.
표는 Visual Perception, STEM Reasoning, Document Intelligence, Agentic Multimodal Intelligence, Frontend Coding, Medical Report Interpretation으로 나눠 모델별 수치를 정리합니다. Ling-3.0-flash-VL은 CountBench 97.33, OmniDocBench1.5 91.35, WebVoyager 90.83, Vision2Web 57.69, AntBench-Medical 0.96 / 0.93을 기록하며, 벤치마크별로 비교 모델보다 높거나 낮은 결과가 함께 나타납니다.

69

LIKES

1.9k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.