microsoft/Mage-VL
Microsoft의 4B 코덱 네이티브 스트리밍 멀티모달 모델로 비디오 코덱의 I/P 프레임 구조를 그대로 활용해 시각 토큰을 75% 이상 줄이면서 최대 3.5배 빠르게 추론한다.
학습 방식 · 처음부터 학습한 Codec-ViT 인코더(Mage-ViT)와 Qwen3-4B-Instruct-2507 디코더를 2단계 처음학습(ViT) 후 결합해, 캡션 정렬→지시튜닝→장문맥 확장→코덱 네이티브 장문맥 적응→스트리밍 게이트 정렬 순의 5단계 지도학습 커리큘럼으로 학습했다(선호도/RL 후처리 없음).
TL;DR
Mage-VL은 처음부터 새로 학습한 Codec-ViT 인코더(Mage-ViT)와 Qwen3-4B 디코더를 결합한 4B 규모 코덱 네이티브 멀티모달 모델로, 비디오 코덱처럼 앵커(I) 프레임은 전부 보존하고 예측(P) 프레임에서는 움직임이 있는 패치만 남겨 시각 토큰을 75% 이상 줄인다. 이 방식으로 균일 프레임 샘플링 대비 최대 3.5배의 추론 속도를 내면서 QVHighlight +22.5, ActivityNet +17.1, VSI-Bench +11.0 등 대부분의 비디오·시간적 그라운딩 벤치마크에서 같은 4B Qwen3 백본의 Qwen3-VL-4B를 앞선다(카드 표에서 MV-Bench만 65.1 대 66.7로 뒤진다). 캡션·지시튜닝·장문맥 적응·스트리밍 정렬까지 5단계 지도학습 커리큘럼으로 학습됐고, 마지막 단계에서는 백본을 고정한 채 가벼운 인지 게이트만 학습해 평상시엔 침묵하고 이벤트가 감지될 때만 코멘터리를 생성하는 능동형 스트리밍을 구현한다. 실시간 스포츠 방송 해설이나 장시간 영상 이해처럼 지속적으로 화면을 지켜봐야 하는 상황에 적합하다.
핵심 포인트
- 비디오 코덱의 I/P 프레임 구조를 그대로 시각 토큰 할당에 적용해 토큰을 75% 이상 줄이고 균일 샘플링보다 최대 3.5배 빠르다.
- 동일한 4B Qwen3 백본의 Qwen3-VL-4B 대비 대부분의 비디오·시간적 그라운딩 지표에서 앞선다(QVHighlight +22.5).
- 가벼운 인지 게이트가 평상시엔 침묵하고 이벤트가 감지될 때만 응답을 생성하는 능동형 스트리밍을 단일 모델로 구현한다.
- 560M 이미지 + 100M 비디오 프레임만으로 사전학습해 billion급 이미지-텍스트 페어로 학습한 SigLIP2와 비슷한 품질에 도달했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| VSI-Bench | score | 64.3 | Qwen3-VL-4B 53.3 (+11.0) |
| QVHighlight (Timelens) | score | 57.4 | Qwen3-VL-4B 34.9 (+22.5) |
| VideoMME | score | 64.0 | Qwen3-VL-4B 59.7 |
333
LIKES
462.5k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.