본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/Mage-VL

이미지·영상 이해 및 능동형(proactive) 스트리밍 커멘터리 생성(단일 체크포인트)4B (비전 인코더 Mage-ViT + Qwen3-4B-Instruct-2507)apache-2.0

Microsoft의 4B 코덱 네이티브 스트리밍 멀티모달 모델로 비디오 코덱의 I/P 프레임 구조를 그대로 활용해 시각 토큰을 75% 이상 줄이면서 최대 3.5배 빠르게 추론한다.

학습 방식 · 처음부터 학습한 Codec-ViT 인코더(Mage-ViT)와 Qwen3-4B-Instruct-2507 디코더를 2단계 처음학습(ViT) 후 결합해, 캡션 정렬→지시튜닝→장문맥 확장→코덱 네이티브 장문맥 적응→스트리밍 게이트 정렬 순의 5단계 지도학습 커리큘럼으로 학습했다(선호도/RL 후처리 없음).

TL;DR

Mage-VL은 처음부터 새로 학습한 Codec-ViT 인코더(Mage-ViT)와 Qwen3-4B 디코더를 결합한 4B 규모 코덱 네이티브 멀티모달 모델로, 비디오 코덱처럼 앵커(I) 프레임은 전부 보존하고 예측(P) 프레임에서는 움직임이 있는 패치만 남겨 시각 토큰을 75% 이상 줄인다. 이 방식으로 균일 프레임 샘플링 대비 최대 3.5배의 추론 속도를 내면서 QVHighlight +22.5, ActivityNet +17.1, VSI-Bench +11.0 등 대부분의 비디오·시간적 그라운딩 벤치마크에서 같은 4B Qwen3 백본의 Qwen3-VL-4B를 앞선다(카드 표에서 MV-Bench만 65.1 대 66.7로 뒤진다). 캡션·지시튜닝·장문맥 적응·스트리밍 정렬까지 5단계 지도학습 커리큘럼으로 학습됐고, 마지막 단계에서는 백본을 고정한 채 가벼운 인지 게이트만 학습해 평상시엔 침묵하고 이벤트가 감지될 때만 코멘터리를 생성하는 능동형 스트리밍을 구현한다. 실시간 스포츠 방송 해설이나 장시간 영상 이해처럼 지속적으로 화면을 지켜봐야 하는 상황에 적합하다.

핵심 포인트

  • 비디오 코덱의 I/P 프레임 구조를 그대로 시각 토큰 할당에 적용해 토큰을 75% 이상 줄이고 균일 샘플링보다 최대 3.5배 빠르다.
  • 동일한 4B Qwen3 백본의 Qwen3-VL-4B 대비 대부분의 비디오·시간적 그라운딩 지표에서 앞선다(QVHighlight +22.5).
  • 가벼운 인지 게이트가 평상시엔 침묵하고 이벤트가 감지될 때만 응답을 생성하는 능동형 스트리밍을 단일 모델로 구현한다.
  • 560M 이미지 + 100M 비디오 프레임만으로 사전학습해 billion급 이미지-텍스트 페어로 학습한 SigLIP2와 비슷한 품질에 도달했다.

벤치마크

벤치마크지표비교
VSI-Benchscore64.3Qwen3-VL-4B 53.3 (+11.0)
QVHighlight (Timelens)score57.4Qwen3-VL-4B 34.9 (+22.5)
VideoMMEscore64.0Qwen3-VL-4B 59.7

333

LIKES

462.5k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.