왜 중요한가
기존 Streaming 모델은 답변을 생성하는 동안 영상을 보지 못해 장면 변화에 맞춘 수정이나 중단이 어려웠습니다. MOSS-VL은 프레임을 생성 중에도 교차 어텐션 캐시에 추가하는 구조와 응답 시점을 학습한 상호작용 코퍼스를 결합해 이 문제를 겨냥했으며, 공개 Streaming 모델 가운데 네 가지 벤치마크 중 세 곳에서 최고 평균을 기록했습니다.
핵심 기여
생성 중 시각 입력을 유지하는 구조
시각 토큰을 디코딩 시퀀스에서 분리하고 gated cross-attention으로만 참조해 새 프레임의 key·value를 캐시에 추가합니다. XRoPE와 절대 timestamp token이 텍스트·패치의 위치와 실제 시간을 연결합니다. 이 설계가 답변 생성 중에도 최신 프레임을 반영하는 경로를 제공합니다.
응답 시점을 학습하는 Realtime-SFT
각 프레임 뒤에 silence 또는 response 상태를 배치하고, 장면 변화로 기존 답이 무효가 되면 자기 수정 답변을 학습시킵니다. 0.56M개 샘플과 약 34.8B 토큰을 사용했으며, 전체 학습 토큰의 3% 미만을 차지합니다. 두 상태 토큰에 focal factor와 빈도 보정 가중치를 적용해 침묵 데이터 편중을 완화합니다.
시간적 추론 기반의 오프라인 성능
Pre-training 과정에서 시간에 정렬된 Caption, Temporal Grounding, 장시간 영상 QA를 결합합니다. MOSS-VL-Instruct는 Minerva 40.5, TOMATO 39.5, VideoMME-Logical 17.1을 기록해 비교 대상 중 해당 시간적 추론 세트에서 가장 높은 점수를 냈습니다. 실시간 상호작용을 위한 학습이 오프라인 영상 이해 기반에도 연결됩니다.
시각 문맥 증가에 강한 서빙
MOSS-VL은 11.3B 파라미터를 사용하지만 시각 토큰을 생성 시퀀스 밖에 둡니다. 동일한 Qwen3-8B 언어 backbone을 사용하는 Qwen3-VL-8B와 비교해 시각 문맥이 커질 때 TTFT 격차가 2.8배에서 5.1배로 확대됩니다. 같은 영상에서 약 두 배의 시각 토큰을 처리하면서도 측정 구간에서 뒤처지지 않았습니다.
핵심 아이디어 이해하기
일반적인 오프라인 Vision-Language 모델은 영상 전체를 먼저 읽은 뒤 답변을 생성하므로, 생성 중에 새로운 프레임이 들어와도 이미 시작한 답변을 즉시 고치기 어렵습니다. Streaming 모델은 프레임을 순차적으로 받을 수 있지만 답변을 내는 동안에는 장면을 보지 못하는 L2~L4 수준에 머뭅니다. MOSS-VL이 겨냥하는 L5 real-time interaction은 말하는 동안에도 계속 지각해 증거가 바뀌는 순간 답변을 수정하거나 끊는 능력입니다.
Transformer의 Self-Attention은 텍스트 디코딩 시퀀스에 포함된 토큰을 중심으로 계산합니다. MOSS-VL은 영상 패치 토큰을 이 시퀀스에 섞지 않고, 텍스트 query가 시각 key·value를 참조하는 gated cross-attention 경로를 별도로 둡니다. 새 프레임이 오면 해당 프레임만 인코딩해 cross-attention cache 뒤에 붙이므로, 다음 출력 토큰이 기존 텍스트 상태를 유지하면서 갱신된 시각 정보를 읽습니다.
위치 정보가 없는 교차 어텐션에서는 텍스트와 패치의 순서 및 공간 관계를 구분하기 어렵습니다. XRoPE는 시간·높이·너비 세 축의 좌표를 텍스트 토큰과 영상 패치에 함께 부여하고, 별도의 absolute timestamp token은 샘플링 위치가 아니라 실제 초 단위 시각을 전달합니다. 여기에 Realtime-SFT가 각 프레임에서 침묵, 응답, 자기 수정을 선택하도록 학습되면서 모델의 출력은 단순한 영상 질의응답에서 시간에 맞춘 상호작용으로 확장됩니다.
방법론
MOSS-VL은 Qwen3-8B에서 초기화한 48층 언어 decoder와 Qwen3-VL vision encoder에서 초기화한 27층 시각 인코더를 결합합니다. 언어 decoder의 36개 Self-Attention 층은 텍스트만 처리하고, 네 층마다 배치한 12개 Gated-XAttention 층이 시각 토큰을 읽습니다. 11.3B 파라미터 가운데 약 8.2B는 언어 backbone, 2.3B는 교차 어텐션 스택, 0.8B는 vision encoder와 projection 모듈에 배정됩니다.
시각 인코더는 4,096~16.8M 픽셀의 native dynamic resolution 입력을 처리하고, 2 × 2 patch 그룹을 합친 뒤 MLP로 4096차원 decoder 공간에 투영합니다. 교차 어텐션은 32 query head와 8 key-value head의 GQA를 사용하며, Attention과 feed-forward 경로에 tanh 게이트를 씌웁니다. 게이트 스칼라를 0으로 초기화해 학습 초기에 언어 backbone이 손상되지 않도록 한 뒤 새 시각 연결부가 점진적으로 영향력을 얻습니다.
XRoPE는 텍스트와 시각 패치를 공통 좌표계 에 배치합니다. 텍스트 토큰은 세 축을 함께 한 칸씩 전진시키고, 시각 패치 는 프레임의 시간 anchor 와 높이·너비 오프셋을 사용하며 및 를 만족합니다. 예를 들어 프레임의 병합 패치 격자가 2 × 3이면 첫 패치는 , 마지막 패치는 에 놓이고, 프레임 뒤의 separator와 text placeholder는 좌표를 공유합니다.
각 프레임 앞에는 <|time_start|>X.X seconds<|time_end|> 형식의 절대 timestamp token을 삽입합니다. 영상은 1~16 fps의 motion-adaptive 방식으로 샘플링되며, 학습에서는 최대 2,048프레임, 평가에서는 최대 768프레임을 사용하고 공개 processor 기본값은 1 fps와 256프레임입니다. 새 프레임이 들어오면 해당 프레임의 key·value만 캐시에 추가되고 디코딩 시퀀스에는 timestamp token과 placeholder token만 늘어나므로, 이전 프레임의 재인코딩과 key·value 재계산을 피합니다.
학습은 네 단계 Pre-training, 표준 SFT, Realtime-SFT 순서로 진행됩니다. Pre-training은 150.3B 토큰의 Vision-Language Alignment, 203.0B 토큰의 Large-Scale Multimodal, 459.0B 토큰의 High-Quality Multimodal, 450.1B 토큰의 Annealing & Long-Context 단계로 구성되며 최대 시퀀스 길이를 8K에서 256K로 늘립니다. 이후 SFT는 7.6M 샘플과 102.8B 토큰으로 오프라인 지시 수행을 익히고, Realtime-SFT는 0.56M 샘플과 약 34.8B 토큰으로 프레임별 상태 결정을 추가합니다.
주요 결과
오프라인 평가에서 MOSS-VL-Instruct는 39개 벤치마크를 다섯 영역으로 나누어 비교했습니다. MMBench-EN 88.1, POPE 89.4, V* 89.0, MME-RealWorld 66.3, BLINK 78.0을 포함해 지각 영역 12개 중 다섯 곳에서 최고 점수를 기록했습니다. 시간적 추론에서는 Minerva 40.5, TOMATO 39.5, VideoMME-Logical 17.1로 각 세트에서 비교 모델보다 4.9점 이상 높았습니다.
MOSS-VL-Realtime은 OVO-Bench 평균 70.2로 2위 AURA 65.3을 앞섰고, OmniMMI 평균 32.7로 2위 25.4를 기록했으며, ProactiveVideoQA 평균 47.2로 2위 42.7을 넘었습니다. StreamingBench 시각 평균은 69.7로 AURA 71.1에 이어 2위였습니다. 능동 응답을 직접 측정하는 OmniMMI Proactive Alerting은 66.0 대 37.5, StreamingBench Proactive Output은 60.0 대 53.2, OVO-Bench Forward Active Responding은 62.1 대 55.8로 모두 MOSS-VL-Realtime이 앞섰습니다.
서빙 효율성은 동일한 Qwen3-8B 언어 backbone을 쓰는 Qwen3-VL-8B와 단일 H200, BF16, SGLang 환경에서 비교했습니다. 시각 출력량을 맞춘 조건에서 TTFT 격차는 시각 문맥이 커질수록 2.8배에서 5.1배로, end-to-end latency 격차는 1.9배에서 4.3배로 확대됐습니다. MOSS-VL이 같은 영상에서 Qwen3-VL보다 약 두 배 많은 시각 토큰을 유지하면서도 뒤처지지 않은 이유는 패치 토큰을 디코딩 시퀀스에 넣지 않고 append-only cross-attention cache로 처리하기 때문입니다.
기술 상세
언어 decoder는 48층으로 구성되며 36개 Self-Attention 층과 12개 Gated Cross-Attention 층을 네 층 간격으로 배치합니다. hidden size와 FFN size는 각각 4096과 12288이고, context window는 262,144 토큰이며, GQA는 32 query head와 8 key-value head를 사용합니다. Vision encoder는 27층, hidden size 1152, FFN size 4304, 16개 Attention head, 16 × 16 patch를 사용합니다.
Realtime-SFT의 입력은 프레임 도착 순서에 따라 텍스트와 교차 배치됩니다. 각 프레임 뒤에는 <|silence|>로 계속 관찰하거나 <|response|> 뒤에 답변을 생성하는 결정 슬롯이 오고, 답변이 끝나는 슬롯은 다시 <|silence|>로 닫힙니다. 한 답변을 여러 프레임의 연속 슬롯에 나누어 배치하므로 rate-limited real-time output과 장면 변화에 따른 여러 번의 발화를 학습할 수 있습니다.
침묵 슬롯이 응답 슬롯보다 훨씬 많으면 일반적인 next-token loss가 침묵만 예측하는 방향으로 치우칩니다. MOSS-VL은 상태 토큰에 inverse-frequency class coefficient와 focal factor를 적용하며, 손실은 로 계산하고 상태 토큰의 가중치는 , 그 외 토큰은 1로 둡니다. 여기서 는 학습 대상 여부, 는 토큰별 cross-entropy, 는 정답 상태 토큰의 예측 확률, 이며, 현재 global batch의 silence·response 개수를 이용해 두 상태의 기본 총가중치를 맞춥니다. 예를 들어 정답 상태 토큰의 확률이 0.5이면 focal 항은 이고, 확률이 0.9이면 0.01이 되어 이미 확신하는 예보다 어려운 상태 결정을 더 크게 반영합니다.
Realtime-SFT 코퍼스는 0.56M 샘플, 약 34.8B 토큰, 2.2M emission decision으로 구성됩니다. 이 결정의 58.7%는 새로운 사용자 질문 없이 모델이 스스로 발화할지 정한 경우이며, 샘플의 5.1%는 목표 사건이 끝까지 나타나지 않아 전체 침묵이 정답입니다. 1 fps로 최대 768프레임, 약 12.8분 길이의 스트림을 구성하고, 실제 영상에서 증거가 보이기 시작하는 시점과 답변이 더 이상 유효하지 않은 시점을 프레임 단위로 검증합니다.
학습 인프라는 Megatron-LM의 data, tensor, sequence, context parallelism을 사용하며 8K에서 256K 토큰 시퀀스를 처리합니다. FlashAttention-3를 확장한 cross_kv_boundary는 각 query 행이 볼 수 있는 시각 key·value prefix를 32-bit 정수 하나로 전달하고, 경계 밖 tile은 계산 전에 제거합니다. 이 방식은 텍스트 길이와 시각 길이의 곱에 비례하는 dense cross-attention mask의 메모리·대역폭 부담을 줄이고, packed training과 KV-cache 실행 경로를 함께 지원합니다.
한계점
논문은 MOSS-VL-Instruct가 MMMU와 문서 중심 벤치마크에서 동일 규모의 강한 오픈 모델보다 낮은 점수를 냈다고 명시합니다. MOSS-VL은 thinking mode 없이 실시간 영상에 맞춘 학습을 수행했기 때문에 시험형 추론에는 약점이 남았습니다. 또한 공개 Streaming 벤치마크가 L2~L4까지만 정량 평가하므로, 생성 중 지각과 답변 수정에 해당하는 L5 성능은 라이브 데모와 공개 inference code를 통한 정성 검증에 그쳤으며, 논문은 전용 L5 벤치마크가 아직 없다고 밝힙니다.
실무 활용
MOSS-VL은 영상이 끝나기를 기다리지 않고 프레임 단위로 장면을 읽으며 응답 시점을 선택하는 실시간 영상 분석 모델입니다. GitHub에 다섯 개 checkpoint, 학습 curriculum, real-time inference code가 공개되어 있어 연구용 재현과 실시간 프로토타이핑에 활용할 근거가 충분합니다.
- 조건이 충족될 때만 알림을 내는 영상 모니터링에 사용할 수 있습니다. Realtime-SFT는 각 프레임에서 `<|silence|>`와 응답을 선택하도록 학습하므로, 사건이 발생하기 전에는 침묵하고 증거가 나타난 순간에만 출력하는 흐름을 구성합니다. 논문 데모에서는 고양이가 당근에 닿는 네 번의 순간에만 응답했습니다.
- 실시간 스포츠 해설과 장면 변화 추적에 사용할 수 있습니다. 프레임이 도착하면 새 시각 key·value를 캐시에 추가하고 생성 중에도 이를 참조하므로, 프리킥 준비와 심판 휘슬, 슈팅, 세리머니, 점수 변화처럼 이어지는 사건을 순서대로 반영합니다. 공개 데모에서는 단일 해설 지시 뒤 1초 이내에 해설을 시작하고 사건 전개를 따라갔습니다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 게이트형 교차 어텐션(Gated Cross-Attention)
- — 텍스트 은닉 상태를 query로 사용하고 시각 토큰을 key·value로 참조하는 Attention 구조입니다. tanh 게이트를 곱해 시각 정보의 영향력을 조절하며, 게이트를 0에서 시작하면 기존 언어 모델의 동작을 유지한 채 시각 연결부를 학습할 수 있습니다.
- 교차 어텐션 캐시(Cross-Attention Cache)
- — 이미 처리한 프레임의 시각 key·value를 저장해 새 프레임이 들어올 때 기존 프레임을 다시 인코딩하지 않도록 하는 추론 메모리입니다. 새 key·value만 뒤에 붙이므로 영상이 길어져도 디코딩 상태를 유지하면서 최신 장면을 반영할 수 있습니다.
- 시간적 추론(Temporal Reasoning)
- — 영상에서 사건이 발생한 순서와 시점을 파악하고, 여러 프레임에 걸친 상태 변화를 근거로 답을 만드는 능력입니다. MOSS-VL은 시간에 정렬된 Caption과 Temporal Grounding 자료를 학습해 Minerva, TOMATO, VideoMME-Logical 같은 평가 세트에서 이 능력을 측정했습니다.
- 첫 토큰 생성 지연 시간(Time-to-First-Token)
- — 입력 처리가 시작된 뒤 모델이 첫 번째 출력 토큰을 내놓기까지 걸리는 시간입니다. 시각 토큰이 디코딩 시퀀스에 들어가는지와 캐시가 어떻게 갱신되는지가 이 지연에 영향을 주며, MOSS-VL은 시각 토큰을 별도 교차 어텐션 경로에 두어 긴 영상에서 지연 증가를 늦췄습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
