256K 문맥과 타임스탬프 기반 실시간 비디오 이해를 지향하는 11B 멀티모달 체크포인트
타임스탬프가 포함된 스트리밍 비디오를 입력으로 받아 프레임 단위의 실시간 질의응답, 사건 요약, 시간적 국소화 및 동적 응답 수정 작업을 수행하는 비디오-텍스트-투-텍스트 멀티모달 태스크이다.11B256K 컨텍스트apache-2.0
MOSS-VL-Realtime은 타임스탬프가 부착된 프레임을 스트리밍으로 처리하며 크로스어텐션과 XRoPE를 통해 실시간 질의응답과 동적 정정을 지원하는 11B 멀티모달 모델이다.
TL;DR
MOSS-VL-Realtime은 MOSS-VL-Base 기반의 11B 멀티모달 체크포인트로서 타임스탬프가 부착된 프레임을 스트리밍으로 입력받아 증분 생성과 동적 정정을 수행하도록 설계되었다. 모델은 크로스어텐션 아키텍처와 XRoPE를 통해 시간과 공간 좌표를 통합적으로 표현하며 256K 토큰 문맥을 활용해 긴 스트리밍 세션의 누적 맥락을 유지한다. 제공되는 실시간 세션 API는 프레임 푸시·프롬프트 삽입·증분 폴링 출력을 지원하고 프로액티브한 침묵 제어 토큰으로 불필요한 응답을 억제한다. 벤치마크 차트에서는 여러 서브테스트에서 상위 성능 포인트가 관찰되나 생산 환경의 지연과 세션 당 인스턴스 제한은 배포 시 고려해야 할 제약으로 남아 있다.
핵심 역량
- 모델은 스트리밍 환경에서 프레임을 연속적으로 수신하면서 관찰된 시점까지의 정보를 근거로 증분 텍스트를 생성할 수 있다. 이 과정에서 사용자가 임의 시점에 질의를 던지면 현재까지 수집된 프레임과 타임스탬프를 결합해 응답을 생성하며 이후 프레임으로 응답을 동적으로 수정할 수 있다. 출력은 필요 시 제어 토큰으로 침묵을 유지하도록 설계되어 불필요한 응답을 줄인다.
- 모델은 각 프레임에 절대 타임스탬프를 포함해 사건의 발생 시점과 지속시간을 추론할 수 있다. XRoPE를 통해 시간축과 이미지 내 공간 좌표를 통합 표현으로 인코딩하기 때문에 시간 기반 질의와 공간적 물체 변화 추적에서 일관된 위치 정보를 제공한다. 이로 인해 장면의 변화, 이벤트 지속성, 시간적 순서 판단이 가능하다.
- 모델은 오프라인 비디오와 이미지 입력도 처리할 수 있는 보조 API를 제공한다. 배치형 오프라인 추론과 단일 비디오 처리 함수가 남아 있어 기존의 오프라인 워크플로와 연계하여 사용 가능하며 같은 체크포인트로 실시간과 오프라인 두 가지 모드를 혼용할 수 있다. 이 점은 서류화된 파이프라인에서 재사용성을 확보한다.
강점
- 256K 토큰의 대규모 문맥 창을 유지해 긴 스트리밍 세션의 누적 대화·관찰 기록을 보존함으로써 시점별 질의에 대해 풍부한 문맥을 참조할 수 있다.
- 타임스탬프 인식 인코딩과 XRoPE를 도입해 시간적 정보와 공간적 패치 위치를 통합적으로 표현하므로 사건의 발생 시점·지속성·순서를 보다 정밀하게 추론할 수 있다.
- 실시간 전용 API와 세션 관리 인터페이스(create_realtime_session, online_generate, session.push_frame 등)를 제공해 프레임 큐 기반의 저지연 스트리밍 구성에 바로 적용할 수 있다.
훈련 방식
MOSS-VL-Base를 기반으로 지속 학습 및 스트리밍 전용 데이터셋을 활용해 타임스탬프가 포함된 프레임 기반 입력을 학습 데이터로 추가하여 실시간 상호작용 동작과 동적 정정 능력을 개선했다.
알아두면 좋은 것
- 라이선스는 Apache-2.0으로 공개되어 있으며 MOSS-VL-Base를 기반으로 한 실시간 스트리밍 체크포인트임이 명시되어 있다.
- 모델 구성표에는 11B 파라미터, BF16 텐서 타입, 256K 토큰의 문맥 길이, 비전 패치 크기 16, 기본 비디오 FPS 1.0 및 최대 프레임 256이 표기되어 있다.
- 실시간 세션은 프레임과 타임스탬프를 입력으로 받는 전용 API(create_realtime_session, online_generate 등)를 제공하며 하나의 모델 인스턴스는 하나의 활성 세션만 지원하도록 설계되어 있다.
- 모델은 `<|silence|>`, `<|round_start|>`, `<|round_end|>` 같은 제어 토큰을 사용하며 하드웨어·디코딩·네트워크 지연 등 실환경 요인에 의해 응답 지연이 좌우될 수 있음이 명시되어 있다.
기술적 특징
- 크로스어텐션 중심의 아키텍처를 채택해 비전 인코더에서 생성된 패치 표현을 언어 디코더의 생성 컨텍스트에 병렬로 주입한다. 이 구조는 전체 비디오를 먼저 로드하는 오프라인 워크플로를 피하고 들어오는 프레임을 곧바로 텍스트 생성에 반영할 수 있게 해 실시간 응답성을 확보한다. 결과적으로 스트리밍 입력에서의 지연을 줄이고 증분적 생성과 동적 정정이 가능해졌다.
- XRoPE(Cross-attention Rotary Position Embedding)를 도입해 시간(Time)과 이미지 내 공간(Height, Width)을 결합한 3차원 좌표계로 토큰과 시각 패치를 매핑한다. 이 매핑은 프레임 간 위치의 일관성과 시간적 연속성을 유지하여 사건 지속성, 동시성, 순서 기반 추론 정확도를 개선한다. 타임스탬프와 결합하면 시간적 국소화가 보다 정밀해진다.
- 타임스탬프 인식 비디오 인코딩을 활용해 각 입력 프레임에 절대 시간을 주입하며 모델이 사건의 발생 시점과 지속시간을 직접 참조하도록 만든다. 이 방식은 단순한 프레임 인덱스 기반 처리보다 시간 축 해석이 명확해져 질문이 특정 시점에 대한 것일 때 더 정확한 근거 기반 응답을 생성한다. 또한 새로운 프레임 도착 시 이전 응답을 수정할 수 있는 기반을 제공한다.
- 실시간 세션과 큐 기반 온라인 생성 인터페이스를 제공하여 프레임 생산자와 추론 워커를 분리하는 배포 패턴을 지원한다. 입력 큐에 프레임·프롬프트·이벤트를 넣고 모델이 출력 청크를 스트리밍하므로 백엔드에서 비동기 파이프라인으로 쉽게 통합할 수 있다. 이 설계는 서비스 측 확장성과 유연성을 높인다.
차별점
- 각 프레임에 절대 타임스탬프를 부착하고 XRoPE로 시간·공간을 통합해 시간적 국소화가 가능한 스트리밍 전용 인코딩을 채택했다.
- 실시간 세션 API(create_realtime_session, online_generate)와 폴링 기반 출력 스트리밍을 제공해 프레임 생산자와 추론기 사이의 비동기화를 용이하게 한다.
- 응답 대신 `<|silence|>` 제어 토큰을 방출해 불충분한 시각 증거에서 불필요한 응답을 줄이고 관찰을 지속하는 프로액티브한 침묵 동작을 구현했다.
이미지 분석


88
Likes
544
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.