OpenMOSS-Team/MOSS-VL-Realtime
타임스탬프가 포함된 스트리밍 비디오를 입력으로 받아 프레임 단위의 실시간 질의응답, 사건 요약, 시간적 국소화 및 동적 응답 수정 작업을 수행하는 비디오-텍스트-투-텍스트 멀티모달 태스크이다.11B256K 컨텍스트apache-2.0
MOSS-VL-Realtime은 타임스탬프가 부착된 프레임을 스트리밍으로 처리하며 크로스어텐션과 XRoPE를 통해 실시간 질의응답과 동적 정정을 지원하는 11B 멀티모달 모델이다.
학습 방식 · MOSS-VL-Base를 기반으로 지속 학습 및 스트리밍 전용 데이터셋을 활용해 타임스탬프가 포함된 프레임 기반 입력을 학습 데이터로 추가하여 실시간 상호작용 동작과 동적 정정 능력을 개선했다.
TL;DR
MOSS-VL-Realtime은 MOSS-VL-Base 기반의 11B 멀티모달 체크포인트로서 타임스탬프가 부착된 프레임을 스트리밍으로 입력받아 증분 생성과 동적 정정을 수행하도록 설계되었다. 모델은 크로스어텐션 아키텍처와 XRoPE를 통해 시간과 공간 좌표를 통합적으로 표현하며 256K 토큰 문맥을 활용해 긴 스트리밍 세션의 누적 맥락을 유지한다. 제공되는 실시간 세션 API는 프레임 푸시·프롬프트 삽입·증분 폴링 출력을 지원하고 프로액티브한 침묵 제어 토큰으로 불필요한 응답을 억제한다. 벤치마크 차트에서는 여러 서브테스트에서 상위 성능 포인트가 관찰되나 생산 환경의 지연과 세션 당 인스턴스 제한은 배포 시 고려해야 할 제약으로 남아 있다.
핵심 포인트
- 각 프레임에 절대 타임스탬프를 부착하고 XRoPE로 시간·공간을 통합해 시간적 국소화가 가능한 스트리밍 전용 인코딩을 채택했다.
- 실시간 세션 API(create_realtime_session, online_generate)와 폴링 기반 출력 스트리밍을 제공해 프레임 생산자와 추론기 사이의 비동기화를 용이하게 한다.
- 응답 대신 `<|silence|>` 제어 토큰을 방출해 불충분한 시각 증거에서 불필요한 응답을 줄이고 관찰을 지속하는 프로액티브한 침묵 동작을 구현했다.
- 256K 토큰의 대규모 문맥 창을 유지해 긴 스트리밍 세션의 누적 대화·관찰 기록을 보존함으로써 시점별 질의에 대해 풍부한 문맥을 참조할 수 있다.
이미지 분석


88
LIKES
544
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.