본문으로 건너뛰기

라이브커머스용 옴니모달 이해 모델 TLive-Omni

TLive-Omni는 Per-vGrid와 단계별 학습으로 라이브커머스의 음성·영상·이미지·텍스트를 함께 이해합니다.

용어 해설

옴니모달 이해(Omni-Modal Understanding)
이미지, 비디오, 오디오, 텍스트처럼 서로 다른 입력 양식을 하나의 표현 공간에서 함께 처리하는 능력입니다. TLive-Omni는 각 양식의 정보를 결합해 상품 인식, 음성 전사, 시간 구간 추정, 질의응답을 수행합니다. 라이브커머스처럼 근거가 여러 양식과 시점에 흩어진 환경에서 핵심 역할을 합니다.
시간 구간 근거 추정(Temporal Grounding)
질문이나 사건에 해당하는 비디오의 시작과 끝 시점을 찾아내는 작업입니다. 모델은 영상 프레임과 음성 정보를 시간축에 맞춰 처리한 뒤 관련 구간을 출력합니다. 라이브 방송에서 특정 상품 시연이나 발화가 언제 발생했는지 찾는 데 사용됩니다.
화자 분할(Speaker Diarization)
오디오 구간마다 누가 말했는지 식별하고 발화 시점을 나누는 기술입니다. 이 논문은 음향 기반 모델과 영상·전사 정보를 함께 사용하는 MLLM의 결과를 비교하고 시간 겹침을 검사합니다. 그 결과 화자별 음성 전사 학습에 사용할 수 있는 정제된 데이터를 확보합니다.
그룹 상대 정책 최적화(Group Relative Policy Optimization)
하나의 프롬프트에서 여러 응답을 생성하고 응답 사이의 보상 차이를 이용해 정책을 갱신하는 강화학습 방식입니다. 각 응답의 보상을 같은 그룹의 평균과 표준편차로 정규화해 상대적 이점을 계산합니다. 절대적인 정답 점수보다 동일 입력에 대한 응답 간 선호를 학습 신호로 활용합니다.
길이 그룹화 샘플링(Length-Grouped Sampling)
토큰 길이가 비슷한 샘플을 같은 전역 배치에 배치하는 데이터 샘플링 방식입니다. 멀티모달 입력의 길이 차이에서 생기는 패딩과 워커 간 작업량 불균형을 줄이면서 고정된 샘플 수를 유지합니다. TLive-Omni는 워커마다 동일한 시드를 사용해 같은 전역 배치를 선택한 뒤 이를 로컬 배치로 나눕니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.