용어 해설
- 옴니모달 이해(Omni-Modal Understanding)
- — 이미지, 비디오, 오디오, 텍스트처럼 서로 다른 입력 양식을 하나의 표현 공간에서 함께 처리하는 능력입니다. TLive-Omni는 각 양식의 정보를 결합해 상품 인식, 음성 전사, 시간 구간 추정, 질의응답을 수행합니다. 라이브커머스처럼 근거가 여러 양식과 시점에 흩어진 환경에서 핵심 역할을 합니다.
- 시간 구간 근거 추정(Temporal Grounding)
- — 질문이나 사건에 해당하는 비디오의 시작과 끝 시점을 찾아내는 작업입니다. 모델은 영상 프레임과 음성 정보를 시간축에 맞춰 처리한 뒤 관련 구간을 출력합니다. 라이브 방송에서 특정 상품 시연이나 발화가 언제 발생했는지 찾는 데 사용됩니다.
- 화자 분할(Speaker Diarization)
- — 오디오 구간마다 누가 말했는지 식별하고 발화 시점을 나누는 기술입니다. 이 논문은 음향 기반 모델과 영상·전사 정보를 함께 사용하는 MLLM의 결과를 비교하고 시간 겹침을 검사합니다. 그 결과 화자별 음성 전사 학습에 사용할 수 있는 정제된 데이터를 확보합니다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — 하나의 프롬프트에서 여러 응답을 생성하고 응답 사이의 보상 차이를 이용해 정책을 갱신하는 강화학습 방식입니다. 각 응답의 보상을 같은 그룹의 평균과 표준편차로 정규화해 상대적 이점을 계산합니다. 절대적인 정답 점수보다 동일 입력에 대한 응답 간 선호를 학습 신호로 활용합니다.
- 길이 그룹화 샘플링(Length-Grouped Sampling)
- — 토큰 길이가 비슷한 샘플을 같은 전역 배치에 배치하는 데이터 샘플링 방식입니다. 멀티모달 입력의 길이 차이에서 생기는 패딩과 워커 간 작업량 불균형을 줄이면서 고정된 샘플 수를 유지합니다. TLive-Omni는 워커마다 동일한 시드를 사용해 같은 전역 배치를 선택한 뒤 이를 로컬 배치로 나눕니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



