용어 해설
- 멀티모달 대형 언어 모델(Multimodal Large Language Model)
- — 이미지나 동영상 같은 시각 입력과 텍스트를 함께 처리하는 언어 모델입니다. 시각 Encoder가 입력을 특징 벡터로 바꾸고 언어 모델이 이를 텍스트 응답과 연결합니다. Video MLLM은 여러 프레임의 정보를 이용해 시간·공간 단위의 인식 작업을 수행합니다.
- 온폴리시 강화학습(On-Policy Reinforcement Learning)
- — 현재 정책이 직접 생성한 rollout을 사용해 정책을 갱신하는 강화학습 방식입니다. 같은 질의에서 여러 출력을 샘플링하고 보상 차이를 비교해 어떤 출력을 강화할지 결정합니다. 데이터가 현재 정책의 탐색 범위에 묶인다는 점이 핵심 특성입니다.
- 연쇄적 사고(Chain-of-Thought)
- — 모델이 최종 답변에 이르기까지 중간 추론 단계를 긴 텍스트로 생성하는 방식입니다. 각 rollout의 토큰 수가 늘어나 학습과 추론 비용이 커집니다. 이 논문은 정답 annotation을 직접 최적화 목표로 사용해 CoT 없이 여러 비디오 작업을 학습합니다.
- 어드밴티지 반전(Advantage Inversion)
- — 강화학습에서 평균보다 높은 보상을 받은 출력이 음의 advantage를 받는 현상입니다. 정답 rollout을 기존 rollout 집합에 섞으면 높은 정답 보상이 그룹 평균을 올려 이런 반전이 발생합니다. 결과적으로 강화해야 할 정책 출력을 억제할 수 있습니다.
- 부호 균형 가지치기(Sign-Balanced Pruning)
- — 강화 신호와 억제 신호에 해당하는 양수·음수 advantage rollout을 모두 남기는 선택 방식입니다. 각 부호에서 절댓값이 큰 rollout을 고르고 정답 oracle은 항상 보존합니다. 선택 뒤 평균과 크기를 보정해 업데이트 방향과 규모가 전체 집합에서 크게 달라지지 않게 합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
