용어 해설
- 의미 스펙트럼(Semantic Spectrum)
- — 이미지에 조건화된 MLLM의 토큰별 로그 우도 프로파일로, 각 프롬프트 토큰이 이미지에서 얼마나 잘 예측되는지를 토큰 단위로 수치화한다. 이미지-텍스트 정렬 능력을 직접 재활용해 토큰별 신호를 제공하고 이들의 평균을 보상으로 집계한다. 프롬프트 충실도와 국소적 의미 오류 검출에 핵심적인 역할을 한다.
- 교사 강제 순방향 추론(Teacher-Forced Forward Pass)
- — 이미지를 조건으로 MLLM에 입력한 뒤 프롬프트 토큰을 정답으로 강제 제공하면서 각 다음 토큰의 조건부 확률을 계산하는 순방향 연산 방식이다. 이 절차로 얻은 토큰 우도들이 의미 스펙트럼을 구성하며 추가 학습 없이 보상 신호로 사용된다. 계산 비용이 낮고 훈련 없이 즉시 적용할 수 있다.
- 자기 SpectraReward(Self-SpectraReward)
- — 통합 멀티모달 모델 내의 이해(읽기) 분기를 동일 모델의 생성(쓰기) 분기의 보상 모델로 사용하는 특수 사례로, 외부 보상 모델이나 추가 레이블 없이 폐쇄 루프 형식으로 정책을 개선한다. 토크나이저와 비전 인코더를 공유함으로써 보상과 정책 간 분포 정렬을 강화한다. 모델 내부의 정렬이 외부 대규모 보상기보다 더 효과적일 수 있음을 시사한다.
- 프롬프트 토큰 우도(Prompt-Token Likelihood)
- — 이미지 조건하에서 MLLM이 다음 프롬프트 토큰을 생성할 확률의 로그값을 의미하며, 각 토큰별로 계산된 값들이 의미 스펙트럼을 형성한다. 토큰 우도의 평균이 SpectraReward의 스칼라 보상으로 환산되어 RL 신호로 사용된다. 텍스트 우도는 그룹 내 비교에서는 상수 항이 되어 정규화가 불필요할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



