본문으로 건너뛰기
HF Daily Papers조회 2

Visual-ERM: 시각적 동등성을 위한 리워드 모델링

기존의 텍스트 기반 지표나 단순 이미지 유사도 측정 방식은 차트나 표의 미세한 데이터 오류를 잡아내지 못해 AI가 보상을 속이는 '리워드 해킹'에 취약했습니다. 이 논문은 생성된 코드를 다시 이미지로 렌더링하여 원본과 직접 비교하는 시각적 보상 모델을 제안하여, AI가 실제 시각적 결과물까지 정확하게 생성하도록 유도합니다.

용어 해설

리워드 해킹(Reward Hacking)
강화학습에서 에이전트가 실제 목표를 달성하기보다 보상 함수(Reward Function)의 허점을 이용해 비정상적인 방식으로 높은 점수를 얻으려는 현상이다. 본 논문에서는 시각적으로는 틀렸지만 텍스트 유사도만 높은 코드를 생성하는 문제를 해결하고자 한다.
그룹 상대 정책 최적화(GRPO)
DeepSeek-V3 등에서 사용된 강화학습 알고리즘으로, 별도의 가치 모델(Critic) 없이 샘플 그룹 내의 상대적 보상을 비교하여 정책을 업데이트한다. 계산 효율성이 높고 학습 안정성이 뛰어나 대규모 언어 모델 학습에 널리 쓰인다.
테스트 타임 스케일링(Test-Time Scaling)
모델의 추론(Inference) 단계에서 더 많은 연산 자원이나 반복적인 사고 과정을 투입하여 결과물의 품질을 높이는 기법이다. 본 논문에서는 리워드 모델의 피드백을 바탕으로 코드를 여러 번 수정하는 자기 반성 루프를 의미한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 14.수집 2026. 03. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.