본문으로 건너뛰기

다양한 모델의 협력으로 라벨 없는 추론 학습

Co-RL은 서로 다른 모델의 다수결 답변을 교차 보상으로 사용해 정답 라벨 없이 LLM과 VLM의 추론 성능을 높인다.

용어 해설

검증 가능한 보상(Verifiable Reward)
모델의 응답이 정답이나 외부 검증 기준을 충족하는지에 따라 부여하는 강화학습 보상이다. Co-RL은 이런 정답 라벨이나 외부 검증기 없이 다른 모델의 다수결 결과를 보상 신호로 사용한다.
자기 보상 강화학습(Self-rewarding RL)
모델이 자신의 여러 응답, 확률 분포, 자기 일관성 등을 이용해 보상을 직접 만드는 강화학습 방식이다. 모델의 판단만 반복해서 사용하기 때문에 기존 편향과 오류가 강화되고 응답이 획일화될 위험이 있다.
GRPO
별도의 critic 모델 없이 같은 프롬프트에서 생성한 여러 응답의 보상을 그룹 안에서 정규화해 상대적 advantage를 계산하는 정책 최적화 방법이다. Co-RL은 각 모델의 응답을 동료 모델의 다수결 보상과 결합해 GRPO를 수행한다.
의사 라벨(Pseudo-label)
사람이 직접 부여한 정답 라벨 대신 모델의 예측을 이용해 만든 학습 목표다. Co-RL에서는 한 동료가 생성한 K개 답변에서 가장 많이 나온 답을 다른 동료의 의사 라벨로 삼는다.
상관된 오류(Correlated Errors)
서로 다른 모델이 같은 문제에서 동일한 오답을 내는 현상이다. 모델군이 비슷할수록 이런 오류가 겹칠 가능성이 커지므로 Co-RL은 모델 family, 크기, 입력 표현을 달리해 상관된 오류를 줄인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.