본문으로 건너뛰기

WizardLM의 새로운 논문: 생성형 보상 모델을 위한 너비와 깊이의 시너지

WizardLM 연구팀이 생성형 보상 모델의 성능을 높이기 위해 작업 성격에 따라 추론의 너비와 깊이를 동적으로 조절하는 Mix-GRM 프레임워크를 발표했습니다.

실용적 조언

  • LLM을 평가자로 사용할 때 작업의 성격에 따라 프롬프트에서 다각도 분석 또는 단계별 검증 중 하나를 강조하는 것이 유리합니다

섹션별 상세

01
단순한 추론 길이 확장의 한계에 대해 논의합니다. 기존의 LLM-as-a-Judge 방식은 단순히 추론 과정을 길게 늘리는 데 집중해 왔습니다. 하지만 연구팀은 주관적인 선호도 판단과 객관적인 정답 확인 작업이 서로 다른 추론 구조를 필요로 한다는 점을 지적합니다. 주관적 작업은 다양한 측면을 살피는 너비가 중요하고, 객관적 작업은 논리적 단계를 밟는 깊이가 핵심입니다.
02
Mix-GRM 프레임워크와 너비 및 깊이의 조화를 설명합니다. 연구팀은 너비 중심의 추론(B-CoT)과 깊이 중심의 추론(D-CoT) 능력을 모두 갖춘 Mix-GRM 프레임워크를 설계했습니다. 이를 통해 모델은 대화의 톤이나 형식 같은 다차원적 요소와 수학 및 코드의 엄격한 연역적 검증을 동시에 수행할 수 있는 기반을 마련했습니다. 이는 단일한 추론 방식보다 훨씬 유연한 평가를 가능하게 합니다.
03
창발적 양극화 현상의 발견을 다룹니다. 강화학습(RLVR) 과정에서 명시적인 라우팅 레이블 없이 최종 판정 결과만으로 학습시켰음에도 불구하고 놀라운 현상이 나타났습니다. 모델 스스로 작업의 성격에 맞춰 너비 또는 깊이 우선 추론을 선택하는 비율이 95%에 달하는 '창발적 양극화' 현상이 관찰되었습니다. 이는 모델이 작업의 본질을 스스로 이해하고 최적의 전략을 선택함을 시사합니다.
04
연산 효율성과 성능의 균형에 대해 분석합니다. Mix-GRM은 단순히 토큰을 많이 소비하는 자기 일관성(Self-Consistency) 방식보다 훨씬 효율적입니다. 표준적인 단일 패스 추론과 비슷한 수준의 토큰을 사용하면서도, 구조적 최적화를 통해 더 높은 성능의 평가 능력을 보여주었습니다. 이는 실무 환경에서 비용 대비 효율적인 모델 운영을 가능하게 하는 중요한 성과입니다.

언급된 도구

Mix-GRM추천

너비와 깊이 추론을 결합한 생성형 보상 모델 프레임워크

RLVR중립

모델의 구조적 정렬을 위한 강화학습 기법

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 05.수집 2026. 03. 05.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.