본문으로 건너뛰기

개인화된 그룹 상대 정책 최적화(P-GRPO): 이질적인 선호도 정렬을 위한 새로운 프레임워크

다양한 사용자 선호도를 반영하기 위해 그룹별 보상 이력을 활용하여 보상을 정규화하는 P-GRPO 프레임워크를 제안한다.

섹션별 상세

01
기존의 RLHF 방식은 모든 사용자를 대상으로 하는 단일한 전역 보상 함수를 최적화하는 구조를 가진다. 이러한 방식은 사용자마다 서로 다른 가치관이나 취향을 가지고 있다는 사실을 충분히 반영하지 못하는 한계가 있다. 결과적으로 특정 그룹의 선호도에만 모델이 최적화되어 다른 사용자들의 요구사항을 충족하지 못하는 문제가 발생한다.
02
GRPO 프레임워크는 그룹 내 샘플들 사이의 상대적 보상을 비교하여 정책을 업데이트하는 온폴리시 강화학습 방식이다. 이 과정에서 사용되는 그룹 기반 정규화는 모든 데이터 샘플이 동일한 분포에서 추출되었다는 가정을 전제로 한다. 하지만 실제 환경에서는 사용자 그룹마다 보상 분포가 다르기 때문에 이러한 가정은 데이터의 이질성을 무시하는 결과를 초래한다.
03
데이터의 이질성을 고려하지 않는 정규화 방식은 다수의 사용자가 선호하는 답변에 학습 가중치가 쏠리는 편향을 유발한다. 이로 인해 소수 그룹이 보내는 중요한 선호 신호는 노이즈로 처리되거나 강력한 다수 신호에 의해 억제되는 현상이 나타난다. 이는 모델이 보편적인 답변만을 생성하게 만들며 개인화된 서비스 제공을 어렵게 만드는 주요 원인이 된다.
04
P-GRPO는 이점 추정 단계를 현재 배치의 통계치로부터 독립시키는 새로운 메커니즘을 도입한다. 기존 방식이 현재 생성된 그룹 내에서만 상대적 우위를 비교했다면 P-GRPO는 각 선호 그룹의 고유한 보상 특성을 별도로 관리한다. 이를 통해 서로 다른 보상 체계를 가진 그룹 간의 간섭을 최소화하고 각 그룹의 의도를 정확히 파악한다.
05
이 프레임워크는 각 선호 그룹별로 축적된 보상 이력을 바탕으로 이점을 정규화하여 대조 신호를 보존한다. 그룹별 보상 이력을 참조함으로써 현재 배치의 샘플이 해당 그룹의 기준에서 얼마나 우수한지를 객관적으로 평가할 수 있다. 이러한 접근은 다양한 선호도가 혼재된 상황에서도 각 신호를 선명하게 유지하며 학습 효율을 극대화한다.
06
다양한 벤치마크 작업에서 P-GRPO를 평가한 결과 표준 GRPO 대비 수렴 속도가 유의미하게 향상되었음이 확인됐다. 또한 최종적으로 도달하는 보상 수치 역시 더 높게 나타나 이질적인 선호 신호를 복원하는 능력이 탁월함을 입증했다. 이는 모델의 일반적인 성능을 저해하지 않으면서도 고도의 개인화를 달성할 수 있음을 시사한다.

용어 해설

그룹 상대 정책 최적화(GRPO)
그룹 내 샘플들 간의 상대적 보상을 비교하여 정책을 최적화하는 강화학습 기법이다. 별도의 가치 함수 네트워크 없이 그룹 통계를 활용해 이점을 추정하므로 계산 효율성이 높다. 하지만 모든 샘플이 동일한 분포를 가진다고 가정하여 이질적인 선호도 반영에 한계가 있다.
인간 피드백 기반 강화학습(RLHF)
인간의 선호도 데이터를 바탕으로 보상 모델을 학습시키고 이를 통해 언어 모델의 출력을 정렬하는 기술이다. 모델이 인간의 의도에 부합하는 답변을 생성하도록 유도하는 핵심적인 사후 학습 방법론이다. 주로 단일한 전역 보상 함수를 사용하여 다양한 개인의 취향을 반영하기 어렵다는 단점이 있다.
이점 추정(Advantage Estimation)
특정 행동이 평균적인 행동에 비해 얼마나 더 나은 성과를 냈는지를 수치화하는 과정이다. 강화학습에서 정책 업데이트의 방향과 크기를 결정하는 핵심 요소로 작용한다. P-GRPO에서는 이를 배치 통계가 아닌 그룹별 보상 이력과 연결하여 개인화된 정규화를 수행한다.
이질적 선호도(Heterogeneous Preferences)
사용자 집단 내에서 동일한 입력에 대해 서로 다른 가치 판단이나 선호가 존재하는 상태를 의미한다. 예를 들어 어떤 사용자는 간결한 답변을 선호하는 반면 다른 사용자는 상세한 설명을 선호할 수 있다. 이러한 차이를 무시하고 평균적인 선호도만 학습하면 특정 그룹의 만족도가 저하된다.
온폴리시 강화학습(On-policy RL)
현재 학습 중인 정책이 직접 환경과 상호작용하여 생성한 데이터를 즉시 학습에 사용하는 방식이다. 데이터의 최신성이 보장되지만 샘플 효율성이 낮을 수 있다는 특징이 있다. GRPO와 P-GRPO는 모두 이 방식을 채택하여 실시간 생성 결과를 바탕으로 모델을 정렬한다.

기술

  • GRPO
  • RLHF
  • P-GRPO

활용 사례

  • 개인화된 AI 비서
  • 다양한 문화권 대응 챗봇
  • 소수 사용자 그룹 맞춤형 서비스
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 02.수집 2026. 04. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.