본문으로 건너뛰기

LLM의 추론 능력: RLVR은 정말 새로운 능력을 만드는가?

RLVR이 LLM의 근본적인 추론 한계를 넓히기보다 기존의 잠재적 능력을 더 효율적으로 추출하는 과정임을 입증한 논문을 심층 분석한다.

챕터별 상세

00:00

RLVR의 핵심 가설: 효율성 vs 능력

RLVR이 모델의 추론 한계를 넓히지 않는다는 가설을 검토했다. RLVR은 정답을 맞힐 확률이 높은 경로를 더 자주 선택하게 만드는 샘플링 효율성 개선에 집중한다. 실험 결과 Base 모델에서 충분히 많은 샘플을 뽑으면 RL 모델과 유사한 성능이 나타났다. 이는 RL이 새로운 지식을 주입하는 것이 아니라 기존 지식을 더 잘 꺼내게 함을 시사한다.

RLVR은 수학 문제나 코드 테스트처럼 정답 여부를 객관적으로 검증할 수 있는 보상을 사용하는 강화학습 기법이다.

02:36

RLVR과 기존 RLHF의 차별점

RLVR은 인간의 피드백에 의존하는 RLHF와 달리 이진화된 검증 가능 보상을 사용한다. RLHF는 보상이 조밀하고 복잡하지만, RLVR은 유닛 테스트 통과 여부나 수학적 정답 여부로 명확하게 결정된다. 토론자들은 RLVR이 모델의 예측 분포를 특정 정답 경로로 수렴시키는 과정임을 확인했다. 이 과정에서 모델의 엔트로피가 감소하고 특정 답변에 대한 확신이 강해진다.

RLHF는 인간의 선호도를 학습한 Reward Model을 사용하지만, RLVR은 코드 실행 결과 등 객관적 지표를 보상으로 쓴다.

11:26

Pass@K 지표를 통한 능력 검증

Pass@K 곡선을 분석하여 Base 모델과 RL 모델의 성능 차이를 비교했다. K(샘플 수)가 작을 때는 RL 모델이 압도적이지만, K가 커질수록 Base 모델의 성능이 RL 모델을 추월하거나 일치하는 현상이 발견됐다. 이는 Base 모델이 이미 정답을 알고 있었으나 확률이 낮아 샘플링되지 않았을 뿐임을 증명한다. 반면 Distillation을 거친 모델은 K 값과 상관없이 Base 모델보다 높은 성능 한계를 보였다.

Pass@K는 K개의 샘플을 생성했을 때 그중 하나라도 정답일 확률을 나타내는 평가지표다.

19:31

Perplexity 분석과 정답 경로의 성격

RL 모델이 생성한 정답 경로의 Perplexity를 Base 모델 기준으로 측정했다. RL로 학습된 정답 경로들이 Base 모델의 분포 내에 존재하며, Base 모델 입장에서 특별히 '놀라운' 경로가 아님이 확인됐다. 이는 RL이 모델이 전혀 생각지 못한 새로운 논리 전개를 만들어내는 것이 아님을 뒷받침한다. 모델은 이미 가능한 경로들 사이에서 보상에 따라 가중치를 재배치할 뿐이다.

Perplexity는 모델이 특정 텍스트 시퀀스를 얼마나 예측하기 어려워하는지를 나타내는 척도다.

31:19

Distillation과 지식 주입의 메커니즘

토론자들은 모델에 새로운 능력을 부여하는 유일한 방법으로 Distillation을 꼽았다. 더 강력한 모델(Teacher)이 생성한 고품질 추론 로그를 학습함으로써 Base 모델의 한계를 넘어서는 지식을 주입할 수 있다. RLVR은 이 과정을 가속화하거나 최적화할 수는 있지만, 데이터에 없는 새로운 논리 구조를 스스로 창조하지는 못한다. 따라서 고성능 모델 구축을 위해서는 양질의 데이터 증강과 Distillation이 필수적이다.

Distillation은 상위 모델의 출력값을 하위 모델이 학습하여 성능을 전이받는 기법이다.

46:34

반론: RL이 새로운 능력을 깨우는 경우

Nvidia의 ProRL 논문 등 반대되는 연구 결과에 대해 토론했다. 특정 어려운 과제(Dice task 등)에서는 Base 모델의 성공 확률이 0에 가깝더라도 RL 학습을 통해 성능이 유의미하게 향상되는 경우가 보고되었다. 이는 학습 시간이 충분히 길고 과제가 특정 조건에 부합할 경우 RL이 잠재력을 넘어선 새로운 조합을 찾아낼 가능성을 시사한다. 하지만 일반적인 벤치마크에서는 여전히 '효율성 개선' 관점이 지배적이다.

ProRL 논문은 RL 학습이 모델의 추론 경계를 실제로 확장할 수 있다는 증거를 제시한 연구다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 01. 15.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.