본문으로 건너뛰기

가중 상호 정보량 데이터 선택을 통한 효율적인 RLVR 학습

LLM 강화학습에서 모든 데이터를 동일하게 학습하는 비효율을 해결하기 위해, 모델이 실제로 배울 것이 많은 데이터를 정교하게 골라내는 INSIGHT 프레임워크를 제안함. 이를 통해 학습 속도를 2.2배 높이면서도 수학 및 추론 성능을 유의미하게 개선함.

용어 해설

검증 가능한 보상이 있는 강화학습(RLVR)
수학 문제나 코드 실행 결과처럼 정답 여부를 명확히 확인할 수 있는 환경에서의 Reinforcement Learning임. 보상이 객관적이므로 모델의 추론 능력을 정밀하게 개선하는 데 필수적임.
에피스테믹 불확실성(Epistemic Uncertainty)
모델이 특정 데이터를 충분히 학습하지 못해 발생하는 지식의 결여를 의미함. 데이터를 더 많이 관찰함으로써 줄일 수 있으며, 효율적인 학습을 위해 우선적으로 해소해야 할 대상임.
상호 정보량(Mutual Information)
하나의 확률 변수를 관찰했을 때 다른 변수에 대해 얻게 되는 정보의 양을 측정함. 이 아티클에서는 보상을 관찰함으로써 모델의 성공률 예측이 얼마나 정확해지는지를 나타냄.
베타 분포(Beta Distribution)
0과 1 사이의 값을 가지는 확률 변수의 분포를 모델링하는 데 사용됨. 성공과 실패 횟수를 바탕으로 모델의 현재 성공 확률을 추정하는 베이지안 업데이트에 최적화된 도구임.
알레아토리 불확실성(Aleatoric Uncertainty)
데이터 자체의 난이도나 노이즈로 인해 발생하는 근본적인 무작위성을 의미함. 학습을 더 한다고 해서 줄어들지 않으며, 난이도 조절의 핵심 요소가 됨.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 02.수집 2026. 03. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.