본문으로 건너뛰기
HF Daily Papers조회 1

LEAD: 길이 기반의 적응적 동적 추론으로 대형 언어 모델의 길이 효율화

CoT 추론은 문제의 난이도와 무관하게 길이가 증가하는 경향이 있다. 고정된 길이 제어는 다양한 프롬프트의 요구를 모두 충족하지 못하고, 학습 진행에 따라 최적의 정확도-효율성 트레이드오프가 달라진다. LEAD는 온라인으로 보상 가중치를 조정하고 문제별 목표 길이를 추정해 불필요한 추론을 줄이면서도 정확도를 유지한다.

용어 해설

길이 기반 보상(Length-based Reward)
정답 여부와 별개로 출력 토큰 수를 줄이려는 목표의 보상 항목으로, 모델의 추론 길이를 제어하도록 설계된다.
그룹 정규화(Group Normalization)
다양한 보상의 스케일 차이를 완화하고, 보상 간 비교를 안정화하는 정규화 기법으로, 각 보상을 개별적으로 정규화한 뒤 합친다.
잠재적-스케일링 불안정성(Potential-Scaled Instability (PSI))
각 보상의 불안정성과 남은 여강(headroom)을 곱해 가중치를 온라인으로 조정하는 지표로, 정보성 있는 신호에 더 많은 학습 용량을 부여한다.
목표 길이(L*q*)(Target Length (L*q*))
정답 가능한 롤아웃에서 계산된 문제별 평균 길이로, 각 프롬프트의 적절한 추론 길이를 동적으로 설정하는 기준점이다.
문제별 보정(Per-Problem Calibration)
전역 예산 대신 각 프롬프트의 특성에 맞춰 목표 길이와 보상 구성을 조정하는 기법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 10.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.