본문으로 건너뛰기

LLM 추론을 언제 멈출지 정하는 원칙

LLM이 낮은 성공 가능성의 추론을 토큰 생성 중 중단하도록 value function과 abstention reward를 결합한 연구입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Chain-of-thought reasoning을 사용하는 LLM은 정답 가능성이 낮은 추론도 긴 응답으로 이어가며 계산 자원을 소모할 수 있습니다. 이 연구는 답변 생성 전후가 아니라 토큰 생성 중에도 abstention을 선택하도록 하고, 현재 추론 상태의 value function이 abstention reward보다 낮아지는 순간 생성을 멈추게 합니다. 이 규칙은 정규화 강화학습 안에서 계산량과 정보 획득의 균형을 다루며, value function을 효율적으로 근사하는 방법으로 실제 적용 비용을 낮춥니다. 수학적 reasoning과 toxicity avoidance 실험에서 기존 방법보다 selective accuracy가 향상됐지만, 원문에는 정확한 수치가 제시되지 않았습니다.

빠른 이해

새로운 점

생성 전후에만 답변을 거부하던 abstention을 토큰 생성 중의 행동으로 formalize하고, value function과 abstention reward의 비교로 중단 규칙을 정립했습니다.

핵심 메커니즘

LLM이 토큰별로 reasoning trace를 생성하면 근사 value function이 현재 상태의 기대 가치를 계산하고, 그 값이 abstention reward보다 낮을 때 답변 생성을 중단합니다. 정규화 강화학습은 생성 지속과 abstention을 함께 행동 공간에 넣어 계산량과 정보 획득의 균형을 학습하며, 수학적 reasoning과 toxicity avoidance 과제에서 선택적 정확도를 평가합니다.

섹션별 상세

01

긴 추론을 중간에 멈추는 문제

Chain-of-thought reasoning을 사용하는 LLM은 정답 가능성이 낮은 추론을 긴 응답으로 계속 생성하면서 계산 자원을 소모할 수 있습니다. 기존 abstention 방식은 생성 전이나 생성 후에 답변을 거부하지만, dynamic mid-generation abstention은 각 토큰 위치에서 현재 reasoning trace를 계속할지 중단할지 결정합니다. 연구진은 이 중단을 단순한 경험적 규칙이 아니라 모델이 선택하는 명시적 행동으로 취급하기 위해 정규화 강화학습 틀에 넣었습니다. 따라서 모델은 답변을 계속 생성하는 행동과 abstention하는 행동 사이에서 계산량과 정보 획득의 균형을 학습합니다.
02

보상 기준으로 중단 시점을 정하기

연구의 핵심은 abstention reward라는 보상 매개변수로 추론 지속과 중단의 교환 관계를 조절하는 데 있습니다. 현재 추론 상태의 value function이 이 보상보다 낮아지면 추가 토큰 생성에서 얻을 기대 이익이 중단보다 작다고 판단해 생성을 끝냅니다. 연구진은 이 규칙이 일반적인 조건에서 자연스러운 기준선보다 엄격하게 우수하다는 이론적 결과를 도출했습니다. 또한 실제 추론에 적용할 수 있도록 value function을 효율적으로 근사하는 방법을 마련해 매 토큰 위치의 판단 비용을 줄였습니다.
03

수학 추론과 유해성 회피에서 검증

제안한 framework는 수학적 reasoning과 toxicity avoidance 과제에서 기존 방법과 비교됐습니다. 실험은 낮은 성공 가능성을 가진 reasoning trace를 중간에 제거하는 방식이 답변을 선택하는 기준을 개선할 수 있음을 뒷받침했습니다. 특히 연구 결과는 이론에서 정한 value function과 abstention reward의 관계가 selective accuracy 향상으로 이어지는지 확인하는 데 초점을 맞췄습니다. 다만 원문에는 과제별 정확도, 계산량 감소율, 비교 기준선의 구체적인 수치가 포함되지 않아 개선 폭은 정량적으로 판단하기 어렵습니다.

용어 해설

동적 중단(Dynamic Abstention)
LLM이 추론을 끝까지 생성하지 않고 토큰을 생성하는 중간에 성공 가능성이 낮은 reasoning trace를 중단하는 방법입니다. 계산량을 줄이는 대신 답변을 내놓지 않는 선택을 허용해 정확도와 정보량 사이의 균형을 조절합니다.
가치 함수(Value Function)
현재까지 진행된 추론 상태에서 앞으로 얻을 것으로 예상되는 보상을 나타내는 함수입니다. 연구에서는 이 값이 abstention reward보다 낮아지는 순간 생성을 멈추도록 규칙을 정하고, 계산 지속과 중단 중 어느 선택이 더 유리한지 판단하는 기준으로 사용합니다.
정규화 강화학습(Regularized Reinforcement Learning)
행동에 따른 보상만 최대화하지 않고 정규화 항을 함께 적용해 학습 결과의 안정성과 정책의 성질을 조절하는 강화학습 방식입니다. 이 연구에서는 답변 생성과 abstention을 모두 행동으로 포함해 추론 중단의 비용·정보 균형을 수학적으로 다룹니다.
선택적 정확도(Selective Accuracy)
모델이 모든 입력에 답하지 않고 확신이 낮은 사례를 거부했을 때, 답변을 선택한 사례에서 얼마나 정확한지를 나타내는 평가 관점입니다. 동적 중단에서는 낮은 품질의 긴 reasoning trace를 제거해 계산량을 관리하면서 선택된 답변의 정확도를 비교합니다.

기술

  • LLMs
  • chain-of-thought reasoning
  • dynamic abstention
  • regularized reinforcement learning
  • value function
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 15.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.