본문으로 건너뛰기

토큰 예산 인지형 LLM 추론

프롬프트에 토큰 예산을 명시하고 문제 복잡도에 따라 추론 토큰을 동적으로 조절해 CoT의 토큰 사용량을 줄였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Chain-of-Thought는 정확도를 높이지만 중간 단계 생성이 많은 토큰을 소비해 비용이 커진다. 본 논문은 프롬프트에 토큰 예산을 포함하고 문제 난이도에 따라 추론 토큰 수를 동적으로 할당하는 프레임워크를 도입해 출력 길이를 압축한다. 실험에서는 토큰 비용을 의미 있게 줄이는 한편 성능 저하는 작게 유지되어 비용과 정확도 사이의 실용적 균형을 제시한다.

섹션별 상세

현재 Chain-of-Thought 기반 추론은 문제를 단계별로 분해해 정확도를 높이지만 생성되는 중간 단계가 많은 토큰을 소비해 비용과 지연을 키우는 문제가 있다. 논문은 프롬프트에 합리적 토큰 예산을 포함하면 추론 길이를 압축할 수 있다는 관찰에서 출발한다. 또한 동일한 예산이라도 선택 방식에 따라 압축 효과가 크게 달라지므로 예산을 고정하지 않고 문제 난이도에 따라 조절해야 한다고 주장한다.
저자들은 문제별 난이도를 반영해 추론 토큰 수를 동적으로 조정하는 Token-Budget-Aware LLM Reasoning 프레임워크를 도입했다. 입력으로는 원래 질의와 예산 지시가 결합된 프롬프트가 들어가며 내부적으로는 각 문제의 복잡성에 맞춰 허용되는 추론 토큰을 할당한 뒤 모델이 그 범위 내에서 중간 단계와 답을 생성하도록 유도하는 방식이다. 이 과정은 프롬프트 수준에서 토큰 길이를 제어해 출력의 길이·구조를 압축하는 방식이며, 설계 목표는 비용 감소와 정확도 유지의 균형이다.
실험 결과는 CoT 기반 추론에서 토큰 비용을 효과적으로 줄이는 대신 성능 저하는 미미하다는 점을 보였다. 논문 초록은 실험을 통해 비용 감소 효과와 작은 성능 손실이 관찰되었다고 기술하며 구현 코드를 공개하고 있다. 이러한 절충은 대규모 추론 비용이 중요한 실제 서비스에서 효율성과 정확도를 함께 고려하는 실용적 대안이 된다고 볼 수 있다.

용어 해설

연쇄 사고(Chain-of-Thought)(Chain-of-Thought (CoT))
Chain-of-Thought은 복잡한 문제를 중간 추론 단계로 분해해 LLM이 단계별로 사고하도록 유도하는 프롬프트 기법이다. 중간 단계 생성은 정답률을 높이는 경향이 있으나 각 단계가 토큰을 소비해 추론 비용과 지연이 증가한다. 본 논문은 이 토큰 소비를 줄이면서 CoT의 장점은 유지하려는 관점에서 출발한다.
토큰 예산(Token Budget)
토큰 예산은 한 요청에서 추론을 위해 허용되는 토큰 수의 한계값을 의미한다. 프롬프트에 예산을 명시하면 모델의 생성 길이를 제한하거나 압축된 추론을 유도할 수 있으며, 예산 선택은 성능과 비용 사이의 균형에 직접적인 영향을 미친다. 논문은 예산을 문제 난이도에 맞춰 동적으로 할당하는 접근을 연구한다.
추론 토큰(Reasoning Tokens)
추론 토큰은 LLM이 중간 사고 단계와 최종 답안을 생성하는 데 사용되는 출력 토큰을 뜻한다. 이 토큰 수가 늘어날수록 CoT의 자세한 사고 과정을 얻을 수 있지만 비용과 응답 지연이 증가한다. 논문은 문제별로 추론 토큰 수를 조정해 불필요한 토큰 소비를 줄이는 방식을 중심으로 연구를 수행했다.

근거 모음

근거
  • 제안한 프레임워크는 Chain-of-Thought 추론에서 토큰 비용을 유의하게 줄이면서 성능 저하는 미미하게 유지한다. 초록에서 실험 결과가 '토큰 비용을 효과적으로 줄이면서 작은 성능 저하'를 보고하고 있고 코드가 공개되었음. 출처

기술

  • Chain-of-Thought (CoT)
  • Prompt engineering
  • Large language models (LLMs)

활용 사례

  • CoT를 사용하는 QA·추론 서비스에서 요청당 토큰 비용을 줄여 운영 비용을 낮추는 경우에 적용 가능하다.
  • 대량의 자동화된 추론이 이뤄지는 백엔드 파이프라인에서 응답 길이를 제어해 처리량과 비용을 동시에 개선하려는 상황에 적합하다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 06.수집 2026. 08. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.