본문으로 건너뛰기
r/LocalLLaMA조회 1

OpenCode의 로컬 추론 예산 설정

OpenCode와 llama.cpp에서 모델별 Reasoning Effort와 token budget을 조합해 로컬 추론량을 제한하는 설정입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 OpenCode에서 커스텀 llama.cpp 설정을 사용해 로컬 모델의 reasoning 강도와 토큰 사용량을 조절합니다. Qwen 3.8, DeepSeek V4, Glimmer에는 모델이 학습한 low·medium·high·xhigh·max 계열의 Reasoning Effort를 적용하고, Qwen 3.5와 3.6에는 token budget으로 추론 길이를 제한합니다. Qwen 3.8에는 effort 단계별 max reasoning-token cap을 추가하며, API가 CLI 기본값을 덮어쓸 수 있어 preserve_thinking과 예산을 호출 수준에서 조정합니다. reasoning을 대화 기록에 남기지 않는 xhigh-no-preserve도 제공하며, 작성자는 대부분 low reasoning을 사용합니다.

실용적 조언

  • Reasoning Effort를 지원하는 모델이라도 단계 이름만 선택하지 말고 effort별 max reasoning-token cap을 함께 두는 구성이 사용됩니다. 명시적인 effort 학습이 없는 Qwen 3.5와 3.6 계열에는 token budget을 직접 지정해 추론 길이를 제한합니다. 작성자는 실제 사용의 대부분에서 low reasoning을 선택한다고 밝혔습니다.
  • 추론 내용을 대화 기록에 남기고 싶지 않은 경우 xhigh-no-preserve 변형을 사용할 수 있습니다. 이 모드는 reasoning을 scratchpad로 활용한 뒤 conversation history에는 보존하지 않습니다. 긴 대화에서 reasoning 결과가 context window를 불필요하게 차지하지 않도록 할 때 쓰는 선택지입니다.

섹션별 상세

작성자는 Qwen 3.8, DeepSeek V4, Glimmer처럼 Reasoning Effort 단계가 학습된 모델에는 모델별로 low부터 max까지 제공되는 수준을 사용합니다. Qwen 3.5와 3.6처럼 reasoning은 지원하지만 명시적인 effort 학습이 없는 모델에는 별도의 token budget을 적용해 추론량을 제한합니다. 모델의 학습 방식에 따라 단계 선택과 토큰 상한을 다르게 두는 구성이 핵심입니다.
Qwen 3.8에는 기본 Reasoning Effort 단계가 있지만, 작성자는 각 단계에 max reasoning-token cap도 함께 설정합니다. llama.cpp CLI의 preserve_thinking과 기본 reasoning budget은 API 호출에서 덮어쓸 수 있으므로, CLI 기본값에만 의존하지 않고 API 수준에서 설정을 제어합니다. 추론 강도와 추론량을 별도 축으로 관리해 과도한 thinking이 요청마다 컨텍스트와 처리 자원을 잠식하는 상황을 줄이는 방식입니다.

이미지 분석

OpenCode에서 로컬 모델의 추론 수준과 reasoning 보존 방식을 설정한 화면 캡처입니다.
Screenshot

첨부 이미지는 게시물에서 설명한 로컬 모델 설정 구성을 시각적으로 보완하며, Reasoning Effort와 추론 토큰 제한을 조합하는 흐름과 연결됩니다. 특히 reasoning을 대화 이력에 남길지 선택하는 설정이 컨텍스트 사용량 관리와 이어진다는 점을 확인하는 자료입니다.

OpenCode에서 로컬 모델의 추론 수준과 reasoning 보존 방식을 설정한 화면 캡처입니다.

용어 해설

추론 노력 수준(Reasoning Effort)
모델이 답변 전에 수행하는 내부 추론의 강도를 조절하는 설정입니다. low, medium, high, xhigh, max처럼 단계별 값을 선택해 추론 토큰 사용량과 답변 품질 사이의 균형을 맞추며, 모델에 따라 지원하는 단계가 다릅니다.
토큰 예산(Token Budget)
추론 과정에 사용할 수 있는 토큰 수의 상한입니다. 명시적인 Reasoning Effort 학습이 없는 모델에서는 이 예산으로 내부 사고의 길이를 제한하며, 예산이 작을수록 컨텍스트와 처리 시간을 덜 사용합니다.
추론 보존 설정(preserve_thinking)
모델이 생성한 reasoning 내용을 대화 기록에 남길지 결정하는 설정입니다. 이를 비활성화하면 추론을 답변 작성용 scratchpad로만 사용하고 대화 이력에는 보존하지 않아, 이후 요청에 쓸 context window를 절약할 수 있습니다.
임시 추론 공간(Scratchpad)
모델이 최종 답변을 만들기 전에 중간 사고를 임시로 기록하는 공간입니다. xhigh-no-preserve 모드에서는 이 내용을 대화 기록에 추가하지 않고 현재 답변 생성에만 사용해 컨텍스트 소비를 줄입니다.
컨텍스트 윈도(Context Window)
모델이 한 번에 참조할 수 있는 입력과 대화 기록의 최대 범위입니다. reasoning을 대화 이력에 보존하면 이 공간을 더 많이 차지하므로, 긴 대화에서는 추론 보존 여부가 실제 사용 가능한 입력 길이에 영향을 줍니다.

언급된 도구

OpenCode중립

로컬 모델을 연결해 사용하는 코드 작업 환경의 설정 대상입니다.

llama.cpp중립

Reasoning Effort, preserve_thinking, reasoning budget 같은 로컬 추론 설정을 적용하는 실행 구성입니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.