TL;DR
추론 비용은 입력 토큰과 출력 토큰 양쪽에 의존하며 출력 토큰의 단가가 보통 더 높다. 같은 항목에서 입력 축약과 출력 축약을 비교하면 실제 청구액(realized cost)과 생성 텍스트의 의미적 일치가 서로 다르게 움직여 배포 의사결정에 직접적인 영향을 준다.
왜 중요한가
추론 비용은 입력 토큰과 출력 토큰 양쪽에 의존하며 출력 토큰의 단가가 보통 더 높다. 같은 항목에서 입력 축약과 출력 축약을 비교하면 실제 청구액(realized cost)과 생성 텍스트의 의미적 일치가 서로 다르게 움직여 배포 의사결정에 직접적인 영향을 준다.
핵심 기여
두 채널을 동시 측정하는 평가 프로토콜
Condition A(입력 압축)와 Condition B(출력 제약)를 동일한 항목에서 비교하는 Cavewoman 프로토콜을 도입했다. 각 생성에 대해 작업 정확도, 항목별 실현 비용, 그리고 모델의 무제약(L0) 생성과의 참조-텍스트 일치를 bidirectional NLI 등 12개 보조 지표로 평가한다.
입력·출력 채널의 비용 비대칭성 정량화
8개 모델과 5개 벤치마크에서 출력 압축이 API 모델 대부분과 공개 가중치 모델에서 실현 비용을 1.4–2.4×(최대 3×) 줄이는 반면, 동일 수준의 입력 압축은 보상적 출력 확장으로 인해 평균 ≈1.15× 비용 증가(최대 1.8× 개별 데이터셋, 더 강한 압축에서 2.7×)를 초래함을 보고했다.
표면 텍스트와 정확도의 탈동조 측정
L1 출력 제약에서 비추론(non-reasoning) 모델 패널을 기준으로 생성의 51.9%가 정답이면서도 무제약(L0) 생성과의 표면-텍스트 일치(entailment)를 상실함을 발견했다. 길이 일치 재채점(length-matched re-scoring)에서는 이 비율이 80.4%로 증가해 표면 텍스트와 정답이 독립적으로 변할 수 있음을 보였다.
광범위한 모델·데이터셋 적용과 견고성 검증
Qwen2.5-VL-7B, Qwen3.5-9B, DeepSeek-R1-Distill-Qwen-7B, Gemma-4-E4B, GPT-4o, GPT-5.4, Claude Haiku 4.5, Claude Sonnet 4.6 등 8개 모델을 GSM8K, BoolQ, ARC-Easy, CommonsenseQA, MMLU-STEM에서 L0–L4로 평가하고 LLMLingua-2, 여러 의미 판정기, 통계 보정으로 결과의 재현성과 강건성을 검증했다.
핵심 아이디어 이해하기
대형 언어 모델의 추론 비용은 입력과 출력 토큰 수에 비례하며, 서비스 요금제에서는 출력 토큰의 단가가 보통 입력보다 4–8배 높다. 따라서 동일한 토큰 수 절감이라도 어느 채널을 축소하느냐에 따라 실질 청구액이 달라진다.
입력 압축은 질문에서 function-word나 문장구조를 제거해 입력 토큰을 줄이지만 모델이 부족한 정보를 보완하려고 더 긴 출력을 생성하는 보상적 거동을 보인다. 출력 토큰의 단가가 높으므로 이 보상적 출력 증가는 입력 토큰 절감으로 얻은 이득을 상쇄하거나 역전시켜 전체 실현 비용을 올린다.
출력 제약은 모델에게 더 짧고 telegraphic한 응답 레지스터를 강제해 실제 청구되는 출력 토큰을 줄인다. 이 방식은 비용을 절감하지만, 모델의 무제약 생성(L0)에서 보인 표면적 표현(surface text)과의 일치를 훼손할 수 있다. 결과적으로 정확도(정답 여부)는 유지되는 경우가 많지만 모델이 원래 문장으로 표현한 추론흐름과 표면 형태는 분리될 수 있다.
따라서 '토큰 수만 줄이면 비용이 내려간다'는 단일 지표 접근은 오도한다. 실용적 비용 설계는 어떤 채널을 압축할지, 압축 후 출력의 의미적 일관성(감시·감사 로그 필요성 여부)을 함께 고려해야 한다.
방법론
전체 접근: 동일 모델 ℳ와 동일 문항 x에 대해 두 지점에서 동일한 품사 기반 필터 φ_ℓ을 적용한다. Condition A는 사용자 메시지를 φ_ℓ로 전처리해 모델에 입력하고 시스템 프롬프트는 중립으로 유지한다(입력 압축). Condition B는 질문은 보존하되 시스템 프롬프트로 출력 레지스터를 φ_ℓ와 같은 수준으로 제한한다(출력 제약). 각 레벨 L0–L4은 보존할 품사군과 토큰 예산(max_new_tokens={400,300,200,150,20})으로 정의된다.
관련 Figure

다이어그램은 Condition A(입력 압축)가 사용자 질문을 POS 필터 φ_ℓ로 전처리해 모델에 전달하는 반면, Condition B(출력 제약)는 질문을 보존하고 시스템 프롬프트로 생성 레지스터를 제한함을 시각적으로 정리한다. 이 구조가 실험 설계의 핵심이며 동일 항목에서 두 채널을 비교하는 근거가 된다.
Cavewoman의 두 채널 파이프라인 도식(입력 압축 vs 출력 제약)을 나타낸 다이어그램.
주요 결과
메인 결과(Finding 1): 출력 압축은 API 모델 다수와 공개 가중치 모델에서 실현 항목별 비용을 평균 1.4–2.4× 절감했고, 최적 셀에서는 최대 3× 절감이 관찰됐다. 반대로 동일한 수준의 입력 압축은 모델의 보상적 출력 확장으로 인해 평균 ≈1.15× 비용 증가를 유발했고, 개별 데이터셋에서는 최대 1.8×, 더 강한 압축(L4 등)에서는 최대 2.7×까지 비용이 증가했다.
표면 텍스트 탈동조(Finding 2): L1 출력 제약에서 비추론 모델 패널의 생성 중 51.9%가 정답이면서도 L0 동일-채널 생성과의 bidirectional NLI entailment를 잃었다. 길이 일치 재채점 시 이 비율은 80.4%로 증가해 단순한 길이 차이로는 설명되지 않는 표면적 불일치가 존재함이 확인됐다.
추가 분석: LLMLingua-2 학습 기반 압축과 여러 보조 의미 판정기에서 결과가 재현되었고, 통계적 유의성은 Wilcoxon signed-rank 테스트 및 Benjamini–Hochberg 보정 후에도 유지됐다. 또한 일부 관찰치(예: MMLU-STEM의 겉보기 성능 개선)는 응답 추출률(answer-extraction-rate) 회복에 기인한 것으로 분리하여 보고했다.
관련 Figure

이 그림은 입력 압축이 레벨이 깊어질수록 정확도를 급격히 떨어뜨리는 반면 출력 제약은 많은 모델에서 정확도를 더 잘 유지하는 경향을 보인다는 본문 주장의 근거가 된다. 결과적으로 출력 제약에서 정확도 유지가 비용 절감으로 이어지는 경우가 많다.
모든 모델·벤치마크에 대한 레벨별 정확도 바 플롯(입력 압축은 실선, 출력 제약은 해치드).

히트맵은 동일한 압축 수준에서 두 채널이 반대 방향으로 비용을 이동시킨다는 점을 강조한다: 출력 채널은 녹색(비용 감소), 입력 채널은 적색(비용 증가)으로 대체로 구분된다. 이는 실험의 핵심 정량 근거(Finding 1)와 직접 연결된다.
입력 채널(왼쪽)과 출력 채널(오른쪽)에서 L1–L4의 실현 비용 변화(Δcost vs L0)를 히트맵으로 표시한 그림.

이 그림은 C1(정확+일치), C2(정확+불일치), C3(오답+일치), C4(오답+불일치)로 분할된 분포를 보여주며, 비추론 모델에서 C2 비중이 크다는 점이 Finding 2의 시각적 근거다. 즉 정답이면서도 L0 생성과 표면적으로 일치하지 않는 사례가 다수 존재함을 시사한다.
L1 출력 제약에 대한 모델별 2×2 dissociation(정확도 vs 참조-텍스트 일치) 누적 막대그래프.
기술 상세
아키텍처·파이프라인: 실험은 채팅 템플릿(시스템 프롬프트 + 사용자 메시지)에 대해 단일 결정적 spaCy 품사 태깅을 사용해 입력을 필터링하거나(Condition A) 레벨별 시스템 프롬프트로 출력 레지스터를 강제하는(Condition B) 두 채널을 구성했다. 각 항목은 L0–L4로 처리되며 동일 항목에서 두 채널을 비교했다.
핵심 메커니즘·수식: 항목별 실현 비용은 C = n_in p_in + n_out p_out로 계산된다. 즉, 입력 토큰 수 n_in과 출력 토큰 수 n_out에 각각 단가 p_in, p_out을 곱해 더한다 → 이 합이 항목별 청구액 C가 된다 → 토큰 절감은 반드시 C 감소로 이어지지 않으며 출력 토큰이 더 비싼 경우 출력 확장은 C를 증가시킨다. 이 수식은 입력 절감과 출력 보상 사이의 정량적 경쟁을 설명한다.
평가 지표·판정기: 작업 정확도는 정규표현식 기반 추출과 숫자 허용치(0.01)를 적용했고, 참조-텍스트 일치는 DeBERTa 기반 bidirectional NLI를 헤드라인 기준으로 사용했다. 추가로 11개의 보조 의미적 기준을 병행해 강건성을 확보했다. L4는 출력 제약에서 응답만 요구하므로 참조-텍스트 평가는 제외됐다.
데이터·모델·세부 설정: GSM8K, BoolQ, ARC-Easy, CommonsenseQA, MMLU-STEM을 사용해 총 11,465개 항목을 평가했다. max_new_tokens는 L0–L4에서 {400,300,200,150,20}으로 고정했다. 모델별로 DeepSeek-R1의 숨겨진 토큰과 Qwen3.5의 선택적 thinking 모드 같은 구현 세부가 비용 산정에 영향을 줄 수 있음을 명시했다.
한계점
Bidirectional NLI 판정기는 표면 텍스트 일치(surface-text)만 측정하며 절대적 프로포지셔널(명제적) 보존을 의미하지 않는다. L0-A/L0-B 사이의 시스템 프롬프트 차이가 만든 노이즈 플로어를 완전히 분리하지 못했다. 사용한 5개 벤치마크는 모두 짧고 구조화된 정답(숫자·불리언·MCQ)에 한정되며 장문 생성이나 요약과 같은 작업에는 결과를 일반화하지 못한다. 실험은 greedy decoding으로만 수행되었고 샘플링 기반 디코딩은 범위 밖이다. 두 개의 API 공급자, 8개 모델로 구성된 패널이므로 공급자·가족 수준 결론은 내리지 않았다.
실무 활용
프로토콜과 코드는 GitHub에 공개되어 있어(https://github.com/danielle34/cavewoman) 모델 선택과 비용 최적화 의사결정에 바로 적용 가능하다. 특히 출력 중심의 제약을 도입하면 실질 청구액을 낮추면서도 최종 정답을 보존할 수 있는 설정을 빠르게 식별할 수 있다.
- API 기반 서비스에서 응답 길이를 줄여 추론 비용을 절감하려는 경우, 출력 제약(Condition B) 수준을 모델별로 검증해 비용-정확도 트레이드오프를 최종 결정한다.
- 감사·트랜스크립트가 필요한 시스템에서 표면 텍스트 일관성이 중요한 경우, 출력 압축 도입 전 L0 대비 bidirectional NLI 기반 일치율을 검증해 감사 요건 충족 여부를 판단한다.
- 온프레미스 공개 모델을 공공요금 체계로 운영할 때 출력 제약이 공개 가중치 모델에서 비용 절감 효과를 내는지 검증해 호스팅 비용 산정에 반영한다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Bidirectional NLI
- — 한 텍스트가 다른 텍스트의 명제적 내용을 함축(entail)하는지 양방향으로 판정하는 방식이다. 본문에서는 L0(무제약) 생성과 압축 생성 사이의 'surface-text' 일치 여부를 판정하는 보수적 기준으로 사용되어, 문장 형태 대신 의미적 일관성을 검증하는 기준으로 작동한다.
- POS-tag filter
- — spaCy의 Penn Treebank 품사 태그로 질문을 필터링하는 결정적 규칙 집합이다. L1~L4의 각 레벨이 보존하거나 제거할 품사군을 정의해 입력 또는 출력 레지스터를 축약하는 데 사용된다.
- Realized cost
- — 모델에 청구되는 실제 항목별 비용으로, 입력 토큰 수·출력 토큰 수와 각 토큰의 단가를 곱해 합산한 값이다(C = n_in p_in + n_out p_out). 토큰 절감이 비용 절감으로 이어지는지 여부는 이 값으로 판단한다.
- Answer-extraction rate
- — 생성된 텍스트에서 정답을 정규표현식 등으로 추출해낼 수 있는 비율이다. 낮은 추출률은 '파서 복구'로 인한 겉보기 성능 향상을 유발할 수 있어 정확도 해석에 영향을 준다.
- Surface-text divergence
- — 압축된 생성의 표면 형태가 동일 항목의 무제약(L0) 생성과 어휘·구문 수준에서 일치하지 않는 현상이다. 본문에서는 Bidirectional NLI를 통해 '정답은 맞지만 표면 텍스트가 더 이상 L0와 함축 관계가 아니다'인 경우를 수치화했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.