본문으로 건너뛰기

언어 입력과 출력 압축에 따른 LLM의 행동

출력 압축은 정확도를 유지하며 API 비용을 평균 1.5배 낮췄지만 입력 압축은 비용과 정확도를 함께 악화시켰습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

CAVEWOMAN 연구는 입력 prompt를 줄이는 방식과 출력 길이를 줄이는 방식을 같은 질문과 여러 모델·데이터셋에서 비교했습니다. 출력 압축은 정확도를 대체로 유지하면서 API 모델 비용을 평균 약 1.5배, 최선의 경우 최대 3배 낮췄습니다. 반대로 입력 압축은 모델이 생략된 내용을 보충하려고 더 길게 답해 최악의 benchmark에서 비용을 최대 96% 높이고 정확도도 떨어뜨렸습니다. 정확한 축약 답변의 약 절반은 제약이 없을 때의 출력과 달랐지만, 최종 정답만 필요한 작업에서는 허용될 수 있습니다.

실용적 조언

  • 짧은 단일 턴 API 작업에서는 입력 prompt를 무작정 줄이기보다 출력 토큰 수를 제한하고 비용과 정확도를 함께 기록하는 편이 적절합니다.
  • 출력 압축을 적용할 때는 최종 정답의 정확도뿐 아니라 제약이 없을 때의 답변과 텍스트가 얼마나 달라지는지도 확인해야 합니다.
  • 다국어 서비스에서는 영어 결과만으로 판단하지 말고 실제 지원 언어별로 출력 길이, 비용, 정확도를 별도 측정해야 합니다.

섹션별 상세

01
CAVEWOMAN 연구는 같은 질문에 대해 입력 prompt를 줄이는 방식과 모델에게 더 짧게 답하도록 지시하는 방식을 다섯 단계의 압축 수준으로 비교했습니다. 비용, 정확도, 제약이 없을 때의 답변과 축약된 답변이 일치하는 정도를 측정했고, GPT-4o·GPT-5.4·Claude Haiku 4.5·Claude Sonnet 4.6·Qwen2.5-VL-7B·Qwen3.5-9B·DeepSeek-R1-Distill·Gemma-4-E4B·Kimi-K2.6을 대상으로 했습니다. 다섯 개의 short-answer 데이터셋, 10개 언어 출력, 장문 요약 실험까지 포함해 특정 모델이나 영어 작업에만 국한되지 않도록 구성했습니다.
02
discussion_points.push
03
출력 길이를 줄인 방식은 정확도를 대체로 유지하면서 API 모델 비용을 평균 약 1.5배 낮췄고, 가장 좋은 경우 최대 3배 저렴해졌습니다. 독일어·스페인어·프랑스어·스와힐리어·중국어·일본어·러시아어·벵골어·태국어·텔루구어에서도 같은 방향의 효과가 나타났습니다. 출력 토큰 단가가 입력 토큰보다 높기 때문에 짧은 단일 턴 작업에서는 답변 길이를 직접 제한하는 것이 비용 구조와 맞물려 작동했습니다.
04
discussion_points.push
05
입력 prompt를 줄이는 방식은 단순히 입력 토큰을 절약하지 못했고, 모델이 삭제된 내용을 보충하려고 더 긴 답변을 생성하면서 결과가 악화됐습니다. 최악의 benchmark에서는 비용이 최대 96% 증가했고 정확도도 떨어졌습니다. 따라서 입력을 잘라 문맥을 줄이는 방법은 출력 압축과 달리 비용과 품질을 동시에 해칠 수 있다는 결론으로 이어졌습니다.
06
discussion_points.push
07
출력 압축으로 생성된 답변이 정확한 경우에도 약 절반은 압축 제약이 없을 때 모델이 생성했을 텍스트와 일치하지 않았습니다. 이는 최종 정답만 필요한 작업에서는 문제가 아닐 수 있지만, 모델의 원래 추론 전개나 표현을 보존해야 하는 용도에서는 별도의 위험입니다. 제공업체가 concise 옵션의 내부 과금 방식을 공개하지 않는 상황에서도, 사용자가 API prompt를 직접 제어하면 출력 토큰 감소에 따른 비용 절감을 확인할 수 있다는 점이 핵심입니다.

용어 해설

출력 압축(Output Compression)
모델이 생성하는 출력 토큰 수를 줄이도록 제약하는 방법입니다. 답변의 길이를 제한해 API 사용량과 비용을 낮추지만, 정보 손실이나 모델의 추론 표현 변화가 발생할 수 있어 정확도와 함께 확인해야 합니다.
입력 압축(Input Compression)
모델에 전달하는 prompt의 일부를 줄여 입력 토큰을 압축하는 방법입니다. 입력 비용은 줄어들 수 있지만, 이 연구에서는 모델이 생략된 정보를 보충하려고 더 긴 답변을 생성해 전체 비용과 정확도가 악화되는 결과가 나타났습니다.
표면 텍스트 발산(Surface-Text Divergence)
압축 제약을 받은 답변이 제약 없이 생성했을 답변의 표현과 얼마나 다른지를 나타내는 기준입니다. 최종 답변이 맞더라도 모델이 원래 생성했을 문장과 달라질 수 있어, 정확도만으로 출력 압축의 영향을 판단하기 어렵게 만듭니다.
API 모델(API Models)
외부 서비스의 API를 통해 호출하고 토큰 단위로 비용을 지불하는 언어 모델입니다. 이 글에서는 출력 토큰 단가가 입력 토큰보다 높다는 전제 아래, 짧은 단일 턴 작업에서 출력 길이 제한이 비용 절감으로 이어지는지 비교했습니다.

언급된 도구

Claude Code추천

concise output style을 제공하는 코딩 에이전트

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.