본문으로 건너뛰기

프롬프트 캐싱으로 일관성 샘플링 비용 절감

긴 프롬프트를 반복 샘플링할 때 Prompt Caching이 비용을 6배에서 1.55~2.52배로 낮췄습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

동일한 약 21,000토큰 프롬프트를 여섯 번 샘플링해 답변 모순을 검사하는 작업은 Prompt Caching이 적용되면 단일 호출 비용의 1.55~2.52배로 줄어듭니다. 폐쇄형 비용 식은 캐시된 context 비율과 cache-write·cache-read 단가를 사용해 샘플링 비용을 계산하며, 실제 6개 모델 결과를 0.005 이내로 재현했습니다. 그러나 Together의 Qwen·Llama처럼 캐시 할인 단가가 없거나 Gemini처럼 짧은 context에서 캐시가 작동하지 않는 경우에는 비용이 6배로 유지됩니다. 같은 평가에서 정책이 답하지 않는 질문은 한 모델의 No-Yes 반복과 0.40 점수, 프롬프트에 없는 규정 인용으로 드러났고, 정책이 직접 답하는 질문은 모든 모델이 0.99 이상을 기록했습니다.

주요 논점

01찬성소수

Prompt Caching은 byte-identical한 긴 context를 반복 처리하는 Self-Consistency Sampling의 비용을 6배에서 단일 호출의 1.55~2.52배 수준으로 낮춥니다. 다만 cached input 가격이 공개되지 않았거나 캐시 임계값이 높은 provider에서는 비용 절감이 발생하지 않습니다.

합의점 vs 논쟁점

논쟁점

  • 캐시 적중률이 높아도 provider가 cached input에 할인 가격을 적용하지 않으면 실제 청구액은 줄지 않습니다. Together의 Llama 사례처럼 캐시 동작과 비용 할인은 별개의 조건입니다.
  • 측정 결과의 비용 절감은 약 21,000토큰의 긴 context와 반복되는 byte-identical 프롬프트에 집중됩니다. 짧은 입력이나 출력 토큰 비중이 큰 요청에 같은 배수를 적용할 수 없습니다.

실용적 조언

  • Self-Consistency Sampling을 운영 환경에 적용할 때는 반복 샘플의 system prompt와 context가 byte-identical하게 유지되는지 먼저 확인해야 합니다. 앞부분의 한 바이트라도 달라지면 이후 구간이 다시 계산돼 캐시 재사용 범위가 줄어듭니다. 실제 비용 산정에는 샘플 수뿐 아니라 cached input 가격, cache-write 가격, 출력 토큰 가격을 함께 넣어야 합니다.
  • provider를 선택할 때는 캐시 적중률만 보지 말고 cached input의 실제 청구 단가와 적용되는 최소 context 길이를 확인해야 합니다. 이 글의 사례처럼 Qwen과 Llama는 캐시 적중이 있어도 공개 할인 단가가 없어 6배 비용이 유지됐고, Gemini는 약 7,000토큰 이하에서 캐시가 작동하지 않았습니다. 긴 context를 반복 평가하는 경우에는 자신의 토큰 길이와 비용 상한을 폐쇄형 식에 대입해 샘플 수를 정하는 편이 안전합니다.

섹션별 상세

01
동일한 프롬프트를 여섯 번 샘플링해 답변 모순을 검사하는 방식은 기존에 샘플 수만큼 비용이 늘어난다는 문제가 있었습니다. 글 작성자는 약 21,000토큰 context를 사용해 6개 모델과 4개 provider의 비용을 측정했습니다. Prompt Caching이 적용된 경우 여섯 샘플의 비용은 단일 호출의 1.55~2.52배로, 단순한 6배보다 낮았습니다.
02
비용 계산은 캐시된 context 토큰 수와 캐시되지 않은 입력, 출력 토큰, 출력·입력 가격 비율을 변수로 둔 폐쇄형 식으로 정리됐습니다. 캐시가 전혀 없으면 비용 배수 M은 샘플 수 N과 같고, 모든 context가 재사용되면 캐시 쓰기 비용과 이후 캐시 읽기 비용의 합으로 내려갑니다. 이 식은 측정된 6개 모델의 결과를 0.005 이내로 재현했고, 비용 상한을 정하면 그 상한을 넘지 않는 context 크기도 역산합니다.
03
provider별 캐시 가격 정책은 비용 절감 폭을 결정하는 핵심 조건으로 남았습니다. Together의 Qwen과 Llama는 공개된 cached price가 없어 프롬프트의 99.4%가 캐시 적중돼도 비용이 6배 그대로였고, Gemini는 약 7,000토큰 이하에서 캐시가 작동하지 않았습니다. 따라서 이 결과는 긴 context와 바이트 단위로 동일한 반복 입력에 해당하며, 짧은 프롬프트와 긴 답변 조합에는 비용 변화가 없었습니다.
04
일관성 샘플링은 실제 오류도 포착했습니다. 원본 정책이 답하지 않는 질문에서 한 모델은 여섯 번 동안 No-Yes-No-Yes-No-Yes로 번갈아 응답해 noncontradiction 점수 0.40을 기록했고, 다른 모델은 프롬프트에 없는 규정을 인용했습니다. 정책이 직접 답하는 질문에서는 모든 모델의 점수가 0.99 이상이어서 질문 유형에 따른 판별 차이가 나타났습니다.

이미지 분석

동일한 프롬프트의 앞부분이 byte-identical하면 반복 샘플의 context가 캐시에서 제공되고, 질문에 해당하는 출력만 매번 새로 생성되는 구조입니다.
Diagram

도표는 첫 번째 cold sample에서 약 21,000토큰 context 전체가 정가로 계산되고 캐시가 기록되는 흐름을 보여줍니다. 이후 warm samples에서는 동일한 prefix가 약 90% 할인된 캐시 구간으로 처리되며, 여섯 샘플 중 5개가 이 경로를 사용하고 질문과 출력은 매번 full price로 계산됩니다. 따라서 반복 샘플링 비용이 6회 호출 전체가 아니라 캐시 쓰기 1회와 캐시 읽기 5회의 조합으로 낮아지는 원리를 시각화합니다.

동일한 프롬프트의 앞부분이 byte-identical하면 반복 샘플의 context가 캐시에서 제공되고, 질문에 해당하는 출력만 매번 새로 생성되는 구조입니다.

용어 해설

프롬프트 캐싱(Prompt Caching)
Prompt Caching은 이전 요청에서 처리한 입력 프롬프트의 일부를 저장한 뒤, 이후 요청의 앞부분이 바이트 단위로 동일하면 해당 구간을 다시 계산하지 않는 방식입니다. 긴 context를 반복 전송하는 비용과 지연을 줄이는 데 쓰입니다. 다만 캐시 적중 자체가 항상 할인으로 이어지는 것은 아니며, 제공업체의 cached input 가격 정책이 별도로 필요합니다.
Self-Consistency Sampling
Self-Consistency Sampling은 같은 프롬프트를 여러 번 실행하고 서로 다른 답변을 비교해 모델 응답의 일관성을 측정하는 방법입니다. 동일한 context와 질문을 반복 입력한 뒤 답변 간 모순 여부를 계산합니다. 샘플 수가 늘면 신뢰도 판단에 도움이 되지만, 일반적으로 추론 비용도 함께 증가합니다.
Prefix Caching
Prefix Caching은 요청의 앞부분인 prefix를 캐시해 다음 요청에서 해당 토큰을 재계산하지 않는 추론 최적화 방식입니다. 이 글에서는 여러 샘플이 동일한 프롬프트를 byte-identical하게 재전송하므로 긴 context 전체가 캐시 대상이 됩니다. 캐시 저장 비용과 재사용 가격이 적용될 때 전체 샘플링 비용이 크게 낮아집니다.
Noncontradiction Scoring
Noncontradiction Scoring은 동일한 질문에 대한 여러 모델 답변이 서로 모순되는지 측정하는 불확실성 평가 방식입니다. 반복 샘플의 답변을 비교해 일관성 점수를 계산하며, 정책이 답하지 않는 질문에서 응답 변동이나 근거 없는 인용을 포착할 수 있습니다. 이 글에서는 여섯 샘플의 응답 패턴으로 점수의 차이를 확인했습니다.

언급된 도구

UQLM추천

Self-Consistency Sampling 결과의 noncontradiction 점수를 계산하는 open-source uncertainty quantification library입니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.