본문으로 건너뛰기
Databricks Blog조회 1

Databricks, 오픈소스 모델에 프롬프트 캐싱 지원 시작

Databricks가 오픈소스 모델에 프롬프트 캐싱을 적용하여 별도 설정 없이 추론 지연을 3배 줄이고 처리량을 2.5배 향상했다.

섹션별 상세

LLM 추론 시 반복되는 프롬프트 접두사를 매번 처리하는 것은 컴퓨팅 자원 낭비와 지연의 원인이다.
프롬프트 캐싱은 동일한 접두사를 해시 키로 저장하고 이후 요청에서 캐시를 조회하여 토큰 계산 과정을 생략한다.
Databricks는 GPT-OSS, Gemma 3, Llama 3.1/3.3 등 주요 오픈소스 모델에 이 기능을 자동 적용했다.
실제 프로덕션 환경에서 30%의 캐시 적중률만으로도 처리량 2.5배 증가와 지연 시간 3배 감소라는 성능 개선을 확인했다.
프롬프트 캐싱 적용 전후의 시스템 처리량과 지연 시간 비교 차트.
Chart프롬프트 캐싱 도입 시 처리량(toks/sec)은 증가하고 p50 지연 시간(sec)은 감소하는 성능 향상 효과를 시각적으로 보여준다.
근거
  • GPT-OSS 모델 적용 결과, 입력 토큰 처리량이 2.5배 증가하고 P50 지연 시간이 3배 감소했다. Real-World Impact: batch inference on GPT OSS 섹션
보안을 위해 캐시는 휘발성 메모리에만 격리 저장되며 영구 저장되지 않는다.

기술

  • Databricks
  • Llama 3.1
  • Llama 3.3
  • Gemma 3
  • GPT-OSS

활용 사례

  • RAG 시스템
  • 실시간 챗봇
  • 대규모 문서 배치 처리
  • AI 에이전트
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 23.수집 2026. 05. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.