TL;DR
Cachet은 LLM API 앞단에 로컬 캐시를 두어 중복 프롬프트의 비용과 지연을 실시간으로 줄인다. 입력을 정확히 같은 경우 해시로 즉시 캐시에서 응답하고, 의미적으로 유사한 입력은 코사인 유사도 기반의 세맨틱 매칭으로 매칭하여 캐시를 재활용한다. 이 로컬 캐시는 임베딩 API나 벡터DB를 필요로 하지 않으며, Rust로 작성된 단일 바이너리로 배포되어 즉시 활용 가능하고, 대시보드에 실시간 절감액과 히트를 표시한다. 향후 neural embedder 도입 및 디스크 기반 캐시 등 확장 roadmap이 존재한다.
섹션별 상세
이미지 분석

대시보드는 'estimated $ saved'와 hit rate를 실시간으로 표시하며, SSE 스트리밍으로 업데이트되는 모습을 보여준다. GIF를 통해 로컬 캐시의 작동과 비용 절감 효과가 시각적으로 전달된다.
Cachet 대시보드의 실시간 절감액/히트 수를 시각화한 GIF
용어 해설
- 시맨틱 캐시(Semantic Cache)
- — LLM API 호출 중 반복되거나 의미상 동일한 질의를 로컬에서 재사용하기 위해 구축된 캐시 체계로, 외부 벤더 API 호출을 줄이고 응답 시간을 감소시키는 전략이다.
- 정확 해시(Exact Hash)
- — 입력 프롬프트를 고유한 해시 키로 변환해 완전히 동일한 입력에 대해 즉시 캐시에서 응답을 제공하는 방법이다.
- 코사인 유사도(Cosine Similarity)
- — 두 벡터 간 각도를 측정해 의미적으로 가까운 프롬프트를 식별하는 거리 척도로, 세맨틱 매칭의 핵심 원리로 사용된다.
- 임베더(Embedder)
- — 프롬프트를 벡터 공간으로 표현하는 모듈로, 네트워크 임베딩 또는 로컬 임베딩을 구현하는 트레이트/구현체를 지칭한다.
- 렉시컬 임베더(Lexical Embedder)
- — 단어/문자 기반 특징으로 프롬프트를 벡터화하는 임베더로, 신경망 임베딩 없이도 빠르게 매칭에 활용된다.
근거 모음
기술
- Rust
- rustls
- OpenAI API
- Anthropic API
- cargo
활용 사례
- LLM API 프록시 캐싱
- 비용 최적화 및 지연 감소
- 프롬프트 재사용이 많은 개발 워크플로우
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
