TL;DR
긴 시스템 프롬프트는 에이전트의 지시 수행 품질을 높이지만 요청마다 많은 토큰을 처리해야 해 지연 시간과 GPU 비용을 키웁니다. Shopify는 모델 가중치를 고정하고 학습된 gist embeddings만 조정하는 Knowledge Distillation으로 약 6,000토큰의 Sidekick GraphQL agent 프롬프트를 약 1,500개의 gist 토큰으로 압축했습니다. 350 RPM에서 TTFT는 438ms에서 354ms로, E2E latency는 6.8초에서 4.2초로 감소했고 throughput은 20.2 QPS에서 23.4 QPS로 증가했습니다. Prefix Caching과 함께 사용한 Gisting은 운영 GPU 수를 14% 줄였으며, 증류한 embeddings를 Continual Learning의 prefix로 재사용할 수도 있습니다.
섹션별 상세




용어 해설
- 지식 증류(Knowledge Distillation)
- — 큰 모델이나 전체 입력을 사용하는 교사 모델의 출력 분포를 더 짧은 입력을 사용하는 학생 모델이 따라가도록 학습하는 방법입니다. 이 글에서는 모델 가중치를 고정한 채 교사와 학생의 logits 차이를 KL divergence로 계산하고, 학생 역할의 gist embeddings만 조정해 긴 시스템 프롬프트의 동작을 압축합니다.
- Gist 토큰(Gist Token)
- — 긴 자연어 프롬프트를 대신하도록 모델 어휘에 추가한 특수 토큰입니다. 여러 프롬프트 토큰의 의미와 동작을 소수의 학습된 embedding에 담아 추론 시 원문 대신 입력하며, 이 글의 4 대 1 압축에서는 프롬프트 토큰 네 개마다 gist 토큰 하나를 배치합니다.
- KL Divergence
- — 두 확률분포가 얼마나 다른지 측정하는 값으로, 지식 증류에서 교사 모델과 학생 모델의 예측 분포를 맞추는 학습 신호로 쓰입니다. 이 글에서는 동일한 응답 위치에 대한 teacher logits와 student logits 사이의 KL divergence를 줄여, 압축된 입력에서도 학생의 예측이 교사에 가까워지도록 만듭니다.
- Prefix Caching
- — 이전에 처리한 시퀀스의 Key와 Value를 KV cache에 저장해 같은 접두사를 다시 계산하지 않도록 하는 추론 최적화입니다. 다만 생성 토큰마다 전체 캐시를 메모리에서 읽어야 하므로 긴 접두사의 decode 비용은 남으며, Gisting은 시퀀스 자체를 짧게 만들어 attention 계산과 KV cache 읽기량을 함께 줄입니다.
- Continual Learning
- — 새로 유입되는 데이터로 모델을 계속 보정하고 개선하는 학습 방식입니다. 이 글에서는 한 번 증류한 gist embeddings를 다음 학습의 prefix로 재사용하고, 증분 데이터에 맞춰 모델 가중치와 gist embeddings를 함께 업데이트해 매번 처음부터 압축을 다시 학습하는 비용을 피합니다.
기술
- Gisting
- Sidekick GraphQL agent
- Knowledge Distillation
- KL divergence
- Prefix Caching
- KV cache
- autoresearch
- tokenizer
- continual learning
활용 사례
- GraphQL 에이전트 서빙
- 긴 시스템 프롬프트를 사용하는 LLM 에이전트
- 대규모 동시 요청 처리
- GPU 기반 전용 모델 서빙
- Continual Learning 기반 모델 보정
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
