용어 해설
- KV 캐시(KV Cache)
- — Transformer 추론에서 키(key)와 값(value)을 토큰별로 저장하여 미래 토큰 생성 시 재사용하는 메모리 레이어로, 긴 컨텍스트에서 메모리와 대역폭을 크게 차지하므로 공유·재사용·압축 기법으로 최적화가 중요하다.
- p p -RoPE
- — RoPE 계열의 위치 인코딩 변형으로서, 글로벌 레이어에 다른 주파수 스케일(p)을 적용해 위치 표현을 조정하고 글로벌 KV 캐시 크기를 줄이는 방식으로 긴 문맥 처리 효율을 개선하는 기법이다.
- 양자화 인식 학습(Quantization-Aware Training)
- — 모델 파라미터와 활성화를 저비트 표현으로 변환할 때 발생하는 품질 저하를 학습 단계에서 모사하여 보정하는 방법으로, 추론 시 메모리·지연 감소를 유지하면서 성능 손실을 최소화한다.
- 추정적 디코딩(Speculative Decoding)
- — 작은 드래프터가 미래 토큰을 빠르게 예측하고 메인 모델의 정식 디코딩을 병렬로 진행하여 전체 디코딩 지연을 줄이는 전략으로, 드래프터의 수용률과 집단 확률 조정이 성능·효율에 직접 영향을 준다.
- 인코더-프리 구조(Encoder-Free)
- — 전통적 별도 비전·오디오 인코더를 사용하지 않고 원시 패치나 오디오 청크를 바로 LLM 임베딩 공간으로 사영하는 설계로, 인코더 파라미터를 줄이고 메모리 단편화를 완화하는 데 목적이 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
