용어 해설
- 희소 어텐션(Sparse Attention)
- — 모든 토큰 간의 관계를 계산하는 대신 중요한 일부 토큰만 선택하여 연산하는 기법이다. 연산 복잡도를 시퀀스 길이의 제곱에서 선형 수준으로 낮추어 긴 문맥 처리를 가능하게 하는 핵심 기술이다.
- KV 캐시(KV Cache)
- — 이전 추론 단계에서 계산된 Key와 Value 벡터를 메모리에 저장해 두었다가 재사용하는 기술이다. 매 단계마다 전체 시퀀스를 다시 계산할 필요가 없게 하여 LLM의 생성 속도를 비약적으로 높인다.
- 지식 증류(Knowledge Distillation)
- — 복잡한 모델(교사)의 출력 분포를 더 단순한 모델(학생)이 모방하도록 학습시키는 기법이다. 본 논문에서는 여러 레이어의 어텐션 정보를 하나의 인덱서가 학습하도록 하는 데 활용된다.
- 프리필(Prefill)
- — LLM 추론의 첫 단계로, 입력된 프롬프트 전체를 한꺼번에 처리하여 초기 상태를 생성하는 과정이다. 문맥이 길어질수록 이 단계에서 발생하는 연산 병목 현상이 심화된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
