TL;DR
LLM의 컨텍스트 길이가 늘어날 때 연산 비용이 제곱으로 증가하는 이유는 어텐션 메커니즘의 구조적 특성 때문이다. 모든 토큰이 서로를 참조하는 '모두 대 모두' 비교 방식은 입력 토큰 수()가 두 배가 될 때 연산량과 메모리 사용량을 4배()로 늘린다. 이러한 이차식 비용은 연산 속도 저하와 GPU 메모리 부족을 유발하며, 이를 해결하기 위해 슬라이딩 윈도우나 희소 어텐션 같은 최적화 기법이 사용된다. 긴 프롬프트를 사용할 때 불필요한 문맥을 제거하는 것이 가장 효과적인 비용 절감 방법이다.
챕터별 상세
컨텍스트 길이와 비용의 관계
입력 토큰 수()에 대해 연산량이 으로 증가하는 현상을 의미한다.
어텐션 메커니즘의 작동 원리
모든 토큰이 서로를 참조하는 '모두 대 모두' 비교 방식이 병목의 원인이다.
스코어 그리드와 연산량
그리드의 면적()이 연산의 복잡도를 결정한다.
메모리 병목과 최적화
희소 어텐션(Sparse Attention)이나 로컬 윈도우 기법은 메모리 사용량을 줄이는 핵심 최적화 방식이다.
실무적 시사점
불필요한 토큰을 제거하는 것이 연산 비용을 줄이는 가장 효과적인 전략이다.
용어 해설
- 어텐션 메커니즘(Attention)
- — LLM에서 입력된 토큰 간의 연관성을 계산하는 핵심 구조이다. 모든 토큰이 다른 모든 토큰과 비교를 수행하며, 이로 인해 입력 길이가 길어질수록 연산량이 제곱으로 증가하는 특성을 가진다.
- 컨텍스트(Context)
- — 모델이 한 번의 추론 과정에서 처리하는 입력 텍스트의 전체 범위이다. 컨텍스트가 길어질수록 모델이 참조할 정보는 많아지지만, 연산 비용과 메모리 사용량이 급격히 늘어난다.
- 이차식 비용(Quadratic Cost)
- — 입력 데이터의 크기()가 증가함에 따라 연산량이나 메모리 사용량이 에 비례하여 증가하는 현상이다. 어텐션 메커니즘의 구조적 한계로 인해 발생한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


