TL;DR
이 글은 LLM이 입력 토큰을 임베딩 벡터로 바꾼 뒤 Attention과 Feed-forward network로 구성된 Transformer block을 여러 번 통과시켜 다음 토큰의 확률을 만드는 과정을 순서대로 연결합니다. Attention은 각 토큰의 Query와 앞선 토큰들의 Key를 비교하고 Softmax 가중치로 Value를 섞어 문맥 정보를 전달하며, Feed-forward network는 문맥이 반영된 각 토큰을 서로 독립적으로 변환합니다. 생성 중에는 이미 계산한 Key와 Value를 KV cache에 저장하므로 과거 토큰을 다시 계산하지 않고 새 토큰의 Query만 캐시와 비교할 수 있습니다. Prompt를 읽는 Prefill에서는 N개 토큰의 Attention 점수가 N×N 구조를 이루어 길이의 제곱에 비례하고, Decode에서는 한 번에 한 행씩 계산하지만 생성 토큰마다 반복되며, FlashAttention은 같은 결과를 전체 점수 행렬 없이 계산해 메모리 사용량을 선형으로 유지합니다.
섹션별 상세






용어 해설
- 순전파(Forward pass)
- — 모델이 입력 토큰을 벡터로 바꾸고 Transformer block을 차례로 통과시킨 뒤 다음 토큰의 확률을 계산하는 전체 실행 과정입니다. 출력 토큰 하나마다 한 번 수행되며, 생성 단계에서는 새 토큰을 입력으로 다시 순전파를 실행합니다.
- 임베딩(Embedding)
- — 어휘에 있는 각 토큰을 고정된 크기의 숫자 벡터로 바꾸는 표현입니다. 모델은 토큰마다 학습된 행을 조회해 벡터를 얻고, 이후 Transformer block은 텍스트가 아닌 이 벡터를 계속 수정합니다.
- 소프트맥스(Softmax)
- — 여러 원시 점수를 양수인 가중치 또는 확률로 변환해 합계가 1이 되게 하는 함수입니다. Attention에서는 어떤 토큰의 정보를 얼마나 반영할지 정하고, 마지막 출력층에서는 각 후보 토큰의 확률 분포를 만듭니다.
- 어텐션 헤드(Attention Head)
- — 하나의 Transformer block 안에서 독립적인 Query·Key·Value 변환을 수행하는 병렬 Attention 단위입니다. 여러 헤드가 서로 다른 토큰 관계를 학습한 뒤 결과를 합치며, 각 block과 헤드의 Key·Value가 KV cache 메모리를 차지합니다.
- Grouped-query attention
- — 여러 Query 헤드가 하나의 Key·Value 묶음을 공유하도록 구성하는 Attention 변형입니다. 헤드마다 Key와 Value를 따로 저장하는 구조보다 KV cache 크기를 줄이면서 품질 저하를 작게 유지하는 방향으로 사용됩니다.
- Mixture-of-experts
- — 하나의 Feed-forward network 대신 여러 전문가 네트워크를 두고 각 토큰을 일부 전문가에만 라우팅하는 구조입니다. 전체 파라미터 수는 크게 유지하면서도 개별 토큰이 실제로 사용하는 계산량을 제한하는 방식입니다.
기술
- Transformer
- Attention
- Feed-forward network
- MLP
- Softmax
- KV cache
- FlashAttention
- rotary position encodings
- Grouped-query attention
- Mixture-of-experts
활용 사례
- LLM 추론 과정 이해
- 긴 Prompt의 처리 비용 분석
- KV cache 메모리 구조 이해
- Prefill과 Decode 성능 구분
- Attention 최적화 방식 비교
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
