TL;DR
소비자용 GPU에서 수십억 파라미터 LLM을 학습하려면 단순히 GPU 수를 늘리기보다 가중치, optimizer state, gradient, activation이 메모리 계층을 어떻게 점유하는지 분리해서 관리해야 합니다. QLoRA와 DoRA는 4-bit base weight와 저순위 update를 사용하고, GaLore는 gradient를 저순위 공간에 투영해 optimizer state를 줄이며, FSDP·ZeRO-3는 tensor를 GPU와 CPU 메모리에 나눠 저장합니다. Activation checkpointing, FlashAttention-2, FP8은 activation과 메모리 전송량을 줄이지만 재계산 비용, 하드웨어 호환성, 수치 불안정성 같은 대가가 따릅니다. RingAttention은 32k 토큰을 넘는 context를 여러 장치에 분산하지만 소비자용 PCIe와 네트워크에서는 통신 지연이 처리량을 상쇄할 수 있으므로 GPU 사용률, underflow, checkpoint 무결성을 지속적으로 추적해야 합니다.
섹션별 상세
이미지 분석

이미지는 QLoRA, 저순위 optimizer 메모리 절감, sharded training과 offloading, activation checkpointing, memory-tiled attention과 fused kernel, FP8 mixed precision, Sequence Chunking과 RingAttention을 번호별로 배치합니다. 본문에서 각 기법의 핵심 메모리 절감 또는 분산 처리 방향을 한눈에 연결하지만, 수치와 실패 조건은 포함하지 않습니다.
제한된 하드웨어에서 LLM 학습 효율을 높이는 7가지 접근법을 GPU 그림과 함께 요약한 인포그래픽입니다.
용어 해설
- 정적 메모리 오버헤드(Static Memory Overhead)
- — 모델 가중치, optimizer state, 지속적으로 유지되는 gradient처럼 학습 단계 전반에 걸쳐 VRAM을 점유하는 메모리입니다. 모델 크기와 파라미터 수에 따라 기본 사용량이 결정되므로 소비자용 GPU에서 먼저 한계에 도달하기 쉽습니다.
- 동적 임시 메모리 오버헤드(Dynamic Transient Memory Overhead)
- — Forward와 backward 과정에서 생성되는 activation map 및 임시 buffer가 순간적으로 차지하는 메모리입니다. context length와 batch size가 커질수록 사용량이 증가하며 activation checkpointing으로 일부를 저장하지 않고 다시 계산할 수 있습니다.
- NormalFloat 4
- — 신경망 가중치가 정규분포를 따른다는 특성에 맞춰 값을 표현하는 4-bit 양자화 형식입니다. QLoRA는 NF4로 base weight를 저장한 뒤 계산 시 BF16으로 복원해 메모리 사용량을 줄입니다.
- Optimizer State
- — AdamW가 각 학습 파라미터에 대해 유지하는 1차 및 2차 moment 값입니다. 두 값을 FP32로 저장하면 파라미터당 8바이트가 필요해 7B 모델에서 약 56GB를 차지할 수 있습니다.
- Activation Checkpointing
- — Forward 단계에서 일부 중간 activation을 버리고 backward 단계에서 필요한 값을 다시 계산하는 메모리 절감 기법입니다. 저장하는 tensor 수를 줄이는 대신 학습 단계마다 재계산 비용이 추가됩니다.
- RingAttention
- — 긴 sequence를 여러 장치에 나누고 각 장치가 Query, Key, Value block을 ring 형태로 주고받으며 attention을 계산하는 방식입니다. 계산과 통신을 겹쳐 NVLink 없이 긴 context를 처리하려 하지만 PCIe나 저속 네트워크에서는 통신 지연이 병목이 될 수 있습니다.
기술
- RTX 4090
- A10G
- L40S
- H100
- QLoRA
- DoRA
- NF4
- Double Quantization
- AdamW
- GaLore
- SVD
- FSDP
- ZeRO-3
- CUDA
- FlashAttention-2
- PyTorch
- FP8
- E4M3
- E5M2
- RingAttention
- NVLink
- PCIe
- NVMe
활용 사례
- 24GB 또는 48GB 소비자용 GPU에서 7B~70B 모델 Fine-tuning
- 전체 VRAM보다 큰 모델의 다중 GPU 학습
- 8k~32k 이상 긴 context를 사용하는 Transformer 학습
- NVLink 없이 여러 장치에서 32k 초과 context 학습
- 제한된 하드웨어에서 optimizer state와 activation 메모리 절감
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.