TL;DR
WISP는 MoE 모델을 VRAM, RAM, NVMe 사이에서 스트리밍하는 실행 도구로, GUI와 계층 모니터링을 제공하고 QWEN3 어댑터를 지원합니다. KIMI K3는 KDA recurrence와 CUDA 커널이 검증됐지만 실제 tensor name은 아직 확인되지 않았습니다. DGX SPARK는 실기기 검증 전이며 AMD R9700은 CUDA 의존성 때문에 현재 추론을 지원하지 않습니다.
실용적 조언
- NVIDIA GPU에서 WISP를 시험하려면 먼저 `pip install 'wisp-engine\[gui\]'`로 GUI를 설치한 뒤 wisp-gui를 실행하면 됩니다. GUI에서 메모리 계층, tok/s, 캐시 적중률을 확인하면서 wisp serve가 모델을 어떻게 스트리밍하는지 관찰할 수 있습니다. KIMI K3 가중치를 사용할 때는 wisp inspect로 tensor name을 확인하고 필요하면 WISP_KDA_NAMES로 이름을 덮어써야 합니다.
- AMD R9700에서는 현재 WISP 추론을 시도하지 않는 편이 맞습니다. wisp doctor를 사용하면 장치 감지와 크기 계산은 확인할 수 있지만 CUDA 기반 계산 커널 때문에 실제 추론은 실행되지 않습니다. DGX SPARK도 계층 계산만 검증된 상태이므로 실제 하드웨어에서 Unified Memory 감지와 2계층 동작을 별도로 확인해야 합니다.
섹션별 상세
용어 해설
- Mixture of Experts(MoE)
- — Mixture of Experts는 여러 Expert 네트워크 중 입력과 관련된 일부만 선택해 계산하는 모델 구조입니다. WISP는 이 구조의 모델을 VRAM, RAM, NVMe 사이에서 계층적으로 스트리밍해 제한된 GPU 메모리에서도 실행하려고 합니다.
- 통합 메모리(Unified Memory)
- — Unified Memory는 CPU와 GPU가 하나의 메모리 풀을 공유하는 방식입니다. 글에서는 ARM64, GB10, 약 128GB 통합 메모리 풀을 감지하면 VRAM과 RAM을 따로 나누지 않고 메모리 풀과 NVMe의 2계층으로 처리합니다.
- Grouped-Query Attention(GQA)
- — Grouped-Query Attention은 여러 Query 헤드가 더 적은 수의 Key·Value 헤드를 공유하도록 구성하는 Attention 방식입니다. QWEN3 어댑터는 이 구조를 전제로 하며 config.json에서 아키텍처를 읽어 하드코딩을 피합니다.
- CUDA 커널(CUDA kernel)
- — CUDA kernel은 NVIDIA GPU에서 실행되는 병렬 계산 코드입니다. 글의 KDA 연산과 SiLU gate 커널은 여러 head_dim에서 검증됐지만 CUDA에 의존하므로 AMD R9700에서는 현재 추론을 실행할 수 없습니다.
- NVMe 스트리밍(NVMe streaming)
- — NVMe streaming은 모델 가중치나 계산에 필요한 데이터를 고속 저장장치에서 메모리 계층으로 옮겨 실행하는 방식입니다. WISP는 VRAM과 RAM이 부족한 상황에서 NVMe를 세 번째 계층으로 사용해 MoE 모델을 스트리밍합니다.
코드 예제
beta_t = sigmoid(W_beta x_t)
S_t = (1 − beta_t ⊙ k_t) S_{t−1} + v_t k_tᵀ
o_t = S_t q_tKDA recurrence가 현재 수정된 형태로 계산되는 과정을 나타낸 수식입니다.
pip install 'wisp-engine\[gui\]' → wisp-guiWISP의 데스크톱 GUI를 설치하고 실행하는 명령입니다.
언급된 도구
MoE 모델을 VRAM, RAM, NVMe 사이에서 스트리밍하고 wisp serve와 wisp-gui로 추론 상태를 관리하는 도구입니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.