본문으로 건너뛰기

WISP의 MoE 모델 스트리밍과 하드웨어 지원 현황

WISP가 VRAM·RAM·NVMe를 잇는 MoE 스트리밍과 QWEN3 어댑터를 구현했습니다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

WISP는 MoE 모델을 VRAM, RAM, NVMe 사이에서 스트리밍하는 실행 도구로, GUI와 계층 모니터링을 제공하고 QWEN3 어댑터를 지원합니다. KIMI K3는 KDA recurrence와 CUDA 커널이 검증됐지만 실제 tensor name은 아직 확인되지 않았습니다. DGX SPARK는 실기기 검증 전이며 AMD R9700은 CUDA 의존성 때문에 현재 추론을 지원하지 않습니다.

실용적 조언

  • NVIDIA GPU에서 WISP를 시험하려면 먼저 `pip install 'wisp-engine\[gui\]'`로 GUI를 설치한 뒤 wisp-gui를 실행하면 됩니다. GUI에서 메모리 계층, tok/s, 캐시 적중률을 확인하면서 wisp serve가 모델을 어떻게 스트리밍하는지 관찰할 수 있습니다. KIMI K3 가중치를 사용할 때는 wisp inspect로 tensor name을 확인하고 필요하면 WISP_KDA_NAMES로 이름을 덮어써야 합니다.
  • AMD R9700에서는 현재 WISP 추론을 시도하지 않는 편이 맞습니다. wisp doctor를 사용하면 장치 감지와 크기 계산은 확인할 수 있지만 CUDA 기반 계산 커널 때문에 실제 추론은 실행되지 않습니다. DGX SPARK도 계층 계산만 검증된 상태이므로 실제 하드웨어에서 Unified Memory 감지와 2계층 동작을 별도로 확인해야 합니다.

섹션별 상세

01
WISP는 MoE 모델을 VRAM, RAM, NVMe 순서의 메모리 계층 사이에서 스트리밍하며, wisp-gui를 설치하면 내부적으로 wisp serve에 연결해 라이브 계층 모니터, 초당 토큰 수, 캐시 적중률, 스트리밍 채팅을 사용할 수 있습니다. 글은 197개 테스트와 MIT 라이선스, Windows·Linux 지원을 근거로 현재 제공되는 실행 경로를 제시합니다. 따라서 단순한 모델 포팅이 아니라 메모리 계층을 직접 관찰하면서 데스크톱에서 모델을 구동하는 사용 흐름이 핵심입니다.
02
KIMI K3 지원은 KDA recurrence와 SiLU gate CUDA kernel, KDA projection weight 변환기, 레이어 유형별 C forward pass까지 준비됐지만 실제 가중치의 tensor name은 확인되지 않았습니다. KDA 커널은 head_dim 32, 100, 200에서 검증됐고 head_dim 200은 잘못된 결과가 아니라 GPU를 멈추게 할 수 있는 partial-thread-block barrier 경로를 포함합니다. WISP_KDA_NAMES override와 wisp inspect가 tensor name 문제를 보완하지만, 실제 K3 가중치를 먼저 확보해야 완전한 검증이 가능합니다.
03
QWEN3-235B와 QWEN3-2.4T 어댑터는 GQA 기반으로 구현됐으며 config.json에서 아키텍처를 읽어 특정 설정을 코드에 고정하지 않습니다. QWEN3-235B는 토큰당 약 752회 조회와 약 127.7GB int4 크기가 제시돼 대형 모델을 계층형 메모리에 배치하는 설계와 연결됩니다. 글은 두 모델의 어댑터가 완성됐다는 점과 실제 실행에 필요한 메모리 규모를 함께 제시합니다.
04
DGX SPARK는 ARM64, GB10, 약 128GB 통합 메모리 풀을 감지하면 메모리 풀과 NVMe SSD만 사용하는 2계층 모드로 축소됩니다. 계층 계산은 맞지만 실제 Spark 하드웨어에서 검증하지 못했으며, Blackwell에서 실행되는 CUDA 커널을 전제로 합니다. AMD R9700은 wisp doctor가 장치를 감지하고 크기를 계산하지만 모든 계산 커널이 CUDA라서 현재 추론은 불가능하고 HIP 포팅은 후속 작업으로 남아 있습니다.

용어 해설

Mixture of Experts(MoE)
Mixture of Experts는 여러 Expert 네트워크 중 입력과 관련된 일부만 선택해 계산하는 모델 구조입니다. WISP는 이 구조의 모델을 VRAM, RAM, NVMe 사이에서 계층적으로 스트리밍해 제한된 GPU 메모리에서도 실행하려고 합니다.
통합 메모리(Unified Memory)
Unified Memory는 CPU와 GPU가 하나의 메모리 풀을 공유하는 방식입니다. 글에서는 ARM64, GB10, 약 128GB 통합 메모리 풀을 감지하면 VRAM과 RAM을 따로 나누지 않고 메모리 풀과 NVMe의 2계층으로 처리합니다.
Grouped-Query Attention(GQA)
Grouped-Query Attention은 여러 Query 헤드가 더 적은 수의 Key·Value 헤드를 공유하도록 구성하는 Attention 방식입니다. QWEN3 어댑터는 이 구조를 전제로 하며 config.json에서 아키텍처를 읽어 하드코딩을 피합니다.
CUDA 커널(CUDA kernel)
CUDA kernel은 NVIDIA GPU에서 실행되는 병렬 계산 코드입니다. 글의 KDA 연산과 SiLU gate 커널은 여러 head_dim에서 검증됐지만 CUDA에 의존하므로 AMD R9700에서는 현재 추론을 실행할 수 없습니다.
NVMe 스트리밍(NVMe streaming)
NVMe streaming은 모델 가중치나 계산에 필요한 데이터를 고속 저장장치에서 메모리 계층으로 옮겨 실행하는 방식입니다. WISP는 VRAM과 RAM이 부족한 상황에서 NVMe를 세 번째 계층으로 사용해 MoE 모델을 스트리밍합니다.

코드 예제

text
beta_t = sigmoid(W_beta x_t)
S_t = (1 − beta_t ⊙ k_t) S_{t−1} + v_t k_tᵀ
o_t = S_t q_t

KDA recurrence가 현재 수정된 형태로 계산되는 과정을 나타낸 수식입니다.

text
pip install 'wisp-engine\[gui\]' → wisp-gui

WISP의 데스크톱 GUI를 설치하고 실행하는 명령입니다.

언급된 도구

WISP중립링크

MoE 모델을 VRAM, RAM, NVMe 사이에서 스트리밍하고 wisp serve와 wisp-gui로 추론 상태를 관리하는 도구입니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 25.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.