TL;DR
UC Berkeley와 MIT 연구진은 소비자용 하드웨어에서 대규모 Mixture-of-Experts 모델을 실행하기 위한 오픈소스 추론 엔진 FreeToken을 제시했습니다. 기존 방식은 비활성 Expert 가중치를 호스트 RAM에 두고 GPU가 필요할 때 동기적으로 가져오므로, PCIe 처리량 16–64 GB/s와 RAM 지연이 캐시 누락 때 GPU 정지를 일으켰습니다. FreeToken은 q* 정책으로 실시간 연결 상태에 따라 토큰 계산을 CPU와 GPU에 나누고, FTW 가중치 형식과 전체 레이어 더블 버퍼링으로 가중치 전송과 계산을 겹칩니다. 또한 실행 중 VRAM을 KV cache와 상주 Expert 슬롯 사이에서 재배분해 모델을 다시 불러오지 않고 메모리 구성을 조정합니다.
섹션별 상세
용어 해설
- Mixture-of-Experts
- — 전체 모델 파라미터를 모두 계산하지 않고 입력 토큰마다 일부 Expert만 선택해 처리하는 구조입니다. 계산량은 줄지만, 선택된 Expert 가중치가 메모리에 없으면 여러 장치 사이에서 가중치를 이동해야 하므로 추론 과정의 통신 비용이 커집니다.
- Expert 오프로딩(Expert Offloading)
- — MoE 모델의 비활성 Expert 가중치를 GPU 메모리 대신 호스트 RAM에 보관하는 방식입니다. 특정 Expert가 선택되면 해당 가중치를 GPU로 옮겨 계산하지만, 전송과 계산이 순차적으로 진행되면 캐시 누락 때 GPU가 대기하는 병목이 생깁니다.
- q* 정책(q* Policy)
- — FreeToken이 사용하는 동적 CPU·GPU 공동 스케줄링 정책입니다. 실시간 PCIe 연결 처리량에 맞춰 토큰 계산을 CPU 코어와 GPU Tensor Core 사이에 나누어 캐시 누락이 발생해도 GPU 전체가 멈추지 않도록 설계됐습니다.
- 더블 버퍼링(Double Buffering)
- — 계산에 사용하는 버퍼와 다음 데이터를 불러오는 버퍼를 분리하는 기법입니다. FreeToken은 전체 레이어 단위로 이를 적용해 PCIe를 통한 Expert 가중치 스트리밍과 현재 레이어의 계산을 겹치고, 데이터 전송으로 인한 대기 시간을 줄입니다.
언급된 도구
소비자용 하드웨어에서 대규모 Mixture-of-Experts 모델의 추론을 실행하는 오픈소스 inference engine
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.