본문으로 건너뛰기

소비자용 하드웨어를 위한 FreeToken MoE 추론 엔진

FreeToken이 PCIe 병목을 CPU·GPU 공동 스케줄링과 가중치 스트리밍으로 완화한다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

UC Berkeley와 MIT 연구진은 소비자용 하드웨어에서 대규모 Mixture-of-Experts 모델을 실행하기 위한 오픈소스 추론 엔진 FreeToken을 제시했습니다. 기존 방식은 비활성 Expert 가중치를 호스트 RAM에 두고 GPU가 필요할 때 동기적으로 가져오므로, PCIe 처리량 16–64 GB/s와 RAM 지연이 캐시 누락 때 GPU 정지를 일으켰습니다. FreeToken은 q* 정책으로 실시간 연결 상태에 따라 토큰 계산을 CPU와 GPU에 나누고, FTW 가중치 형식과 전체 레이어 더블 버퍼링으로 가중치 전송과 계산을 겹칩니다. 또한 실행 중 VRAM을 KV cache와 상주 Expert 슬롯 사이에서 재배분해 모델을 다시 불러오지 않고 메모리 구성을 조정합니다.

섹션별 상세

01
Mixture-of-Experts 모델은 토큰마다 전체 파라미터 중 일부 Expert만 계산하지만, 디코딩 과정에서는 수천억 개 규모의 비활성 가중치 가운데 필요한 Expert를 찾아 이동해야 합니다. 데이터센터는 NVLink 같은 고대역폭 인터커넥트로 Expert 전송 비용을 가릴 수 있지만, 소비자용 장치에서는 PCIe 처리량이 일반적으로 16–64 GB/s에 머물고 호스트 RAM 지연까지 더해져 병목이 커집니다. 따라서 계산량을 줄이는 희소 구조만으로는 데스크톱 추론 속도를 보장하기 어렵다는 문제가 출발점입니다.
02
기존 엣지 런타임은 비활성 Expert 가중치를 시스템 RAM에 보관한 뒤 활성화 순간 GPU로 동기 전송하는 정적 오프로딩을 사용합니다. 필요한 가중치가 캐시에 없으면 GPU가 전송이 끝날 때까지 계산을 멈추므로, PCIe 전송 지연이 전체 디코딩 실행을 직렬화합니다. FreeToken은 q* 정책을 사용해 실시간 인터커넥트 처리량에 따라 토큰 계산을 CPU 코어와 GPU Tensor Core에 나누고 캐시 누락 중에도 작업을 이어가도록 구성했습니다.
03
FreeToken은 FTW라는 빠른 가중치 형식과 전체 레이어 더블 버퍼링을 결합해 다음 계산에 필요한 가중치를 PCIe로 가져오는 동안 현재 레이어 계산을 진행합니다. 이 구조는 가중치 스트리밍과 활성 계산 레이어를 완전히 겹치도록 설계됐으며, 고정된 오프로딩 위치 대신 실행 시점의 전송 상태를 스케줄링에 반영합니다. 별도의 탄력적 메모리 관리자는 모델을 다시 불러오지 않고 VRAM을 KV cache 항목과 상주 Expert 슬롯 사이에서 동적으로 재배분합니다.

용어 해설

Mixture-of-Experts
전체 모델 파라미터를 모두 계산하지 않고 입력 토큰마다 일부 Expert만 선택해 처리하는 구조입니다. 계산량은 줄지만, 선택된 Expert 가중치가 메모리에 없으면 여러 장치 사이에서 가중치를 이동해야 하므로 추론 과정의 통신 비용이 커집니다.
Expert 오프로딩(Expert Offloading)
MoE 모델의 비활성 Expert 가중치를 GPU 메모리 대신 호스트 RAM에 보관하는 방식입니다. 특정 Expert가 선택되면 해당 가중치를 GPU로 옮겨 계산하지만, 전송과 계산이 순차적으로 진행되면 캐시 누락 때 GPU가 대기하는 병목이 생깁니다.
q* 정책(q* Policy)
FreeToken이 사용하는 동적 CPU·GPU 공동 스케줄링 정책입니다. 실시간 PCIe 연결 처리량에 맞춰 토큰 계산을 CPU 코어와 GPU Tensor Core 사이에 나누어 캐시 누락이 발생해도 GPU 전체가 멈추지 않도록 설계됐습니다.
더블 버퍼링(Double Buffering)
계산에 사용하는 버퍼와 다음 데이터를 불러오는 버퍼를 분리하는 기법입니다. FreeToken은 전체 레이어 단위로 이를 적용해 PCIe를 통한 Expert 가중치 스트리밍과 현재 레이어의 계산을 겹치고, 데이터 전송으로 인한 대기 시간을 줄입니다.

언급된 도구

FreeToken중립

소비자용 하드웨어에서 대규모 Mixture-of-Experts 모델의 추론을 실행하는 오픈소스 inference engine

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 04.수집 2026. 09. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.