AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
리소스 제약 환경에서 MoE-dLLM의 대용량 파라미터를 효율적으로 운용하려면 GPU-CPU 간의 I/O 비용과 CPU 계산 병목을 줄여야 한다. TIDE는 expert activations의 시간적 안정성을 이용해 interval-based refresh를 도입하고, 모델 정확도에 영향을 주지 않으면서 추론 속도를 높인다. LLaDA2.0-mini와 LLaDA2.0-flash에서 최대 1.4×, 1.5×의 처리량 개선이 보고된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
리소스 제약 환경에서 MoE-dLLM의 대용량 파라미터를 효율적으로 운용하려면 GPU-CPU 간의 I/O 비용과 CPU 계산 병목을 줄여야 한다. TIDE는 expert activations의 시간적 안정성을 이용해 interval-based refresh를 도입하고, 모델 정확도에 영향을 주지 않으면서 추론 속도를 높인다. LLaDA2.0-mini와 LLaDA2.0-flash에서 최대 1.4×, 1.5×의 처리량 개선이 보고된다.
학습 없이 MoE-dLLM 추론 가속
MoE-dLLM에 대한 학습 없이도 I/O 비용과 CPU 계산을 절감하는 손실 없는 추론 가속을 제시한다. 이는 모델 가중치를 바꾸지 않고 expert 배치를 재구성하는 방식으로 수행된다.
Interval-based expert refresh 도입
단계 간 expert activation의 시간적 국소성(근접 단계에서의 유사성)을 활용해 interval τ 간격으로 GPU-메모리의 expert를 재정의한다. 재배치를 줄여 GPU-CPU 간 I/O 오버헤드를 감소시킨다.
최적의 refresh 간격 τ를 위한 MP 기반 최적화
LatI/O(τ)와 LatCPU(τ)를 분석 모델링하고 상호 작용을 고려한 제약식 최적화 문제로 λ(τ)를 해결하여 최적의 τ를 offline에서 찾는다.
비동기 토큰 운영 및 재활용 정책
토큰 라우팅과 연산을 비동기로 수행하고, hit 카운터 기반으로 상위-expert를 재배치해 skipped steps에서도 GPU 활용도를 유지한다.
실험적 검증 및 실용성
LLaDA2.0-mini와 LLaDA2.0-flash에서 Fiddler 및 Mixtral-Offload 대비 일관된 속도 증가를 보이며, 메모리 제약 하에서도 탁월한 성능을 보인다.
단계별 디노이징으로 구성된 MoE-dLLM의 각 denoising step은 활성화되는 전문가 집합이 시간에 따라 큰 폭으로 달라지지 않는다. 즉, 인접한 denoising step 간 전문가 할당은 높은 유사성을 가지며, 5단계 수준에서도 cosine 유사도가 대체로 0.95 이상이다. 이 시간적 안정성을 활용해 interval τ 간격으로 GPU-메모리에 상주하는 전문가 세트를 재생성하고, skipped steps에서는 현 배치를 재사용한다. 이로써 GPU-메모리의 활용도와 토큰 처리율을 유지하면서 지속적인 전문가 교체에 따른 I/O 오버헤드를 줄일 수 있다. 최적의 τ는 LatI/O(τ)와 LatCPU(τ)의 합을 최소화하도록 MP를 통해 오프라인으로 결정한다. 비동기 토큰 라우팅과 hit 기반 재배치를 도입해 CPU와 GPU 간 병렬화를 극대화한다.
관련 Figure

단계별 활성화 패턴은 시간에 따라 비슷하게 유지되며, 이로 인해 interval 기반 재배치의 효과가 뚜렷해진다. 각 단계의 cosine similarity와 활성화된 전문가 수의 변화가 함께 제시된다.
Figure 2: Block 크기 32에서의 Expert Activation 패턴과 단계 간 유사성
관련 Figure

스케줄링 전략의 핵심 아이디어를 시각화한다. (a)에서 인접 단계 사이의 라우팅 유사성은 높고, (b)에서 refresh와 skip 단계의 동작 흐름이 제시되며, (c)에서 제안된 방법의 처리량 이점을 비교한다.
Figure 1의 (a) Expert Routing Similarity Heatmap, (b) Method Overview, (c) LLaDA2.0 모델의 처리량 비교

디자인의 핵심 구성요소를 보여준다. refresh 단계에서 GPU-resident expert를 재배치하고, skipped 단계에서 재배치를 하지 않는 하이브리드 흐름으로 고성능 GPU-주도 계산을 유지한다.
Figure 3: TIDE 설계 개요(Refresh vs Skipped 단계, 토큰 라우팅 흐름)

τ 증가에 따른 GPU-미스 레이트와 마이그레이션 수의 변화, LatCPU/LAT I/O 간의 상호작용이 그래프로 제시된다. 최적 τ는 Lat(total)을 최소화하는 지점으로 식(7)을 통해 도출된다.
Figure 4: Refresh Interval τ의 영향(미스 비율, 마이그레이션 수, 총 지연의 트레이드오프)
관련 Figure

테이블 1과 2의 흐름을 보완하는 추가 시각으로, Baseline과 비교한 TIDE의 throughput 향상을 다수 설정에서 확인할 수 있다.
Figure: Throughput 분석 및 비교(다양한 설정에서의 비교 차트)
MoE-dLLM 추론을 리소스 제약 환경에서 수행할 때 I/O 및 CPU 병목을 줄이고, 손실 없이 throughput를 높이는 방법이다.
코드 공개 여부: 공개
코드 저장소 보기아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
LLM 추론은 커널·메모리·통신을 분리 측정하고 처리량과 지연 시간의 Pareto Frontier에서 운영점을 찾아야 합니다.
FreeToken은 PCIe 전송과 CPU 실행을 나눠 개인용 GPU에서 35B부터 753B MoE 모델까지 서빙한다.
ShardFlow가 CUDA Graphs와 추측 디코딩으로 WAN 분산 추론 처리량을 높였습니다.