TL;DR
전통적인 embedding 기반 RecSys는 사용자 이력과 상품 embedding의 유사도를 계산하지만, 데이터가 테라바이트·페타바이트 규모로 커지면 GPU HBM 부족, long-tail 상품의 희소한 학습 신호, 신규 사용자·상품의 cold start, 수 밀리초 단위 latency가 병목이 된다. Generative Recommender는 이 문제를 사용자 이력에서 다음 상품을 생성하는 순차 예측으로 바꾸며, HSTU는 SiLU weighting과 relative attention bias로 긴 시퀀스를 처리하고 Semantic IDs는 상품을 작은 토큰 vocabulary로 변환해 beam search로 후보를 생성한다. NVIDIA의 recsys-examples는 DynamicEmb, TorchRec, Megatron-Core, fused CUDA ops, 추천 전용 KV cache를 결합해 대규모 학습과 추론을 최적화하고, HSTU 학습 MFU를 7.65%에서 31.40%로 높였다. Semantic ID-GR 전용 추론 경로는 context 5,000과 beam width 256 조건에서 SGLang보다 offline latency를 2.27배 줄이고 online throughput을 약 1.85배 높였으며, nv-embedding-cache는 GPU·CPU·원격 저장소의 계층형 embedding 조회로 단일 GPU를 넘는 table을 서비스한다.
빠른 이해
새로운 점
추천 시스템의 긴 context와 짧은 beam decoding에 맞춰 ContextKV, BeamKV, BeamPath를 분리한 GR 전용 추론 경로를 제안한다.
핵심 메커니즘
사용자 이력과 상품 정보를 입력으로 받아 HSTU는 순차 표현을 학습하고, Semantic ID 기반 GR은 상품을 계층적 토큰 시퀀스로 생성한다. 학습 단계에서는 DynamicEmb가 실제 접근한 ID만 scored hash table에 저장하고 HBM·host memory에 분산하며, 추론 단계에서는 ContextKV와 BeamKV를 분리해 긴 공통 context를 beam마다 복제하지 않는다. nv-embedding-cache는 GPU HBM, CPU DRAM, 원격 parameter store를 계층형 lookup으로 연결하고 cache promotion과 동시 eviction을 수행한다. 최종 출력은 item-constrained beam search가 생성한 Semantic ID 후보이며, logits와 beam 경로가 추천 순위를 결정한다.
핵심 수치
- 두 DGX H100 노드 학습 MFU: 7.65% -> 31.40%- recsys-examples HSTU 학습 스택
- AOTI backend와 KV cache 추론 speedup: Python backend 대비 2.20x ~ 2.38x- 이상적인 all GPU cache-hit 조건
- Semantic ID-GR offline latency: ctx=5000, batch=4, beam=256, output=3에서 3154.224ms -> 349.857ms, 2.27x faster- H100 80GB, Qwen3-1.7B, SGLang beam-search 비교
- Semantic ID-GR online serving throughput: 약 10.7 req/s -> 약 19.7 req/s, 약 1.85x higher- ctx=5000, concurrency=4, beam=256, output=3
- Semantic ID-GR online median latency: 약 370ms -> 약 198ms, 약 46% lower- ctx=5000, concurrency=4, beam=256, output=3
- DLRM v3 online server throughput: 99,997 queries/sec- MLPerf generative recommender benchmark에서 recsys-examples와 NVE 조합
섹션별 상세
대규모 RecSys의 병목
생성형 추천의 전환
HSTU의 순차 모델링
- HSTU는 softmax 대신 SiLU 기반 weighting과 relative attention bias, elementwise gating을 사용해 긴 사용자 시퀀스를 처리한다. — HSTU 절에서 표준 Transformer attention과 다른 aggregation mechanism을 설명한 문단
Semantic IDs와 생성 경로

- GR-specialized Semantic ID inference path는 context 5,000, beam width 256 조건에서 SGLang beam-search보다 offline latency와 online throughput을 개선했다. — Semantic ID-GR 절의 Table 2 serving results
recsys-examples의 실행 구조

- recsys-examples 통합 학습 스택은 두 개의 DGX H100 노드에서 MFU를 7.65%에서 31.40%로 높였다. — HSTU support 절의 Model FLOP Utilization 수치
- AOTI backend와 KV cache를 함께 사용한 추론은 Python backend 대비 2.20배에서 2.38배의 speedup을 기록했다. — HSTU support 절의 Triton Inference Server 성능 비교와 Figure 2
NVE의 계층형 embedding cache

- recsys-examples와 nv-embedding-cache는 DLRM v3 기반 MLPerf generative recommender benchmark에서 99,997 queries/sec를 달성했다. — nv-embedding-cache 절의 DLRM v3 online server benchmark 문단
용어 해설
- 생성형 추천 시스템(Generative Recommender)
- — 사용자 이력에서 다음 행동이나 상품을 확률적으로 생성하는 추천 모델이다. 기존처럼 사용자와 상품의 embedding 유사도를 계산해 후보를 찾는 대신, 순차 모델링과 autoregressive decoding으로 추천 결과와 순위를 함께 산출한다. 이를 통해 retrieval과 ranking을 하나의 모델 안에서 통합할 가능성이 생긴다.
- Semantic ID
- — 상품 embedding을 계층적으로 군집화한 뒤 각 상품에 의미 정보를 반영한 짧은 토큰 시퀀스를 부여하는 방식이다. 모델은 거대한 상품 전체에 대한 full softmax 대신 작은 토큰 vocabulary를 순차적으로 생성하며, 비슷한 상품 간 일반화와 long-tail 상품 선택을 지원한다.
- Dynamic Embedding
- — 고정된 embedding table을 미리 할당하지 않고 실제로 접근한 사용자나 상품 ID에만 embedding 행을 동적으로 배정하는 방식이다. scored hash table과 admission control, score-based eviction을 사용해 HBM과 pinned host memory를 함께 관리하며, 계속 늘어나는 고카디널리티 데이터를 처리한다.
- KV Cache
- — Transformer의 이전 attention 계산에서 나온 key와 value를 저장해 다음 토큰 생성 때 재계산을 줄이는 메모리 구조다. 이 글의 추천 workload에서는 긴 사용자 context와 짧은 beam별 decoding 기록을 분리하고, GPU·CPU·원격 저장소 계층에 나누어 배치한다.
- Beam Search
- — 각 decoding 단계에서 가능성이 높은 여러 경로를 동시에 유지하며 최종 출력 후보를 선택하는 탐색 방법이다. Semantic ID 기반 추천에서는 beam width 128 또는 256으로 여러 상품 토큰 경로를 병렬 탐색해 추천 다양성을 높이고, item-constrained generation으로 유효한 상품만 남긴다.
기술
- Generative Recommenders
- HSTU
- Semantic IDs
- TIGER
- PLUM
- OneRec v1/v2
- PyTorch
- recsys-examples
- DynamicEmb
- TorchRec
- Megatron-Core
- FBGEMM
- AOTInductor
- NVIDIA Triton Inference Server
- FlexKV
- Qwen3-1.7B
- SGLang
- vLLM
- TensorRT LLM
- CUDA
- nv-embedding-cache
- Redis
- RocksDB
- DLRM v3
- MLPerf
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.