TL;DR
기존 추천 시스템은 과거 행동의 공기(共起) 패턴을 맞추는 데 집중해 사용자의 숨은 의도까지 포착하지 못했다. RecGPT-V3는 LLM 기반의 추론 능력을 실제 운영 환경에서 저비용·저지연으로 유지하는 방법을 제시해 대규모 전자상거래 추천의 실용적 한계를 돌파했다. 이 시스템은 정확도 향상과 인프라 비용 절감을 동시에 달성하여 실서비스 적용 가능성을 크게 높였다.
왜 중요한가
기존 추천 시스템은 과거 행동의 공기(共起) 패턴을 맞추는 데 집중해 사용자의 숨은 의도까지 포착하지 못했다. RecGPT-V3는 LLM 기반의 추론 능력을 실제 운영 환경에서 저비용·저지연으로 유지하는 방법을 제시해 대규모 전자상거래 추천의 실용적 한계를 돌파했다. 이 시스템은 정확도 향상과 인프라 비용 절감을 동시에 달성하여 실서비스 적용 가능성을 크게 높였다.
핵심 기여
Memory Hub로 상태 저장 사용자 모델링 도입
사용자 전체 행동 시퀀스를 구조화된 메모리 유닛으로 응축해 지속 저장하는 메모리 허브를 설계했다. 각 메모리 유닛은 행동 패턴 식별자와 자연어 선호 요약, 출처 인덱스와 시간 프로파일을 포함하며 증분 갱신 정책으로 진화한다. 이 접근으로 글로벌 플래너의 사용자 모델링 계산을 55.8% 저감하고 단위별 토큰을 94.5%까지 압축했다.
Semantic ID(SID)를 추가한 Hybrid-modal Recommendation Foundation Model
아이템의 멀티모달 임베딩을 CN-CLIP과 Q-Former로 얻어 RQ-VAE로 양자화해 SID 토큰을 생성하고 LLM 어휘에 병합했다. 두 레벨의 코드북(각 32,768)으로 총 65,536개의 SID 토큰을 도입해 모델이 자연어와 SID를 동시에 추론하도록 학습했다. 이러한 병렬 표현은 태그-아이템 병목을 해소해 의도 추론에서 직접 검색 호환 식별자를 출력할 수 있게 했다.
Latent Intent Reasoning으로 추론 비용 대폭 축소
장문의 chain-of-thought를 autoregressive로 생성하는 대신 학습 가능한 잠재 <CoT> 슬롯에 압축해 내부화했다. 이 잠재 토큰은 추론 비용을 본문 기준으로 200배 절감하면서 필요 시 사람이 읽을 수 있는 근거로 다시 디코드할 수 있다. 해당 기법은 실시간 QPS 제약 하에서 해석 가능성과 지연 사이의 균형을 유지했다.
핵심 아이디어 이해하기
추천 문제는 사용자의 관찰된 행동을 단순히 다음 클릭으로 예측하는 수준을 넘어 그 행동을 유발한 의도를 추론해야 더 본질적인 결과를 얻을 수 있다. 기존 모델들은 행동의 공기적 연관성을 포착하는 데는 강했지만 의도와 실제 아이템 공간 사이의 정보 손실을 극복하지 못했다. RecGPT-V3는 이 근본적 차이를 해결하려고 출발했다.
방법론
전체 접근은 세 가지 축을 병행해 성능과 효율을 동시에 개선하는 구조로 설계되었다. 첫째로 Memory Hub는 사용자의 전체 이력을 한 번 요약해 메모리 유닛 집합으로 저장하고 이후에는 새로 수집된 행동 증분과 요약 메모리만으로 추론을 수행해 반복 인코딩을 배제한다. 둘째로 Hybrid-modal Foundation Model은 자연어와 SID라는 두 출력을 LLM의 동일 어휘 공간에서 다루도록 학습시켜 태그 기반의 정보 손실을 제거하고 검색으로의 대역폭을 확보한다. 셋째로 Latent Intent Reasoning은 긴 CoT를 밀집된 잠재 토큰으로 대체해 추론 시 출력 토큰과 지연을 극적으로 줄이되, 요청 시 해당 잠재 표현을 사람이 읽을 수 있는 근거로 디코드할 수 있도록 설계했다.
관련 Figure

다이어그램은 아이템 메타정보에서 CN-CLIP과 Q-Former로 멀티모달 임베딩을 얻고 RQ-VAE로 계층적 SID를 생성해 Qwen3-14B 기반 모델에 SID 토큰을 추가하는 과정을 시각화한다. 또한 Stage 1의 SID-grounding과 Stage 2의 instruction tuning을 통해 SID와 자연어가 정렬되는 훈련 절차를 함께 제시해 방법론의 구성 요소들이 어떻게 연결되는지 명확히 보여준다.
Hybrid-modal Recommendation Foundation Model의 전체 흐름과 두 단계의 학습 파이프라인을 도식화한 아키텍처 다이어그램이다.
주요 결과
대규모 온라인 A/B 테스트에서 RecGPT-V3는 Taobao의 'Guess What You Like' 피드에 적용되어 주요 지표 개선과 비용 절감을 동시에 달성했다. 구체적으로 IPV는 +1.28%, CTR은 +1.00%, TC는 +1.97%, GMV는 +3.97%의 상승을 보고했으며 전체 서빙 연산량은 RecGPT-V2 대비 52.4% 감소했다. 모델 계열 비교에서 RecGPT-V3는 RecGPT-V1 대비 GPU 사용을 19% 수준으로 줄였고 이는 RecGPT-V2 대비 52.4% 절감에 해당한다.
관련 Figure

왼쪽과 가운데 패널은 Item Scene과 Main Feed에서 세대별(RecGPT-V1/V2/V3) CTR, IPV, TC 등의 상대적 향상을 수치로 제시하고 오른쪽 패널은 GPU 비용 비중을 비교해 RecGPT-V3가 RecGPT-V1 대비 19%의 GPU 사용만으로 동작함을 보여준다. 그래프의 수치와 화살표는 모델 진화에 따른 성능 향상과 자원 효율화가 동시 달성되었음을 정량적으로 전달한다.
RecGPT 시리즈의 온라인 지표 개선과 GPU 비용 절감량을 막대 그래프로 비교한 도표이다.
기술 상세
전체 아키텍처는 세 주요 컴포넌트로 구성된다. Memory Hub는 초기 Structured Behavior Compression 단계에서 사용자의 전체 행동 시퀀스 B를 LLM 기반 구성 함수 F_phi로 한 번 처리해 K개의 메모리 유닛 M을 만든다. 각 유닛은 행동 패턴 식별자 p_k와 선호 요약 s_k, 대표 인덱스와 시간 프로파일을 보유하며 이후 Evolving Memory Curation 단계에서 증분 ΔB와 결합한 단일 포워드 패스로 기존 단위를 선택 갱신하거나 새로운 단위를 추출해 시간 t+δ의 메모리를 구성한다.
실무 활용
RecGPT-V3는 실서비스 규모에서 LLM 기반 추천의 핵심 비용·지연 병목을 해소한 아키텍처를 제공하므로 대형 전자상거래 추천 파이프라인에 직접 적용 가능한 설계 요소를 포함한다. Memory Hub와 SID 기반 검색 연결은 기존 태그-재현 방식의 교체가 가능한 실무적 경로를 제시한다.
- 대규모 전자상거래 플랫폼에서 개인화 피드 추천의 사용자 모델링 비용과 응답 지연을 모두 낮출 때 적용 가능하다.
- 검색·추천 파이프라인에서 자연어 기반 의도 추론 결과를 아이템 식별자(SID)로 직접 연결해 하이브리드 검색을 구현할 때 유용하다.
- 실시간 QPS 제약이 있는 환경에서 설명 가능한 추론 근거를 보존하면서 chain-of-thought의 토큰 비용을 줄여야 하는 경우에 적용할 수 있다.
코드 공개 여부: 미확인
키워드
용어 해설
- Memory Hub
- — 사용자의 긴 행위 이력을 구조화된 메모리 단위로 요약·저장하는 계층이다. 메모리 허브는 원시 로그 대신 응축된 메모리 유닛과 최근 행위 증분만을 입력으로 삼아 반복 계산을 피하고 사용자 모델링 비용을 줄인다. 이 논문에서는 단위별 출처 추적성, 점진적 갱신, 94.5% 토큰 압축과 55.8% 사용자 모델링 비용 절감이라는 설계 목표를 충족한다.
- Semantic ID (SID)
- — 아이템의 멀티모달 표현을 이산 토큰으로 양자화한 식별자이다. 두 단계의 잔차 양자화로 구성된 코드북에서 각 아이템은 두 개의 코드로 표현되어 자연어와 병렬로 LLM의 어휘에 추가된다. SID는 자연어 태그의 손실을 보완해 의도에서 아이템 공간으로의 고대역 인터페이스를 제공한다.
- RQ-VAE (Residual Quantization VAE)
- — 연속적 멀티모달 임베딩을 다단계 이산 코드로 변환하는 양자화 모델이다. 첫 번째 레벨에서 거친 군집을, 두 번째 레벨에서 세부 식별자를 할당해 전체 어휘 수를 제어하면서 미세 구분을 유지한다. 본문에서는 두 레벨 각 32,768 크기를 사용해 총 65,536개의 SID 토큰을 생성했다.
- Latent Intent Reasoning
- — 명시적 장문의 chain-of-thought를 학습 가능한 잠재 토큰으로 내부화하여 추론 토큰 비용과 지연을 크게 줄이는 기법이다. 전용 <CoT> 슬롯이 전체 추론 흔적을 밀도 높은 잠재 표현으로 압축하고 필요 시 사람이 읽을 수 있는 근거로 디코드 가능하다. 본문에서는 출력 토큰 비용을 200배 절감한 것으로 보고되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
