본문으로 건너뛰기
Meta (Facebook)조회 1

메타의 다단계 시퀀스 모델과 광고 스케일링 법칙

긴 행동 시퀀스를 오프라인에서 깊게 학습하고 온라인에서 경량으로 결합해 광고 랭킹을 확장하는 접근법

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

메타는 긴 사용자 행동 시퀀스를 오프라인에서 심층적으로 처리해 사용자별 임베딩을 캐시하고 온라인에서는 이 임베딩을 실시간 후보 신호와 결합해 경량 랭킹을 수행하는 다단계 시퀀스 모델을 도입했다. 조밀 토크나이제이션과 타깃 인지 다중 헤드 어텐션을 통해 희소 ID와 시퀀스 데이터를 하나의 표현 공간으로 통합하면서 모델이 직접 피처 상호작용을 학습하게 했다. 실 트래픽에서 LLM 유사의 로그-선형 스케일링 거동이 관찰되며 Instagram 전환 6퍼센트, Facebook 전환 3퍼센트, Facebook 광고 클릭 3.5퍼센트의 누적 향상이 보고되었다.

섹션별 상세

광고 추천은 수천 개의 후보를 밀리초 단위로 검색하고 순위를 매겨야 하기 때문에 긴 시퀀스와 희소 ID 피처를 동시에 처리하는 데서 병목이 발생한다. 이 글은 오프라인에서 긴 사용자 히스토리를 무겁게 처리해 사용자별 임베딩을 캐시하고 온라인에서는 경량 랭킹을 수행하는 다단계 구조로 이 병목을 분리하는 방법을 기술한다. 이렇게 하면 오프라인 모델 용량을 크게 늘려도 온라인 서빙 비용이 비례해 증가하지 않아 실무적 확장이 가능해진다.
다단계 아키텍처의 시각적 개요를 보여주는 다층 다이어그램으로, 오프라인 사용자 모델과 온라인 랭킹 모델 사이의 데이터 흐름을 도식화하고 있다.
Diagram이미지는 여러 레이어가 쌓여 아래에서 입력 피처가 결합되어 위쪽으로 축약되는 흐름을 시각화해 다단계 설계의 핵심인 오프라인 표현의 집적과 온라인에서의 경량 결합을 직관적으로 전달한다. 화살표와 레이어 분리는 오프라인에서 계산된 임베딩을 캐시해 온라인 단계로 전달하는 처리 파이프라인을 강조하며, 아키텍처가 서빙 비용을 제어하면서도 표현 용량을 키우는 메커니즘을 보여준다. 다이어그램은 본문에서 말한 분리 설계와 캐시 기반 파이프라인을 읽을 때 유용한 시각적 근거를 제공한다.
근거
  • 오프라인 사용자 모델과 온라인 랭킹을 분리하는 다단계 설계가 모델 용량을 늘리면서 서빙 비용의 급증을 피할 수 있게 했다. 본문의 다단계 모델 개요와 '두 단계의 분리로 오프라인 모델 복잡도는 확장 가능하고 온라인은 지연 제약을 유지'라는 기술 서술 부분.
오프라인 사용자 모델은 수천 길이의 시퀀스를 처리할 수 있는 여러 Transformer 레이어를 비동기적으로 동작시키고, 각 사용자에 대해 심층 행위 패턴을 담는 임베딩을 사전계산해 캐시한다. 이 단계는 사용자 피처를 광고 후보와 철저히 분리해 임베딩이 특정 광고에 종속되지 않도록 설계되어 있으며, 비동기 처리로 레이턴시 제약을 피한다. 결과적으로 긴 시퀀스와 큰 모델 깊이를 추구하면서도 실시간 서빙 비용을 억제할 수 있다.
왼쪽에 오프라인 사용자 모델, 오른쪽에 온라인 모델을 배치한 구조도이며, Transformer 기반 레이어와 임베딩 흐름, 실시간 후보 결합을 그림으로 표현한다.
Diagram이 그림은 오프라인 모델에서 Transformer가 긴 시퀀스를 처리해 Layer0 임베딩을 생성하고 이를 온라인 랭킹 모델의 입력으로 사용하는 구체적 처리 단계를 보여준다. 각 구성 요소의 입력과 출력이 명확히 표시돼 있어 오프라인·온라인 분리, 캐싱 지점, 실시간 신호 병합 지점을 이해하는 데 도움이 된다. 기술적 독자는 이 도식을 통해 오프라인 추론 주기와 온라인 서빙 루프의 인터페이스 설계 조건을 빠르게 파악할 수 있다.
온라인 랭킹 모델은 오프라인에서 생성된 캐시 임베딩과 실시간 유저 신호 및 광고 후보 피처를 결합해 최종 점수를 계산한다. 이 단계는 엄격한 지연 예산을 만족하도록 경량화되어 있으며, 오프라인 표현을 활용해 풍부한 사용자 이해를 실시간 의사결정에 즉시 반영한다. 분리된 설계로 온라인 모델은 서빙 비용 제약 내에서 성능을 높이는 쪽으로 조정할 수 있다.
조밀 토크나이제이션은 희소 피처와 시퀀스 행위를 하나의 조밀 어휘로 합쳐 attention이 데이터로부터 직접 피처 상호작용을 발굴하도록 만든다. 타깃 인지 다중 헤드 어텐션은 광고 후보 정보를 역사 시퀀스와 융합해 각 레이어가 후보별로 과거 행동을 재가중치하고 고차 상호작용을 추출하도록 설계된 메커니즘이다. 여러 정렬된 어텐션 블록을 쌓아 긴 시퀀스를 점진적으로 압축하고 후보-행동 간 상호작용을 계층적으로 증폭시키는 방식이 핵심 기술적 기여이다.
실무 트래픽에서 이 다단계 모델은 LLM에서 관찰되는 것과 유사한 로그-선형 스케일링 법칙을 보였다는 점이 중요하다. 모델 깊이, 너비, 시퀀스 길이, 콘텐츠 의미적 보강이라는 네 가지 축을 적절히 조합하면 계산량 대비 예측 가능한 성능 개선을 얻을 수 있으며, 단축 축 하나만 키우면 병목과 수익 체감이 발생할 수 있다는 점을 경험적으로 확인했다. 따라서 균형적 모델 형상, 오프라인·온라인의 조정 가능성, 시퀀스 구성의 다양성, 의미적 피처 보강이 스케일링을 여는 핵심 레버로 제시된다.
계산량(FLOPs)과 정규화 엔트로피(NE) 사이의 관계를 축으로 모델 깊이, 너비, 시퀀스 길이 등 여러 축에서의 스케일링 거동을 비교한 그래프이다.
Chart그래프는 로그-선형 형태의 성능 개선 경향을 보이며, 각 색상 점선이 모델 깊이, 너비, 콘텐츠 보강, 시퀀스 길이에 따른 NE 변화를 분리해 보여준다. 이 시각 증거는 본문의 주장을 뒷받침하는 근거로서 계산량 대비 예측 가능한 성능 향상이 관찰되었음을 직관적으로 전달한다. 따라서 스케일링 레버별 기여도를 계량적으로 평가하려는 독자에게 중요한 기술적 데이터 포인트를 제공한다.
근거
  • 실제 광고 트래픽에서 계산량 대비 성능이 로그-선형 관계를 보이며 LLM 유사 스케일링 법칙이 관찰되었다. Figure 2 및 본문의 'LLM-Style Scaling Law' 설명과 총 FLOPs 대비 NE(정규화 엔트로피) 그래프.
플랫폼 효과와 실측 성과 측면에서 다단계 시퀀스 모델과 조밀 토크나이제이션을 포함한 GEM 통합은 실사용 지표 개선을 가져왔다. 글에서는 Instagram 전환 6퍼센트, Facebook 전환 3퍼센트, Facebook 광고 클릭 3.5퍼센트의 누적 향상을 보고하며, 초기 평가에서 서빙 자원에 미치는 영향은 제한적이었음을 언급한다. 이 아키텍처는 광고 랭킹 과제 전반으로 일반화할 수 있는 백본으로 설계되어 다른 광고 작업으로의 확장 여지가 있다.
근거
  • 다단계 모델과 관련 기술이 Instagram 전환을 6퍼센트, Facebook 전환을 3퍼센트, Facebook 광고 클릭을 3.5퍼센트 향상시켰다. 기사 본문 마지막 Impact 단락에 명시된 누적 향상 수치.

용어 해설

다단계 시퀀스 모델(Multi-stage sequence model)
오프라인에서 긴 시퀀스를 처리해 사용자별 임베딩을 캐시하고 온라인에서 실시간 후보 신호와 결합해 최종 랭킹을 생성하는 구조로, 모델 복잡도 확장과 서빙 비용의 분리를 목표로 한다.
조밀 토크나이제이션(Dense tokenization)
희소 ID 피처와 순차 행위 데이터를 단일 조밀 어휘로 통합해 attention이 교차 특성 상호작용을 학습하도록 하는 토크나이제이션 방식으로, 수작업 특징 공학을 줄이고 모델이 직접 상호작용을 획득하게 한다.
타깃 인지 다중 헤드 어텐션(Target-aware multi-head attention)
광고 후보 정보를 사용자 과거 행동 시퀀스와 결합해 각 레이어가 후보와 과거 행동의 고차 상호작용을 캡처하도록 설계된 메모리 효율적 어텐션 변형으로, 후보별 중요도를 계층적으로 정제한다.
LLM 유사 스케일링 법칙(LLM-style scaling law)
계산량(FLOPs)과 모델 성능(정규화 엔트로피 등) 사이에 로그-선형 관계가 성립해 모델 깊이, 너비, 시퀀스 길이 확장이 예측 가능한 성능 향상을 가져오는 경험적 법칙을 말한다.

기술

  • Transformer
  • Dense tokenization
  • Target-aware multi-head attention
  • Generative Ads Recommendation Model (GEM)
  • Mixture-of-experts

활용 사례

  • 대규모 광고 랭킹에서 긴 사용자 히스토리를 반영해 광고 관련성 및 전환율을 개선하는 데 적용할 수 있다. 오프라인에서 깊은 행동 표현을 계산해 캐시하고 온라인에서 후보별 신호와 결합하면 실시간 서빙 제약을 지키면서 더 풍부한 사용자 정보를 활용할 수 있다. 특히 수천 길이 시퀀스를 요구하는 캠페인이나 긴 시계열 패턴이 중요한 광고 상품에 유리하다.
  • 콜드 스타트 상황에서 의미적 콘텐츠 피처를 결합해 신호 커버리지를 확장하는 데 활용할 수 있다. 본문은 foundation model 기반 의미적 표현이 새로운 광고나 광고주에 유용하다고 언급하므로, 콘텐츠 임베딩을 보강하면 초기 성능 저하를 완화할 수 있다. 이 접근은 신상품 론칭이나 소규모 광고주를 지원하는 운영 전략에 직접적으로 연결된다.
  • 다양한 액션 타입을 섞어 시퀀스 다양성을 확보하면 사용자 표현의 질을 높여 추천 품질을 개선할 수 있다. 뷰·클릭·전환 등 혼합된 행동을 포착한 시퀀스는 단일 고신호 이벤트만으로 구성된 시퀀스보다 더 넓은 행동 맥락을 제공한다. 따라서 데이터 수집 정책과 로그 표준화 작업에서 액션 타입 분류를 세밀하게 설계하는 것이 중요하다.

언급된 리소스

문서LLaTTE: Scaling Laws for Multi-Stage Sequence Modeling in Large-Scale Ads Recommendation
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 06.수집 2026. 08. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.