본문으로 건너뛰기

다중 목적 강화학습 기반 LLM 사전학습용 Holistic Data Scheduler

사전학습 데이터의 출처 구성과 혼합 전략이 LLM 성능과 학습 효율을 결정한다. HDS는 데이터 혼합을 에이전트가 실시간으로 최적화하도록 하여 학습 스텝과 연산 비용을 크게 줄이고 downstream 성능을 동시에 향상시켰다.

용어 해설

다목적 강화학습(Multi-Objective Reinforcement Learning)
여러 목표(보상)를 동시에 최적화하기 위해 강화학습 문제를 구성하는 접근법이다. 이 논문에서는 data-quality, inter-domain influence, model-stability 세 가지 보상 성분을 가중합하여 에이전트가 데이터 믹싱 정책을 학습하도록 한다. 다목적 보상은 서로 상충하는 신호들 사이의 균형을 찾아 전반적 학습 효율을 개선한다.
그래디언트 정렬(Gradient Alignment)
한 도메인에서 계산된 gradient와 다른 도메인들의 gradient 합과의 내적을 계산하여 양(positive) 혹은 음(negative) 영향력을 평가하는 지표다. 입력: 도메인별 gradient 벡터 → 연산: 내적(⟨g_i, Σ_{j≠i} g_j⟩) → 결과: 스칼라값 → 의미: 양수면 해당 도메인 업데이트가 다른 도메인 학습에 유리하다는 신호다.
Measure of Textual Lexical Diversity (MTLD)(MTLD)
문서의 어휘 다양성(텍스트 복잡도)을 수치화한 지표다. 논문에서는 배치별 MTLD를 [0,1] 범위로 정규화한 후 시간 스텝 t에 따라 보상으로 사용해 'simple-to-complex' 커리큘럼을 형성한다. 입력: 배치 텍스트 → 연산: MTLD 계산 및 정규화 → 결과: 정규화 점수 → 의미: 낮은 값은 단순한 텍스트, 높은 값은 복잡한 텍스트를 의미한다.
확률 심플렉스(Probability Simplex)
도메인 가중치 벡터 a∈Δ^K가 속하는 공간으로, 모든 요소가 0 이상이며 합이 1이 되는 K차원 공간이다. 이 논문에서 에이전트의 Action은 이 심플렉스 상의 샘플링 확률 분포이다. 입력: 실수 벡터 → 연산: 비음수 및 합=1 제약 → 결과: 도메인 샘플링 확률 → 의미: 다음 배치에서 각 도메인이 선택될 확률을 규정한다.

코드 예제

text
Input : Corpus D = { D1, … , DK }, hyperparameters
Initialize : Actor π_{θ_A}, critics Q_{θ_{C1},C2}, target critics θ' ← θ, replay buffer B, Na_c, entropy temperature α_ent, LLM θ_M.
for t = 1, …, T do
  Observe state s^t from the LLM environment;
  Sample action a^t;
  Sample data batch B^t according to P_{a^{t+1}};
  Update LLM parameters: θ_M^{t+1} ← θ_M^t − η_M ∑_{i=1}^K a_i^{t+1} ∇ ℒ(θ_M^t, B_i^t);
  Compute reward vector r^t using Eq. (1)-(5);
  Observe next state s^{t+1};
  Store transition (s^t, a^t, r^t, s^{t+1}) in B;
  for n_ac = 1, …, N_ac do
    Sample a minibatch {(s^j, a^j, r^j, s^{j+1})} from B;
    Compute target y^j for each transition;
    Update critics by minimizing L(θ_{C1}) and L(θ_{C2});
    Update actor by minimizing L(θ_A);
    Update entropy temperature by minimizing L(α_ent);
    Update target networks using Polyak averaging;
  end
end
Algorithm 1 The Holistic Data Scheduler (HDS)

HDS의 의사코드로, 에이전트가 상태를 관찰해 도메인 가중치(action)를 샘플링하고 LLM을 업데이트한 뒤 리플레이 버퍼로부터 에이전트 파라미터를 갱신하는 전체 루프를 보여준다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.