용어 해설
- 다목적 강화학습(Multi-Objective Reinforcement Learning)
- — 여러 목표(보상)를 동시에 최적화하기 위해 강화학습 문제를 구성하는 접근법이다. 이 논문에서는 data-quality, inter-domain influence, model-stability 세 가지 보상 성분을 가중합하여 에이전트가 데이터 믹싱 정책을 학습하도록 한다. 다목적 보상은 서로 상충하는 신호들 사이의 균형을 찾아 전반적 학습 효율을 개선한다.
- 그래디언트 정렬(Gradient Alignment)
- — 한 도메인에서 계산된 gradient와 다른 도메인들의 gradient 합과의 내적을 계산하여 양(positive) 혹은 음(negative) 영향력을 평가하는 지표다. 입력: 도메인별 gradient 벡터 → 연산: 내적(⟨g_i, Σ_{j≠i} g_j⟩) → 결과: 스칼라값 → 의미: 양수면 해당 도메인 업데이트가 다른 도메인 학습에 유리하다는 신호다.
- Measure of Textual Lexical Diversity (MTLD)(MTLD)
- — 문서의 어휘 다양성(텍스트 복잡도)을 수치화한 지표다. 논문에서는 배치별 MTLD를 [0,1] 범위로 정규화한 후 시간 스텝 t에 따라 보상으로 사용해 'simple-to-complex' 커리큘럼을 형성한다. 입력: 배치 텍스트 → 연산: MTLD 계산 및 정규화 → 결과: 정규화 점수 → 의미: 낮은 값은 단순한 텍스트, 높은 값은 복잡한 텍스트를 의미한다.
- 확률 심플렉스(Probability Simplex)
- — 도메인 가중치 벡터 a∈Δ^K가 속하는 공간으로, 모든 요소가 0 이상이며 합이 1이 되는 K차원 공간이다. 이 논문에서 에이전트의 Action은 이 심플렉스 상의 샘플링 확률 분포이다. 입력: 실수 벡터 → 연산: 비음수 및 합=1 제약 → 결과: 도메인 샘플링 확률 → 의미: 다음 배치에서 각 도메인이 선택될 확률을 규정한다.
코드 예제
Input : Corpus D = { D1, … , DK }, hyperparameters
Initialize : Actor π_{θ_A}, critics Q_{θ_{C1},C2}, target critics θ' ← θ, replay buffer B, Na_c, entropy temperature α_ent, LLM θ_M.
for t = 1, …, T do
Observe state s^t from the LLM environment;
Sample action a^t;
Sample data batch B^t according to P_{a^{t+1}};
Update LLM parameters: θ_M^{t+1} ← θ_M^t − η_M ∑_{i=1}^K a_i^{t+1} ∇ ℒ(θ_M^t, B_i^t);
Compute reward vector r^t using Eq. (1)-(5);
Observe next state s^{t+1};
Store transition (s^t, a^t, r^t, s^{t+1}) in B;
for n_ac = 1, …, N_ac do
Sample a minibatch {(s^j, a^j, r^j, s^{j+1})} from B;
Compute target y^j for each transition;
Update critics by minimizing L(θ_{C1}) and L(θ_{C2});
Update actor by minimizing L(θ_A);
Update entropy temperature by minimizing L(α_ent);
Update target networks using Polyak averaging;
end
end
Algorithm 1 The Holistic Data Scheduler (HDS)HDS의 의사코드로, 에이전트가 상태를 관찰해 도메인 가중치(action)를 샘플링하고 LLM을 업데이트한 뒤 리플레이 버퍼로부터 에이전트 파라미터를 갱신하는 전체 루프를 보여준다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






