용어 해설
- Evolution Strategies
- — Evolution Strategies는 모델 파라미터 주변에 무작위 perturbation을 가하고 각 변형 모델의 환경 보상을 비교해 파라미터를 갱신하는 최적화 방법입니다. 상호작용 전체를 미분하거나 역전파하지 않고 보상과 perturbation의 상관관계만 사용하므로 긴 trajectory와 대규모 모델을 다루는 데 중요합니다.
- Credit Assignment
- — Credit Assignment는 여러 단계의 행동으로 얻은 최종 보상을 각 행동이나 파라미터 변화에 배분하는 문제입니다. 긴 agent trajectory에서는 중간 보상이 희소하고 분기 수가 늘어나므로 어떤 결정이 성공에 기여했는지 추정하기 어려워지며, Agentic ESOpt는 이를 하나의 전체 정책 perturbation에 연결합니다.
- 희소 보상(Sparse Reward)
- — Sparse Reward는 trajectory 중간에는 거의 보상이 없고 작업이 끝난 뒤에만 성공 점수 같은 신호가 주어지는 설정입니다. 이 논문의 Sudoku와 WebArena 환경에서는 최종 결과가 여러 turn의 행동을 한꺼번에 평가하므로, turn별 gradient를 안정적으로 계산하기가 어려워집니다.
- 파라미터 공간 최적화(Parameter-Space Optimization)
- — Parameter-Space Optimization은 행동 확률의 gradient를 직접 계산하는 대신 모델 파라미터 자체에 변화를 샘플링하고 성과가 높은 방향을 선택하는 방식입니다. 입력은 현재 파라미터와 perturbation이고 출력은 보상에 가중된 파라미터 업데이트이며, 전체 파라미터 Fine-tuning을 inference 수준 GPU 메모리로 수행할 수 있다는 점이 핵심입니다.
- Cosine Decay Schedule
- — Cosine Decay Schedule은 최적화 초기에 perturbation 규모를 크게 두고 업데이트가 진행될수록 cosine 함수에 따라 줄이는 일정입니다. 큰 σ는 넓은 탐색과 regularization을 제공하고 작은 σ는 현재 작업 주변의 세밀한 적응을 가능하게 하므로, 탐색과 적응 사이의 균형을 조절합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




