본문으로 건너뛰기

장기 LLM agent를 위한 저메모리 ES Fine-tuning

Agentic ESOpt는 전체 trajectory 보상으로 LLM 파라미터를 갱신해 장기 agent Fine-tuning의 메모리와 Credit Assignment 문제를 줄입니다.

용어 해설

Evolution Strategies
Evolution Strategies는 모델 파라미터 주변에 무작위 perturbation을 가하고 각 변형 모델의 환경 보상을 비교해 파라미터를 갱신하는 최적화 방법입니다. 상호작용 전체를 미분하거나 역전파하지 않고 보상과 perturbation의 상관관계만 사용하므로 긴 trajectory와 대규모 모델을 다루는 데 중요합니다.
Credit Assignment
Credit Assignment는 여러 단계의 행동으로 얻은 최종 보상을 각 행동이나 파라미터 변화에 배분하는 문제입니다. 긴 agent trajectory에서는 중간 보상이 희소하고 분기 수가 늘어나므로 어떤 결정이 성공에 기여했는지 추정하기 어려워지며, Agentic ESOpt는 이를 하나의 전체 정책 perturbation에 연결합니다.
희소 보상(Sparse Reward)
Sparse Reward는 trajectory 중간에는 거의 보상이 없고 작업이 끝난 뒤에만 성공 점수 같은 신호가 주어지는 설정입니다. 이 논문의 Sudoku와 WebArena 환경에서는 최종 결과가 여러 turn의 행동을 한꺼번에 평가하므로, turn별 gradient를 안정적으로 계산하기가 어려워집니다.
파라미터 공간 최적화(Parameter-Space Optimization)
Parameter-Space Optimization은 행동 확률의 gradient를 직접 계산하는 대신 모델 파라미터 자체에 변화를 샘플링하고 성과가 높은 방향을 선택하는 방식입니다. 입력은 현재 파라미터와 perturbation이고 출력은 보상에 가중된 파라미터 업데이트이며, 전체 파라미터 Fine-tuning을 inference 수준 GPU 메모리로 수행할 수 있다는 점이 핵심입니다.
Cosine Decay Schedule
Cosine Decay Schedule은 최적화 초기에 perturbation 규모를 크게 두고 업데이트가 진행될수록 cosine 함수에 따라 줄이는 일정입니다. 큰 σ는 넓은 탐색과 regularization을 제공하고 작은 σ는 현재 작업 주변의 세밀한 적응을 가능하게 하므로, 탐색과 적응 사이의 균형을 조절합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.