용어 해설
- Self-Play Reinforcement Learning
- — 하나의 모델 또는 여러 학습 주체가 서로 다른 역할을 맡아 상호작용하며 얻은 보상으로 정책을 갱신하는 강화학습 방식입니다. SPADE에서는 같은 LLM이 Environment Designer와 Reasoning Agent 역할을 번갈아 수행하고, 생성된 환경의 난이도와 에이전트의 해결 능력이 함께 변합니다. 고정된 문제 집합을 반복하는 대신 학습 과정에서 새로운 과제를 계속 만들 수 있다는 점이 중요합니다.
- Markov Decision Process
- — 현재 상태와 행동에 따라 다음 상태와 보상이 결정되는 환경의 수학적 표현입니다. 상태 공간, 행동 공간, 전이 함수, 보상 함수, 초기 상태 분포로 구성되며, SPADE에서는 이 요소들을 실행 가능한 Python 코드로 작성합니다. 따라서 한 번의 정답 판정부터 여러 단계의 도구 사용까지 같은 환경 인터페이스로 처리할 수 있습니다.
- 힌트 기반 후회 보상(Hint-Based Regret)
- — 동일한 환경에서 privileged hint를 받은 에이전트의 평균 보상과 힌트 없이 행동한 에이전트의 평균 보상 차이로 환경 설계자의 보상을 계산하는 방식입니다. 힌트가 있으면 풀 수 있지만 없으면 어려운 환경에서 차이가 커지므로, 해결 가능하면서도 현재 능력의 경계에 있는 환경을 선택하게 만듭니다. 두 조건 모두 성공하면 숙달된 환경이고, 힌트가 있어도 실패하면 지나치게 어려운 환경으로 간주됩니다.
- Group Relative Policy Optimization
- — 같은 입력에서 여러 응답을 샘플링한 뒤 각 응답의 보상을 그룹 평균과 표준편차에 맞춰 정규화하고 정책을 갱신하는 강화학습 최적화 방법입니다. SPADE는 Reasoning Agent의 과제 보상과 Environment Designer의 힌트 기반 보상을 역할별로 정규화해 하나의 공유 정책에 적용합니다. 정책 비율을 clipping하고 참조 정책과의 KL 정규화를 추가해 두 역할의 공동 학습을 안정화합니다.
- 환경 메모리(Environment Memory)
- — 이전에 생성한 환경을 regret 점수와 skill 태그와 함께 저장해 다음 환경 설계 입력으로 재사용하는 메모리입니다. Environment Designer는 높은 regret 환경을 변형하고, 이미 너무 쉽거나 어려웠던 환경은 피하면서 현재 에이전트가 어려워하는 지점에서 새 환경을 시작합니다. 외부 corpus가 환경의 주제 다양성을 넓힌다면 memory는 환경 난이도의 연속성을 유지합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


