용어 해설
- 문맥 창(Context Window)
- — LLM이 한 번에 처리할 수 있는 텍스트의 최대 양이다. 장기 작업에서는 이 한계를 초과하는 데이터가 발생하여 과거 정보를 잊거나 연산 비용이 급증하는 병목 현상이 발생한다.
- 역참조(Dereferencing)
- — 메모리 주소나 인덱스를 통해 실제 데이터 값을 찾아오는 과정이다. 본 논문에서는 에이전트가 요약된 인덱스를 보고 외부 저장소에서 상세 정보를 다시 불러오는 메커니즘을 의미한다.
- 보상 설계(Reward Shaping)
- — 강화학습에서 에이전트가 원하는 행동을 하도록 보상 함수를 세밀하게 조정하는 기법이다. 여기서는 문맥 오버플로우나 중복 호출에 페널티를 주어 효율적인 메모리 사용을 유도한다.
- 그룹 상대적 어드밴티지 추정(GRPO)
- — 여러 개의 샘플(rollout)을 생성하여 그들 사이의 상대적인 성능 차이를 바탕으로 모델을 업데이트하는 강화학습 알고리즘이다. 별도의 가치 모델(Value Model) 없이도 효율적인 학습이 가능하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

