용어 해설
- 인컨텍스트 학습(In-context Learning)
- — 모델의 파라미터를 갱신하지 않고 입력 프롬프트의 맥락만으로 새로운 사례에 적응하는 방식이다. 본 논문에서는 시뮬레이터 상호작용과 외부 스킬 문서를 프롬프트로 주입해 에이전트가 과거 실험에서 얻은 지식을 즉시 재사용하도록 만든다는 관점으로 사용된다. 파라미터 업데이트가 불가능한 폐쇄형 모델에도 적용 가능한 점이 중요하다.
- 스킬 은행(Skill Bank)
- — 실험 궤적에서 추출한 재사용 가능한 자연어 기반 전략과 실패 유형의 집합이다. 각 스킬은 제목, 원리, 적용 조건, 예시, 출처 시드, 보상 점수로 구조화되어 저장되며 이후 에피소드의 프롬프트에 주입되어 탐색을 유도한다. 스킬 은행은 증거 기반으로 진화하며 다른 레벨로 재합성되어 제로샷 전이에도 사용된다.
- 능동적 실험(Active Experimentation)
- — 에이전트가 환경에 개입하여 가설을 검증하고 쿼리별 증거를 수집하는 능동적 탐색 행위이다. 시뮬레이터의 도구 호출(부분 시뮬레이션, 접촉 로그, 스냅샷/복원 등)을 통해 중간 역학을 관찰하고 실패의 원인을 식별한다. 본 논문에서는 이러한 사이클이 스킬 추출과 재사용의 핵심 데이터 소스로 작동한다.
- 이볼버(Evolver)
- — 배치로 생성된 궤적과 보상 레이블을 읽어 스킬과 실패 레코드를 구조화하여 스킬 은행을 갱신하는 LLM 기반 모듈이다. 고보상 궤적과 저보상 궤적을 대비해 성공의 원리를 추출하고 실패에서 부분적으로 유효한 추론 단계를 보존한다. 은행 용량·보상 기반 순위·병합·삭제 정책을 적용해 점진적으로 은행을 진화시킨다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


