용어 해설
- LLM 에이전트(LLM agents)
- — LLM을 정책으로 사용해 환경과 상호작용하며 행동을 선택하는 시스템입니다. 환경에서 관찰한 상태를 입력으로 받고 실행 궤적에 따라 다음 행동을 결정하므로, 환경 설계와 검증 방식이 학습 성능에 직접 영향을 줍니다.
- 환경 하네스(Environment Harness)
- — 기존 환경의 내부 로직을 바꾸지 않고 외부 구성 요소를 덧붙여 행동 양식을 재구성하는 프로그래밍 계층입니다. 표준 인터페이스와 원래 검증기를 유지해 여러 도메인에 적용하는 것이 핵심입니다.
- 블랙박스 정책(black-box policy)
- — 정책의 내부 가중치나 구조를 직접 읽지 않고 입력과 출력, 실행 과정만 관찰하는 정책 표현입니다. EnvRigger는 이 실행 궤적에서 약점을 진단하고 환경 구성 요소를 합성하는 데 이 방식을 사용합니다.
- 실행 궤적(execution trajectories)
- — 에이전트가 환경에서 관찰하고 행동하며 결과를 얻는 순차 기록입니다. 이 기록은 정책이 어떤 상황에서 실패하는지 파악하는 입력이 되고, 새 환경 구성 요소를 검증하는 롤아웃과도 연결됩니다.
- 공진화(co-evolution)
- — 정책과 환경을 한쪽만 고정하지 않고 상호작용 속에서 함께 최적화하는 방식입니다. 환경이 정책의 약점을 겨냥해 바뀌고 정책이 다시 변화하면서 강화학습에 지속적이고 targeted한 최적화 신호를 제공합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.