용어 해설
- 실기기 닫힌 루프(Real-device Closed Loop)
- — 실제 물리적 장치를 주 실행 환경으로 삼아 데이터 수집·학습·평가를 동일한 실행 분포에서 반복하는 방식으로, 시뮬레이터 편향을 줄이고 실제 배포 환경에서의 상태 분포(권한 대화상자, 결제 인증 등)를 반영하여 에이전트의 수행 안정성을 높이는 데 중요하다.
- 데이터 플라이휠(Data Flywheel)
- — 실행 실패 궤적을 교정 행동, 반성적 설명, 복구 시연 등으로 자동 변환하여 재학습에 투입함으로써 실패로부터 점진적으로 능력을 개선시키는 반복적 데이터 증식·갱신 메커니즘이다.
- 에이전틱 강화학습(Agentic Reinforcement Learning)
- — 단계별 행동 선택과 고차원적 계획·회복 능력을 포함하여 에이전트 수준의 연속적 의사결정을 학습시키는 강화학습 방식으로, 단일 행동의 보상뿐 아니라 장기 목표 달성과 실패 복구를 고려하도록 정책을 갱신한다.
- 스텝 레벨 강화학습(Step-level Reinforcement Learning)
- — 각 인터페이스 조작 스텝(탭, 스와이프, 텍스트 입력 등)을 별도의 행동 단위로 정의하고 그 보상 신호로 정책을 학습시켜 장기적 작업 성공률을 높이는 세부 행동 중심의 RL 접근법이다.
- 지도학습 파인튜닝(Supervised Fine-tuning)
- — 사전수집된 다중 출처 행동-상태 데이터로 모델의 행동 출력을 지도학습 방식으로 미세조정하여 초기 정책을 형성하고 이후 강화학습 단계의 안정적 수렴을 돕는 방법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.