용어 해설
- 그룹 상대 정책 최적화(GRPO)
- — 강화학습 기법 중 하나로, 별도의 가치 함수 네트워크 없이 샘플 그룹 내의 상대적 보상을 계산하여 정책을 업데이트하는 방식이다. 연산 효율성이 높고 대규모 언어 모델의 정렬 및 최적화에 효과적이다.
- 자기 진화(Self-Evolution)
- — 모델이나 에이전트가 외부의 추가적인 데이터 입력이나 인간의 개입 없이 스스로의 성능을 평가하고 개선하는 프로세스이다. 지속적인 학습과 적응형 시스템 구축의 핵심 개념이다.
- 지침 기반 기술(Instruction-only Skills)
- — 실행 가능한 코드 없이 텍스트 형태의 지침(Prompt)만으로 구성된 에이전트의 기능 단위이다. 모델의 추론 능력에 의존하여 특정 과업을 수행하도록 설계된다.
- 코드 포함 기술(Code-inclusive Skills)
- — 텍스트 지침뿐만 아니라 실제 실행 가능한 스크립트나 코드를 포함하는 기술 모듈이다. 외부 도구 연동이나 복잡한 데이터 처리가 필요한 작업에 주로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


